点二列相关计算器
衡量二元变量与配对连续观测值之间的关联。
计算点二列相关
输入顺序对应的二元数据和连续数据列表,每个观测对象各有一个值。
关于点二列相关
点二列相关用于衡量一个天然二分变量与一个连续变量之间关联的强度和方向。二元变量包含两个类别,编码为零和一;连续变量则是同一批观测对象的数值测量结果。常见例子包括通过或未通过与学习时间、治疗组或对照组与结果评分,以及购买或未购买与客户年龄的配对。该系数通常记为 rpb,范围为 -1 到 1。
计算时,先比较编码为一和编码为零的观测对象的连续得分均值。两组均值之差除以全部连续得分的总体标准差,再乘以 p 与 q 乘积的平方根,其中 p 是编码为一的比例,q 是编码为零的比例。这一调整考虑了两组的相对规模。正系数表示编码为一的组均值更高;负系数表示编码为零的组均值更高。
符号完全取决于编码方式。将所有零和一互换,系数绝对值不变,但符号反转,因此报告应说明各编码的含义。系数大小与皮尔逊相关系数具有相同解释:越接近零,组别与连续结果之间的线性关联越弱;越接近两端,组间分离越明显。解释需要结合背景,对“小、中、大”等通用阈值应谨慎使用。
当二分变量以零和一表示时,点二列相关在数学上等同于皮尔逊相关。它也与独立样本 t 检验密切相关。两种方法都评估两组均值的分离程度,但呈现效应的方式不同。相关系数是标准化效应量,而 t 检验结合效应和抽样不确定性来检验原假设。本计算器返回系数与分组详情,不提供 p 值或置信区间。
配对列表必须具有相同观测数,并保持对应顺序。第一个二元编码对应第一个连续值,第二个对应第二个,以此类推。两个二元组都必须出现,连续数据也必须有变化,否则相关系数无定义。缺失值应整对删除,而不是只从一个列表中删除,因为独立删除会破坏对应关系,使结果失去意义。
合理解释还依赖可靠的数据收集。系数较高并不能证明组别导致数值差异,混杂变量也可能解释观察到的关系。异常值会强烈影响组均值和标准差。得出结论前,应检查分布、样本量及异常测量值。对于人为二分的连续变量,二列相关或使用原始连续预测变量的模型可能更合适,因为切分天然连续量会损失信息。
点二列相关示例
每个二元编码与同一位置的连续值配对。
| 配对数据 | rpb | 解释 |
|---|---|---|
| 二元值 0,0,1,1;连续值 1,2,3,4 | 0.894427 | 编码为一的组数值明显更高。 |
| 二元值 0,1,0,1;连续值 10,20,30,40 | 0.447214 | 中等程度的正相关。 |
| 二元值 1,1,0,0;连续值 1,2,3,4 | -0.894427 | 互换编码会使符号反转。 |
如何计算点二列相关
- 按原始顺序,以零和一输入二元观测值。
- 以相同顺序输入配对的连续测量值。
- 选择“计算相关系数”,比较组均值并将差异标准化。
- 根据零和一的定义解释符号,并查看系数大小。
点二列相关常见问题
什么时候应该使用点二列相关?
适用于天然二元变量与连续测量值配对的情况。两个值必须描述相同的观测对象,并逐行对应。
如何解释负系数?
负值表示编码为零的观测组,其连续变量均值高于编码为一的组。互换组编码会反转符号,但不改变关联强度。
点二列相关与皮尔逊相关相同吗?
它是一个变量编码为零和一时的皮尔逊相关。点二列公式突出显示了两组连续得分均值之间的等效比较。
计算器能证明因果关系吗?
不能。相关描述的是关联,不能确立因果机制。研究设计、混杂因素、测量质量和抽样必须另行考虑。
为什么零和一都必须出现?
该统计量比较两个组,因此任何一组都不能为空。若所有编码相同,组别就没有变化,相关系数无定义。