本福特定律计算器
分析首位数字频率,将数据集与本福特定律的预期分布进行比较。
首位数字分布分析器
输入数字,用逗号、空格或分号分隔。
忽略零值;负数按绝对值进行分析。
关于本福特定律
本福特定律描述了许多自然形成的数值集合中一个出人意料的规律:第一个有效数字并非均匀分布。数字 1 出现在首位的比例约为 30.1%,而 9 仅约为 4.6%。数字 d 的预期概率为 log10(1 + 1/d)。当数值跨越多个数量级,且来自乘法过程而非人为指定的范围时,往往会呈现这种对数规律。
本计算器提取每个有效数值的第一个非零数字,将 1 至 9 的实际比例与本福特定律的理论比例进行比较,并报告样本量、平均绝对偏差和卡方统计量。平均绝对偏差概括实际比例与预期比例之间的平均差距。卡方统计量用预期计数对计数差的平方进行加权,因此较大的偏离影响更强。这里的两项指标均为描述性指标;解读正式统计显著性时,还需考虑样本量、数据间的依赖关系及数据选择方式。
本福特分析常用于法务会计、审计、选举数据探索、科研质量控制和异常检测,作为初步筛查手段。异常分布可帮助调查者找出值得进一步检查的记录,但不能证明存在欺诈或造假。合法数据也可能因封顶、舍入、人工赋值、集中于狭窄区间,或受最小值或最大值限制而不符合定律。发票编号、邮政编码、电话号码及其他标识符尤其不适用,因为其数字是分配的,而非自然生成的。
要进行有意义的比较,请提供规模较大且绝对值跨越多个十次幂的数据集。可以包含负数,因为其绝对值具有相同的首位数字;零没有第一个有效数字,因此会被排除。不要仅为增加样本量而混合本质上无关的总体。如果结果显示较大差异,请先检查采集方法、范围限制、舍入规则及子组表现,再作结论。本福特定律最适合作为一种诊断信号,与领域知识、数据校验和其他统计证据结合使用。
本福特定律示例
以下示例展示不同的首位数字模式如何影响比较结果。
| 数据集模式 | 预期结果 | 解读 |
|---|---|---|
| 1,000 个数值中有 301 个以 1 开头 | 数字 1 的实际频率:30.10% | 与本福特定律对数字 1 的预期频率完全一致。 |
| 1,000 个数值中有 46 个以 9 开头 | 数字 9 的实际频率:4.60% | 接近预期频率 4.58%。 |
| 1,000 个数值中有 500 个以 1 开头 | 数字 1 的实际频率:50.00% | 明显偏离预期的 30.10%。 |
如何分析数据集
- 收集可比较、自然生成且数值范围较广的数据。
- 在数据集字段输入数值,用逗号、空格或分号分隔。
- 选择“分析分布”,计算首位数字的实际频率与预期频率。
- 查看偏差指标,并在解读异常前了解数据背景。
常见问题
什么是本福特定律?
本福特定律描述许多现实数据集第一个有效数字的对数概率分布,预测较小的首位数字比较大的数字更常见。
不符合定律就能证明欺诈吗?
不能。不符合定律只是一种筛查信号,可能值得进一步调查。范围限制、舍入、选择规则或人工编号均可造成合理偏离。
需要多少数据?
较大的样本通常产生更稳定的频率,数百条观测优于数十条。样本是否适用及数值范围,与原始数量同样重要。
可以包含负数和小数吗?
可以。计算器使用绝对值并寻找第一个非零数字,因此正负号和小数点位置不会改变首位数字。零没有有效首位数字,会被排除。
哪些数据集不适合本福特分析?
人工分配的标识符、固定价格表以及局限于狭窄区间的数值通常不适用。跨越多个数量级的自然测量值最可能符合该定律。