本福特定律计算器

分析首位数字频率,将数据集与本福特定律的预期分布进行比较。

首位数字分布分析器
输入数字,用逗号、空格或分号分隔。

忽略零值;负数按绝对值进行分析。

关于本福特定律

本福特定律描述了许多自然形成的数值集合中一个出人意料的规律:第一个有效数字并非均匀分布。数字 1 出现在首位的比例约为 30.1%,而 9 仅约为 4.6%。数字 d 的预期概率为 log10(1 + 1/d)。当数值跨越多个数量级,且来自乘法过程而非人为指定的范围时,往往会呈现这种对数规律。 本计算器提取每个有效数值的第一个非零数字,将 1 至 9 的实际比例与本福特定律的理论比例进行比较,并报告样本量、平均绝对偏差和卡方统计量。平均绝对偏差概括实际比例与预期比例之间的平均差距。卡方统计量用预期计数对计数差的平方进行加权,因此较大的偏离影响更强。这里的两项指标均为描述性指标;解读正式统计显著性时,还需考虑样本量、数据间的依赖关系及数据选择方式。 本福特分析常用于法务会计、审计、选举数据探索、科研质量控制和异常检测,作为初步筛查手段。异常分布可帮助调查者找出值得进一步检查的记录,但不能证明存在欺诈或造假。合法数据也可能因封顶、舍入、人工赋值、集中于狭窄区间,或受最小值或最大值限制而不符合定律。发票编号、邮政编码、电话号码及其他标识符尤其不适用,因为其数字是分配的,而非自然生成的。 要进行有意义的比较,请提供规模较大且绝对值跨越多个十次幂的数据集。可以包含负数,因为其绝对值具有相同的首位数字;零没有第一个有效数字,因此会被排除。不要仅为增加样本量而混合本质上无关的总体。如果结果显示较大差异,请先检查采集方法、范围限制、舍入规则及子组表现,再作结论。本福特定律最适合作为一种诊断信号,与领域知识、数据校验和其他统计证据结合使用。

本福特定律示例

以下示例展示不同的首位数字模式如何影响比较结果。

数据集模式预期结果解读
1,000 个数值中有 301 个以 1 开头数字 1 的实际频率:30.10%与本福特定律对数字 1 的预期频率完全一致。
1,000 个数值中有 46 个以 9 开头数字 9 的实际频率:4.60%接近预期频率 4.58%。
1,000 个数值中有 500 个以 1 开头数字 1 的实际频率:50.00%明显偏离预期的 30.10%。

如何分析数据集

  1. 收集可比较、自然生成且数值范围较广的数据。
  2. 在数据集字段输入数值,用逗号、空格或分号分隔。
  3. 选择“分析分布”,计算首位数字的实际频率与预期频率。
  4. 查看偏差指标,并在解读异常前了解数据背景。

常见问题

什么是本福特定律?

本福特定律描述许多现实数据集第一个有效数字的对数概率分布,预测较小的首位数字比较大的数字更常见。

不符合定律就能证明欺诈吗?

不能。不符合定律只是一种筛查信号,可能值得进一步调查。范围限制、舍入、选择规则或人工编号均可造成合理偏离。

需要多少数据?

较大的样本通常产生更稳定的频率,数百条观测优于数十条。样本是否适用及数值范围,与原始数量同样重要。

可以包含负数和小数吗?

可以。计算器使用绝对值并寻找第一个非零数字,因此正负号和小数点位置不会改变首位数字。零没有有效首位数字,会被排除。

哪些数据集不适合本福特分析?

人工分配的标识符、固定价格表以及局限于狭窄区间的数值通常不适用。跨越多个数量级的自然测量值最可能符合该定律。