组距计算器
根据数据上下限或原始数据集,为频数分布表或直方图求出实用的分组区间宽度。
计算组距
选择输入方式,指定组数,计算向上取整的区间宽度。
关于组距
组距是在频数分布表或直方图中,将定量数据分组时每个区间的宽度。分组可将冗长的单个数值列表转为紧凑的汇总,呈现集中程度、离散程度、间隙和整体形状。等宽分组尤其有用,因为柱高可以直接比较,且每个观察值都按相同尺度分类。
基本计算方法是将数据极差除以所需组数。极差等于最大值减去最小值。小数组距可能不便使用,而且边界设置不慎时可能无法覆盖最大观察值,因此本计算器将商向上取整。例如最小值为 5、最大值为 47、分为六组时,极差为 42,组距为 7。分组边界可从 5 开始,每次增加七。
可以直接输入已知的最小值与最大值,也可以输入以逗号分隔的原始数据集。在原始数据模式中,计算器会自动识别最小和最大观察值。两种方式都要求组数为正整数。组数太少会掩盖重要结构,太多则会使图形杂乱,出现稀疏或空区间。常见起点为五到二十组,具体取决于样本量与分析目的。
有几种规则可用于建议组数。斯特奇斯规则约为 1 + log₂(n),平方根规则使用 √n。这些只是参考,并非通用答案。大样本、偏斜分布、离散测量或多数据集比较需求,都可能需要不同选择。比较直方图时,尽可能统一边界与组距,避免分组方式造成虚假的视觉差异。
组限和组界也需要谨慎处理。连续数据通常使用半开区间,例如从 5 到但不含 12,接着从 12 到但不含 19。最后一个区间应按需包含最大值。对于整数测量值,可将边界移动半个单位以避免歧义。标签应清楚说明所用约定。
取整后的组距是实用起点,不应凌驾于专业判断之上。分析者常选择附近便于阅读的数值,如 5、10 或 25,再调整起始边界以覆盖所有数据。务必确认最终区间序列包含最小值和最大值,且区间不重叠、不留空隙。
组距示例
无论直接输入上下限,还是从原始数据推导上下限,都使用相同公式。
| 输入 | 组距 | 计算过程 |
|---|---|---|
| 最小值 5,最大值 47,6 组 | 7 | 极差 42 除以 6,恰好为 7。 |
| 数据 12,18,25,31,42;5 组 | 6 | 极差 30 除以 5,得到组距 6。 |
| 最小值 3,最大值 40,5 组 | 8 | 商 7.4 向上取整,以容纳所有观察值。 |
如何计算组距
- 选择输入已知上下限,或以逗号分隔的原始数据集。
- 输入最小值与最大值,或至少两个有限观察值。
- 输入正整数作为所需组数。
- 选择“计算组距”,用取整后的结果构建连续区间。
组距常见问题
为什么计算器将组距向上取整?
向上取整有助于让指定数量的等宽区间覆盖完整范围。向下取整可能使最大值落在最后一组之外。
应该分成多少组?
五到二十组是常见实用范围,但样本量和分布形状也很重要。斯特奇斯规则或平方根规则可提供初步估计。
组距和极差一样吗?
不一样。极差衡量最小值到最大值的全部距离,组距则将该距离划分为指定数量的分组区间。
数据可以包含负数或小数吗?
可以。计算器接受有限的负数和小数观察值。为便于分组,得到的商仍会向上取整为整数组距。
第一组应该从哪里开始?
可以从最小值或略低于最小值的方便数值开始。无论选择哪个起点,都应确保区间覆盖全部数据、互不重叠且间距一致。