t检验计算器

输入各组均值、标准差和样本量,即可进行双样本Welch t检验,并即时获得双侧p值。

独立双样本t检验
比较两个独立总体的均值,无需假定总体方差相等。

关于双样本t检验

独立双样本t检验用于评估两个互不相关组的均值差异,是否超出了随机抽样波动通常会产生的程度。本计算器采用Welch t检验,不要求两个总体的方差相等。它使用各组的均值、样本标准差和样本量等汇总统计量,因此适合没有原始观测数据、但有可靠汇总数据的情况。 检验统计量等于组间均值之差除以其标准误。Welch方法的标准误为√(s₁²/n₁ + s₂²/n₂)。统计量为正表示第一组均值较大,为负表示第二组均值较大。交换组的顺序会改变符号,但不会改变双侧p值。统计量的绝对值表示观测到的均值差相当于多少个估计标准误。 Welch–Satterthwaite自由度同时考虑两组的方差和样本量。自由度通常为非整数,这是正常现象。当两组样本量和标准差均相同时,自由度简化为n₁ + n₂ − 2,与经典合并方差检验一致。当变异程度或样本量不同时,Welch调整后的自由度通常比直接合并方差更能可靠控制第一类错误。 报告的p值为双侧p值。它表示在总体均值相等的原假设及模型假设成立时,获得任一方向上至少与当前观测结果同样极端的t统计量的概率。较小的p值提示数据与原假设模型不相容,但不代表原假设为真的概率。应将其与分析前选定的显著性水平比较,避免把任意阈值当作实际重要性的衡量标准。 该方法假定组内及组间观测相互独立、结果为定量变量,且样本能够恰当代表目标总体。小样本中严重偏态或影响较大的离群值可能削弱检验的可靠性。较大样本能提高对适度非正态性的稳健性,但独立性和合理抽样仍不可或缺。如果观测是配对的,例如同一批人的前后测量,则不应使用独立样本检验,而应对配对差值进行配对t检验。 报告统计显著性时,还应同时报告实际均值差、不确定性及研究背景。置信区间展示合理的总体均值差范围,Cohen's d等效应量有助于表达差异大小。本计算器提供准确的Welch统计量及p值,适合快速分析或核对计算,但决策还应考虑研究设计、多重比较、测量质量,以及差异在相应领域是否有实际意义。

t检验示例

分组汇总数据结果解读
组1:10,标准差2,n 25;组2:8,标准差2,n 25t = 3.5355;df = 48变异程度和样本量相同时,会得到常见的整数自由度。
组1:5,标准差1,n 10;组2:4,标准差1,n 10t = 2.2361;df = 18观测差异约等于2.24个标准误。
组1:20,标准差5,n 12;组2:20,标准差3,n 18t = 0;p = 1样本均值相等时,没有显示均值差异的证据。

如何进行双样本t检验

  1. 输入组1的均值、样本标准差和样本量。
  2. 输入独立组2对应的三项汇总统计量。
  3. 点击“运行t检验”,计算Welch统计量、自由度和双侧p值。
  4. 结合预先选定的alpha解读p值,并考虑均值差的大小和方向。

t检验常见问题

为什么使用Welch t检验?

当组间方差或样本量不同时,Welch检验仍然适用。当这些量相等时,其结果也与合并方差检验非常接近。

双侧p值检验什么?

它检验总体均值在任一方向上是否存在差异,将两侧尾部中至少与观测统计量同样极端的结果都计入。

为什么自由度有时是小数?

Welch近似会针对不等方差和样本量调整自由度。非整数值在数学上有效,计算p值前不应将其取整。

能用于配对观测吗?

不能。配对观测并不独立,需要分析配对内差值。重复测量或匹配对象应使用配对t检验。

p值小是否意味着差异很重要?

不是。统计证据与实际重要性是不同概念。应结合背景查看均值差、置信区间及效应量。