カイ二乗検定計算機
分割表、カイ二乗統計量、自由度、p値を使い、2つのカテゴリ変数に関連があるか検定します。
独立性のカイ二乗検定
列はカンマ、行はセミコロンで区切ってください。
独立性のカイ二乗検定について
独立性のカイ二乗検定は、2つのカテゴリ変数に統計的な関連があるかを評価します。データは分割表に配置し、各行は一方の変数のカテゴリ、各列はもう一方の変数のカテゴリを表し、各セルに観測度数を入れます。帰無仮説は変数が独立であること、つまり列方向の割合がどの行でも同じであることを示します。対立仮説は関連があるとします。
計算機は各セルの行合計、列合計、総合計から期待度数を求めます。期待度数は行合計と列合計の積を総合計で割った値です。各セルについて (観測度数 − 期待度数)² / 期待度数 を計算し、その合計をカイ二乗統計量とします。観測度数と期待度数のずれが大きいほど統計量も大きくなります。自由度は (行数 − 1) × (列数 − 1) です。
p値は、求めた統計量と自由度に対応するカイ二乗分布の上側確率です。p値が小さいほど、本当に独立ならこれほどのずれは起こりにくいことを示します。通常、分析前に決めた 0.05 などの有意水準と比較します。p値がその基準を下回れば帰無仮説を棄却する根拠になりますが、関連の強さや実用上の重要性を測るものではありません。
観測が互いに独立し、期待度数が十分に大きい場合に近似はよく機能します。一般的な目安は、すべての期待度数が一以上で、五未満のセルが 20% 以下であることです。度数の少ない二行二列の表では、代わりにフィッシャーの正確確率検定が必要な場合があります。入力は実際の度数とし、百分率、率、平均、重複した観測は使わないでください。各観測が一つのセルだけに入るよう、カテゴリは互いに排他的である必要があります。
実用上の重要性を見るときは、クラメールのVなどの効果量も併用してください。標本が非常に大きいと弱い関連でも統計的に有意になり、小さいと意味のある関連でも通常の基準に届かない場合があります。この計算機は推論に必要な統計量、自由度、p値を提供しますが、妥当な結論には研究計画、代表性のある標本抽出、両カテゴリ変数の明確な定義が欠かせません。
独立性のカイ二乗検定の例
分割表はアンケート回答、結果、カテゴリの好みなどを表せます。
| 観測度数表 | 検定結果 | 解釈 |
|---|---|---|
| 10, 20; 20, 40 | χ² = 0, df = 1, p = 1 | 両行の割合が同じなので、観測度数と期待度数が一致します。 |
| 10, 10; 10, 30 | χ² = 3.75, df = 1, p ≈ 0.0528 | p値は有意水準 0.05 に近いものの、それを上回っています。 |
| 30, 10; 10, 30 | χ² = 20, df = 1, p < 0.001 | 行のパターンが逆になっており、関連を強く示唆します。 |
カイ二乗検定の手順
- 一方の変数を行、もう一方を列にして実際の度数を配置します。
- セル間にカンマ、行間にセミコロンを入力します。
- 「カイ二乗を計算」を選び、統計量とp値を求めます。
- 分析前に決めた有意水準とp値を比較します。
カイ二乗検定のよくある質問
小さいp値は何を意味しますか?
独立を仮定すると、この観測表は起こりにくいことを意味します。関連を支持しますが、因果関係を証明したり効果量を示したりはしません。
度数の代わりに百分率を入力できますか?
いいえ。期待度数と標本変動は総標本数に依存するため、観測度数が必要です。まず元のデータを度数に戻してください。
自由度とは何ですか?
p値の計算に使うカイ二乗分布を決める値です。r行c列の表では、自由度は (r − 1)(c − 1) です。
期待度数が小さすぎる目安は?
一般には全セルの期待度数が一以上で、少なくとも 80% が五以上であることが目安です。小さな表で満たせない場合は、正確検定を検討してください。
有意なら関連は強いのですか?
必ずしもそうではありません。有意性は標本数の影響を受けるため、クラメールのVなどの効果量も報告してください。関連の重要性は文脈により異なります。