카이제곱 적합도 계산기

범주별 관측빈도와 기대빈도를 비교하고 카이제곱 통계량, 자유도, p값을 계산합니다.

적합도 검정
서로 대응하는 관측빈도와 기대빈도 목록을 쉼표로 구분해 입력하세요.

카이제곱 적합도 안내

카이제곱 적합도 검정은 관측된 범주별 빈도를 이론, 과거 모형 또는 지정된 확률분포가 예측한 빈도와 비교합니다. 하나의 범주형 변수를 대상으로 합니다. 귀무가설은 모집단이 제시된 범주 비율을 따른다고 가정하며, 대립가설은 하나 이상의 비율이 다르다고 봅니다. 주사위가 공정한지, 고객 선택이 예측을 따르는지, 유전 결과가 제시된 비율에 맞는지 확인할 때 흔히 사용합니다. 계산기는 각 관측빈도를 같은 위치의 기대빈도와 짝짓습니다. 범주마다 (관측값 − 기대값)² / 기대값을 계산하고 이를 합해 카이제곱 통계량을 구합니다. 영이면 모든 관측빈도가 기대빈도와 정확히 일치합니다. 값이 클수록 전체 불일치가 크며, 기대빈도가 작은 범주의 차이에 상대적으로 더 큰 가중치가 적용됩니다. 모든 기대비율을 현재 자료와 독립적으로 지정했다면 자유도는 보통 범주 수에서 일을 뺀 값입니다. 관측자료에서 모수를 추정했다면 자유도를 추가로 빼야 합니다. 이 계산기는 범주 수에서 일을 빼므로 분포 모수를 적합하는 분석자는 방법을 조정해야 합니다. p값은 해당 카이제곱 분포에서 계산된 통계량의 상위 꼬리 확률입니다. 검정 전에 관측이 독립적이고 범주가 서로 배타적이며 입력값이 백분율이 아닌 빈도인지 확인하세요. 카이제곱 근사가 잘 작동하려면 기대빈도는 일반적으로 최소 다섯이어야 합니다. 기대빈도가 작은 범주는 과학적으로 의미 있고 관측 차이를 참고하지 않고 결정한 경우에 한해 합칠 수 있습니다. 그렇지 않으면 정확 검정이나 시뮬레이션 기반 검정이 더 적절할 수 있습니다. 작은 p값은 제시된 분포가 맞다면 관측된 편차가 드물다는 뜻입니다. 어떤 범주가 결과를 주도하는지, 인과적 설명이 무엇인지, 실질적으로 얼마나 중요한지는 알려 주지 않습니다. 각 셀의 기여도를 살피고 관측값과 기대값을 비교해 패턴을 이해하세요. 유의수준은 결과를 보기 전에 정하고 다중 검정이 해석에 영향을 주는지도 고려해야 합니다. 기대빈도의 합은 관측빈도의 합과 같아야 합니다. 기대확률이 있다면 각 확률에 전체 관측 수를 곱한 뒤 입력하세요. 반올림으로 생긴 작은 합계 차이는 수정하여 모형과 표본이 같은 수를 나타내게 해야 합니다. 이러한 확인을 거치면 적합도 계산기로 범주형 자료가 제시된 모형을 얼마나 잘 따르는지 투명하고 재현 가능하게 요약할 수 있습니다.

적합도 예시

각 행은 관측빈도를 완전히 지정된 기대분포와 비교합니다.

관측값과 기대값검정 결과해석
20,20,20 대 20,20,20χ² = 0, df = 2, p = 1관측분포와 기대분포가 정확히 일치합니다.
10,20,30 대 20,20,20χ² = 10, df = 2, p ≈ 0.00674범주별 빈도가 같다는 가정을 잘 뒷받침하지 않습니다.
48,52 대 50,50χ² = 0.16, df = 1, p ≈ 0.689작은 편차는 50/50 모형과 양립합니다.

적합도 계산 방법

  1. 일관된 범주 순서로 관측빈도를 나열하세요.
  2. 정확히 같은 순서로 양수인 기대빈도를 나열하세요.
  3. 적합도 계산을 선택해 검정 결과를 구하세요.
  4. p값을 미리 정한 유의수준과 비교하고 범주별 차이를 살펴보세요.

적합도 자주 묻는 질문

관측빈도와 기대빈도의 합이 같아야 하나요?

네, 두 목록은 같은 전체 관측 수를 나타내야 합니다. 검정 전에 기대확률을 빈도로 바꾸고 반올림 오차를 수정하세요.

자유도는 어떻게 계산하나요?

기본값은 범주 수에서 일을 뺀 값입니다. 같은 관측자료에서 모수를 추정했다면 자유도를 추가로 빼세요.

기대빈도가 영이어도 되나요?

아니요. 각 범주의 기여도를 계산할 때 기대빈도로 나눕니다. 관측된 범주에 영의 확률을 부여하는 모형에는 다른 분석 방법이 필요합니다.

기대빈도가 다섯 미만이면 어떻게 하나요?

희소한 범주에서는 카이제곱 근사가 불안정할 수 있습니다. 타당한 범주 통합이나 정확한 시뮬레이션 기반 적합도 검정을 고려하세요.

유의한 결과는 무엇을 뜻하나요?

선택한 기준에서 자료가 제시된 분포와 일치하지 않는다는 뜻입니다. 차이의 이유나 실질적 중요성을 그 자체로 설명하지는 않습니다.