Hypothesis Testing, End to End
하나의 데이터로 보는
t → p → α → CI → β의 흐름
시험 평균이 100점인지 확인하기 위해 25명을 조사했습니다. 같은 데이터 하나가 표준오차, t값, p값, 신뢰구간, 검정력까지 전부 어떻게 이어지는지 순서대로 따라가 봅니다.
주어진 데이터
H₀μ = 100
Hₐμ ≠ 100
α0.05
SE표준오차
표본평균이 얼마나 흔들리는가
t값을 구하기 전에, 먼저 표본평균 104가 얼마나 오차를 가질 수 있는지부터 확인합니다.
tt-value
100에서 몇 SE만큼 떨어졌나
차이는 4점, SE는 2점이므로 100으로부터 표준오차 2개만큼 떨어져 있다는 뜻입니다.
pp-value
이 정도 차이가 나올 가능성
자유도 df = n − 1 = 24. 양측검정이므로 t분포에서 양쪽 꼬리 확률을 더합니다.
귀무가설(H₀: μ=100)이 사실이라고 가정해도, 지금처럼 100에서 꽤 떨어진 결과가 나올 가능성이 약 5.7% 있다는 뜻입니다.
α기각 기준과의 비교
두 가지 방법, 같은 결론
α = 0.05는 데이터에서 계산되는 값이 아니라, 검정을 하기 전에 미리 정해두는 기준입니다. 이 기준으로 두 가지 방식으로 판단해도 결론은 같아야 합니다.
p-value 방식
0.0569 > 0.05
p > α
t-value 방식
2.00 < 2.064
|t| < t*
t = 2.00은 기각역(±2.064) 안쪽, 즉 채택역에 있습니다.
p > α → 같은 결론 ← |t| < t*
"평균이 100이라는 가설을 기각할 만큼 충분한 증거가 없다"는 뜻입니다.
CI95% 신뢰구간
μ가 있을 것으로 보이는 범위
자유도 24, 양측 0.025 기준으로 t-table을 보면 t* = 2.064입니다.
H₀(=100)이 95% 신뢰구간 안에 있습니다 → Fail to Reject.
p-value로 얻은 결론과 정확히 같습니다. p > α 이면 H₀ 값은 항상 CI 안에 있고, p < α 이면 항상 CI 밖에 있습니다.
β놓칠 확률과 검정력
β는 데이터에서 저절로 나오지 않는다
지금까지의 값들과 달리 β는 표본만으로 하나로 정해지지 않습니다. "실제 평균이 얼마라고 가정할 것인가"가 먼저 필요합니다. 여기서는 실제 평균이 μ = 108이라고 가정해봅니다. (H₀는 여전히 μ=100입니다.)
Power · 실제 효과를 잡아낼 확률
≈ 0.970
β = 1 − Power · 놓칠 확률
≈ 0.030
실제 평균이 108인데도, "100이라고 볼 수 있다"며 차이를 놓칠 확률이 약 3%라는 뜻입니다.
Σ전체 요약
같은 데이터, 한눈에 정리
n주어진 표본 크기25
x̄주어진 표본평균104
s주어진 표본표준편차10
SE평균의 흔들림, s/√n2
tH₀에서 몇 SE 떨어졌나2.00
dfn−1, t분포의 자유도24
pH₀가 맞을 때 이 결과가 나올 가능성0.0569
α미리 정한 기각 기준0.05
t*기각 경계, t-table 값2.064
CIμ가 있을 것으로 보는 범위(99.872, 108.128)
β실제 효과를 놓칠 확률 (μ=108 가정)≈0.030
Power실제 효과를 잡아낼 확률≈0.970