AP Statistics · 계산기와 함께 끝내는 개념 워크북

알파, 베타, p-value,
이제 숫자로 직접 만나보자.

단원마다 아주 단순한 숫자로 예제를 만들고, 손으로 공식을 풀어본 다음, TI-84로 똑같이 계산해본다. 마지막엔 헷갈리기 쉬운 개념을 표로 정리하고 객관식 문제로 점검한다. 5월 시험에서 5점 받는 게 목표다.

UNIT 1 · 1.6, 1.9

정규분포와 z-score

z-score는 어떤 값이 평균에서 표준편차 몇 개만큼 떨어져 있는지를 나타낸다. z = (x − 평균) / 표준편차. z를 구하면 표준정규분포표나 계산기의 normalcdf로 확률을 바로 구할 수 있다.

단순 데이터 학생 5명의 시험 점수: 70, 75, 80, 85, 90
손으로 계산하기
평균 x̄ = (70+75+80+85+90) / 5 = 80

편차 제곱합 = 100+25+0+25+100 = 250
표본표준편차 Sx = √(250 / (5−1)) = √62.5 ≈ 7.906

x = 90일 때 z = (90 − 80) / 7.906 ≈ 1.26
P(X > 90) = P(Z > 1.26) ≈ 0.103
① STAT → EDIT → L1에 70,75,80,85,90 입력
② STAT → CALC → 1:1-Var Stats → L1 → ENTER
③ 2ND → VARS(DISTR) → 2:normalcdf(
normalcdf(90, 1E99, 80, 7.906)
x̄ = 80 Sx = 7.9057 normalcdf(...) = 0.1029
직접 계산해보기 — 점수가 70일 때 z-score는?
핵심: z-score는 부호(+/−)와 크기 둘 다 의미가 있다. z가 음수면 평균보다 작다는 뜻이고, 절댓값이 클수록 평균에서 멀리 떨어진 특이한 값이라는 뜻이다.
UNIT 4 · 4.10, 4.11

이항분포 (Binomial Distribution)

시행이 독립적이고, 결과가 성공/실패 둘 중 하나이며, 성공 확률 p가 매 시행마다 동일할 때 이항분포를 쓴다. n번 시행 중 정확히 x번 성공할 확률은 P(X=x) = C(n,x)·pˣ·(1−p)ⁿ⁻ˣ.

단순 데이터 동전을 10번 던져 앞면이 나올 확률 p = 0.5. 앞면이 정확히 6번 나올 확률은?
손으로 계산하기
C(10,6) = 210
P(X=6) = 210 × 0.5⁶ × 0.5⁴ = 210 × 0.5¹⁰ = 210 × 0.0009766
P(X=6) ≈ 0.2051 (약 20.5%)

평균 μ = np = 10 × 0.5 = 5
표준편차 σ = √(np(1−p)) = √2.5 ≈ 1.581
2ND → VARS(DISTR) → A:binompdf(
binompdf(10, 0.5, 6)
누적확률(6번 이하)이 필요하면 binomcdf(10,0.5,6)
binompdf(10,0.5,6) = 0.2051
직접 계산해보기 — B(n=10, p=0.5)에서 P(X=6)은?
핵심: 이항분포의 평균은 np, 표준편차는 √(np(1−p))라는 것만 외워두면 Unit 5의 표본비율 공식과 자연스럽게 연결된다.
UNIT 5 · 5.3, 5.7

표본분포와 중심극한정리 (CLT)

표본평균 x̄들을 모아놓은 분포를 표본분포라 한다. 중심극한정리에 따르면 표본크기 n이 커질수록 x̄의 분포는 정규분포에 가까워지고, 그 표준편차(표준오차)는 σ/√n점점 작아진다 — 표본이 클수록 표본평균이 더 안정적이라는 뜻이다.

단순 데이터 Unit 1의 모집단을 그대로 사용: μ = 80, σ = 7.906. 이번엔 n=25명씩 표본을 반복해서 뽑는다. 표본평균이 82보다 클 확률은?
손으로 계산하기
표준오차 SE = σ/√n = 7.906 / √25 = 7.906 / 5 ≈ 1.581
z = (82 − 80) / 1.581 ≈ 1.26
P(x̄ > 82) = P(Z > 1.26) ≈ 0.103
2ND → VARS(DISTR) → 2:normalcdf(
normalcdf(82, 1E99, 80, 1.581)
결과 = 0.1029
직접 계산해보기 — n=25일 때 표준오차(SE)는?
핵심: 위 계산이 Unit 1과 z값이 똑같이 나온 건 우연이 아니다 — n=25가 σ를 정확히 √25=5배 줄여서, 82와의 거리 비율이 그대로 유지됐기 때문이다. 표본크기가 표준오차를 어떻게 줄이는지 체감해보자.
UNIT 6 · 6.2–6.7

비율 신뢰구간 & 가설검정 — p-value, α, β

신뢰구간은 모수가 있을 법한 범위를 추정하고, 가설검정은 "이 결과가 우연히 나올 수 있는 정도"를 확률(p-value)로 계산해 판단한다. 유의수준 α는 검정 전에 미리 정해두는 기준선(보통 0.05)이고, p-value < α이면 귀무가설을 기각한다.

단순 데이터 — 신뢰구간 표본 100명 중 60명이 제품을 선호(p̂ = 0.6). 모비율에 대한 95% 신뢰구간은?
손으로 계산하기
SE = √(p̂(1−p̂)/n) = √(0.6×0.4/100) = √0.0024 ≈ 0.0490
오차범위 ME = 1.96 × 0.0490 ≈ 0.0960
95% CI = 0.6 ± 0.096 = (0.504, 0.696)
STAT → TESTS → A:1-PropZInt
x=60, n=100, C-Level=.95
(.50399, .69601) p̂ = 0.6
단순 데이터 — 가설검정 같은 표본(60/100)으로 H₀: p = 0.5 vs Hₐ: p > 0.5를 α=0.05에서 검정.
손으로 계산하기
SE₀ = √(p₀(1−p₀)/n) = √(0.5×0.5/100) = √0.0025 = 0.05
z = (0.6 − 0.5) / 0.05 = 2.00
p-value = P(Z > 2.00) ≈ 0.0228
판단: 0.0228 < 0.05 → H₀ 기각 (유의미하게 0.5보다 크다)
STAT → TESTS → 5:1-PropZTest
p₀=.5, x=60, n=100, prop>p₀
z = 2.00 p = 0.0228
직접 계산해보기 — 위 검정통계량 z 값은?
α vs β 한 번에 정리:
• α (제1종 오류 확률) = 참인 H₀를 잘못 기각할 위험. 검정 전에 내가 직접 정하는 값이다.
• β (제2종 오류 확률) = 거짓인 H₀를 기각하지 못할 위험. 표본크기를 늘리면 β는 줄어든다.
• 검정력(Power) = 1 − β = 실제로 효과가 있을 때 그것을 잡아낼 확률.
UNIT 7 · 7.4, 7.5

평균에 대한 t-검정

모표준편차 σ를 모르고 표본표준편차 s로 대신 추정할 때는 z 대신 t분포(자유도 df = n−1)를 쓴다. t분포는 z분포보다 꼬리가 두꺼워서, 같은 통계량이라도 t검정의 p-value가 z검정보다 살짝 더 크게 나온다.

단순 데이터 학생 8명의 개선된 점수: 표본평균 x̄=82, 표본표준편차 s=6, n=8. H₀: μ=78 vs Hₐ: μ≠78 (양측검정, α=0.05)
손으로 계산하기
SE = s/√n = 6/√8 = 6/2.828 ≈ 2.121
t = (82 − 78) / 2.121 ≈ 1.886
df = n − 1 = 7
p-value (양측) ≈ 0.102
판단: 0.102 > 0.05 → H₀ 기각 못함 (유의미한 차이라 보기 어려움)
STAT → TESTS → 2:T-Test → Stats
μ₀=78, x̄=82, Sx=6, n=8, ≠μ₀
t = 1.886 p = 0.1018 df = 7
직접 계산해보기 — 검정통계량 t 값은?
핵심: 공식 구조는 z-검정과 완전히 똑같다 — (통계량−가정값)/표준오차. 달라지는 건 σ 대신 s를 쓰고, 정규분포 대신 t분포(df=n−1)의 표를 본다는 것뿐이다.
UNIT 8 · 8.2, 8.3

카이제곱 적합도 검정 (Goodness of Fit)

범주형 자료의 관측도수기대도수와 얼마나 다른지를 측정한다. χ² = Σ (관측−기대)² / 기대. 차이가 클수록 χ²가 커지고 p-value는 작아진다.

단순 데이터 주사위를 60번 던진 눈금별 관측도수: 8, 12, 9, 11, 10, 10. 공정한 주사위라면 각 눈금 기대도수는 60/6 = 10.
손으로 계산하기
χ² = (8−10)²/10 + (12−10)²/10 + (9−10)²/10 + (11−10)²/10 + 0 + 0
χ² = 0.4 + 0.4 + 0.1 + 0.1 + 0 + 0 = 1.0
df = 6 − 1 = 5
p-value ≈ 0.96 (매우 크다) → H₀ 기각 못함 (주사위는 공정해 보임)
L1 = 관측값 {8,12,9,11,10,10}
L2 = 기대값 {10,10,10,10,10,10}
STAT → TESTS → D:χ²GOF-Test
χ² = 1.00 p = 0.9626 df = 5
직접 계산해보기 — 위 χ² 통계량 값은?
핵심: χ²는 항상 0 이상이며, 0에 가까울수록 "관측값이 기대값과 잘 맞는다"는 뜻이다. z나 t와 달리 왼쪽 극단은 의미가 없고 오른쪽 꼬리(큰 값)만 기각역이 된다.
UNIT 9 · 9.4, 9.5

회귀직선 기울기 검정

두 양적변수 사이에 선형관계(기울기 ≠ 0)가 있는지를 검정한다. 기울기의 표준오차를 이용해 t통계량을 만들고, 자유도는 df = n − 2 (데이터 점 개수에서 절편·기울기 2개를 뺀 값)이다.

단순 데이터 회귀 데이터 n=6쌍에서 계산기가 알려준 결과: 기울기 b₁=2.5, 기울기의 표준오차 SEᵦ=0.8. H₀: β₁=0 vs Hₐ: β₁≠0
손으로 계산하기
t = b₁ / SEᵦ = 2.5 / 0.8 ≈ 3.125
df = n − 2 = 6 − 2 = 4
p-value (양측) ≈ 0.035 → H₀ 기각 (기울기는 0이 아니다, 관계 있음)
L1, L2에 원자료 입력 후
STAT → TESTS → E:LinRegTTest
Xlist=L1, Ylist=L2, β & ρ ≠0
t = 3.125 p ≈ 0.035 df = 4
직접 계산해보기 — 기울기 검정의 t 값은?
핵심: 구조는 계속 똑같다 — (추정값−0) / 표준오차. 평균, 비율, 기울기 어떤 검정이든 이 패턴만 기억하면 공식을 따로 외울 필요가 줄어든다.

⑧ 헷갈림 방지 표 — p-value · α · β · 제1·2종 오류

AP 시험에서 가장 많이 틀리는 게 바로 이 개념들 서로 헷갈리는 것이다. 한 번에 정리해서 눈에 박아두자.

용어정의누가 정하는가기억하는 법
α (유의수준) 제1종 오류를 저지를 확률의 허용 기준선. 보통 0.05. 검정 시작 전에 연구자가 직접 정한다. "내가 감수할 위험선"
p-value H₀가 참이라고 가정할 때, 관측된 만큼 극단적이거나 더 극단적인 결과가 나올 확률. 검정통계량 계산 후 계산으로 얻는다. "내 데이터가 얼마나 놀라운가"
제1종 오류 (Type I) H₀가 참인데 잘못 기각하는 오류. 확률 = α. "멀쩡한 사람을 범인으로 판결"
제2종 오류 (Type II) H₀가 거짓인데 기각하지 못하는 오류. 확률 = β. "진짜 범인을 무죄로 판결"
β 제2종 오류를 저지를 확률. 표본크기 ↑ 이면 β ↓. 표본크기·효과크기로 결정됨 (직접 지정 X). "놓칠 확률"
검정력 (Power) Hₐ가 참일 때 실제로 H₀를 기각해낼 확률. Power = 1 − β. "진짜 효과를 잡아낼 힘"
z-검정 모표준편차 σ를 알고 있을 때 사용. 비율 검정은 항상 z. "σ를 안다 → z"
t-검정 모표준편차 σ를 모르고 표본 s로 추정할 때 사용. 평균 검정은 대부분 t. "σ를 모른다 → t (df=n−1)"
이항분포 독립시행 n번, 성공확률 p 일정, 결과는 성공/실패 둘 중 하나. μ=np, σ=√(np(1−p))
정규분포 연속형 데이터가 평균 중심으로 좌우대칭 종모양을 이룰 때. CLT의 극한 형태이기도 함. z = (x−μ)/σ

⑨ 실전 문제 10제 (객관식)

답을 고르면 바로 정답 여부와 해설이 나온다. 다 풀고 나면 [채점하기]를 눌러 점수를 확인하자.

10문항 · 각 1점 0 / 10