나의 통계 자습노트 ✏️
0/19 2026.08.09

2026 AP Statistics
FRQ 자습노트

College Board 2026 Section II 서술형 6문제를, 초보자도 이해하기 쉽게 내가 직접 쓴 노트처럼 다시 정리했어요. 문제마다 스스로 풀어보는 칸이 있으니 먼저 적어보고, 그 다음에 정답을 확인해보세요!

공부법 메모
① 문제 읽기 → ② 밑에 연습장에 내 풀이 써보기 → ③ 정답 확인 버튼 누르기 → ④ 틀렸으면 왜 틀렸는지 체크!
UNIT 1 · 기술통계1 / 6
Q1.

염소 두 품종 몸무게 비교하기 🐐

📝 무슨 얘기냐면: 염소 두 품종(H, J)의 몸무게 14마리씩 표본을 뽑았어. H는 실제 숫자 목록으로, J는 상자그림(boxplot)으로 정보가 주어져. 두 품종을 비교하는 문제야.
ABreed H 데이터로 다섯수치요약(최솟값·Q1·중앙값·Q3·최댓값)을 구해보자.
데이터: 48,48,55,56,56,57,62,66,72,72,72,73,80,80 (n=14, 이미 정렬됨)
check!

n=14는 짝수라서, 중앙값은 7번째·8번째 값의 평균이야.

중앙값 = (62 + 66) / 2 = 64

앞쪽 7개(48,48,55,56,56,57,62)의 중앙값 → Q1 = 56 (4번째 값)

뒤쪽 7개(66,72,72,72,73,80,80)의 중앙값 → Q3 = 72 (4번째 값)

최솟값 48 · Q1 56 · 중앙값 64 · Q3 72 · 최댓값 80

💡 짝수 개일 땐 전체를 딱 반으로 나눈 다음, 각 반쪽 안에서 다시 중앙값을 구하면 그게 Q1, Q3야.

BBreed J의 상자그림(최솟값≈50, Q1≈57, 중앙값≈64, Q3≈80, 최댓값≈88)과 A에서 구한 값을 이용해서 중심변동성을 비교해보자.
check!

중심: H의 중앙값(64파운드)과 J의 중앙값(약 64파운드)이 거의 같다 → 두 품종의 전형적인 몸무게는 비슷해.

변동성: H의 IQR(72−56=16)과 범위(80−48=32)가, J의 IQR(약 80−57=23)과 범위(약 88−50=38)보다 작다 → J 염소들의 몸무게가 더 넓게 퍼져있다(변동성이 크다).

💡 채점 포인트: 반드시 숫자로 비교하고 "파운드(pounds)" 단위를 꼭 언급해야 만점!

C줄기잎그림을 보면 H의 데이터에 62와 66 사이 틈(gap)72에서 몰림(cluster)이 보여. i. 상자그림에서는 안 보이지만 줄기잎그림에서는 보이는 모양의 특징은? ii. 상자그림이 그걸 못 보여주는 이유는?
check!

i. 데이터 사이의 틈(gap)이나 특정 값에 몰려있는 군집(cluster) — 즉 분포가 여러 덩어리로 뭉쳐있는 모양이 줄기잎그림에서는 보이지만 상자그림에서는 안 보여.

ii. 상자그림은 개별 데이터를 다 안 보여주고, 딱 5개의 요약값(최솟값·Q1·중앙값·Q3·최댓값)만 갖고 그리기 때문에 그 사이의 빈틈이나 몰림은 알 수 없어.

UNIT 4 · 실험설계2 / 6
Q2.

커피 찌꺼기랑 장미 개수 실험 🌹

📝 무슨 얘기냐면: 식물학자 Holly가 장미덤불 30그루 중 15그루엔 커피 찌꺼기를, 나머지 15그루엔 안 넣고 3개월 뒤 장미 개수를 비교하는 실험 얘기야.
A다음 세 가지를 찾아보자. i. 처리(treatments) ii. 실험 단위(experimental units) iii. 반응변수(response variable)
check!

i. 처리: ① 커피 찌꺼기 넣기, ② 커피 찌꺼기 안 넣기 (2가지)

ii. 실험 단위: 장미덤불 30그루 (한 그루 한 그루)

iii. 반응변수: 3개월 뒤 각 장미덤불의 장미 개수

B각 처리가 같은 개수씩 배정되도록 무작위로 배정하는 방법을 설명해보자.
check!

장미덤불 30그루에 1~30번을 매긴다. 난수(랜덤) 생성기로 비복원(중복 없이) 15개의 번호를 뽑아, 그 번호의 덤불에 커피 찌꺼기 처리를 준다. 나머지 15그루는 자동으로 커피 찌꺼기 없음 처리.

💡 채점 포인트: "번호 매기기 → 난수로 15개 뽑기 → 비복원" 이 세 가지가 다 있어야 만점!

Cα = 0.05에서 결과가 통계적으로 유의했다고 한다. "통계적으로 유의하다"는 게 이 상황에서 무슨 뜻일까?
check!

만약 실제로는 커피 찌꺼기가 장미 개수에 아무 효과가 없다면(귀무가설이 참이라면), 무작위 배정만으로 우연히 지금 관측한 것만큼 크거나 더 큰 차이가 나올 확률이 0.05보다 작다는 뜻이야. 즉, 이 차이는 우연이 아니라 커피 찌꺼기 때문에 생긴 것이라는 설득력 있는 증거가 있다는 얘기지.

UNIT 5&6 · 확률분포3 / 6
Q3.

응원가 연주 시간 재기 🎵

μ
📝 무슨 얘기냐면: 응원가 연주 시간이 정규분포 N(109, 16)을 따른대. 이걸로 세 가지(정규분포, 이항분포, 기하분포)를 다 물어보는 종합 문제야.
A한 번의 연주가 120초보다 길 확률은?
check!
z = (120 − 109) / 16 = 0.6875 P(X>120) = P(Z>0.6875) = 1 − 0.7540
P(X > 120) ≈ 0.2460
B연주 10번을 뽑을 때, 120초 넘는 게 3번 이상 나올 확률 P(X≥3)은? (X는 이항분포)
check!

X ~ Binomial(n=10, p=0.246). 여사건: P(X≥3) = 1 − P(X≤2)

P(X=0) ≈ 0.0594 P(X=1) ≈ 0.1938 P(X=2) ≈ 0.2845 합계 P(X≤2) ≈ 0.5377
P(X≥3) = 1 − 0.5377 ≈ 0.4623
CBen은 모든 경기에 가. Y = 120초 넘는 연주가 처음 나올 때까지의 경기 수(기하분포). i. Y의 평균은? ii. Y의 표준편차는?
check!
i. μ_Y = 1/0.246 ≈ 4.065 (경기) ii. σ_Y = √(0.754/0.246²) = √12.461 ≈ 3.531 (경기)
DC(ii)의 표준편차, 문맥 속에서 해석해보자.
check!

Ben이 120초 넘는 연주를 처음 볼 때까지 참석하는 경기 수는, 평균 4.065경기로부터 전형적으로 약 3.531경기 정도 벗어난다.

💡 해석 문제 필수 3요소: ① 무엇의 표준편차인지 ② 단위(경기 수) ③ "전형적으로 벗어난다"는 표현.

UNIT 6 · 두 평균 검정4 / 6
Q4.

비료 브랜드별 오렌지 개수 🍊

📝 무슨 얘기냐면: 비료 C와 N을 준 나무 58그루씩, 오렌지 개수 평균·표준편차 비교. 두 독립표본 t검정 문제야.

Brand C: n=58, 평균 141, 표준편차 15  /  Brand N: n=58, 평균 148, 표준편차 19
·α=0.05에서 두 비료 간 평균 오렌지 개수에 차이가 있다는 증거가 있을까? (가설→조건→검정통계량→p값→결론 순서로 풀어보자)
check!

① 가설:

H0: μ_C = μ_N (평균 차이 없음) Ha: μ_C ≠ μ_N (평균 차이 있음)

② 조건: 무작위 배정으로 두 그룹을 만들었고, n=58씩 표본이 충분히 커서 중심극한정리로 표본평균 분포가 근사적으로 정규분포를 따른다.

③ 검정통계량:

SE = √(15²/58 + 19²/58) ≈ 3.179 t = (141 − 148) / 3.179 ≈ −2.20

④ p값: df≈57에서 양측 p값 ≈ 0.031

⑤ 결론: p값(0.031) < α(0.05) → H0 기각. 브랜드 C와 N 비료를 준 나무들의 평균 오렌지 개수가 다르다는 설득력 있는 통계적 증거가 있다.

💡 결론엔 항상 p값 vs α 비교 + 기각/채택 + 문맥(오렌지, 브랜드) 3가지가 다 들어가야 해!

UNIT 3&8 · 확률/카이제곱5 / 6
Q5.

프로선수 연령대 & 종목 이원표 🎲

📝 무슨 얘기냐면: 프로선수 4,193명 전체(모집단)를 연령대 × 종목으로 나눈 표. 확률 계산 + 모자이크플롯 + 독립성 판단까지 종합적으로 물어봐.

전체 합계 — 농구 516 / 미식축구 2,461 / 야구 1,216, 전체 4,193명. (미식축구&35세↑ 교차 41명, 야구&35세↑ 교차 61명)
A i. 무작위로 뽑은 선수가 미식축구 선수일 확률은? ii. 미식축구 선수라는 조건 하에 "25≤나이<30"일 확률은?
check!
i. P(미식축구) = 2,461/4,193 ≈ 0.5869 ii. P(25≤나이<30 | 미식축구) = 1,326/2,461 ≈ 0.5388
B모자이크플롯의 너비 b, 높이 h는 확률을 나타내. i. b는 A(i)와 A(ii) 중 어느 것과 대응할까? ii. 넓이 x=b·h는 무슨 확률을 뜻할까?
check!

i. b(막대의 너비)는 A(i) — P(미식축구)에 대응해. (h는 그 안에서의 조건부확률 = A(ii))

ii. x = b×h는 "미식축구 선수 이면서 동시에 25≤나이<30인" 결합확률 P(미식축구 그리고 25≤나이<30)이야.

C i. "야구"와 "35세≤나이"는 배반사건일까? ii. 이 둘은 독립일까?
check!

i. 배반 아님. 야구선수이면서 35세 이상인 선수가 61명 있으니까(교집합≠0) 동시에 일어날 수 있어.

P(야구)×P(35세≤) ≈ 0.2900×0.02886 ≈ 0.00837 P(야구 그리고 35세≤) = 61/4,193 ≈ 0.01455
0.00837 ≠ 0.01455 → 독립 아님
D이건 표본이 아니라 4,193명 전체(모집단) 데이터야. 카이제곱 독립성 검정을 하는 게 적절할까?
check!

적절하지 않아. 통계적 추론(검정)은 표본으로 모집단을 추정할 때 쓰는 도구야. 근데 이건 이미 모집단 전체라서 더 이상 추정할 게 없어 — 이미 정확한 값을 다 알고 있으니까!

UNIT 9 · 회귀분석6 / 6
Q6.

안타 수 vs 득점 수 회귀분석 ⚾

📝 무슨 얘기냐면: 30개 야구팀의 안타 수 vs 득점 수. 회귀식이 주어지고, 신뢰구간과 예측구간의 차이까지 물어보는 문제야.

회귀식: 예측 득점 = −372.2 + 0.823×(안타 수)
A i. 산점도에서 안타 수와 득점 수의 관계를 문맥 속에서 설명해보자. ii. 안타 1,250개를 달성하면 예측 득점은?
check!

i. 안타 수와 득점 수는 양(+)의, 대체로 강한 선형관계야 — 안타가 많을수록 득점도 느는 경향.

예측 득점 = −372.2 + 0.823×1,250 = −372.2 + 1,028.75
예측 득점 ≈ 656.55점
B연봉 중앙값(1억6천만$) 기준 ● 고연봉 / □ 저연봉 그룹으로 나눈 산점도(Figure 2)가 주어져. i. 동그라미 친 팀 A를 같은 그룹의 다른 팀들과 비교해보자. ii. 어느 그룹이 안타-득점 선형관계가 더 강할까?
⚠ 실제 그래프를 보면서 판단해야 하는 문제
check!

i. 팀 A가 비슷한 안타 수를 가진 같은 그룹(●)의 다른 팀들보다 득점 수가 더 많은지/적은지 눈으로 비교해서 서술하면 돼. 예: "팀 A는 비슷한 안타 수의 다른 고연봉 팀들보다 득점이 더 많다 → 전반적 추세보다 위에 있다."

ii. 각 그룹에서 점들이 직선 주변에 얼마나 가깝게 모여있는지 비교! 가까이 모여있으면 관계가 더 강함, 흩어져 있으면 더 약함.

💡 이 두 문항은 인쇄된 원본 그래프를 직접 보면서 점의 위치와 흩어진 정도를 비교해야 정확해. 위 기준을 갖고 스스로 채점해보자!

CPoint Estimate ± t*(SE) 공식을 써서 i. df=28, 95% 신뢰수준의 t*는? ii. 평균 득점의 95% 신뢰구간(SE=17.48)은? iii. 개별 팀 득점의 95% 예측구간(SE=56.78)은?
check!

i. df = 30−2 = 28 → t* ≈ 2.05

ii. CI = 656.55 ± 2.048×17.48 = 656.55 ± 35.80 → (620.75, 692.35)
iii. PI = 656.55 ± 2.048×56.78 = 656.55 ± 116.28 → (540.27, 772.83)
D i. 표본평균들의 분포가 개별 관측값 분포보다 변동성이 클까 작을까? ii. 왜 예측구간이 신뢰구간보다 더 넓을까?
check!

i. 표본평균들의 분포는 개별 관측값보다 변동성이 더 작다. 여러 값을 평균 내면 극단값들이 서로 상쇄되니까!

ii. 예측구간 공식엔 신뢰구간 공식에 개별 관측값 하나의 변동성(s²)이 추가로 더해져. 즉 예측구간은 "평균의 불확실성" + "개별값 자체의 추가 변동성"을 다 반영하니까 SE가 더 크고, 구간도 더 넓어져.

오늘 학습 완료! 🎉

오늘의 통계 단어장 🗂️

카드를 눌러서 뒤집어보자 (앞: 용어 · 뒤: 뜻)

다섯수치요약Five-Number Summary
최솟값·Q1·중앙값·Q3·최댓값. 상자그림을 그릴 때 쓰는 5개 숫자.
IQR사분위범위
Q3 − Q1. 데이터 중간 50%가 퍼진 정도(변동성 지표).
처리Treatment
실험에서 실험 단위에 가하는 서로 다른 조건(예: 커피 찌꺼기 O/X).
통계적 유의성Statistical Significance
귀무가설이 참이라면, 지금 관측한 결과(또는 더 극단적인 결과)가 우연히 나올 확률(p값)이 α보다 작다는 뜻.
이항분포Binomial
독립된 시행을 n번 반복할 때, 성공 횟수 X의 분포. 평균=np.
기하분포Geometric
첫 성공이 나올 때까지 걸리는 시행 횟수 Y의 분포. 평균=1/p.
독립사건Independent
P(A∩B) = P(A)×P(B)가 성립하면 독립. 성립 안 하면 독립 아님!
신뢰구간 vs 예측구간CI vs PI
신뢰구간=평균을 추정, 예측구간=개별값을 예측. 예측구간이 항상 더 넓다(개별 변동성 s² 추가).