2026 AP Statistics · Section II · Free-Response

FRQ 풀이 노트

문제를 먼저 스스로 풀어본 다음, 정답 보기 버튼을 눌러 해설을 확인하세요. 기호나 계산 과정을 하나씩 짚어가며 설명했으니 통계를 처음 접해도 따라올 수 있습니다.

먼저 손으로 풀어보고, 그 다음 채점하듯 확인할 것!
1
Descriptive Statistics다섯숫자요약 · 상자그림 · 줄기잎그림

한 목장 주인이 H 품종과 J 품종, 두 종류의 염소를 키우고 있습니다. 두 품종의 몸무게를 비교하기 위해 각 품종에서 독립적으로 14마리씩 무작위로 표본을 추출했습니다. H 품종 염소 14마리의 몸무게(파운드)는 다음과 같습니다.

48, 48, 55, 56, 56, 57, 62, 66, 72, 72, 72, 73, 80, 80
Part A

위 자료를 이용해 H 품종 표본의 다섯숫자요약(five-number summary)을 구하시오.

Part B

J 품종의 몸무게 분포는 상자그림으로 주어져 있습니다 (최솟값≈50, Q1≈57, 중앙값≈64, Q3≈80, 최댓값≈88). Part A의 다섯숫자요약과 J 품종의 상자그림을 이용하여 두 품종의 중심(center)산포(variability)를 문맥에 맞게 비교하시오.

Part C

아래는 H 품종 염소의 몸무게를 나타낸 줄기잎그림입니다. (Key: 4|8 = 48 pounds)

4 | 8 8
5 | 5 6 6 7
6 | 2 6
7 | 2 2 2 3
8 | 0 0

i. Part A의 다섯숫자요약으로 상자그림을 그린다면, 줄기잎그림에서는 보이지만 상자그림에서는 드러나지 않는 분포 모양의 특징은 무엇입니까?

ii. 왜 상자그림은 (i)에서 답한 특징을 보여주지 못하는지 설명하시오.

Part A 풀이

자료가 이미 오름차순으로 정렬돼 있으므로 위치만 찾으면 됩니다. n = 14이므로:

· 최솟값 = 48, 최댓값 = 80

· 중앙값(Median): n이 짝수이므로 7번째, 8번째 값의 평균 → (62+66)/2 = 64

· Q1: 하위 절반(처음 7개: 48,48,55,56,56,57,62)의 중앙값 = 4번째 값 = 56

· Q3: 상위 절반(마지막 7개: 66,72,72,72,73,80,80)의 중앙값 = 4번째 값 = 72

다섯숫자요약: Min = 48, Q1 = 56, Med = 64, Q3 = 72, Max = 80

사분위수 구할 때 짝수 개면 "정확히 반으로 자른 뒤 각 반의 중앙값"이라고 외워두면 실수가 안 나! 중앙값 자체는 어느 쪽에도 포함시키지 않아.
Part B 풀이

중심(center): H 품종의 중앙값은 64파운드이고, J 품종의 중앙값도 약 64파운드로 두 품종의 전형적인 몸무게는 거의 비슷합니다.

산포(variability): H 품종의 IQR = Q3−Q1 = 72−56 = 16, J 품종의 IQR ≈ 80−57 = 23. 범위(range)도 H는 80−48=32, J는 약 88−50=38로 더 큽니다. 즉 J 품종의 몸무게가 H 품종보다 산포(퍼짐)가 더 큽니다.

답할 때는 반드시 "파운드"라는 단위와 "염소 몸무게"라는 맥락을 넣어 문장으로 서술해야 합니다 (숫자만 나열하면 감점).

Part C 풀이

i. 줄기잎그림을 보면 57과 62 사이, 즉 5|7 다음 6|2까지 간격(gap)이 있고, 73과 80 사이에도 값이 없는 구간이 보입니다. 또한 70대에 값이 4개나 몰려있는 군집(cluster)도 보입니다 — 이런 간격이나 뭉침, 혹은 봉우리가 두 개인 모양(bimodal) 같은 세부 형태가 특징입니다.

ii. 상자그림은 오직 최솟값·Q1·중앙값·Q3·최댓값이라는 다섯 개의 요약값만으로 그려지기 때문에, 그 사이에 실제 데이터가 어떻게 흩어져 있는지(간격, 뭉침, 봉우리 개수)는 전혀 반영하지 않습니다. 즉 개별 관측값의 위치 정보가 상자그림에는 남아있지 않습니다.

2
Experimental Design실험설계 · 통계적 유의성

식물학자 Holly는 장미 나무 흙에 커피 찌꺼기를 넣으면 장미가 더 많이 핀다는 글을 읽었습니다. 이를 검증하기 위해 통제된 환경의 온실에서 장미나무 30그루를 키웁니다. 나무가 한 달이 되었을 때 무작위로 15그루에는 매주 커피 찌꺼기 반 컵을 흙에 넣고, 나머지 15그루에는 넣지 않습니다. 3개월 후 각 나무에 핀 장미 개수를 셉니다.

Part A

i. 처리(Treatments)는 무엇입니까?

ii. 실험단위(Experimental units)는 무엇입니까?

iii. 반응변수(Response variable)는 무엇입니까?

Part B

각 처리가 같은 개수의 단위에 배정되도록, 처리를 실험단위에 무작위로 배정하는 구체적인 방법을 설명하시오.

Part C

실험 결과가 유의수준 α = 0.05에서 통계적으로 유의(statistically significant)했다고 합니다. 이 말의 의미를 문맥에 맞게 설명하시오.

Part A 풀이

i. 처리: ① 커피 찌꺼기 반 컵을 매주 흙에 추가 / ② 커피 찌꺼기를 추가하지 않음 — 이렇게 2가지 처리.

ii. 실험단위: 장미나무 30그루 (각각 처리를 배정받는 대상).

iii. 반응변수: 3개월 후 각 장미나무에 핀 장미의 개수.

Part B 풀이

30그루의 나무에 1번부터 30번까지 번호를 매깁니다. 난수표나 난수생성기를 이용해 반복 없이 15개의 번호를 무작위로 선택하고, 선택된 나무들에는 커피 찌꺼기 처리를, 선택되지 않은 나머지 15그루에는 커피 찌꺼기를 넣지 않는 처리를 배정합니다.

실험단위에 "번호를 매긴다 → 난수로 뽑는다 → 정확히 그 개수만큼 배정한다"는 세 단계를 항상 명시해야 만점이야. 그냥 "무작위로 나눈다"라고만 쓰면 부분 점수만 받아!
Part C 풀이

"통계적으로 유의하다"는 말은, 만약 실제로는 커피 찌꺼기가 장미 개수에 아무 효과가 없다면(귀무가설이 참이라면), 관찰된 것만큼 크거나 더 큰 두 그룹 간 차이가 우연히 나타날 확률이 0.05보다 작다는 뜻입니다. 즉 이 정도로 큰 차이가 순전히 우연(무작위 배정에 의한 변동)만으로 발생하기는 어렵기 때문에, 커피 찌꺼기가 실제로 장미 개수에 영향을 준다는 설득력 있는 증거로 해석합니다.

3
Probability Distributions정규분포 · 이항분포 · 기하분포

한 스포츠 팀은 매 경기 시작 시 다른 연주자가 팀 응원가를 연주합니다. 응원가 연주 시간은 평균 \(\mu = 109\)초, 표준편차 \(\sigma = 16\)초인 정규분포를 따르고, 모든 연주는 서로 독립입니다.

Part A

무작위로 선택한 한 경기의 응원가 연주 시간이 120초를 넘을 확률은?

Part B

10경기의 연주를 무작위로 선택합니다. 확률변수 \(X\)를 120초를 넘긴 경기 수라 할 때, \(P(X \ge 3)\)을 구하시오.

Part C

Ben은 이 팀의 모든 경기를 관람합니다. 확률변수 \(Y\)를 "120초를 넘기는 연주가 처음 나올 때까지 관람하는 경기 수"라 할 때:

i. \(Y\)의 평균을 구하시오.

ii. \(Y\)의 표준편차를 구하시오.

Part D

Part C(ii)에서 구한 표준편차를 문맥에 맞게 해석하시오.

Part A 풀이

표준화: \( z = \dfrac{120-109}{16} = \dfrac{11}{16} = 0.6875 \)

\( P(X>120) = P(Z>0.6875) = 1-\Phi(0.6875) \approx 1 - 0.7541 = \)0.2459

(계산기 사용 시 normalcdf(120, 10⁹, 109, 16))

Part B 풀이

한 경기가 120초를 넘길 확률을 성공확률로 보면, \(X \sim B(n=10,\ p=0.2459)\)입니다 (10번의 독립시행, 성공확률 동일 — 이항분포 조건 충족).

\(P(X\ge3) = 1-P(X\le2) = 1-[P(0)+P(1)+P(2)]\)

\(P(0)=\binom{10}{0}(0.2459)^0(0.7541)^{10}\approx 0.0595\)

\(P(1)=\binom{10}{1}(0.2459)^1(0.7541)^{9}\approx 0.1940\)

\(P(2)=\binom{10}{2}(0.2459)^2(0.7541)^{8}\approx 0.2846\)

합 = 0.5381 → \(P(X\ge3) = 1-0.5381 \approx \)0.462

(계산기 사용 시 1 - binomcdf(10, 0.2459, 2). Part A의 확률을 반올림 없이 그대로 이어서 쓰면 값이 약간 달라질 수 있으니, 채점 시엔 합리적 반올림 오차는 허용됩니다.)

Part C 풀이

"처음 성공이 나올 때까지 걸리는 시행 횟수"는 기하분포(Geometric distribution)입니다. \(p=0.2459\)일 때:

i. \( E(Y) = \dfrac{1}{p} = \dfrac{1}{0.2459} \approx \)4.07경기

ii. \( SD(Y) = \sqrt{\dfrac{1-p}{p^2}} = \sqrt{\dfrac{0.7541}{0.2459^2}} \approx \)3.53경기

"몇 번째 만에 처음 성공?" → 기하분포, "n번 중 성공 횟수" → 이항분포. 이 둘을 헷갈리면 Part B, C를 통째로 틀리게 되니 문제를 읽을 때 키워드를 꼭 표시해!
Part D 풀이

Ben이 이 과정을 여러 번 반복해서 관찰한다면, 처음으로 120초를 넘는 연주가 나오기까지 관람하는 경기 수는 평균(약 4.07경기)으로부터 평균적으로 약 3.53경기 정도 벗어난다는 뜻입니다. (표준편차는 항상 평균으로부터의 "전형적인 편차 크기"로 해석)

4
Inference for Means독립 2표본 t검정

한 농부는 현재 쓰는 비료(Brand C)와 새 비료(Brand N)로 기른 나무에서 오렌지 평균 개수에 차이가 있는지 알고 싶습니다. 58그루씩 두 비료에 무작위로 배정했고, 요약통계는 다음과 같습니다.

n평균표준편차
Brand C5814115
Brand N5814819

유의수준 α = 0.05에서, 두 비료 간 평균 오렌지 개수에 차이가 있다는 설득력 있는 통계적 증거가 있습니까? (4단계 검정 절차로 답하시오)

① 가설 (State)

\(H_0:\ \mu_C = \mu_N\) (두 비료의 모평균 오렌지 개수는 같다)

\(H_a:\ \mu_C \ne \mu_N\) (다르다), 여기서 \(\mu_C,\mu_N\)은 각각 Brand C, Brand N을 준 모든 나무의 모평균.

② 조건 확인 (Plan)

독립적인 무작위 배정(실험) → 두 표본은 서로 독립. \(n_1=n_2=58\)로 표본 크기가 충분히 크므로 중심극한정리에 의해 표본평균의 표집분포가 근사적으로 정규분포를 따른다고 볼 수 있습니다. → 이표본 t검정(two-sample t-test) 사용.

③ 계산 (Do)

표준오차: \( SE = \sqrt{\dfrac{15^2}{58}+\dfrac{19^2}{58}} = \sqrt{3.879+6.224} = \sqrt{10.103}\approx 3.179 \)

검정통계량: \( t = \dfrac{141-148}{3.179} \approx \)−2.20

자유도(Welch 근사, 또는 계산기 사용): \(df \approx 108\)

양측검정 p-값: \( P(|T|>2.20) \approx \)0.030 (df ≈ 108일 때)

④ 결론 (Conclude)

p-값(≈0.030) < α(0.05) 이므로 귀무가설을 기각합니다. Brand C와 Brand N 비료를 준 나무들의 평균 오렌지 개수가 다르다는 설득력 있는 통계적 증거가 있습니다.

결론 쓸 때는 항상 "p-value와 α를 비교 → 기각/기각하지 않음 → 맥락(오렌지, 비료) 언급"까지 세 박자를 다 채워야 만점! "차이가 있다"고만 쓰면 감점돼.
5
Categorical Data이원표 · 조건부확률 · 모자이크그림 · 카이제곱

한 연구자가 프로 선수 4,193명 전체(모집단)의 연령대와 종목(농구·미식축구·야구) 사이의 연관성을 조사합니다.

연령(세)농구미식축구야구합계
Age < 252328072591,298
25 ≤ Age < 301751,3266202,121
30 ≤ Age < 3590287276653
35 ≤ Age194161121
합계5162,4611,2164,193
Part A

i. 무작위로 뽑은 선수가 미식축구 선수일 확률은?

ii. 미식축구 선수라는 조건하에 "25 ≤ Age < 30"일 확률은?

Part B

모자이크그림에서 각 종목 막대의 너비 \(b\)와 특정 구간의 높이 \(h\)는 Part A에서 구한 확률에 대응합니다.

i. \(b\)는 Part A(i)와 (ii) 중 어느 확률에 대응합니까?

ii. 넓이 \(x = b\cdot h\)는 문맥상 어떤 확률을 나타냅니까?

Part C

i. "야구 선수"와 "35 ≤ Age" 사건은 배반사건(mutually exclusive)입니까? 설명하시오.

ii. 두 사건은 독립(independent)입니까? 계산으로 보이시오.

Part D

이 자료로 연령대와 종목 사이의 연관성을 검정하기 위해 카이제곱 독립성 검정을 실시하는 것이 적절합니까? 이유를 설명하시오.

Part A 풀이

i. \( P(\text{미식축구}) = \dfrac{2461}{4193} \approx \)0.587

ii. 조건부확률이므로 분모를 "미식축구 선수(2,461명)"로 제한: \( P(25\le\text{Age}<30 \mid \text{미식축구}) = \dfrac{1326}{2461} \approx \)0.539

Part B 풀이

i. 모자이크그림에서 막대의 너비(b)는 각 종목이 전체에서 차지하는 비율, 즉 Part A (i)의 확률(주변확률)에 대응합니다. 높이(h)는 그 종목 안에서 다시 나뉜 연령대 비율, 즉 Part A (ii)의 조건부확률에 대응합니다.

ii. 너비×높이 = "이 종목일 확률" × "이 종목이라는 조건하에 이 연령대일 확률" = 해당 종목이면서 동시에 해당 연령대일 결합확률 (예: 미식축구이면서 25≤Age<30일 확률, 1326/4193 ≈ 0.316)입니다.

Part C 풀이

i. 표에서 "야구 & 35≤Age" 칸을 보면 61명이 존재합니다. 두 사건을 동시에 만족하는 선수가 있으므로 배반사건이 아닙니다.

ii. 독립이라면 \(P(\text{야구})\times P(35\le\text{Age})\)가 \(P(\text{야구}\ \cap\ 35\le\text{Age})\)와 같아야 합니다.

\(P(\text{야구})=1216/4193\approx0.2900\), \(P(35\le\text{Age})=121/4193\approx0.02887\)

곱: \(0.2900\times0.02887\approx0.00837\)

실제 결합확률: \(61/4193\approx0.01455\)

\(0.00837 \ne 0.01455\)이므로 독립이 아닙니다.

Part D 풀이

이 표는 표본이 아니라 4,193명 선수 "전체(모집단)" 데이터입니다. 카이제곱 독립성 검정은 표본에서 관찰된 연관성이 모집단에서도 성립한다고 추론(inference)하기 위한 절차인데, 이미 모집단 전체를 다 조사했다면 표본추출에 따른 변동(표집오차)이 존재하지 않습니다. 즉 표에 나타난 연관성이 바로 모집단의 실제 연관성이므로, 추론 검정을 실시하는 것은 적절하지 않습니다 (할 필요가 없습니다).

"전체 모집단 데이터인지 표본인지"를 확인하는 습관을 들여! AP 시험에서 자주 나오는 함정 포인트야.
6
Regression Inference산점도 · 최소제곱회귀 · 신뢰구간 · 예측구간

프로 야구팀 30개를 무작위로 뽑아 안타 수(hits)와 득점 수(runs)의 관계를 조사했습니다. 산점도는 대체로 우상향하는 흩어짐을 보이며, 표본 회귀식은 다음과 같습니다.

예측 득점수 = −372.2 + 0.823 × (안타 수)
Part A

i. 산점도에서 안타 수와 득점 수의 관계를 문맥에 맞게 설명하시오.

ii. 안타 1,250개를 목표로 할 때, 회귀식으로 예측되는 득점 수는?

Part B

전체 30개 팀 연봉의 중앙값은 1억 6천만 달러입니다. 산점도에 중앙값보다 연봉이 높은 팀(●)과 낮은 팀(□)을 구분해 표시했습니다.

i. 동그라미로 표시된 A팀을, 같은 연봉 그룹(●, 연봉 중앙값 이상)의 다른 팀들과 비교하시오.

ii. 각 연봉 그룹 내에서 안타 수와 득점 수의 선형관계 "강도"를 비교하면, 연봉 상위 그룹이 하위 그룹보다 더 강합니까, 약합니까, 비슷합니까? 설명하시오.

Part C

아래 공식을 사용합니다: 점추정치 ± \(t^*\)(표준오차), 자유도 = n−2 = 28.

i. 95% 신뢰수준에서 사용할 임계값 \(t^*\)는? (소수점 둘째 자리까지)

ii. 평균 신뢰구간의 표준오차가 17.48일 때, 안타 1,250개인 모든 팀의 평균 득점수에 대한 95% 신뢰구간을 구하시오.

iii. 예측구간의 표준오차가 56.78일 때, 안타 1,250개인 한 팀의 득점수에 대한 95% 예측구간을 구하시오.

Part D

i. 표본평균들의 분포는 개별 관측값들의 분포보다 산포가 더 큽니까, 작습니까?

ii. (i)의 답과 신뢰구간·예측구간의 표준오차 공식을 근거로, 예측구간이 신뢰구간보다 더 넓은 이유를 설명하시오.

Part A 풀이

i. 안타 수가 많을수록 득점 수도 대체로 많아지는, 양(positive)의 방향을 가진 중간~강한 정도의 선형(linear) 관계가 나타납니다 (완벽한 직선은 아니지만 뚜렷한 상승 경향).

ii. \( \hat{y} = -372.2 + 0.823(1250) = -372.2 + 1028.75 = \)656.6점

Part B 풀이

i. A팀은 연봉이 중앙값보다 높은 팀들(●) 중에서, 비슷한 안타 수를 기록한 다른 팀들에 비해 더 많은 득점을 올린 편입니다 — 즉 회귀선(추세) 위쪽에 위치해, 안타 수 대비 득점이 상대적으로 높은 "이상치에 가까운" 팀입니다. (실제 그림 상 A의 정확한 상대적 위치는 제공된 산점도를 직접 보고 "추세선보다 위/아래", "그룹 내 다른 점들보다 득점이 많다/적다" 형태로 서술해야 합니다.)

ii. 두 그룹의 상대적 강도를 비교할 때는 각 그룹 내 점들이 직선 추세로부터 얼마나 가깝게 모여있는지(산포의 정도)를 봅니다. 점들이 하나의 직선에 더 가깝게 모여 있는 그룹일수록 선형관계가 "더 강함"이고, 흩어져 있을수록 "더 약함"입니다. 답은 산점도 상에서 각 기호(●, □)의 흩어진 정도를 직접 비교해 "상관계수의 절댓값이 더 크다"는 논리로 서술하세요.

이 파트는 실제 산점도 그림을 보면서 "어느 기호 그룹이 직선에 더 딱 붙어있나"를 눈으로 확인해야 하는 문제야. 원본 산점도 이미지를 옆에 두고 비교하면서 답을 완성해봐!
Part C 풀이

i. df = 30−2 = 28, 95% 신뢰수준 → t표에서 \(t^* = \)2.05 (정확히는 2.048)

ii. 신뢰구간(평균): \(656.55 \pm 2.048(17.48) = 656.55 \pm 35.80\)

(620.75, 692.35)점. 안타 1,250개인 모든 팀들의 평균 득점은 95% 신뢰수준에서 이 구간 안에 있다고 추정합니다.

iii. 예측구간(개별 팀): \(656.55 \pm 2.048(56.78) = 656.55 \pm 116.28\)

(540.27, 772.83)점. 안타 1,250개를 기록한 "한 팀"의 득점은 95% 신뢰수준에서 이 구간 안에 있을 것으로 예측합니다.

Part D 풀이

i. 표본평균의 분포는 개별 관측값의 분포보다 산포가 더 작습니다. 여러 개의 관측값을 평균 내면 극단값들이 서로 상쇄되어 변동이 줄어들기 때문입니다 (표본평균의 표준오차는 \(\sigma/\sqrt{n}\)로, 개별값의 표준편차 \(\sigma\)보다 항상 작습니다).

ii. 예측구간의 표준오차 공식은 신뢰구간과 같은 항에 추가로 \(s^2\) 항이 더해진 형태입니다. 이 \(s^2\)은 "개별 관측값 하나하나"가 갖는 추가적인 변동을 반영한 것이고, 신뢰구간은 "여러 팀의 평균"만을 추정하므로 이 개별 변동을 포함하지 않습니다. (i)에서 확인했듯 개별값의 산포가 평균의 산포보다 크기 때문에, 그 차이만큼 표준오차가 커지고 → 예측구간이 신뢰구간보다 더 넓어집니다.