기초 통계량 실험실 · 숫자로 데이터 읽기
0 / 4 완료
descriptive statistics

수십, 수백 개의 숫자를
한 줄로 요약하면
데이터가 보인다

자료를 일일이 들여다볼 수는 없습니다. 그래서 우리는 자료의 중심퍼짐을 몇 개의 숫자로 압축합니다. 직접 값을 바꿔 보고, 손으로 계산해 검증하고, 마지막에 형성평가로 확인해 보세요.

먼저 질문 하나 — 두 반 중 어느 반이 더 "고르게" 공부했을까요?

두 반 모두 평균 점수는 같습니다(70점). 그런데 느낌이 다릅니다.

1반 점수
68 · 70 · 72 · 69 · 71
2반 점수
40 · 95 · 55 · 90 · 70
평균만 보면 두 반은 똑같습니다. 하지만 2반은 점수가 사방으로 흩어져 있죠. 평균(중심) 하나로는 이 차이를 잡아낼 수 없습니다. 그래서 표준편차IQR(퍼짐)이 필요합니다. 퍼짐을 배운 뒤, 바로 이 두 반의 표준편차·IQR을 직접 구해 답을 닫아 보세요.
01

자료의 중심을 나타내는 값

평균 · 중앙값 · 최빈값 — "이 자료를 대표하는 한 값은?"에 답하는 세 가지 방법

먼저 개념부터 — 평균(mean)이란? 평균

📍 한 줄 정의 mean

자료를 모두 더한 뒤, 자료 개수(n)로 나눈 값이에요. 점 도표에서 보면 점들의 무게중심 — 시소의 받침점과 같습니다.

구하는 순서는 딱 두 단계예요.

① 모든 값을 더하기 ② 개수 n으로 나누기

💛 평균은 모든 값을 사용합니다. 그래서 자료의 정보를 하나도 버리지 않지만, 아주 크거나 작은 값 하나에 쉽게 끌려갑니다. "전체를 공평하게 나눈 몫"이지, 언제나 "보통값"은 아니에요.

평균 = (x₁ + x₂ + ⋯ + xₙ) ÷ n

직접 연습 — 더하고 나누기

합과 평균을 직접 입력해 맞혀 보세요. 평균은 무게중심이라, 모든 점을 같은 무게로 둔 받침점입니다.

먼저 개념부터 — 중앙값(median)이란? 중앙값

📍 한 줄 정의 median

자료를 크기순으로 줄 세웠을 때, 정확히 한가운데에 있는 값이에요. "키 순서로 줄 선 반에서 맨 가운데 친구"를 떠올리면 됩니다.

구하는 순서는 딱 두 단계예요.

① 작은 값 → 큰 값으로 정렬 ② 한가운데 값 고르기

이때 자료 개수가 홀수면 가운데 값이 딱 하나라 그 값이 중앙값이고, 개수가 짝수면 가운데에 값이 두 개 걸리니까 그 둘의 평균을 중앙값으로 삼습니다.

💛 평균과 달리 중앙값은 아주 크거나 작은 값(이상치)에 흔들리지 않아요. 그래서 소득·집값처럼 한쪽으로 길게 늘어진 자료에서 "보통값"을 말할 때 특히 든든합니다.

직접 연습 — 정렬하고 한가운데 찾기

버튼을 차례로 눌러 두 단계를 눈으로 확인하고, 중앙값을 직접 입력해 맞혀 보세요.

먼저 개념부터 — 최빈값(mode)이란? 최빈값

📍 한 줄 정의 mode

자료에서 가장 많이 나온 값이에요. "반에서 가장 흔한 신발 사이즈, 가장 많은 혈액형"을 떠올리면 됩니다.

이 실험실이 쓰는 규칙은 아래 세 줄로 끝나요. 형성평가도 같은 규칙을 따릅니다.

① 모든 값이 한 번씩만 나오면 → 최빈값 없음
② 가장 많이 나온 값이 둘 이상 동점이면 → 그 값들을 모두 최빈값으로 봅니다. 둘이 1등이면 쌍봉(bimodal), 셋 이상이면 다봉(multimodal)이에요.
③ 혈액형·신발 사이즈처럼 종류(범주)를 나타내는 자료에서는 평균·중앙값보다 최빈값이 대표값으로 적절합니다. 평균 혈액형이란 말은 성립하지 않거든요.

💛 "모든 도수가 같다"고 무조건 없는 게 아니에요. [1, 1, 2, 2, 3, 3]처럼 각각 두 번씩이면 1·2·3이 모두 최빈값(다봉)입니다. 없는 경우는 전부 한 번씩일 때뿐입니다.

직접 연습 — 몇 번 나왔는지 세어 보기

자료를 보고 최빈값을 입력하세요. 없으면 없음, 여러 개면 쉼표로 적으면 됩니다 (예: 2, 4).

실험실: 점을 추가/삭제하며 대푯값이 어떻게 움직이는지 보기 중심값

아래 수직선 위 점들이 자료입니다. 값을 더하거나 빼면 평균선(빨강), 중앙값선(청록), 최빈값선(금색)이 실시간으로 움직입니다.

평균 (mean)
중앙값 (median)
최빈값 (mode)
평균 = 모든 값의 무게중심 중앙값 = 크기순 한가운데 최빈값 = 가장 많이 나온 값(없으면 선 없음)

💡 이상치 버튼을 눌러 보세요. 평균선은 이상치 쪽으로 확 끌려가지만, 중앙값선은 거의 안 움직입니다. 오른쪽 꼬리 / 왼쪽 꼬리를 누르면 세 선이 서로 떨어집니다. 오른쪽 꼬리(큰 값 쪽으로 늘어진 분포)에서는 보통 최빈값 < 중앙값 < 평균 순서가 됩니다.

상자그림과 이어 읽기: 오른쪽 꼬리는 상자그림에서 오른쪽 수염이 길게 나타납니다. 왼쪽 꼬리면 왼쪽 수염이 길어요. 아래 ②단원 상자그림에 같은 자료를 넣어 비교해 보세요.

흔한 오해 · “평균이 곧 대푯값이다”

평균은 모든 값을 쓰는 무게중심일 뿐, 언제나 "보통값"은 아닙니다. 이상치가 있거나 한쪽으로 늘어진 자료에서는 중앙값이, 혈액형·신발 사이즈처럼 종류를 나타내는 자료에서는 최빈값이 더 정직합니다. 어떤 숫자를 쓸지는 자료의 모양과 질문에 따라 고르는 거예요.

확인 1. 자료 [3, 5, 6, 7, 100]의 평균은 이상치 100에 끌려 24.2입니다. 가운데 위치로 나머지 값(3~7)을 대표하는 값은?
A평균 — 모든 값을 반영하니까
B중앙값 — 정렬하면 가운데가 6이라 100에 거의 안 흔들리니까
C최댓값 — 가장 큰 값이 대표하니까
02

자료의 퍼짐을 나타내는 값

범위 · 분산 · 표준편차 · 사분위수 — "값들이 중심에서 얼마나 흩어져 있나?"

먼저 개념부터 — 범위(range)란? 범위

📍 한 줄 정의 max − min

범위는 최댓값에서 최솟값을 뺀 값이에요. 계산이 가장 쉬운 산포 척도입니다.

범위 = 최댓값 − 최솟값

💛 단, 범위는 양 끝 두 값만 씁니다. 가운데가 옹기종기 모여 있든, 골고루 퍼져 있든 범위는 같을 수 있어요. 그래서 "구하기는 쉬운데, 이야기 전체를 듣지는 못하는" 숫자입니다.

직접 비교 — 범위는 같은데 느낌이 다를 때

두 자료의 범위를 직접 구한 뒤, 범위만으로 퍼짐을 말할 수 있는지 생각해 보세요.

먼저 개념부터 — 편차 · 분산 · 표준편차 산포

📍 편차(deviation) x − 평균

편차는 각 값이 평균에서 얼마나 떨어져 있는지예요. 그냥 값 − 평균이죠. 평균보다 크면 +, 작으면 −가 됩니다.

그런데 편차를 전부 더하면 항상 0이 돼요(+와 −가 정확히 상쇄되거든요). 그래서 "흩어진 정도"를 재려면 부호를 없애야 하는데, 그 방법이 제곱입니다.

📍 분산(variance) 편차²의 평균

분산편차를 제곱해서 모두 더한 뒤, 자료 개수로 나눈 값이에요. 값들이 평균에서 멀리 흩어질수록 커집니다.

분산 = { (x₁−평균)² + (x₂−평균)² + ⋯ } ÷ n

단점이 하나 있어요. 제곱을 했으니 단위도 제곱이 됩니다(점 → 점²). "흩어진 정도가 4점²"이라고 하면 영 와닿지 않죠.

📍 표준편차(standard deviation) √분산

그래서 분산에 제곱근을 씌워 단위를 원래대로(점² → 점) 되돌린 값이 표준편차예요. 가장 자주 쓰는 산포의 척도입니다.

읽는 법이 직관적이에요. 표준편차가 3점이라면 값들이 평균을 중심으로 대략 그 크기만큼 흩어져 있다는 뜻입니다. 작을수록 옹기종기 모여 있고, 클수록 넓게 퍼져 있습니다.

표준편차는 |편차|의 평균(평균절대편차)과 다릅니다. 편차를 제곱한 뒤 다시 제곱근을 취하므로, 멀리 떨어진 값이 더 크게 반영됩니다. “평균적으로 ±3”이라고 외우기보다 흩어진 정도의 대표 크기로 읽는 편이 정확해요.

① 평균 ② 편차(값−평균) ③ 편차² ④ 합 ÷ n = 분산 ⑤ √분산 = 표준편차
÷n 과 n−1. 이 실험실은 지금 보고 있는 자료 전체를 요약하므로 분산·표준편차를 ÷n으로 구합니다. 엑셀의 STDEV.S나 파이썬에서 표본 표준편차를 구하면 n−1로 나눕니다. 정보 시간에 표본을 다룰 때 그 차이를 다시 만나요. 여기서 손으로 계산한 값이 엑셀과 조금 달라도, 이 페이지의 정답은 ÷n입니다.

직접 연습 — 표를 채우며 표준편차까지 구하기

평균은 미리 알려 드릴게요. 각 칸에 편차편차²을 채우고, 아래에서 분산·표준편차를 완성한 뒤 채점해 보세요.

실험실 A: 퍼짐을 키우면 표준편차가 어떻게 변할까 표준편차

평균은 50으로 고정한 채, 슬라이더로 자료가 흩어진 정도만 바꿉니다. 막대(분포)가 넓게 퍼질수록 표준편차가 커집니다.

평균
50
분산 (variance)
표준편차 (σ)
분산 = (편차)²의 평균 = Σ(xᵢ − 평균)² ÷ n  |  표준편차 = √분산

📌 편차는 각 값이 평균에서 떨어진 거리(값 − 평균)입니다. 그냥 더하면 0이 되니까, 제곱해서 더한 뒤 평균 낸 것이 분산입니다. 분산은 단위가 제곱(점²)이라 감이 안 와서, 다시 제곱근을 씌워 원래 단위로 되돌린 것이 표준편차입니다. 흩어진 정도의 대표 크기로 읽으면 됩니다(|편차|의 평균과는 조금 다릅니다).

먼저 개념부터 — 사분위수 · IQR · 펜스 IQR

📍 사분위수(quartile) Q1 · Q2 · Q3

자료를 크기순으로 줄 세운 뒤 4등분하는 세 경계예요.

Q2는 한가운데 = 중앙값이에요. Q1은 아래쪽 절반의 중앙값(전체의 25% 지점), Q3은 위쪽 절반의 중앙값(75% 지점)입니다.

정렬 Q2 = 전체 중앙값 Q1 = 아래 절반의 중앙값 Q3 = 위 절반의 중앙값

이 실험실의 방법 = Tukey 방식. 중앙값(Q2)은 아래·위 절반에 넣지 않습니다. 홀수 개일 때 가운데 값을 빼고 남은 값만으로 Q1·Q3를 구해요. 엑셀 QUARTILE.INC는 보간을 쓰므로 값이 조금 다를 수 있습니다. 손으로 계산한 값이 엑셀과 달라도, 여기서는 Tukey가 정답입니다.

📍 IQR(사분위범위) Q3 − Q1

IQR은 Q3에서 Q1을 뺀 값으로, 가운데 50% 자료가 퍼져 있는 폭이에요. 양 끝의 극단값을 빼고 "중심부가 얼마나 모여 있나"를 보는 거라, 이상치에 휘둘리지 않는 든든한 산포 척도입니다.

📍 펜스(fence)와 이상치(outlier) Q ± 1.5·IQR

어디까지를 "정상 범위"로 볼지 울타리를 치는 거예요. 이 울타리를 펜스라고 합니다.

아래 펜스 = Q1 − 1.5 × IQR  |  위 펜스 = Q3 + 1.5 × IQR

펜스 바깥으로 벗어난 값이상치로 봅니다. 상자그림에서 수염은 펜스 안쪽 끝값까지만 뻗고, 그 너머의 값은 점으로 따로 찍어요.

예를 들어 Q1=10, Q3=20이면 IQR=10, 펜스는 10−15=−5와 20+15=35. 즉 −5보다 작거나 35보다 큰 값이 이상치가 됩니다.

직접 연습 — Q1·Q3·IQR·펜스로 이상치 찾기

정렬된 자료를 보고 사분위수와 펜스를 구한 뒤, 펜스 밖의 값(이상치)을 골라 채점해 보세요.

실험실 B: 사분위수와 상자그림(box plot) IQR

자료를 4등분하는 경계가 사분위수입니다. 값을 바꾸면 상자그림이 다시 그려집니다.

Q1 (1사분위)
Q2 (중앙값)
Q3 (3사분위)
IQR = Q3−Q1

📦 상자의 길이(IQR)는 가운데 50% 자료가 퍼진 폭입니다. 상자 안 세로선은 중앙값. 수염 밖으로 멀리 떨어진 점(빨간 점)은 이상치 후보입니다. 표준편차와 달리 IQR은 이상치에 휘둘리지 않아 분포가 치우친 자료에 강합니다.

수염으로 치우침 읽기. 오른쪽 수염이 왼쪽보다 훨씬 길면 큰 값 쪽으로 자료가 늘어진 오른쪽 치우침입니다. ①단원 점 도표에서 평균이 중앙값보다 오른쪽에 있던 바로 그 모양이에요. 왼쪽 수염이 길면 반대입니다.

확인 2. 두 자료 모두 평균이 50입니다. =[48,49,50,51,52], =[10,30,50,70,90]. 표준편차가 더 쪽과 그 의미는?
A가 — 값이 더 흩어져 있다
B나 — 값이 평균에서 더 멀리, 더 넓게 흩어져 있다
C평균이 같으므로 표준편차도 같다

도입으로 돌아가기 — 두 반을 숫자로 비교하기 닫힌 고리

맨 처음 질문입니다. 두 반 평균은 둘 다 70점. 이제 표준편차와 IQR을 구해 "어느 반이 더 고르게 공부했나"에 숫자로 답해 보세요.

1반 · 평균 70
68 · 70 · 72 · 69 · 71
2반 · 평균 70
40 · 95 · 55 · 90 · 70
그래서, 어느 반이 더 고르게 공부했나요?
A1반 — 표준편차와 IQR이 훨씬 작다
B2반 — 높은 점수가 있으니 더 잘했다
C평균이 같으므로 두 반은 같다

흔한 오해 · “표준편차가 작을수록 항상 좋다”

표준편차는 흩어진 정도이지 잘함/못함이 아닙니다. 모든 학생이 똑같이 40점이면 표준편차는 0이지만 "잘했다"는 뜻은 아니에요. 반대로 창의 과제처럼 다양성이 중요하면 어느 정도 퍼짐이 자연스럽습니다. 1반이 더 고르다는 것은 "점수가 비슷하다"는 뜻이지, 2반보다 항상 우수하다는 뜻은 아닙니다.

03

데이터를 직접 파악해 보기

자료를 보고 손으로 통계량을 구해 입력 → 채점 → 어떤 숫자를 쓸지 고르고 한 문장으로 말하기

우리 반 점수 붙여넣기 계산기

쉼표, 공백, 줄바꿈으로 숫자를 붙여 넣으면 이 페이지와 같은 공식(÷n, Tukey 사분위수)으로 요약해 줍니다. 서버로 보내지 않고 이 창에서만 계산합니다.

04

형성평가 · 문항 은행

약 100문항 풀에서 20·40·전체를 순서 또는 랜덤으로 풀어 보세요. 답을 고르거나 입력하면 바로 풀이가 나오고, 아래 바로 전체 점수도 집계됩니다.

선택형은 보기를 고르면 바로 채점되고, 계산형은 숫자를 입력한 뒤 Enter(또는 칸 밖 클릭)로 채점됩니다. (소수는 둘째 자리까지, 예: 2.24) 분산·표준편차는 편차 제곱의 평균(÷n) 기준입니다. 20·40문제는 중심·퍼짐·사분위/상자·해석이 고르게 나옵니다.

문제 수
출제 방식
– / 20
05

미리보기 · 68–95–99.7 선택 · 평가 제외

표준편차를 한 걸음만 더 연장해 보는 경험 규칙입니다. 형성평가에는 나오지 않아요.

종 모양 분포에서 표준편차로 비율 읽기 선택

자료가 평균을 중심으로 좌우 대칭인 종 모양(정규분포에 가까운 모양)일 때, 대략 아래 비율이 평균 근처에 모입니다. 이 페이지의 자료가 항상 종 모양인 것은 아니니, "나중에 만날 규칙"으로만 봐 주세요.

평균 ± 1σ
약 68%
평균 ± 2σ
약 95%
평균 ± 3σ
약 99.7%

예를 들어 어떤 모의고사 평균이 70점, 표준편차가 10점이면 — 종 모양을 가정할 때 — 대략 68%가 60~80점, 95%가 50~90점 구간에 있습니다. 표준편차가 "평균에서 얼마나 떨어져 있나"를 한 줄로 읽게 해주는 연장선이에요.

필수 아님. ①~④단원과 형성평가는 이 규칙 없이도 끝낼 수 있습니다. 정보·수학에서 정규분포를 만날 때 다시 꺼내 보세요.