Journey to CS/머신러닝

[ML 스터디 3주차] Z스코어 - 서로 다른 분포의 값을 비교하는 방법

Cordilog 2026. 8. 9. 17:48

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드
참고 본문: 107p. 3.4.7 z 점수

--------------

분포마다 평균과 퍼짐의 정도는 제각각이다.

그래서 수학 80점과 영어 85점 중 어느 쪽이 더 잘한 것인지, 과목마다 난이도와 점수 분포가 다르기에 답하기 어렵다.

Z스코어(표준점수)는 어떤 값이 자기가 속한 분포의 평균에서 표준편차 몇 개만큼 떨어져 있는지를 계산해, 기준이 서로 다른 값들을 하나의 공통 잣대 위로 옮겨놓는다.

1. Z스코어란 무엇인가

1️⃣ 값의 위치를 '표준편차 단위'로 환산

Z스코어는 하나의 값이 평균으로부터 표준편차 몇 배만큼 떨어져 있는지를 나타내는 수치다. 정의는 다음과 같다.

       x − μ
  z = ───────
         σ

각 기호의 의미는 다음과 같다.

🔵 : 우리가 평가하려는 개별 값 (예: 어떤 학생의 수학 점수 80점)
🔵 (뮤): 모집단의 평균 (예: 수학 반평균 65점)
🔵 (시그마): 모집단의 표준편차, 즉 데이터가 평균을 중심으로 퍼진 정도 (예: 10점)

이 예시를 대입하면 가 된다.

즉 80점이라는 수학 점수는 반평균보다 표준편차 1.5개만큼 위에 있다는 뜻이다.

값의 원래 단위(점)는 사라지고, "평균에서 얼마나 떨어졌는가"라는 상대적 위치만 남는다.

2️⃣ Z스코어의 부호와 크기가 말해주는 것

Z스코어는 부호와 절댓값 두 가지 정보를 동시에 담는다.

부호는 방향을, 절댓값은 거리를 나타낸다.

🔵 : 값이 평균보다 크다 (평균의 오른쪽)
🔵 : 값이 정확히 평균과 같다
🔵 : 값이 평균보다 작다 (평균의 왼쪽)
🔵 |z| 가 클수록: 평균에서 멀리 떨어진, 상대적으로 드문 값이다

예를 들어 인 값과 인 값이 있다면, 전자가 집단 안에서 훨씬 극단적인 위치에 있다는 것을 단위를 몰라도 즉시 알 수 있다.

2. 표준화: 임의의 정규분포를 표준정규분포로 옮김

1️⃣ 표준정규분포라는 공통 기준

Z스코어는 표준화(standardization)라는 변환에서 진짜 의미가 있다.

 

어떤 정규분포든 모든 값을 Z스코어로 바꾸면, 평균이 0이고 표준편차가 1인 하나의 표준정규분포로 정렬된다.

이 분포를 보통 로 표기한다.

즉 원래 분포가 평균 65에 표준편차 10인 수학 점수이든, 평균 72에 표준편차 8인 영어 점수이든, 표준화를 거치면 모두 같은 모양의 표준정규분포 위로 겹쳐진다.

 

다음은 척도가 다른 두 원본 정규분포가 표준화를 거쳐 하나의 표준정규분포로 수렴하는 과정을 보여준다.

2️⃣ 표준화가 유용한 이유

표준화는 단순히 숫자를 바꾸는 것이 아니라, 비교의 기준을 통일하는 작업이다.

다만 여기서 유의할 점이 있다.

표준화가 가능하게 하는 것은 무관한 두 대상을 견주는 일이 아니라, 자기 집단 안에서의 위치를 단위 없는 수로 만들어 의미 있는 비교와 합산을 가능하게 하는 일이다.

대표적으로 세 가지 쓰임이 있다.

 

첫째, 같은 대상의 여러 특성을 견줄 수 있다.

한 학생이 수학은 , 영어는 라면, 원점수로는 수학 80점·영어 74점이라 두 과목이 비슷해 보여도, 각 과목의 분포를 감안한 상대적 성취도는 수학이 뚜렷하게 앞선다.

반에서 수학은 상위권이지만 영어는 평균을 조금 웃도는 수준이라는 진단이 선다.

 

둘째, 같은 종류의 값을 서로 다른 기준집단에 걸쳐 비교할 수 있다.

A반(평균 65, 편차 10)에서 80점을 받은 학생()과 B반(평균 78, 편차 4)에서 82점을 받은 학생() 중 자기 반 안에서의 위치가 더 높은 쪽은 전자다.

원점수는 후자가 높지만, 반의 수준과 분포가 다르기 때문에 표준화가 공정한 비교를 가능하게 한다.

 

셋째, 여러 특성을 하나의 점수로 합산할 수 있다.

척도가 다른 지표라도 Z스코어로 단위를 맞추면 더하거나 가중평균을 낼 수 있다.

지표들을 비교한다기보다 같은 자 위에 올려 합산 가능하게 만드는 것이 목적이다.

 

정리하면, 각 값이 자기 집단 안에서 차지하는 위치를 단위 없는 공통 척도로 표현해, 같은 대상의 여러 특성을 비교하거나 서로 다른 집단의 위치를 견주거나 여러 지표를 합산할 수 있게 하는 것이 표준화의 핵심이다.

3. 정리

Z스코어는 하나의 값이 자기 집단의 평균에서 표준편차 몇 개만큼 떨어져 있는지를 계산해, 값을 단위 없는 상대적 위치로 바꾸는 도구다.

이 표준화를 거치면 어떤 정규분포든 평균 0, 표준편차 1인 표준정규분포로 정렬되므로, 같은 대상의 여러 특성을 비교하거나 서로 다른 집단의 위치를 견주거나 여러 지표를 합산할 수 있다.

무관한 두 대상을 억지로 견주는 것이 아니라, 위치를 공통 척도로 표현하는 것이 표준화의 요점이다.

구분 원본 값 x Z스코어 z
단위 원래 단위 (점, 회 등) 없음 (표준편차 배수)
기준 각 분포의 평균·표준편차 언제나 평균 0, 표준편차 1
용도 개별 관측 위치 비교·확률 계산·지표 합산
의미 측정된 실제 값 평균 대비 상대적 위치

 

이전 글에서 다룬 PDF와 CDF가 "확률이 면적으로 존재하고 누적된다"는 원리를 세웠다면, Z스코어는 그 원리를 서로 다른 분포에 걸쳐 실제로 쓸 수 있게 만드는 연결 고리다.

임의의 정규분포 위의 한 점을 표준정규분포의 좌표로 번역함으로써, 하나의 표와 하나의 임계값으로 비교·확률 계산·합산을 처리할 수 있게 된다.