스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드
참고 본문: 102p. 3.4.5 정규분포 - 확률 밀도 함수(PDF)
--------------
연속형 데이터에서 확률은 점이 아니라 면적으로 존재하며, 이 면적을 왼쪽부터 쌓아 올린 것이 누적 확률이다.
1. 확률밀도함수(PDF): 면적 = 확률
1️⃣ 연속형 데이터에서 점의 확률은 0이다
키, 몸무게, 시간처럼 값이 끊어지지 않고 이어지는 데이터를 연속형 데이터라 부른다.
이런 데이터에서는 특정 값이 소수점 끝까지 정확히 일치할 확률이 수학적으로 0에 수렴한다.
키가 정확히 175.000...cm인 사람을 특정하는 순간, 그 아래로 무한히 많은 소수점 자리가 존재하기 때문이다.
따라서 연속형 데이터의 확률은 하나의 점이 아니라 구간으로 정의해야 한다.
곡선 아래 특정 구간의 면적을 구하면, 그 값이 데이터가 해당 구간에 존재할 확률이 된다.
2️⃣ 곡선 아래 전체 면적은 항상 1이다
모든 사건이 일어날 확률의 합은 100%다.
이는 PDF 곡선 아래의 전체 면적은 항상 1이 된다는 규칙이 된다.

여기서 세로축은 확률이 아니라 확률밀도라는 점에 주의해야 한다.
밀도 자체는 1을 넘을 수도 있으며, 확률로서 의미를 갖는 것은 어디까지나 가로축 구간과 곱해져 만들어지는 면적이다.
2. 확률 변수 와 기준값 의 구분
면적을 계산해 확률을 구하려면 기준이 필요하다.
1️⃣ 대문자 - 확률 변수
관찰하고 측정하려는 대상 그 자체를 의미한다. 아직 값이 확정되지 않은, 데이터 전체를 포괄하는 개념이다. 예를 들어 어떤 집단의 키 데이터 전체가 여기에 해당한다.
2️⃣ 소문자 - 기준값
확률을 구하기 위해 가로축 위에 설정한 구체적인 숫자, 즉 임계값(Threshold)이다.
175cm처럼 확정된 하나의 값이다.
P(X≤x)는 다음과 같이 읽는다.
관찰 대상 가 특정 숫자 이하일 확률
즉 "키()가 175cm() 이하일 확률"이라는 문장을 수식으로 압축한 것이다.
3. 누적분포함수(CDF): 누적 확률
1️⃣ CDF는 기준값까지의 누적 면적이다
누적분포함수(CDF)는 기준값 를 활용해 그 지점까지 누적된 확률을 보여준다.
PDF 그래프의 가장 왼쪽 끝, 즉 음의 무한대에서 출발해 기준값 까지 색칠한 모든 면적의 합이 바로 그 지점에서의 CDF 값이다.

2️⃣ CDF가 S자(시그모이드)를 그리는 이유
왼쪽에서 오른쪽으로 이동할수록 면적은 더해지기만 할 뿐 줄어들지 않는다.
그 결과 CDF는 다음 성질을 갖는다.
🔵 항상 0에서 시작한다 (음의 무한대 지점에는 쌓인 면적이 없다)
🔵 감소하지 않고 단조 증가한다 (면적은 더해지기만 한다)
🔵 최종적으로 1(100%)을 향해 올라간다 (전체 면적이 1이므로)
이 세 성질이 결합되어 CDF는 0에서 1로 완만하게 상승하는 S자 형태, 즉 시그모이드 곡선을 그린다.
4. 정리
PDF에서 기준값 이하로 칠해진 넓이를 구하면, 그 값이 정확히 CDF 그래프에서 가 가리키는 높이와 일치한다.
면적(PDF)과 높이(CDF)는 표현 방식만 다를 뿐 동일한 확률을 가리킨다.
| 구분 | 확률밀도함수(PDF) | 누적분포함수(CDF) |
| 보여주는 것 | 구간의 밀도 | 누적된 결과 |
| 확률의 위치 | 곡선 아래 면적 | 특정 지점의 높이 |
| 그래프 형태 | 종 모양 곡선 | S자(시그모이드) |
| 전체 범위 값 | 전체 면적 = 1 | 최댓값 = 1 |
| 방향성 | 밀도의 분포 | 왼쪽부터 누적 |
'Journey to CS > 머신러닝' 카테고리의 다른 글
| [ML 스터디 4주차] 중심 극한 정리와 신뢰 구간 - 표본으로 모집단을 추론 (0) | 2026.08.09 |
|---|---|
| [ML 스터디 3주차] Z스코어 - 서로 다른 분포의 값을 비교하는 방법 (0) | 2026.08.09 |
| [ML 스터디 3주차] 표본 분산은 왜 n이 아니라 n-1로 나누는가? (0) | 2026.08.08 |
| [ML 스터디 3주차] 분산과 표준편차 - 왜 제곱인가? (0) | 2026.08.08 |
| [ML 스터디 2주차] 이항 분포 vs 베타 분포 (0) | 2026.08.01 |