전체 글 259

[ML 스터디 3주차] Z스코어 - 서로 다른 분포의 값을 비교하는 방법

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드참고 본문: 107p. 3.4.7 z 점수--------------분포마다 평균과 퍼짐의 정도는 제각각이다.그래서 수학 80점과 영어 85점 중 어느 쪽이 더 잘한 것인지, 과목마다 난이도와 점수 분포가 다르기에 답하기 어렵다.Z스코어(표준점수)는 어떤 값이 자기가 속한 분포의 평균에서 표준편차 몇 개만큼 떨어져 있는지를 계산해, 기준이 서로 다른 값들을 하나의 공통 잣대 위로 옮겨놓는다.1. Z스코어란 무엇인가1️⃣ 값의 위치를 '표준편차 단위'로 환산Z스코어는 하나의 값이 평균으로부터 표준편차 몇 배만큼 떨어져 있는지를 나타내는 수치다. 정의는 다음과 같다. x − μ z = ─────── σ각 기호의 의미는 다음과..

[ML 스터디 3주차] 확률밀도함수(PDF)와 누적분포함수(CDF)

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드참고 본문: 102p. 3.4.5 정규분포 - 확률 밀도 함수(PDF)--------------연속형 데이터에서 확률은 점이 아니라 면적으로 존재하며, 이 면적을 왼쪽부터 쌓아 올린 것이 누적 확률이다.1. 확률밀도함수(PDF): 면적 = 확률1️⃣ 연속형 데이터에서 점의 확률은 0이다키, 몸무게, 시간처럼 값이 끊어지지 않고 이어지는 데이터를 연속형 데이터라 부른다.이런 데이터에서는 특정 값이 소수점 끝까지 정확히 일치할 확률이 수학적으로 0에 수렴한다.키가 정확히 175.000...cm인 사람을 특정하는 순간, 그 아래로 무한히 많은 소수점 자리가 존재하기 때문이다.따라서 연속형 데이터의 확률은 하나의 점이 아니라 구간으로 정의해야 한다.곡선..

[ML 스터디 3주차] 표본 분산은 왜 n이 아니라 n-1로 나누는가?

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드참고 본문: 97p. 3.4.4 분산과 표준편차--------------1. 모집단과 표본모집단(population)은 분석 대상이 되는 전체 데이터를 뜻한다.예를 들어 대한민국 전체 인구가 모집단이다.표본(sample)은 그중 일부만 뽑아낸 데이터다. 조사를 위해 100명을 뽑았으면, 그 뽑은 100명이 표본이다.전체 데이터를 모두 조사하는 것은 대부분 불가능하므로, 일부를 뽑아 전체를 추정하는 것이 통계의 기본 방식이다.문제는 표본만으로 계산한 분산이 모집단의 실제 분산과 일정한 방향으로 어긋난다는 데 있다.그리고 그 어긋남의 방향은 항상 '실제보다 작게'로 정해져 있다.2. 표본 평균 기준의 편차는 작게 계산된다표본으로 분산을 구할 때, 편..

[ML 스터디 3주차] 분산과 표준편차 - 왜 제곱인가?

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드참고 본문: 94p. 3.4.4 분산과 표준편차--------------1. 분산과 표준편차의 정의1️⃣ 퍼짐을 측정하는 출발점: 평균과의 차이데이터가 얼마나 퍼져 있는지를 측정하려면 각 데이터 값이 평균에서 얼마나 떨어져 있는지를 봐야 한다.가장 직접적인 방법은 각 데이터에서 평균을 빼는 것이다. 이 차이를 편차(deviation)라고 부른다.문제는 여기서 발생한다. 평균보다 큰 데이터는 편차가 양수(+)가 되고, 평균보다 작은 데이터는 편차가 음수(-)가 된다.이 편차들을 그대로 더하면 양수와 음수가 서로 상쇄되어 항상 0이 된다.평균은 데이터의 무게중심이므로, 정의상 편차의 합은 언제나 0이 된다.따라서 편차의 합만으로는 데이터가 퍼진 정도..

Active Directory 인증 공격의 이해 — Pass-the-Hash와 Golden Ticket, 그리고 방어 체계

이전 글에서 AD와 DC의 구조, 그리고 이기종 OS 연동까지 살펴봤다.요점은 AD가 전사 인증 권한이 DC 한 지점에 집중된 핵심 자산이며, DC가 Windows 인증 스택 위에 서 있다는 것이었다.이번 글에서는 바로 그 집중된 권한을 탈취하려는 공격자가 사용하는 대표적인 두 기법, Pass-the-Hash(PtH)와 Golden Ticket을 알아본다.두 공격 모두 인증 메커니즘 자체의 설계 특성을 파고든다는 공통점을 갖는다. 먼저 보안 관점에서 방어 우선순위를 짚어본다면, AD는 전사적 시스템 권한이 집중된 자산이므로, 인프라 보안 관점에서는 DC 자체의 네트워크 격리, 철저한 방화벽 설정, 계정 권한 관리가 가장 우선적인 방어 과제가 된다.1. Pass-the-Hash(PtH) 공격1️⃣ NTLM..

Active Directory와 Domain Controller의 구조, 그리고 이기종 OS 연동

기업 네트워크에 수십, 수백 대의 컴퓨터가 존재할 때 이를 개별 관리(Workgroup)하면 직원 입·퇴사마다 모든 PC의 계정과 권한을 일일이 설정해야 한다.이 문제를 해결하기 위한 중앙 집중형 관리 체계가 Active Directory(AD)이며, 이를 실제로 구동하는 서버가 Domain Controller(DC)다.AD는 전사 시스템 권한이 집중된 핵심 자산이므로, 그 구조를 정확히 이해하는 것이 이후 보안 설계의 출발점이 된다.1. Active Directory(AD)란AD는 네트워크상의 다양한 자원(사용자, 그룹, 컴퓨터, 공유 폴더 등)에 대한 정보를 중앙에 저장하고 관리하는 디렉터리 서비스(데이터베이스)다.쉽게 말해 사내 '조직도'이자 '전화번호부'와 같은 역할을 한다.1️⃣ 프로토콜 구성데..

UEFI 펌웨어 구조와 부팅 원리

OS 설치를 진행하다 보면 펌웨어 환경의 차이를 이해해야 하는 순간이 온다.파티션이 인식되지 않거나, 부트로더가 로드되지 않거나, Secure Boot 오류로 커스텀 커널이 실행되지 않는 문제 대부분은 UEFI 펌웨어의 동작 원리를 알아야 해결된다.UEFI가 무엇이고, 기존 BIOS와 무엇이 다르며, ESP 파티션을 중심으로 부팅이 어떻게 진행되는지 알아보자.1. UEFI란?EFI(Extensible Firmware Interface)는 컴퓨터의 하드웨어와 운영체제를 연결하는 소프트웨어 인터페이스다.수십 년간 사용되던 BIOS(Basic Input/Output System)를 대체하기 위해 개발된 현대적 펌웨어 표준이며, 현재는 인텔뿐 아니라 여러 기업이 참여해 표준화한 UEFI(Unified EFI)라..

[ML 스터디 2주차] 이항 분포 vs 베타 분포

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드참고 본문: 72p. 2.4 베타 분포--------------책에서 사용한 엔진 테스트 예시 대신에 좀 더 단순한 예시들을 가지고 이항 분포와 베타 분포의 차이를 알아본다. 1. 알고자 하는 것이항 분포와 베타 분포의 가장 큰 차이는 '무엇을 알고 있고, 무엇을 모르는가(무엇을 추정하려 하는가)'에 있다.똑같은 동전 던지기 상황을 다루더라도 두 분포에서 알고자 하는 것은 반대 방향을 가리킨다.1️⃣ 이항 분포: 동전의 성능을 알 때, 결과는 어떨까앞면이 나올 확률이 50%인 정상적인 동전이 있다고 하자. 이때 "이 동전을 10번 던졌을 때 앞면이 정확히 7번 나올 확률은 얼마인가"를 묻는다.성능(확률)은 이미 주어졌고, 궁금한 것은 성공 횟수,..

[ML 스터디 2주차] 제트 엔진 테스트 사례로 살펴보는 이항 분포와 통계적 의사결정

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드참고 본문: 70p. 2.3 이항 분포--------------책에서 이항 분포 설명을 위해 다음과 같은 예시를 들었다. 새로 개발한 제트 엔진을 10회 테스트했더니 8회 성공, 2회 실패. 눈에 보이는 성공률은 80%다.목표치인 90%에 미치지 못한 이 결과를 두고 팀 내부에서는 "재설계가 필요하다"와 "표본이 부족하므로 추가 검증이 필요하다"는 두 입장이 대립했다.직관이 아닌 정량적 근거로 이 논쟁을 정리하려면 이항 분포(Binomial Distribution) 개념이 필요하다. 1. 이항 분포의 전제 조건1️⃣ 이항(Binomial)의 어원과 정의이항이라는 용어는 두 개를 뜻하는 접두사 Bi-와 항을 뜻하는 -nomial의 결합이다.통계학에..

[ML 스터디 2주차] 확률과 가능도, 그리고 베이즈 정리

스터디 교재: "개발자를 위한 필수 수학" by 토마스 닐드참고 본문: 65p. 2.2.3 베이즈 정리-------------- 확률(Probability)과 가능도(Likelihood)는 얼핏 비슷해 보이는데 사실은 바라보는 방향이 서로 반대인 개념이다.확률은 원인에서 결과를 향하고, 가능도는 결과에서 원인을 향한다.확률과 가능도를 결합하면 이미 알고 있던 지식에 새로 관측한 증거를 곱해 결론을 갱신하는 베이즈 정리(Bayes' Theorem)가 나오는데, 이것은 단편적인 통계에 속지 않고 합리적인 판단을 하게 도와주는 근거가 된다. 1. 확률: 정해진 조건에서 결과를 예측1️⃣ P(결과 | 조건)확률은 이미 정해진 환경이 있는 상태에서 앞으로 어떤 일이 벌어질지를 예측하는 개념이다.즉, 설정은 고정되..