이 단원은 실험에 쓸 데이터를 만들고 나누는 법을 다룬다. 정답(gold)을 어떻게 만들고 그 품질을 어떻게 재는지, 데이터를 왜 셋으로 나누고 어디서 누수가 새는지, 그리고 측정 자체가 숫자를 부풀리는 세 가지 방식을 배운다. 통계 이전에 데이터가 잘못되면 어떤 분석도 소용없다.
- 5강부터 7강까지 순서대로 읽는다.
- 1단원의 변수·arm 용어(4강)를 전제로 한다.
- 6강의 분할·누수 개념은 18강(학습 데이터 오염)에서 LLM 맥락으로 다시 확장된다.
-
- 데이터 수집과 주석
-
- 데이터 분할과 누수
-
- 측정의 함정
-
- 데이터 수집과 주석
gold(정답)를 만드는 절차와, 주석자 두 명이 필요한 이유·Cohen's κ를 다룬다.
-
- 데이터 분할과 누수
train/val/test를 나누는 이유, 그룹 분할, test를 한 번만 여는 이유를 다룬다.
-
- 측정의 함정
천장 효과·편향·오염이 숫자를 부풀리는 세 가지 방식을 다룬다.
- 주석 지침을 만들고 주석자 간 일치도를 κ로 보고할 수 있다.
- 그룹 누수 없는 데이터 분할을 설계할 수 있다.
- 측정 결과가 부풀려질 수 있는 경로를 설계 단계에서 점검할 수 있다.