이 단원은 LLM을 실험 대상으로 삼을 때만 생기는 문제를 다룬다. 무엇을 정답으로 볼지 정하는 평가 설계, 모델이 답을 이미 외웠을 가능성(오염), 그리고 프롬프트 한 글자 차이로 조건 비교가 무너지는 문제까지. 앞 단원들의 일반 원칙이 LLM 실험에서 어떻게 구체화되는지를 본다.
- 17강부터 19강까지 순서대로 읽는다.
- 6강(분할과 누수), 7강(측정의 함정), 13강(재현성과 시드)을 전제로 한다.
- LLM 실험을 당장 설계하는 중이라면 이 단원을 14강(사전 등록)과 함께 읽는다.
-
- LLM 평가 설계
-
- 학습 데이터 오염
-
- 프롬프트 공정성
-
- LLM 평가 설계
객관식과 자유 생성의 트레이드오프, LLM-judge의 순환성 문제를 다룬다.
-
- 학습 데이터 오염
암기와 이해를 구별하는 법, 학습 컷오프 기반 층화를 다룬다.
-
- 프롬프트 공정성
템플릿 통제·보기 위치 편향·디코딩 시드에서 조건 비교가 무너지는 지점을 다룬다.
- 평가 형식(객관식/자유 생성/judge)의 트레이드오프를 근거와 함께 고를 수 있다.
- 오염 가능성을 실험 설계 단계에서 방어할 수 있다.
- 조건 간 프롬프트 차이를 템플릿 슬롯 하나로 통제할 수 있다.