연구 용어와 방법론이 낯선 사람이 스스로 연구를 설계하고, 수행하고, 보고할 수 있게 만드는 강의다. 기초 개념에서 시작해 데이터, 통계, 재현성, LLM 연구 특화 주제까지 순서대로 쌓는다. 각 장은 앞 장을 전제로 하므로 위에서 아래로 읽는다.
- 연구 질문, 가설, 반증 조건 같은 기초 용어를 정확한 뜻으로 쓴다.
- 데이터 분할, 누수, 오염 같은 함정을 실험을 돌리기 전에 설계 단계에서 피한다.
- p값, 효과 크기, 신뢰구간을 구별해서 읽고, 결과를 과장 없이 보고한다.
- LLM을 대상으로 하는 실험(평가 형식, 오염 방어, 프롬프트 통제)을 직접 설계한다.
각 장의 제목 옆 질문에 이미 답할 수 있으면 그 장은 건너뛰어도 된다. 전체 22강이다.
| 강 |
제목 |
다루는 질문 |
| 1 |
연구 질문 만들기 |
좋은 연구 질문의 조건. 왜 예/아니오나 숫자로 답할 수 있는 형태여야 하는가 |
| 2 |
가설과 반증 조건 |
반증할 수 없는 주장이 과학이 아닌 이유. HARKing의 정의와 위험 |
| 3 |
선행 연구 조사 |
비슷한 연구를 찾고, 읽고, 정리하고, 인용하는 절차 |
| 4 |
실험 설계 기초 |
독립·종속 변수, 실험군과 대조군, arm과 baseline, 통제의 뜻 |
| 강 |
제목 |
다루는 질문 |
| 5 |
데이터 수집과 주석 |
gold(정답)를 만드는 절차. 주석자 두 명이 필요한 이유와 Cohen's κ |
| 6 |
데이터 분할과 누수 |
train/val/test를 나누는 이유. 그룹 분할. test를 한 번만 여는 이유 |
| 7 |
측정의 함정 |
천장 효과·편향·오염이 숫자를 부풀리는 세 가지 방식 |
| 강 |
제목 |
다루는 질문 |
| 8 |
기술통계 기초 |
평균·분산·분포를 보는 법. 요약값이 숨기는 것 |
| 9 |
가설 검정과 p값 |
p값이 실제로 뜻하는 것과 흔한 오해 |
| 10 |
효과 크기와 신뢰구간 |
"유의하다 ≠ 차이가 크다"의 뜻. Cohen's d와 95% CI 읽는 법 |
| 11 |
비교 설계 |
대응(페어드) 검정이 강력한 이유. 층화 보고가 필수인 상황 |
| 12 |
검정력과 표본 크기 |
표본이 몇 개면 충분한가. 검출하지 못한 것과 없는 것의 차이 |
| 강 |
제목 |
다루는 질문 |
| 13 |
재현성과 시드 |
시드의 뜻. 단일 시드 보고가 위험한 이유. 다중 시드와 결정론 |
| 14 |
사전 등록 |
결과를 보기 전에 고정해야 하는 것. "판정 불가"를 미리 정의하는 이유 |
| 15 |
p-해킹과 다중 비교 |
"돌려보고 싶어서" 추가한 실험이 위험한 이유. 사후 선택의 유혹 |
| 16 |
음성 결과의 가치 |
가설 기각이 연구 실패가 아닌 이유 |
| 강 |
제목 |
다루는 질문 |
| 17 |
LLM 평가 설계 |
객관식과 자유 생성의 트레이드오프. LLM-judge의 순환성 문제 |
| 18 |
학습 데이터 오염 |
암기와 이해를 구별하는 법. 학습 컷오프 기반 층화 |
| 19 |
프롬프트 공정성 |
템플릿 통제·보기 위치 편향·디코딩 시드에서 조건 비교가 무너지는 지점 |
| 강 |
제목 |
다루는 질문 |
| 20 |
연구 파이프라인과 재현 도구 |
데이터에서 논문 그림까지 한 그래프로 잇는 이유. DVC와 시드 고정 |
| 21 |
논문 작성 기초 |
IMRaD 구조. 그림·표 만들기. 투고와 리뷰 절차 |
| 22 |
연구 용어집 |
기초부터 심화까지 이 강의 전체 용어를 한 페이지로 정리 |
각 문서는 다음을 지킨다. 규칙이 곧 품질 관리다.
- 첫머리에 "이 문서를 읽고 나면 답할 수 있는 질문" 2~3개를 둔다. 건너뛰기 판단 기준이 된다.
- 실제 연구 사례를 1개 이상 든다. 추상적 설명만으로 끝내지 않는다.
- 마지막에 확인 질문 3개를 둔다. 답이 막히면 다시 읽는다.
- 한 문서는 한 개념만 다룬다. 길어지면 쪼갠다.
- 용어가 처음 나올 때 한국어 용어(영어 원어)를 병기하고, 이후는 한국어만 쓴다.