이 단원은 196강부터 200강까지를 맡습니다. 순서를 되찾습니다.
03단원이 물은 것은 **"바꾸면 어떻게 되는가"**였습니다. 이 단원이 묻는 것은 다릅니다.
그런데 그 물음에 답하기 전에 앞 세 단원의 전제 하나를 걷어 내야 합니다. 관측이 서로 독립이라는 가정입니다.
| 강의 | 하는 일 |
|---|---|
| 구조를 보고 독립 가정이 깨진 자리를 잽니다 | |
| 그 구조를 되먹임과 이동평균으로 적습니다 | |
| 정상이 아닌 자료를 정상으로 만듭니다 | |
| 예측하고 얼마나 틀릴지 말합니다 | |
| 계절을 모형에 들이고 실무 전체를 정리합니다 |
196강 문제 1에서 이웃 상관이 면 관측 개가 개 값밖에 못 한다는 것을 봤습니다. 강 이후의 표준오차가 그 자리에서 전부 다시 계산돼야 합니다.
| 어디서 | 무엇이 드러나나 |
|---|---|
| 문제 | 독립 가정 표준오차가 배 틀림 |
| 문제 | 관계 없는 두 누적합이 의 비율로 유의 |
| 문제 | 칸 앞에서 모형이 평균만 말하는 것과 같아짐 |
| 문제 | 를 정상이라고 가려낼 검정력이 |
| 문제 | 구조가 변하면 퍼센트 구간이 만 담음 |
| 문제 | 달의 길이만으로 매년 퍼센트의 가짜 계절 |
둘째 줄이 이 단원의 가장 위험한 결과입니다. 표본을 늘리면 오류율이 목표로 수렴하는 것이 보통인데, 가짜 회귀는 표본을 늘릴수록 나빠집니다.
| 어떤 자료 | 처리 | 충격이 |
|---|---|---|
| 추세 정상 | 시간을 다룸 | 사라집니다 |
| 차분 정상 | 차분함 | 남습니다 |
| 분산이 커짐 | 로그 변환 | 해당 없음 |
| 계절 | 더미나 삼각함수나 계절 차분 | 되풀이됩니다 |
첫 두 줄이 미래에 대해 전혀 다른 말을 합니다. 강 문제 에서 칸 앞 예측이 과 으로 갈렸으며, 어느 쪽이 옳은지는 자료가 아니라 대상이 정합니다.
셋째 줄이 첫째입니다. 분산이 변하면 차분해도 정상이 안 되므로 로그가 차분보다 먼저입니다.
| 무엇을 보는가 | 되먹임 차 | 이동평균 차 |
|---|---|---|
| 자기상관 | 천천히 줄어듦 | 뒤로 끊김 |
| 부분자기상관 | 뒤로 끊김 | 천천히 줄어듦 |
두 그림이 정확히 뒤집힌 관계입니다. 나란히 놓으면 어느 부품인지 알 수 있고, 그 위에 AIC와 BIC와 묶음 검정이 얹힙니다.
강 문제 에서 이동평균 계수 하나면 될 일에 되먹임 계수 다섯이 들었습니다. 같은 설명력을 적은 계수로 얻는 것이 목표입니다.
| 자료 | 기준선 |
|---|---|
| 정상 | 평균 |
| 누적 | 바로 앞 값 |
| 계절 | 지난 주기 같은 자리 |
강 문제 에서 누적 자료의 평균 대비 개선이 퍼센트였는데, 그것은 바로 앞 값을 그대로 쓰기만 해도 나오는 값입니다. 기준선 없는 성능 숫자는 아무 말도 하지 않습니다.
강 문제 에서 계수 개짜리 모형이 계수 개짜리보다 나은 폭이 대 이었습니다. 그 차이가 계수 개의 값어치입니다.
| 이 단원의 개념 | 어디서 배웠는가 |
|---|---|
| 유효 표본 | 강 문제 , 강 문제 |
| 다중비교 | 강, 강 문제 |
| 부분상관과 통제 | 강, 강 문제 |
| 정보 기준 | 강 문제 , 강 문제 |
| 선택 후 추론 | 강 문제 , 강 심화 |
| 군집 표준오차 | 강 문제 , 강 문제 |
| 붓스트랩 | 강 문제 , 강 문제 |
| 누출 | 강, 강 문제 |
| 편향과 분산 | 강 문제 , 강 문제 |
| 로그 변환과 젠센 | 강, 강 심화 |
여섯째 줄이 강과 이어집니다. 시점이 둘뿐인 이중차분에서도 표준오차를 고쳐야 했으니, 시점이 백 개면 고칠 것이 훨씬 많습니다.
S9는 목표를 바꿉니다. 이 과목 전체가 물은 것은 하나였습니다.
다음 과목이 묻는 것은 **"무엇이 잘 맞는가"**입니다. 그런데 강 문제 의 가짜 회귀와 강 문제 의 AUC가 보였듯, 잘 맞는다고 참인 것은 아닙니다. S9는 그 긴장을 정면으로 다루며, 이 단원에서 세운 가정 목록이 계속 필요합니다.