이 단원은 210강부터 214강까지를 맡습니다. 답이 새 자료에서도 맞는지를 다룹니다.
02단원이 답한 것은 **"어떻게 최소화할 것인가"**였습니다. 이 단원이 묻는 것은 다릅니다.
그 답이 새 자료에서도 맞는가 \text{그 답이 새 자료에서도 맞는가}
그 답이 새 자료에서도 맞는가
이 단원이 이 과목의 중심입니다. 205강 문제 1에서 표본 5 55 일 때 경험적 위험 0.395658 0.3956580 . 3 9 5 6 5 8 과 참 위험 4.985743 4.9857434 . 9 8 5 7 4 3 의 간극을 봤습니다. 그 간극이 무엇으로 이루어져 있고, 무엇으로 줄이고, 무엇으로 재는지 를 다섯 강에 걸쳐 답합니다.
강의
하는 일
210 2102 1 0
오차를 잡음과 편향과 분산 셋으로 쪼갭니다
211 2112 1 1
벌점의 모양이 무엇을 바꾸는지 봅니다
212 2122 1 2
λ \lambdaλ 를 고르는 법을 자료에게 묻습니다
213 2132 1 3
변수가 많으면 무엇이 어려워지는지 봅니다
214 2142 1 4
복잡도를 재는 눈금을 만듭니다
다섯 강이 하나의 줄기입니다. 간극을 분해하고, 줄이는 장치를 만들고, 그 장치의 손잡이를 고르고, 어려움의 근원을 보고, 마지막으로 어려움을 재는 자를 만듭니다.
복잡도는 세는 것이 아니라 재는 것입니다 \text{복잡도는 세는 것이 아니라 재는 것입니다}
복잡도는 세는 것이 아니라 재는 것입니다
세려고 하면
실제로는
어디서
계수의 개수
유효 자유도가 21 212 1 에서 0.11 0.110 . 1 1 까지 움직임
214 2142 1 4 강 문제 1 11
변수의 개수
내재 차원이 어려움을 정함
213 2132 1 3 강 문제 4 44
모형의 크기
자료가 늘면 외울 힘이 줄어듦
214 2142 1 4 강 문제 4 44
VC 차원
표본이 476 4764 7 6 배여도 상계가 0.34 0.340 . 3 4
214 2142 1 4 강 문제 3 33
모형만 봐서는 복잡도를 알 수 없습니다. 학습 방식과 자료가 함께 정합니다.
E [ ( y − f ^ ( x ) ) 2 ] = σ 2 ⏟ 잡음 + ( E [ f ^ ] − f ) 2 ⏟ 편향 제곱 + Var [ f ^ ] ⏟ 분산 \mathbb{E}[(y-\hat{f}(x))^{2}]=\underbrace{\sigma^{2}}_{\text{잡음}}+\underbrace{(\mathbb{E}[\hat{f}]-f)^{2}}_{\text{편향 제곱}}+\underbrace{\text{Var}[\hat{f}]}_{\text{분산}}
E [ ( y − f ^ ( x ) ) 2 ] = 잡음 σ 2 + 편향 제곱 ( E [ f ^ ] − f ) 2 + 분산 Var [ f ^ ]
차수
편향 제곱
분산
0 00
0.594691 0.5946910 . 5 9 4 6 9 1
0.003745 0.0037450 . 0 0 3 7 4 5
3 33
합이 최소인 0.103436 0.1034360 . 1 0 3 4 3 6
12 121 2
0.000023 0.0000230 . 0 0 0 0 2 3
0.049351 0.0493510 . 0 4 9 3 5 1
잡음은 줄일 수 없고 편향과 분산은 서로 밀고 당깁니다. 210강에서 이 분해를 확인하고, 211강부터는 분산 쪽을 누르는 장치 를 만듭니다.
방법
0 00 이 아닌 계수 수
검증 오차
릿지 λ 0.01 \lambda\,0.01λ 0 . 0 1
200 2002 0 0
10.929741 10.9297411 0 . 9 2 9 7 4 1
라소 λ 0.05 \lambda\,0.05λ 0 . 0 5
38 383 8
0.375322 0.3753220 . 3 7 5 3 2 2
표본 80 808 0 에 변수 200 2002 0 0 이고 참 계수가 8 88 개일 때 스물아홉 배 차이가 납니다. 그런데 참 계수가 고르게 퍼져 있으면 릿지가 낫습니다. 어느 쪽이 좋은지는 참 구조가 정하고 참 구조는 미리 알 수 없으므로 , 212강의 교차검증으로 자료에게 묻습니다.
무엇으로 쟀나
평균
참 오차와의 차
표준편차
학습 자료 그대로
0.664301 0.6643010 . 6 6 4 3 0 1
− 0.849451 -0.849451− 0 . 8 4 9 4 5 1
0.138007 0.1380070 . 1 3 8 0 0 7
따로 뗀 20 202 0 개
2.059905 2.0599052 . 0 5 9 9 0 5
0.546153 0.5461530 . 5 4 6 1 5 3
0.765656 0.7656560 . 7 6 5 6 5 6
5 55 겹 교차검증
1.749904 1.7499041 . 7 4 9 9 0 4
0.236153 0.2361530 . 2 3 6 1 5 3
0.428040 0.4280400 . 4 2 8 0 4 0
5 55 겹은 따로 떼기보다 편향도 작고 분산도 절반입니다. 그런데 교차검증 값 자체도 흔들립니다. 같은 자료에 나누기만 바꿔도 표준편차가 0.207097 0.2070970 . 2 0 7 0 9 7 이고, 후보를 100 1001 0 0 개 두고 최소를 고르면 값이 1.728606 1.7286061 . 7 2 8 6 0 6 에서 1.060290 1.0602901 . 0 6 0 2 9 0 까지 내려갑니다. 고르는 행위 자체가 값을 끌어내립니다.
자료
겉보기 차원
상관 차원
이웃 오차의 분산 대비 비율
60 606 0 차원인데 내재 1 11 차원
60 606 0
1.013144 1.0131441 . 0 1 3 1 4 4
0.000270 0.0002700 . 0 0 0 2 7 0
진짜 60 606 0 차원
60 606 0
15.754661 15.7546611 5 . 7 5 4 6 6 1
1.236375 1.2363751 . 2 3 6 3 7 5
같은 60 606 0 차원인데 한쪽은 이웃 방법이 완벽히 듣고 다른 쪽은 평균보다도 못합니다. 213강이 이 차이를 설명하고, 대응 수단 다섯 가지를 정리합니다.
이 단원의 개념
어디서 배웠는가
편향과 분산
165 1651 6 5 강, 210 2102 1 0 강 문제 1 11
정규화와 사전분포
116 1161 1 6 강과 148 1481 4 8 강, 211 2112 1 1 강 문제 1 11
특이값 분해
84 848 4 ~89 898 9 강, 211 2112 1 1 강 문제 4 44
공선성
187 1871 8 7 강, 211 2112 1 1 강 문제 2 22
변수 선택과 선택 후 추론
189 1891 8 9 강, 211 2112 1 1 강 문제 5 55
라그랑주 승수
107 1071 0 7 강, 211 2112 1 1 강 심화 6 66
유효 표본 크기
163 1631 6 3 강, 212 2122 1 2 강 문제 2 22
지렛대
180 1801 8 0 강, 212 2122 1 2 강 심화 1 11
시계열의 앞뒤
199 1991 9 9 강, 212 2122 1 2 강 문제 4 44
주성분
88 888 8 강, 213 2132 1 3 강 문제 4 44
델타법
153 1531 5 3 강, 213 2132 1 3 강 심화 2 22
자유도
163 1631 6 3 강과 207 2072 0 7 강, 214 2142 1 4 강 문제 1 11
완전 분리
208 2082 0 8 강, 214 2142 1 4 강 문제 2 22
조기 종료
197 1971 9 7 강, 214 2142 1 4 강 문제 4 44
마지막 줄이 눈에 띕니다. 197 1971 9 7 강에서 실무 요령으로 썼던 조기 종료가 214 2142 1 4 강에서 왜 그런지 밝혀집니다. 걸음 수가 계수 크기를 묶어 λ \lambdaλ 의 역수처럼 작동합니다.
습관
왜
학습 오차만 보고 판단하지 않기
214 2142 1 4 강 문제 4 44 에서 검증이 74 747 4 배 나빠지는 동안 학습은 좋아짐
고르는 데 쓴 값을 성능으로 보고하지 않기
212 2122 1 2 강 문제 3 33 의 후보 수 효과
라벨을 섞어 학습시켜 보기
214 2142 1 4 강 심화 6 66 의 누출 탐지
04단원부터는 실제 지도학습 알고리즘을 하나씩 유도합니다.
답이 새 자료에서도 맞는가 ⟶ 어떤 답들이 있는가 \text{답이 새 자료에서도 맞는가} \;\longrightarrow\; \text{어떤 답들이 있는가}
답이 새 자료에서도 맞는가 ⟶ 어떤 답들이 있는가
이 단원에서 만든 분해와 손잡이와 눈금 이 04단원의 모든 알고리즘을 판단하는 자가 됩니다.