이 단원은 205강부터 209강까지를 맡습니다. 학습을 최적화 문제 하나로 적습니다.
01단원이 답한 것은 **"무엇을 최소화할 것인가"**였습니다. 이 단원이 답하는 것은 다릅니다.
그리고 그 과정에서 손실함수가 어디서 왔는지를 유도하고, 왜 그렇게 계산해야 하는지까지 갑니다.
| 강의 | 하는 일 |
|---|---|
| 경험적 위험 최소화라는 틀을 세웁니다 | |
| 지수족에서 손실함수를 직접 꺼냅니다 | |
| 닫힌 해가 있는 문제를 안정적으로 풉니다 | |
| 닫힌 해가 없는 문제를 반복으로 풉니다 | |
| 갈래가 셋 이상인 문제로 넓힙니다 |
다섯 강이 하나의 줄기입니다. 틀을 세우고, 목적함수를 유도하고, 실제로 푸는 순서입니다.
| 무엇을 정하면 | 무엇이 정해지나 | 어디서 |
|---|---|---|
| 분포 가정 | 손실함수 | 강 |
| 손실과 모형 | 볼록한지 | 강 문제 |
| 볼록성과 크기 | 어떤 방법으로 풀지 | ~강 |
| 갈래 수 | 분모 비용과 방법 | 강 |
"학습 알고리즘"이라는 것이 이 넷을 정한 결과일 뿐입니다. 새로운 문제를 만나도 이 순서로 물으면 됩니다.
| 표본 크기 | 경험적 위험 | 참 위험 |
|---|---|---|
표본 에 계수 개면 거의 완벽히 맞는데 참 위험은 열두 배입니다. 같은 표본으로 고르고 같은 표본으로 점수를 매기므로 구조적으로 낙관되며, 그 간극을 다루는 것이 단원입니다.
| 무엇 | 볼록한가 | 무엇이 따라오나 |
|---|---|---|
| 제곱오차와 선형모형 | 예 | 닫힌 해가 있음 |
| 교차엔트로피와 선형 로짓 | 예 | 시작점에 안 걸림 |
| 제곱오차와 시그모이드 | 아니오 | 멀리서 시작하면 갇힘 |
| 교차엔트로피와 신경망 | 아니오 | S의 주제 |
강 문제 에서 제곱오차가 멀리서 시작해 떨어진 곳에 갇혔습니다. 같은 자료에서 교차엔트로피는 두 시작점에서 소수점 여섯 자리까지 같은 자리에 왔습니다.
그런데 볼록해도 어려운 자리가 있습니다. 강 문제 에서 계수를 배로 키우니 곡률이 로 사라졌고, 그때는 갇히지는 않지만 도달하지 못합니다.
| 의 조건수 | 정규방정식 오차 | QR 오차 |
|---|---|---|
를 만드는 순간 조건수가 제곱됩니다. 수식이 맞다고 그대로 계산하면 안 된다는 것이 강에서 배운 것이고, 강에서 실제 손해로 나타났습니다.
반복법에서는 같은 문제가 수렴 속도로 나타납니다. 강 문제 에서 눈금이 배 차이 나는 자료에 경사하강을 걸음 돌려도 기울기가 이었고, 표준화하면 까지 갔습니다.
| 어디서 | 무엇이 일어나나 |
|---|---|
| 강 문제 | 점 개를 차수 다항식이 다 지남 |
| 강 문제 | 잔차 인 해가 무한히 많음 |
| 강 문제 | 라벨이 무작위인데 표본 에 변수 면 언제나 완전 분리 |
셋이 같은 현상입니다. "학습 위험이 "이 좋은 소식이 아니라 정보가 모자라다는 신호이며, 그때 답을 정하는 것은 자료가 아니라 우리가 넣은 가정입니다.
| 이 단원의 개념 | 어디서 배웠는가 |
|---|---|
| 정사영 | 강, 강 문제 |
| 조건수와 수치 안정성 | 강, 강 문제 |
| 특이값 분해 | ~강, 강 문제 |
| 라그랑주 승수 | 강, 강 문제 |
| 최대우도 | 강, 강 문제 |
| 피셔 정보 | 강, 강 문제 |
| 정규화와 사전분포 | 강과 강, 강 문제 |
| 이분산과 가중 | 강, 강 문제 |
| IRLS | 강, 강 문제 |
| 더미변수 함정 | 강, 강 문제 |
| 자유도 | 강과 강, 강 문제 |
아홉째 줄이 눈에 띕니다. 강에서 도구로 썼던 IRLS가 강에서 왜 그런지 밝혀집니다. 가중치 가 곧 그 관측의 분산이고, 분산의 역수로 가중하는 것이 최대우도입니다.
03단원은 답이 새 자료에서도 맞는지 묻습니다.
강 문제 에서 본 경험적 위험과 참 위험의 간극이 무엇으로 이루어져 있는지가 강의 주제이고, 그것을 줄이는 장치가 강의 정규화와 강의 교차검증입니다.