이 단원은 231강부터 234강까지를 맡습니다. 그래디언트를 정확하고 빠르게 얻는 법을 세웁니다.
강에서 경사하강을 배웠습니다. 그런데 거기서 미분한 것은 계수 벡터 하나였습니다.
그리고 층이 백 개면 손으로 백 번 유도할 수 없습니다. 이 단원은 그 일을 규칙과 자료구조로 넘깁니다.
| 강의 | 무엇을 묻는가 |
|---|---|
| 행렬로 미분한다는 것이 무슨 뜻인지 정합니다 | |
| 연결을 자료구조가 알게 만듭니다 | |
| 층 위에서 그 훑기를 알고리즘으로 적습니다 | |
| 반복문을 행렬 연산으로 접습니다 |
강이 문법이고 강이 구조입니다. 강이 둘을 합치고 강이 그것을 빠르게 만듭니다.
| 무엇을 무엇으로 | 결과의 모양 | 어디서 |
|---|---|---|
| 스칼라를 벡터로 | 벡터 | 강 문제 |
| 스칼라를 행렬로 | 같은 모양 행렬 | 강 문제 |
| 벡터를 벡터로 | 야코비 | 강 문제 |
| 층 하나의 가중치 | 바깥곱 | 강 문제 |
| 배치까지 | 전치 곱하기 신호 | 강 문제 |
손실이 언제나 스칼라이므로 그래디언트는 언제나 입력과 같은 모양입니다. 그것 하나로 전치 위치가 정해집니다.
| 무엇 | 모양 | 무엇을 뜻하나 |
|---|---|---|
| 위쪽 신호 | 배치 곱하기 출력차원 | 뒤에서 온 것 |
| 가중치 그래디언트 | 입력차원 곱하기 출력차원 | 표본을 다 더함 |
| 아래쪽 신호 | 배치 곱하기 입력차원 | 앞으로 넘길 것 |
층이 몇 개든 이 두 줄을 되풀이할 뿐입니다. 강 문제 에서 세 층 신경망의 여섯 파라미터가 모두 수치 미분과 일치했습니다.
| 깊이 | 첫 층 그래디언트 크기 | 마지막 층 크기 |
|---|---|---|
강 문제 입니다. 역전파 식은 완벽히 맞는데 첫 층에 신호가 안 닿습니다.
초기화 표준편차를 로 키우면 반대로 터집니다. 깊이 에서 첫 층 크기가 을 넘습니다.
| 무엇을 했나 | 상대 오차 | 예외가 나나 |
|---|---|---|
| 소프트맥스를 열 방향으로 | 안 남 | |
| 정사각에서 전치를 틀림 | 안 남 | |
| 배치로 안 나눔 | 크기가 표본 수 배 | 안 남 |
| 잔차 연결을 빠뜨림 | 안 남 |
넷 다 예외가 안 납니다. 그래서 이 단원은 유도한 식을 언제나 수치 미분과 견줍니다.
| 이 단원의 개념 | 어디서 배웠는가 |
|---|---|
| 바깥곱 | 강, 강 문제 |
| 행렬 곱은 바깥곱의 합 | 강, 강 문제 |
| 특이값 분해 | 강, 강 심화 |
| 다변수 연쇄법칙 | 강, 강 문제 |
| 헤세 | 강, 강 심화 |
| 위상 정렬 | 강 문제 |
| 교차엔트로피 | 강, 강 문제 |
| 사전확률 보정 | 강, 강 문제 |
| 정규방정식 | 강, 강 문제 |
| 과적합 | 강, 강 문제 |
강의 교차엔트로피가 강에서 예측 빼기 정답으로 접힙니다. 그 한 줄이 딥러닝 분류의 출발점입니다.
| 습관 | 왜 |
|---|---|
| 모양표를 먼저 그리기 | 식을 외울 필요가 없기 때문 |
| 갈래를 반드시 더하기 | 안 더하면 조용히 틀리기 때문 |
| 수치 미분으로 검산하기 | 예외가 안 나기 때문 |
| 첫 손실을 확인하기 | 로그 갈래 수여야 하기 때문 |
02단원은 이렇게 얻은 그래디언트를 어떻게 쓸지 봅니다.
지금까지는 자료 전체의 그래디언트를 계산했습니다. 실제로는 몇십 개만 보고 한 걸음 딛습니다. 그것이 왜 되는지가 강의 물음입니다.