이 단원은 158강부터 162강까지를 맡습니다. 수학에서 자료로 넘어옵니다.
157강까지 다룬 것은 모두 이미 있는 수와 분포였습니다. 확률변수는 정의된 대로 행동했고, 표본은 가정한 분포에서 나왔으며, 결측이나 오타는 없었습니다.
실제 자료는 그렇지 않습니다. 칸이 비어 있고, 단위가 섞여 있고, 같은 사람이 두 번 들어 있고, 금액이 음수입니다. 그리고 이 모든 것을 계산하기 전에 처리해야 합니다.
이 단원은 그 앞의 다섯 걸음입니다.
| 강의 | 하는 일 |
|---|---|
| 158 | 자료를 어떤 그릇에 담을지 정하고 스키마로 계약을 겁니다 |
| 159 | 담은 것에서 원하는 것을 꺼내고 NULL의 논리를 다룹니다 |
| 160 | 표 여럿을 잇고 묶어 세며 팬아웃을 막습니다 |
| 161 | 없는 값과 튀는 값이 왜 생겼는지 묻고 처리합니다 |
| 162 | 그 처리를 반복 가능한 파이프라인으로 굳힙니다 |
앞의 셋은 자료를 얻는 일이고 뒤의 둘은 얻은 자료를 믿을 만하게 만드는 일입니다.
| 강의 | 어디에서 나타나는가 |
|---|---|
| 158 | int8에 담은 이 이 됩니다 |
| 159 | 조건이 참인 행과 부정이 참인 행을 합쳐도 전체가 아닙니다 |
| 160 | COUNT(*)가 인데 COUNT(amount)가 입니다 |
| 161 | 결측을 뺀 평균의 분모가 무작위로 줄어들지 않았습니다 |
| 162 | 전체로 표준화하면 검증부가 자기 기준을 만듭니다 |
다섯 경우 모두 오류가 나지 않습니다. 계산은 성공하고 숫자는 나옵니다. 틀린 것을 알아채는 방법은 무엇이 분모에 들어 있는지 직접 세어 보는 것뿐이며, 이 단원의 실전 기술이 그것입니다.
| 강의 | 조용한 실패 | 대가 |
|---|---|---|
| 158 문제 2 | 을 만 번 더하면 | 회계가 맞지 않습니다 |
| 159 문제 3 | NOT IN 목록에 NULL이 하나 있습니다 |
결과가 통째로 빕니다 |
| 160 문제 3 | 일대다 조인 뒤 SUM |
매출이 배 부풉니다 |
| 161 문제 4 | 오염 퍼센트에서 시그마 | 이상치를 하나도 못 잡습니다 |
| 162 문제 2 | 나누기 전에 특징 선택 | 무작위 라벨에서 정확도 |
마지막 줄이 가장 비쌉니다. 검증 성능이 좋게 나오므로 아무도 의심하지 않고, 배포한 뒤에야 드러납니다.
| 이 단원의 개념 | 어디서 배웠는가 |
|---|---|
조건을 AND, OR, NOT으로 잇기 |
22강 명제와 논리 연산 |
| 드모르간 법칙 | 22강 |
| 합집합, 교집합, 차집합 | 26강 집합의 연산 |
| 포함배제 | 122강 확률의 공리와 셈 |
| 파국적 상쇄 | 92강 수치해석의 오차 |
| 결측을 뺀 평균의 편향 | 148강, 149강 |
| 표준오차가 1/\sqrt | 142강 |
| 상관행렬의 고윳값 | 86강 대칭행렬 |
| 마할라노비스 거리 | 140강 다변량 정규분포 |
여덟째 줄이 이 단원에서 새로 쓰이는 방식입니다. 쌍별 제거로 모은 상관행렬의 최소 고윳값이 가 되는데, 고윳값이 음수인 상관행렬은 존재할 수 없으므로 그 행렬은 어떤 자료에서도 나올 수 없는 것입니다.
예측 시점에 알 수 없던 정보가 학습에 섞이는 것을 누출이라 부르며, 이 단원에서 세 가지 모습으로 나타납니다.
| 어디서 | 무엇이 새는가 |
|---|---|
| 160강 심화 4 | 미래의 값이 특징에 섞입니다 |
| 162강 문제 2 | 검증부의 라벨이 특징 선택에 섞입니다 |
| 162강 문제 2 | 검증부의 값이 표준화 기준에 섞입니다 |
셋 다 검증 자료로는 잡을 수 없습니다. 검증 자료 자체가 오염되었기 때문이며, 순서를 구조로 강제하는 것 말고는 막을 방법이 없습니다. 162강이 그 구조를 다룹니다.
02단원은 얻은 자료를 요약합니다. 이 단원이 자료를 손에 넣는 일이었다면, 다음은 그것을 몇 개의 숫자와 그림으로 줄이는 일입니다.
이미 절반은 만났습니다. 161강 문제 5에서 평균과 중앙값이 오염 앞에서 갈리는 것을 보았고, 162강 문제 3에서 척도 변환이 그 둘 중 무엇에 기대는지 보았습니다.