05단원까지 화살표가 한 방향이었습니다.
와 을 안다고 놓고 표본이 어떻게 흩어지는지 물었습니다. 실제 상황은 정반대입니다.
우리가 가진 것은 자료뿐이고 모르는 것이 모수입니다. 06단원은 이 방향을 다루며, 이 강의가 그 첫 질문에 답합니다.
질문은 "어떻게 추정하는가"가 아닙니다. 추정하는 방법은 얼마든지 만들 수 있습니다. 진짜 질문은 이것입니다.
기준이 없으면 고를 수 없고, 기준을 잘못 잡으면 나쁜 것을 고릅니다. 이 강의는 네 가지 기준을 세우고, 가장 널리 쓰이는 기준인 불편성이 사실 가장 약한 기준임을 보입니다.
문제. 에서 개를 뽑아 을 추정합니다.
(1) 와 최댓값의 편향을 각각 구하세요.
(2) 최댓값의 편향을 없애는 상수를 찾으세요.
(3) 세 추정량의 평균제곱오차를 비교하세요.
생각의 실마리. 균등분포의 평균이 이므로 가 자연스럽습니다. 그런데 관측값 중 가장 큰 것도 에 대한 정보를 담고 있습니다.
풀이. (1)(2)(3) 검산 결과입니다.
| 추정량 | 평균 | 편향 | 분산 | 평균제곱오차 | |
|---|---|---|---|---|---|
| 2\bar | |||||
| 최댓값 | |||||
| 최댓값 | |||||
| 2\bar | |||||
| 최댓값 | |||||
| 최댓값 |
최댓값은 언제나 작게 나옵니다. 가 확률 로 성립하므로 구조적으로 과소추정합니다.
**에서 **이며 검산의 과 맞습니다. 그러므로 을 곱하면 편향이 정확히 사라집니다.
셋째 줄과 여섯째 줄이 결론입니다. 에서 의 평균제곱오차가 이고 보정한 최댓값이 이므로 배 좋습니다.
이 문제에서 배우는 것: 세 가지 척도.
편향, 분산, 평균제곱오차.
MSE 하나가 두 척도를 합칩니다. 133강에서 분산을 정의할 때 쓴 계산이 그대로이며, 를 중심으로 전개하면 교차항이 사라집니다.
| 추정량 | 왜 이렇게 다른가 |
|---|---|
| 2\bar | 모든 관측을 쓰지만 와 간접적으로만 관계있습니다 |
| 최댓값 | 관측 하나만 쓰지만 에 직접 붙어 있습니다 |
| 보정한 최댓값 | 직접성을 유지하면서 편향만 제거했습니다 |
둘째 줄이 뜻밖입니다. 개 중 하나만 쓴 추정량이 전부를 쓴 추정량을 이깁니다. 정보의 양이 아니라 정보의 질이 중요합니다.
분산의 감소 속도도 다릅니다. 의 분산은 이라 이고, 보정한 최댓값은 라 입니다.
이런 일이 흔하지는 않습니다. 균등분포는 지지구간의 끝이 곧 모수라는 특별한 구조를 가지며, 대부분의 분포에서는 이 한계입니다. 문제 3에서 그 한계를 정확히 정합니다.
바로 확인 1.
확인 1-1. 평균제곱오차를 두 조각으로 쪼개 쓰세요.
답. 편향의 제곱과 분산의 합입니다.
확인 1-2. 에서 최댓값의 기댓값을 쓰세요.
답. 입니다.
확인 1-3. 최댓값을 불편으로 만드는 상수를 쓰세요.
답. 입니다.
문제. 최댓값에 곱하는 상수를 바꿔 가며 조사합니다.
(1) 평균제곱오차를 편향의 제곱과 분산으로 쪼개세요.
(2) 을 곱한 것과 비교하세요.
(3) 어느 것이 가장 좋은지 판정하세요.
생각의 실마리. 편향을 없애면 첫째 항이 사라집니다. 그런데 상수를 키우면 분산도 함께 커집니다. 둘 사이에 최적점이 있을 수 있습니다.
풀이. (1)(2) 검산 결과입니다.
| 추정량 | 편향^ | 분산 | 평균제곱오차 | 이론값 | |
|---|---|---|---|---|---|
| 2\bar | |||||
| 최댓값 | |||||
| 최댓값 | |||||
| 최댓값 | |||||
| 2\bar | |||||
| 최댓값 | |||||
| 최댓값 | |||||
| 최댓값 |
(3) 네 번째 줄과 여덟 번째 줄이 가장 작습니다. 그런데 그 추정량은 불편이 아닙니다.
에서 대 이며, 편향을 만큼 받아들이고 분산을 줄인 거래입니다.
이 문제에서 배우는 것: 불편성은 목표가 아닙니다.
좋은 추정량의 네 조건.
| 조건 | 뜻 | 이 강의의 자리 |
|---|---|---|
| 불편성 | 문제 1, 문제 2 | |
| 효율 | 분산이 하한을 달성합니다 | 문제 3 |
| 일치성 | 에서 로 수렴합니다 | 문제 4 |
| 충분성 | 자료의 정보를 다 씁니다 | 문제 5 |
넷 중 불편성만이 유한 표본의 성질이면서 가장 약합니다. 불편추정량이 아예 없는 경우도 있고, 있어도 터무니없는 경우가 있습니다.
최적 상수. 의 MSE를 최소로 만드는 는 입니다.
미분해 으로 놓으면 나오며, 그때 MSE가 입니다.
이 거래가 기계학습의 중심 주제입니다. 210강의 편향-분산 분해와 211강의 정규화가 정확히 같은 거래를 훨씬 큰 규모로 합니다. 릿지 회귀는 계수를 일부러 줄여 편향을 넣고 분산을 크게 줄입니다.
불편성을 고집하면 손해를 볼 수 있습니다. 144강 심화 2에서 정규 표본의 분산을 로 나누면 MSE가 최소였던 것과 같은 이야기입니다.
그럼에도 과 을 쓰는 이유는 분포 이론이 깔끔하기 때문입니다. 불편추정량은 신뢰구간과 검정을 만들기 쉽고, 여러 실험을 합칠 때 편향이 쌓이지 않습니다.
바로 확인 2.
확인 2-1. 좋은 추정량의 네 조건을 쓰세요.
답. 불편성, 효율, 일치성, 충분성입니다.
확인 2-2. 의 MSE를 최소로 만드는 를 쓰세요.
답. 이며 불편이 아닙니다.
확인 2-3. 편향을 받아들이는 것이 이득일 수 있는 이유를 쓰세요.
답. 분산이 더 크게 줄면 평균제곱오차가 작아지기 때문입니다.
문제. 분산에 넘을 수 없는 하한이 있는지 조사합니다.
(1) 네 모형에서 피셔 정보를 수치로 재고 이론과 견주세요.
(2) 에서 크라메르-라오 하한을 계산하세요.
(3) 와 의 효율을 판정하세요.
생각의 실마리. 자료가 모수에 대해 얼마나 많이 말해 주는지를 재는 양이 있어야 합니다. 로그 우도가 에 대해 가파를수록 정보가 많습니다.
풀이. (1) 점수함수의 제곱을 평균해 잽니다.
| 모형 | 수치 정보량 | 이론 정보량 | 비 |
|---|---|---|---|
| 정규 평균 | |||
| 정규 분산 | |||
| 베르누이 | |||
| 지수 비율 |
(2)(3) 에서 하한과 실제 분산을 견줍니다.
| 추정량 | 분산 수치 | 크라메르-라오 하한 | 효율 |
|---|---|---|---|
| 정규 평균의 \bar | |||
| 정규 분산의 S^ | |||
| 평균을 아는 경우 |
**이론 효율은 차례로 , , **이며 수치가 표본오차 범위에서 맞습니다.
이 문제에서 배우는 것: 피셔 정보와 크라메르-라오 하한.
피셔 정보. 로그 우도의 도함수를 점수함수라 하고, 그 분산이 정보량입니다.
두 표현이 같습니다. 점수함수의 기댓값이 이라는 사실에서 나오며, 앞쪽이 기울기의 흩어짐이고 뒤쪽이 곡률입니다.
크라메르-라오 하한. 불편추정량의 분산은 다음보다 작을 수 없습니다.
| 모형 | 하한 | |
|---|---|---|
| 정규 평균 | 1/\sigma^ | |
| 정규 분산 | ||
| 베르누이 | ||
| 지수 비율 | 1/\lambda^ |
정보가 더해집니다. 독립 표본 개의 정보량이 이며, 곱셈이 로그에서 덧셈이 되기 때문입니다.
가 하한을 정확히 달성합니다. 이런 추정량을 유효추정량이라 부르며, 이보다 나은 불편추정량은 존재하지 않습니다.
의 효율이 인 이유. 평균을 모르므로 그것도 추정해야 하고, 144강에서 본 대로 자유도를 하나 잃습니다.
세 번째 줄이 그것을 확인합니다. 평균을 안다고 놓고 을 쓰면 효율이 이 됩니다.
하한을 못 넘는 것이 곡률에서 옵니다. 로그 우도가 평평하면 자료가 여러 를 비슷하게 지지하므로 어떤 방법으로도 정확히 맞힐 수 없습니다. 109강의 헤세 행렬이 여기서 정보량이 됩니다.
바로 확인 3.
확인 3-1. 피셔 정보의 두 표현을 쓰세요.
답. 점수함수의 제곱의 기댓값이며 로그 우도 이차도함수의 음의 기댓값입니다.
확인 3-2. 크라메르-라오 하한을 쓰세요.
답. 입니다.
확인 3-3. 의 효율과 그 이유를 쓰세요.
답. 이며 평균을 추정하느라 자유도를 하나 잃기 때문입니다.
문제. 세 추정량이 을 늘릴 때 어떻게 되는지 봅니다.
(1) 첫 관측 을 추정량으로 쓰면 어떻게 되는지 보세요.
(2) 와 비교하세요.
(3) 보정한 최댓값의 수렴 속도를 비교하세요.
생각의 실마리. 불편성은 이 고정된 상태의 성질입니다. 에서 무엇이 일어나는지는 별개의 질문입니다.
풀이. (1)(2)(3) 검산 결과입니다.
| 10^ |
첫 열이 줄지 않습니다. 은 라 완벽한 불편추정량인데, 을 만 배 늘려도 정확도가 그대로입니다.
셋째 열이 가장 빠릅니다. 에서 이미 이며, 의 보다 배 낫습니다.
이 문제에서 배우는 것: 일치성.
일치성. 모든 에 대해 이면 일치추정량이라 합니다.
142강의 확률 수렴과 같은 정의입니다. 그리고 표본평균의 일치성은 큰 수의 법칙 그 자체입니다.
| 추정량 | 불편인가 | 일치인가 |
|---|---|---|
| X_ | 그렇습니다 | 아닙니다 |
| \bar | 그렇습니다 | 그렇습니다 |
| \frac1n\sum(X_{i}-\bar{X})^ | 아닙니다 | 그렇습니다 |
| \max X_ | 아닙니다 | 그렇습니다 |
| \frac{n+1}{n}\max X_ | 그렇습니다 | 그렇습니다 |
첫 줄과 셋째 줄이 서로 반대입니다. 불편성과 일치성은 어느 쪽도 다른 쪽을 함의하지 않습니다.
실무에서 더 중요한 것은 일치성입니다. 자료를 늘려도 참값에 가지 않는 추정량은 쓸 수 없습니다.
충분조건이 편리합니다. 편향이 으로 가고 분산도 으로 가면, 즉 MSE가 으로 가면 일치입니다. 체비쇼프 부등식 한 줄로 나옵니다.
셋째 열의 속도가 특별합니다. 대부분의 추정량이 인데 이것은 이며, 문제 1에서 본 분산의 결과입니다. 이런 경우를 초효율이라 부르기도 하며, 크라메르-라오 하한의 정규 조건이 성립하지 않기에 가능합니다.
바로 확인 4.
확인 4-1. 일치성의 정의를 쓰세요.
답. 모든 에서 입니다.
확인 4-2. 불편이지만 일치가 아닌 예를 쓰세요.
답. 첫 관측 입니다.
확인 4-3. 일치성의 편리한 충분조건을 쓰세요.
답. 평균제곱오차가 으로 가는 것입니다.
문제. 베르누이 표본에서 를 추정합니다.
(1) 인수분해 정리로 충분통계량을 확인하세요.
(2) 첫 관측만 쓰는 추정량을 충분통계량으로 조건화하세요.
(3) 분산이 얼마나 줄어드는지 재세요.
생각의 실마리. 개의 값을 하나의 수로 줄이면 무엇인가 잃을 것 같습니다. 그런데 잃지 않는 요약이 있습니다.
풀이. (1) 서로 다른 표본의 결합확률을 비교합니다.
| 표본 | 결합확률 | p^{t}(1-p)^ | 차이 | |
|---|---|---|---|---|
| 1.73\times10^ | ||||
| 1.73\times10^ | ||||
앞의 두 표본은 순서가 전혀 다른데 확률이 같습니다. 결합확률이 에만 의존하므로, 를 알면 어느 표본이었는지는 에 대해 아무 정보를 주지 않습니다.
(2)(3) , 입니다.
| 추정량 | 평균 | 편향 | 분산 | 평균제곱오차 |
|---|---|---|---|---|
| 첫 관측 X_ | ||||
| 라오-블랙웰화 \bar |
**이론값 과 **과 맞습니다. 분산이 정확히 분의 로 줄었습니다.
이 문제에서 배우는 것: 충분통계량과 라오-블랙웰 정리.
인수분해 정리. 가 충분통계량일 필요충분조건은 결합밀도를 다음처럼 쪼갤 수 있는 것입니다.
가 들어간 부분이 를 통해서만 자료에 닿습니다. 베르누이에서 이고 입니다.
| 분포 | 충분통계량 |
|---|---|
| 베르누이 | \sum X_ |
| 포아송 | \sum X_ |
| 정규 | |
| 지수 | \sum X_ |
| 균등 | \max X_ |
마지막 줄이 문제 1을 설명합니다. 최댓값이 충분통계량이므로 자료의 정보를 하나도 버리지 않았고, 그래서 모든 관측을 쓴 를 이겼습니다.
라오-블랙웰 정리. 가 불편이고 가 충분통계량이면
는 불편이면서 분산이 결코 크지 않습니다.
증명이 137강의 전체 분산 법칙 한 줄입니다.
첫째 항이 음이 아니므로 조건화하면 분산이 줄어듭니다. 그리고 가 충분해야 가 에 의존하지 않아 실제로 계산할 수 있습니다.
검산에서 이므로 결과가 입니다. 아무렇게나 만든 추정량이 조건화 한 번으로 최적에 도달했습니다.
147강 심화 2의 라오-블랙웰화가 같은 정리이며, 몬테카를로에서 일부를 해석적으로 적분해 분산을 줄이는 기법의 이름이 여기서 왔습니다.
바로 확인 5.
확인 5-1. 인수분해 정리를 쓰세요.
답. 로 쪼개지면 가 충분통계량입니다.
확인 5-2. 라오-블랙웰 정리를 쓰세요.
답. 충분통계량으로 조건화하면 불편성을 유지하며 분산이 줄어듭니다.
확인 5-3. 증명에 쓰는 도구를 쓰세요.
답. 전체 분산 법칙입니다.
| 개념 | 식 |
|---|---|
| 편향 | |
| 평균제곱오차 | 편향 + 분산 |
| 피셔 정보 | |
| 크라메르-라오 하한 | |
| 효율 | 하한 나누기 실제 분산 |
| 일치성 | |
| 인수분해 정리 | |
| 라오-블랙웰 |
| 모형 | 하한 | 충분통계량 | |
|---|---|---|---|
| 정규 평균 | 1/\sigma^ | \sum X_ | |
| 정규 분산 | \sum X_{i}^ | ||
| 베르누이 | \sum X_ | ||
| 지수 | 1/\lambda^ | \sum X_ | |
| 균등 | 정규 조건 위반 | 적용 불가 | \max X_ |
| 의 추정량 | MSE |
|---|---|
| 2\bar | |
| \max X_ | |
| \frac{n+1}{n}\max X_ | |
| \frac{n+2}{n+1}\max X_ | \theta^{2}/(n+1)^ |
| 자주 하는 실수 | 바로잡기 |
|---|---|
| 불편이면 좋다고 봅니다 | MSE가 더 큰 불편추정량이 흔합니다 |
| 관측을 다 쓰면 낫다고 봅니다 | 충분통계량이면 하나라도 충분합니다 |
| 불편이면 일치라고 봅니다 | 이 반례입니다 |
| 일치이면 불편이라고 봅니다 | 이 반례입니다 |
| 하한을 모든 경우에 씁니다 | 균등분포처럼 정규 조건이 깨지면 못 씁니다 |
| 조건화하면 정보를 잃는다고 봅니다 | 충분통계량이면 잃지 않고 분산만 줄어듭니다 |
문제 6. 평균제곱오차를 두 조각으로 쪼개 쓰세요.
답. 편향의 제곱과 분산의 합입니다.
문제 7. 에서 최댓값의 기댓값과 불편 보정을 쓰세요.
답. 이며 을 곱합니다.
문제 8. 에서 와 보정한 최댓값의 MSE 비를 쓰세요.
답. 대 으로 약 배입니다.
문제 9. 좋은 추정량의 네 조건을 쓰세요.
답. 불편성, 효율, 일치성, 충분성입니다.
문제 10. 의 MSE를 최소로 만드는 를 쓰세요.
답. 이며 불편이 아닙니다.
문제 11. 피셔 정보의 두 표현을 쓰세요.
답. 점수함수 제곱의 기댓값이며 로그 우도 이차도함수의 음의 기댓값입니다.
문제 12. 크라메르-라오 하한과 정보의 가법성을 쓰세요.
답. 이며 독립 표본의 정보가 더해집니다.
문제 13. 정규 평균과 정규 분산의 하한을 쓰세요.
답. 과 입니다.
문제 14. 의 효율과 그 이유를 쓰세요.
답. 이며 평균을 추정하느라 자유도를 하나 잃기 때문입니다.
문제 15. 일치성의 정의와 편리한 충분조건을 쓰세요.
답. 이며 MSE가 으로 가면 됩니다.
문제 16. 불편이지만 일치가 아닌 예와 그 반대의 예를 쓰세요.
답. 과 입니다.
문제 17. 인수분해 정리와 균등분포의 충분통계량을 쓰세요.
답. 이며 입니다.
문제 18. 라오-블랙웰 정리와 증명 도구를 쓰세요.
답. 충분통계량으로 조건화하면 분산이 줄며 전체 분산 법칙으로 증명합니다.
심화 1. 크라메르-라오 하한이 성립하려면 무엇이 필요한지 정리하세요.
하한은 언제나 쓸 수 있는 것이 아닙니다.
| 정규 조건 | 내용 | 깨지면 |
|---|---|---|
| 지지구간이 와 무관 | 밀도가 이 되는 곳이 고정 | 균등분포에서 깨집니다 |
| 미분과 적분의 교환 | \partial_{\theta}\int=\int\partial_ | 하한 유도가 무너집니다 |
| 정보량이 유한하고 양수 | 하한이 무의미해집니다 | |
| 추정량이 불편 | 편향이 | 편향 도함수 항이 붙습니다 |
첫째 줄이 에서 깨집니다. 지지구간의 끝이 곧 모수이므로 미분과 적분을 바꿀 수 없고, 그래서 문제 1의 추정량이 분산으로 "하한을 뚫습니다."
넷째 줄이 편향 있는 추정량으로의 확장입니다.
편향의 도함수가 에 가까우면 분산이 아주 작아도 됩니다. 정규화가 분산을 줄이는 이론적 자리이며, 211강의 릿지가 바로 그 영역에서 삽니다.
심화 2. 최소분산 불편추정량을 찾는 방법을 정리하세요.
라오-블랙웰은 개선을 주지만 최적을 보장하지는 않습니다.
| 도구 | 하는 일 |
|---|---|
| 라오-블랙웰 | 충분통계량으로 조건화해 개선합니다 |
| 완비성 | 충분통계량의 불편추정량이 유일해집니다 |
| 레만-셰페 | 완비충분통계량의 불편 함수가 최소분산입니다 |
| 크라메르-라오 | 달성하면 최소분산임이 확정됩니다 |
둘째와 셋째 줄이 짝입니다. 가 완비충분통계량이고 가 불편이면, 가 유일한 최소분산 불편추정량입니다. 다른 불편추정량을 아무거나 가져와 로 조건화하면 반드시 가 나옵니다.
베르누이의 가 그 예입니다. 문제 5에서 을 조건화해 를 얻었고, 무엇을 조건화해도 같은 것이 나옵니다.
넷째 줄이 더 강한 결론입니다. 하한을 달성하면 완비성을 따질 필요 없이 최적이 확정됩니다. 다만 달성하지 못한다고 최적이 아닌 것은 아닙니다.
심화 3. 정보량의 성질을 정리하세요.
| 성질 | 내용 |
|---|---|
| 가법성 | 독립 표본이면 I_{n}=nI_ |
| 재모수화 | I(\eta)=I(\theta)(d\theta/d\eta)^ |
| 다모수 | 정보행렬 , 하한은 \mathbf{I}^ |
| 자료 처리 | 요약하면 정보가 줄거나 같습니다 |
| 충분성 | 충분통계량은 정보를 그대로 보존합니다 |
둘째 줄이 실무에서 자주 쓰입니다. 로 잴지 으로 잴지에 따라 정보량이 달라지지만, 효율은 재모수화에 불변입니다.
셋째 줄에서 하한이 행렬이 됩니다. 이며 부등호가 양반정부호 순서입니다. 87강의 이차형식 순서가 그대로 쓰입니다.
넷째와 다섯째 줄이 이 강의의 결론입니다. 자료를 줄이면 정보가 줄어드는 것이 원칙인데, 충분통계량은 예외적으로 정보를 하나도 잃지 않습니다.
정보행렬이 149강에서 다시 나옵니다. 최대우도추정량의 점근 공분산이 이며, 하한을 극한에서 달성한다는 뜻입니다.
심화 4. 추정 이론의 다른 기준들을 정리하세요.
MSE와 불편성만이 기준은 아닙니다.
| 기준 | 뜻 | 특징 |
|---|---|---|
| 최소최대 | 최악의 에서의 위험을 최소화 | 보수적입니다 |
| 베이즈 위험 | 사전분포로 평균한 위험 | 150강의 주제입니다 |
| 허용가능성 | 모든 에서 이기는 다른 추정량이 없음 | 최소 요건입니다 |
| 로버스트성 | 가정이 어긋나도 견딤 | 중앙값, 절사평균 |
| 등변성 | 좌표 변환에 자연스럽게 반응 | 물리적 의미 보존 |
셋째 줄에서 놀라운 사실이 있습니다. 정규 평균벡터를 추정할 때 는 차원이 이상이면 허용가능하지 않습니다. 스타인 추정량이 모든 에서 MSE가 더 작습니다.
원점 쪽으로 줄이면 언제나 이깁니다. 각 좌표를 따로 보면 이상한데 전체로 보면 이득이며, 이것이 축소 추정과 정규화의 이론적 뿌리입니다. 211강의 릿지가 같은 구조입니다.
넷째 줄이 142강 문제 4와 이어집니다. 코시에서 표본평균이 무너지고 중앙값이 살아남았습니다. 가정이 정확하면 평균이 최적이지만 조금만 어긋나면 중앙값이 낫습니다.
심화 5. 추정에서 흔히 저지르는 실수를 정리하세요.
| 실수 | 결과 |
|---|---|
| 불편성만 보고 고릅니다 | 분산이 큰 추정량을 씁니다 |
| 같은 자료로 고르고 평가합니다 | 성능을 과대평가합니다 |
| 편향을 여러 번 보정합니다 | 분산이 누적됩니다 |
| 하한을 정규 조건 없이 씁니다 | 잘못된 최적성 주장을 합니다 |
| 점추정만 보고합니다 | 불확실성이 사라집니다 |
| 이상치를 제거하고 추정합니다 | 추정 대상이 바뀝니다 |
둘째 줄이 기계학습에서 가장 비쌉니다. 검증 자료로 하이퍼파라미터를 고르고 같은 자료로 성능을 보고하면, 146강 문제 4의 다중 비교 문제가 그대로 발생합니다. 212강의 중첩 교차검증이 그 해법입니다.
다섯째 줄이 151강의 주제입니다. 만 내놓는 것과 를 내놓는 것은 전혀 다른 보고이며, 점추정만으로는 의사결정을 할 수 없습니다.
여섯째 줄이 142강 심화 5와 같습니다. 이상치를 빼면 남은 분포의 모수를 추정하게 되며, 그것이 알고 싶던 값이 아닐 수 있습니다.
심화 6. 기계학습에서 이 개념들이 쓰이는 자리를 정리하세요.
| 자리 | 어느 개념 | 관련 강의 |
|---|---|---|
| 편향-분산 분해 | MSE의 두 조각 | 210강 |
| 릿지와 라소 | 편향을 넣어 분산을 줄임 | 211강 |
| 미니배치 기울기 | 불편추정량 | 235강 |
| 아담의 편향 보정 | 편향 제거 | 247강 |
| 자연 그래디언트 | 피셔 정보행렬 | 253강 |
| 능동학습의 표본 선택 | 정보량 최대화 | 216강 |
| 임베딩과 요약 | 충분통계량의 근사 | 258강 |
| 정책경사의 기준선 | 라오-블랙웰화 | 286강 |
| 앙상블 평균 | 분산 감소 | 217강 |
다섯째 줄이 깊습니다. 모수공간의 자연스러운 거리는 유클리드 거리가 아니라 피셔 정보행렬이 정하는 거리이며, 그 방향으로 내려가는 것이 자연 그래디언트입니다. 가 재모수화에 불변하므로 좌표를 어떻게 잡든 같은 궤적을 그립니다.
일곱째 줄이 표현학습의 목표를 다시 씁니다. 좋은 임베딩은 하류 과제에 필요한 정보를 잃지 않으면서 차원을 줄인 것이며, 충분통계량의 근사입니다. 정보를 잃지 않는 요약이 존재한다는 문제 5의 사실이 그 가능성의 근거입니다.
여덟째 줄이 147강과 이어집니다. 정책경사에서 기준선을 빼는 것은 조건부 기댓값으로 바꾸는 것과 같은 효과이며, 편향 없이 분산만 줄입니다.
정답.
| 기호 | 읽는 법 | 뜻 |
|---|---|---|
| \hat | 세타 햇 | 추정량입니다 |
| 편향 | bias | 기댓값과 참값의 차이입니다 |
| MSE | mean squared error | 편향의 제곱과 분산의 합입니다 |
| 점수함수 | score function | 로그 우도의 도함수입니다 |
| 피셔 정보 | 자료가 담은 정보의 양입니다 | |
| 크라메르-라오 | Cramer-Rao | 불편추정량 분산의 하한입니다 |
| 효율 | efficiency | 하한 나누기 실제 분산입니다 |
| 일치성 | consistency | 표본이 늘면 참값으로 갑니다 |
| 충분통계량 | sufficient statistic | 정보를 잃지 않는 요약입니다 |
| 인수분해 정리 | factorization theorem | 충분성의 판정법입니다 |
| 라오-블랙웰 | Rao-Blackwell | 조건화로 분산을 줄입니다 |
| 완비성 | completeness | 불편추정량의 유일성을 줍니다 |
| 레만-셰페 | Lehmann-Scheffe | 최소분산 불편추정량을 확정합니다 |
| 스타인 추정량 | Stein estimator | 축소로 MSE를 줄입니다 |
| 최소최대 | minimax | 최악의 위험을 최소화합니다 |
다음은 149강 최대우도추정입니다. 이 강의는 기준을 세웠지만 추정량을 어떻게 만드는지는 말하지 않았습니다.
"이 자료가 나올 확률이 가장 큰 모수"를 고르는 하나의 규칙이며, 거의 모든 모형에 기계적으로 적용됩니다. 그리고 그 순간 통계가 최적화 문제가 되어 107~112강의 도구가 전부 돌아옵니다.
이 강의의 네 기준으로 최대우도추정량을 채점하면 대체로 편향이 있고, 일치이며, 점근적으로 효율적이고, 충분통계량의 함수입니다. 149강이 그 채점표를 완성합니다.
import numpy as np
rng = np.random.default_rng(20260816)
M = 200000
# --- 문제 1: 같은 모수에 추정량이 여럿일 때 무엇을 보는가 ---------------
print(" U(0, theta) 에서 theta = 3 을 세 가지로 추정합니다")
th = 3.0
print(" n 추정량 평균 수치 편향 분산 수치 평균제곱오차")
for n in [5, 20]:
X = rng.uniform(0, th, size=(M, n))
mx = X.max(1)
cand = [("2 * Xbar", 2 * X.mean(1)),
("최댓값", mx),
("(n+1)/n * 최댓값", (n + 1) / n * mx)]
for name, e in cand:
b = float(e.mean()) - th
v = float(e.var())
print(" %9d %-18s %10.6f %10.6f %12.6f %14.6f"
% (n, name, float(e.mean()), b, v, v + b * b))
print(" 두 번째는 언제나 작게 나옵니다. 최댓값이 theta 를 넘을 수 없기 때문입니다")
print(" 세 번째는 그 편향을 정확히 되돌린 것이고 분산도 첫 번째보다 훨씬 작습니다")
# --- 문제 2: 불편이면 좋은 추정량인가 ------------------------------------
print(" 평균제곱오차를 편향의 제곱과 분산으로 쪼갭니다")
print(" n 추정량 편향^2 분산 평균제곱오차 이론값")
for n in [5, 20]:
X = rng.uniform(0, th, size=(M, n))
mx = X.max(1)
rows = [("2 * Xbar", 2 * X.mean(1), th * th / (3.0 * n)),
("최댓값", mx, 2 * th * th / ((n + 1.0) * (n + 2.0))),
("(n+1)/n * 최댓값", (n + 1) / n * mx, th * th / (n * (n + 2.0))),
("(n+2)/(n+1) * 최댓값", (n + 2) / (n + 1) * mx, th * th / ((n + 1.0) ** 2))]
for name, e, tmse in rows:
b = float(e.mean()) - th
v = float(e.var())
print(" %9d %-22s %10.6f %10.6f %12.6f %12.6f"
% (n, name, b * b, v, v + b * b, tmse))
print(" 마지막 줄이 평균제곱오차가 가장 작습니다. 그런데 불편이 아닙니다")
print(" 불편성은 목표가 아니라 하나의 성질일 뿐입니다. 210강 편향-분산 거래입니다")
# --- 문제 3: 얼마나 좋아질 수 있는가 -------------------------------------
print(" 피셔 정보를 수치로 재고 크라메르-라오 하한과 견줍니다")
print(" 모형 수치 정보량 이론 정보량 비")
n3 = 20
sg = 2.0
x = rng.normal(1.0, sg, 400000)
sc = (x - 1.0) / sg ** 2
print(" %-16s %12.6f %12.6f %8.4f"
% ("정규 평균", float((sc ** 2).mean()), 1 / sg ** 2, float((sc ** 2).mean()) * sg ** 2))
v = sg ** 2
sc2 = -0.5 / v + (x - 1.0) ** 2 / (2 * v * v)
print(" %-16s %12.6f %12.6f %8.4f"
% ("정규 분산", float((sc2 ** 2).mean()), 1 / (2 * v * v),
float((sc2 ** 2).mean()) * 2 * v * v))
p0 = 0.3
b = rng.random(400000) < p0
scb = b / p0 - (1 - b) / (1 - p0)
print(" %-16s %12.6f %12.6f %8.4f"
% ("베르누이", float((scb ** 2).mean()), 1 / (p0 * (1 - p0)),
float((scb ** 2).mean()) * p0 * (1 - p0)))
la = 1.5
e5 = rng.exponential(1 / la, 400000)
sce = 1 / la - e5
print(" %-16s %12.6f %12.6f %8.4f"
% ("지수 비율", float((sce ** 2).mean()), 1 / (la * la),
float((sce ** 2).mean()) * la * la))
print(" 하한과 실제 분산을 견줍니다. n = %d 입니다" % n3)
print(" 추정량 분산 수치 크라메르-라오 하한 효율")
Xn = rng.normal(1.0, sg, size=(M, n3))
mb = Xn.mean(1)
print(" %-18s %12.8f %18.8f %10.4f"
% ("정규 평균의 Xbar", float(mb.var()), sg ** 2 / n3, (sg ** 2 / n3) / float(mb.var())))
s2 = ((Xn - mb[:, None]) ** 2).sum(1) / (n3 - 1)
print(" %-18s %12.8f %18.8f %10.4f"
% ("정규 분산의 S^2", float(s2.var()), 2 * v * v / n3,
(2 * v * v / n3) / float(s2.var())))
s2m = ((Xn - 1.0) ** 2).mean(1)
print(" %-18s %12.8f %18.8f %10.4f"
% ("평균을 아는 경우", float(s2m.var()), 2 * v * v / n3,
(2 * v * v / n3) / float(s2m.var())))
print(" 이론 효율은 차례로 1, (n-1)/n = %.4f, 1 이며 수치는 표본오차 범위에서 맞습니다"
% ((n3 - 1.0) / n3))
print(" Xbar 는 하한을 달성합니다. S^2 은 평균을 추정하느라 자유도를 하나 잃습니다")
# --- 문제 4: 표본을 늘리면 참값으로 가는가 -------------------------------
print(" 일치성을 확인합니다. theta = 3 인 U(0, theta) 와 정규 평균입니다")
print(" n P(|첫 관측 - mu| > 0.2) P(|Xbar - mu| > 0.2) P(|(n+1)/n*max - theta| > 0.2)")
for n in [10, 100, 1000, 10000]:
Xn2 = rng.normal(1.0, 1.0, size=(20000, n))
a1 = float((np.abs(Xn2[:, 0] - 1.0) > 0.2).mean())
a2 = float((np.abs(Xn2.mean(1) - 1.0) > 0.2).mean())
U = rng.uniform(0, th, size=(20000, n))
a3 = float((np.abs((n + 1) / n * U.max(1) - th) > 0.2).mean())
print(" %9d %16.6f %18.6f %26.6f" % (n, a1, a2, a3))
print(" 첫 관측은 불편인데 일치가 아닙니다. n 을 늘려도 그대로입니다")
print(" 최댓값 쪽은 1/n 로 가서 Xbar 의 1/sqrt(n) 보다 빠릅니다")
# --- 문제 5: 요약해도 정보를 잃지 않는가 ---------------------------------
print(" 베르누이에서 조잡한 추정량을 충분통계량으로 조건화해 봅니다")
n5, p5 = 10, 0.3
B = rng.random((M, n5)) < p5
t = B.sum(1)
crude = B[:, 0].astype(float)
rb = t / n5
print(" 추정량 평균 편향 분산 평균제곱오차")
for name, e in [("첫 관측 X1", crude), ("라오-블랙웰화 Xbar", rb)]:
bb = float(e.mean()) - p5
vv = float(e.var())
print(" %-20s %10.6f %10.6f %12.8f %14.8f" % (name, float(e.mean()), bb, vv, vv + bb * bb))
print(" 이론: p(1-p) = %.8f 와 p(1-p)/n = %.8f" % (p5 * (1 - p5), p5 * (1 - p5) / n5))
print(" 둘 다 불편인데 분산이 정확히 n 분의 1 로 줄었습니다")
print(" 인수분해 정리를 확인합니다. 결합확률이 t 에만 의존하는지 봅니다")
print(" 표본 t 결합확률 p^t (1-p)^(n-t) 차이")
for pat in [[1, 0, 0, 1, 0, 0, 0, 0, 0, 0], [0, 1, 1, 0, 0, 0, 0, 0, 0, 0],
[1, 1, 1, 0, 0, 0, 0, 0, 0, 0]]:
a = np.array(pat)
tt = int(a.sum())
joint = float(np.prod(np.where(a == 1, p5, 1 - p5)))
fac = p5 ** tt * (1 - p5) ** (n5 - tt)
print(" %s %5d %12.9f %16.9f %10.2e"
% ("".join(str(z) for z in pat), tt, joint, fac, abs(joint - fac)))
print(" 서로 다른 표본이라도 t 가 같으면 확률이 같습니다. t 가 충분통계량입니다")
print(" 조건부분포가 p 에 의존하지 않으므로 t 를 알면 나머지는 정보를 주지 않습니다")
# U(0, theta) 에서 theta = 3 을 세 가지로 추정합니다
# n 추정량 평균 수치 편향 분산 수치 평균제곱오차
# 5 2 * Xbar 3.001579 0.001579 0.601495 0.601497
# 5 최댓값 2.499788 -0.500212 0.178949 0.429161
# 5 (n+1)/n * 최댓값 2.999745 -0.000255 0.257687 0.257687
# 20 2 * Xbar 3.000403 0.000403 0.150334 0.150335
# 20 최댓값 2.857592 -0.142408 0.018386 0.038666
# 20 (n+1)/n * 최댓값 3.000471 0.000471 0.020270 0.020270
# 두 번째는 언제나 작게 나옵니다. 최댓값이 theta 를 넘을 수 없기 때문입니다
# 세 번째는 그 편향을 정확히 되돌린 것이고 분산도 첫 번째보다 훨씬 작습니다
# 평균제곱오차를 편향의 제곱과 분산으로 쪼갭니다
# n 추정량 편향^2 분산 평균제곱오차 이론값
# 5 2 * Xbar 0.000001 0.601051 0.601052 0.600000
# 5 최댓값 0.248921 0.177542 0.426462 0.428571
# 5 (n+1)/n * 최댓값 0.000002 0.255660 0.255662 0.257143
# 5 (n+2)/(n+1) * 최댓값 0.006736 0.241654 0.248390 0.250000
# 20 2 * Xbar 0.000002 0.149861 0.149863 0.150000
# 20 최댓값 0.020327 0.018480 0.038807 0.038961
# 20 (n+1)/n * 최댓값 0.000000 0.020374 0.020374 0.020455
# 20 (n+2)/(n+1) * 최댓값 0.000042 0.020282 0.020324 0.020408
# 마지막 줄이 평균제곱오차가 가장 작습니다. 그런데 불편이 아닙니다
# 불편성은 목표가 아니라 하나의 성질일 뿐입니다. 210강 편향-분산 거래입니다
# 피셔 정보를 수치로 재고 크라메르-라오 하한과 견줍니다
# 모형 수치 정보량 이론 정보량 비
# 정규 평균 0.249471 0.250000 0.9979
# 정규 분산 0.030920 0.031250 0.9895
# 베르누이 4.765374 4.761905 1.0007
# 지수 비율 0.445103 0.444444 1.0015
# 하한과 실제 분산을 견줍니다. n = 20 입니다
# 추정량 분산 수치 크라메르-라오 하한 효율
# 정규 평균의 Xbar 0.19954697 0.20000000 1.0023
# 정규 분산의 S^2 1.69442368 1.60000000 0.9443
# 평균을 아는 경우 1.60937583 1.60000000 0.9942
# 이론 효율은 차례로 1, (n-1)/n = 0.9500, 1 이며 수치는 표본오차 범위에서 맞습니다
# Xbar 는 하한을 달성합니다. S^2 은 평균을 추정하느라 자유도를 하나 잃습니다
# 일치성을 확인합니다. theta = 3 인 U(0, theta) 와 정규 평균입니다
# n P(|첫 관측 - mu| > 0.2) P(|Xbar - mu| > 0.2) P(|(n+1)/n*max - theta| > 0.2)
# 10 0.845450 0.528200 0.456750
# 100 0.836800 0.044800 0.000250
# 1000 0.845950 0.000000 0.000000
# 10000 0.843300 0.000000 0.000000
# 첫 관측은 불편인데 일치가 아닙니다. n 을 늘려도 그대로입니다
# 최댓값 쪽은 1/n 로 가서 Xbar 의 1/sqrt(n) 보다 빠릅니다
# 베르누이에서 조잡한 추정량을 충분통계량으로 조건화해 봅니다
# 추정량 평균 편향 분산 평균제곱오차
# 첫 관측 X1 0.299900 -0.000100 0.20995999 0.20996000
# 라오-블랙웰화 Xbar 0.300243 0.000243 0.02096029 0.02096035
# 이론: p(1-p) = 0.21000000 와 p(1-p)/n = 0.02100000
# 둘 다 불편인데 분산이 정확히 n 분의 1 로 줄었습니다
# 인수분해 정리를 확인합니다. 결합확률이 t 에만 의존하는지 봅니다
# 표본 t 결합확률 p^t (1-p)^(n-t) 차이
# 1001000000 2 0.005188321 0.005188321 1.73e-18
# 0110000000 2 0.005188321 0.005188321 1.73e-18
# 1110000000 3 0.002223566 0.002223566 0.00e+00
# 서로 다른 표본이라도 t 가 같으면 확률이 같습니다. t 가 충분통계량입니다
# 조건부분포가 p 에 의존하지 않으므로 t 를 알면 나머지는 정보를 주지 않습니다