151강의 신뢰구간은 **"모수가 어디쯤인가"**에 답합니다. 그런데 실무의 질문은 대개 다른 모양입니다.
답이 예 또는 아니오여야 합니다. 구간을 보고 사람이 눈으로 판단하는 것이 아니라, 미리 정한 규칙이 자동으로 결정을 내려야 여러 사람이 같은 자료에서 같은 결론에 이릅니다.
가설검정은 추정이 아니라 결정의 언어입니다. 그리고 결정에는 두 가지 방식으로 틀릴 수 있습니다.
| 실제 | 을 기각 | 을 유지 |
|---|---|---|
| 이 참 | 1종 오류 | 옳습니다 |
| 이 거짓 | 옳습니다(검정력) | 2종 오류 |
두 오류를 동시에 줄일 수는 없습니다. 이 강의는 그 거래를 정확히 다루고, 151강 심화 1에서 예고한 검정과 구간의 동치를 확인하며, 값이 무엇이고 무엇이 아닌지를 분명히 합니다.
문제. 을 단측 로 검정합니다. 을 안다고 둡니다.
(1) 1종 오류가 효과크기에 의존하는지 확인하세요.
(2) 검정력을 이론과 견주세요.
(3) 표본을 늘릴 때 무엇이 달라지는지 쓰세요.
생각의 실마리. 기각역을 으로 잡습니다. 이 경계는 만 보고 정한 것이라 대립가설이 무엇이든 상관없습니다.
풀이. (1)(2)(3) 검산 결과입니다. 입니다.
| 효과 | 1종 오류 | 2종 오류 | 검정력 | 검정력 이론 | |
|---|---|---|---|---|---|
| 이 참입니다 | |||||
**1종 오류가 어느 줄에서나 **입니다. 를 바꿔도 을 바꿔도 변하지 않으며, 우리가 정한 값이기 때문입니다.
2종 오류는 통제되지 않습니다. , 에서 이며, 효과가 있는데도 절반 이상 놓칩니다.
둘째 줄과 넷째 줄이 짝입니다. 같은 에서 을 네 배로 늘리자 검정력이 에서 으로 올라갔습니다.
이 문제에서 배우는 것: 비대칭한 두 오류.
검정의 요소.
| 요소 | 뜻 |
|---|---|
| H_ | 귀무가설, 기각할 대상 |
| H_ | 대립가설 |
| 검정통계량 | 자료를 하나의 수로 요약합니다 |
| 유의수준 | 허용하는 1종 오류 |
| 기각역 | 을 버리는 통계량의 범위 |
| 검정력 | 이 참일 때 기각할 확률 |
검정력 공식. 단측 검정에서
하나가 전부입니다. 효과크기와 의 곱이며, 143강 심화 1의 비중심 모수 가 바로 이것입니다.
두 오류를 동시에 줄일 수 없습니다. 기각역을 좁히면 가 줄고 가 늘며, 넓히면 반대입니다. 둘 다 줄이려면 을 늘려야 합니다.
법정의 비유가 정확합니다. 무죄추정이 이고 유죄 판결이 기각입니다. 무고한 사람을 벌하는 것()을 더 무겁게 보기 때문에 그쪽만 엄격히 통제하고, 진범을 놓치는 것()은 감수합니다.
"유의하지 않다"가 "효과가 없다"는 뜻이 아닙니다. 둘째 줄에서 효과가 분명히 인데 의 경우에 기각하지 못했습니다. 검정력을 모르면 음성 결과를 해석할 수 없습니다.
바로 확인 1.
확인 1-1. 두 종류의 오류를 쓰세요.
답. 참인 을 기각하는 1종 오류와 거짓인 을 유지하는 2종 오류입니다.
확인 1-2. 1종 오류가 효과크기에 의존하는지 쓰세요.
답. 의존하지 않으며 우리가 로 정합니다.
확인 1-3. 검정력을 정하는 하나의 양을 쓰세요.
답. 입니다.
문제. 단순가설 대 에서 입니다.
(1) 네 가지 검정통계량의 임계값을 에 맞추세요.
(2) 각각의 검정력을 재세요.
(3) 가장 강한 것이 무엇이고 왜 그런지 쓰세요.
생각의 실마리. 유의수준을 같게 맞춰야 공정한 비교입니다. 아래에서의 분위수를 임계값으로 잡으면 모두 정확히 가 됩니다.
풀이. (1)(2) 검산 결과입니다.
| 검정통계량 | 임계값 | 실제 1종 오류 | 검정력 |
|---|---|---|---|
| 표본평균(우도비) | |||
| 절사평균 | |||
| 중앙값 | |||
| 첫 관측 |
(3) 표본평균이 가장 강합니다. 절사평균 , 중앙값 , 첫 관측 으로 차례로 밀립니다.
우연이 아닙니다. 우도비를 계산하면 다음이 됩니다.
의 일차식이므로 우도비가 크다는 것과 가 크다는 것이 같습니다.
이 문제에서 배우는 것: 네이만-피어슨 보조정리.
네이만-피어슨 보조정리. 단순가설 대 에서, 우도비가 임계값을 넘을 때 기각하는 검정이 주어진 에서 검정력이 가장 큽니다.
증명의 발상이 단순합니다. 기각역에 넣을 자료 점을 고를 때 " 아래 확률이 크고 아래 확률이 작은" 점부터 채우는 것이 이득이며, 그 순위가 곧 우도비입니다.
| 검정 | 왜 밀리는가 |
|---|---|
| 절사평균 | 양 끝 관측의 정보를 버립니다 |
| 중앙값 | 순서만 쓰고 크기를 덜 씁니다 |
| 첫 관측 | 관측 아홉 개를 버립니다 |
148강 문제 5의 충분통계량과 이어집니다. 정규분포에서 가 충분통계량이므로 그것을 쓰는 검정이 정보를 하나도 버리지 않습니다.
복합가설에서는 언제나 최강력 검정이 있지는 않습니다. 단조 우도비를 갖는 족에서는 단측 검정에 대해 일양최강력 검정이 존재하지만, 양측이면 대개 없습니다.
그럴 때 쓰는 것이 우도비 검정입니다. 최강력이라는 보장은 없지만 점근적으로 최적이며 어떤 모형에도 적용됩니다. 그 통계량 가 카이제곱을 따르는 것이 145강 심화 6의 윌크스 정리입니다.
바로 확인 2.
확인 2-1. 네이만-피어슨 보조정리를 쓰세요.
답. 단순가설에서 우도비 검정이 주어진 에서 최강력입니다.
확인 2-2. 정규 평균 검정에서 우도비가 무엇의 함수인지 쓰세요.
답. 의 일차식이므로 의 단조함수입니다.
확인 2-3. 검산에서 첫 관측만 쓴 검정의 검정력을 쓰세요.
답. 입니다.
문제. 의 양측 검정입니다.
(1) 이 참일 때 값의 분포를 확인하세요.
(2) 에서는 어떻게 되는지 보세요.
(3) 일 때 이 참일 확률을 계산하세요.
생각의 실마리. 값은 관측된 것만큼 또는 그보다 극단적인 결과가 아래에서 나올 확률입니다. 그 정의에서 분포가 바로 따라 나옵니다.
풀이. (1) 검산 결과입니다.
| 항목 | 값 |
|---|---|
| 값의 평균 | |
| 이하 비율 | |
| 이하 비율 | |
| 균등분포와의 최대 거리 |
이 참이면 값이 균등분포입니다. 129강 문제 3의 확률적분변환이며, 연속인 통계량의 분포함수를 자기 자신에 씌운 결과입니다.
(2) 에서 ** 이하 비율이 **으로 몰립니다. 이것이 그 상황에서의 검정력입니다.
(3) 사전 확률이 반반일 때 의 사후확률 하한을 계산합니다.
| 값 | 최소 베이즈 인자 | 의 사후확률 하한 |
|---|---|---|
여도 이 참일 확률이 아래로 내려가지 않습니다. 어떤 대립가설을 놓아도 그렇습니다.
이 문제에서 배우는 것: 값의 정확한 뜻.
값. 이 참이라고 가정할 때, 관측된 통계량만큼 또는 그보다 극단적인 값이 나올 확률입니다.
| 옳은 문장 | 틀린 문장 |
|---|---|
| 아래에서 이 정도 극단적일 확률 | 이 참일 확률 |
| 자료가 과 얼마나 안 맞는가 | 효과의 크기 |
| 이면 기각 | 이면 이 참 |
| 이 참이면 균등분포 | 작을수록 효과가 크다 |
오른쪽 첫 줄이 가장 흔한 오해입니다. 와 는 전혀 다르며, 125강 베이즈 정리의 기본 구분입니다.
사전 확률과 대립가설 아래의 확률이 함께 있어야 뒤집을 수 있습니다.
최소 베이즈 인자. 값만 알 때 베이즈 인자는 보다 작아질 수 없습니다.
어떤 대립가설을 최대한 유리하게 잡아도 그 이상 유리해지지 않는다는 뜻이며, 에서 입니다. 증거로서 는 생각보다 훨씬 약합니다.
둘째 줄도 중요합니다. 이 크면 아주 작은 효과도 값이 작아지므로, 값이 작다고 효과가 크다는 뜻이 아닙니다. 효과크기와 신뢰구간을 함께 보고해야 합니다.
바로 확인 3.
확인 3-1. 값의 정의를 쓰세요.
답. 아래에서 관측만큼 또는 그보다 극단적일 확률입니다.
확인 3-2. 이 참일 때 값의 분포를 쓰세요.
답. 균등분포입니다.
확인 3-3. 에서 의 사후확률 하한을 쓰세요.
답. 약 입니다.
문제. 양측 에서 검정력 를 목표로 합니다.
(1) 필요한 표본 크기 공식을 쓰세요.
(2) 효과크기별로 계산하세요.
(3) 실제 검정력을 확인하세요.
생각의 실마리. 문제 1에서 검정력이 하나로 정해졌습니다. 원하는 검정력을 넣고 에 대해 풀면 됩니다.
풀이. (1) , 입니다.
(2)(3) 검산 결과입니다.
| 효과크기 | 필요한 | 그 에서 검정력 수치 | 이론 검정력 |
|---|---|---|---|
모두 를 넘습니다. 올림 때문에 조금씩 여유가 있습니다.
필요한 표본이 효과크기의 제곱에 반비례합니다. 가 절반이 되면 이 네 배가 되며, 에 개, 에 개입니다.
이 문제에서 배우는 것: 검정력 설계.
설계에 필요한 네 가지. , 목표 검정력, 효과크기, 산포 중 셋을 정하면 나머지 하나가 정해집니다.
| 정하는 것 | 근거 |
|---|---|
| 관행이나 규제, 대개 | |
| 검정력 | 관행상 또는 |
| 효과크기 | 실질적으로 의미 있는 최소 크기 |
| 예비 연구나 문헌 |
셋째 줄이 가장 어렵고 가장 중요합니다. "통계적으로 유의한 차이"가 아니라 **"실무에서 의미 있는 차이"**를 먼저 정해야 하며, 그것이 없으면 표본 크기를 정할 수 없습니다.
사후 검정력 계산은 하지 않습니다. 실험이 끝난 뒤 관측된 효과크기로 검정력을 계산하면 값의 함수가 될 뿐이라 새 정보가 없습니다.
대신 신뢰구간을 봅니다. 151강의 구간이 좁으면서 을 포함하면 효과가 작다는 증거이고, 넓으면서 을 포함하면 표본이 부족하다는 증거입니다. 두 상황은 전혀 다른데 값은 둘을 구별해 주지 않습니다.
검정력이 낮은 연구는 두 배로 위험합니다. 효과를 놓치기 쉬울 뿐 아니라, 유의하게 나온 경우 효과크기가 크게 과대추정됩니다. 우연히 큰 값이 나와야 문턱을 넘기 때문입니다.
바로 확인 4.
확인 4-1. 표본 크기 공식을 쓰세요.
답. 입니다.
확인 4-2. 효과크기가 절반이면 이 몇 배가 되는지 쓰세요.
답. 네 배입니다.
확인 4-3. 사후 검정력 계산 대신 무엇을 보는지 쓰세요.
답. 신뢰구간의 폭과 위치를 봅니다.
문제. 가설 개 중 개에만 효과가 있습니다. , 입니다.
(1) 보정 없이 검정하면 어떻게 되는지 보세요.
(2) 본페로니와 홀름을 적용하세요.
(3) 벤야미니-호흐베르크와 비교하고 무엇을 통제하는지 쓰세요.
생각의 실마리. 효과가 없는 개 각각이 확률로 기각됩니다. 개가 그냥 나옵니다.
풀이. (1)(2)(3) 번 시행한 평균입니다.
| 방법 | 평균 발견 수 | 평균 거짓 발견 | 거짓발견율 | 한 번이라도 틀릴 확률 |
|---|---|---|---|---|
| 보정 없음 | ||||
| 본페로니 | ||||
| 홀름 | ||||
| 벤야미니-호흐베르크 |
보정이 없으면 발견 개 중 개가 거짓입니다. 거의 절반이 잡음이며, **한 번이라도 틀릴 확률이 **입니다.
본페로니와 홀름은 한 번이라도 틀릴 확률을 로 누릅니다. 대가는 발견이 개로 줄어드는 것이며, 진짜 개 중 개를 놓칩니다.
벤야미니-호흐베르크가 절충입니다. 발견이 개로 훨씬 많고 거짓발견율이 로 목표 아래입니다. 다만 **한 번이라도 틀릴 확률은 **입니다.
이 문제에서 배우는 것: 무엇을 통제할지 먼저 정합니다.
| 통제 대상 | 정의 | 방법 |
|---|---|---|
| 개별 오류율 | 각 검정의 | 보정 없음 |
| 집단별 오류율 | 하나라도 틀릴 확률 | 본페로니, 홀름 |
| 거짓발견율 | 발견 중 틀린 비율의 기댓값 | 벤야미니-호흐베르크 |
홀름 절차. 값을 오름차순으로 놓고 번째를 과 견줍니다. 처음 실패하는 곳에서 멈추고 그 앞을 모두 기각합니다.
본페로니보다 언제나 강력하면서 같은 보장을 줍니다. 검산에서 발견이 에서 으로 늘었습니다.
벤야미니-호흐베르크 절차. 값을 오름차순으로 놓고 인 가장 큰 를 찾아 그 앞을 모두 기각합니다.
목표를 바꾼 것이 핵심입니다. "틀린 것이 하나도 없어야 한다"에서 **"발견한 것 중 틀린 비율을 로 유지한다"**로 낮추면 훨씬 많이 찾을 수 있습니다.
| 상황 | 권하는 통제 |
|---|---|
| 결론 하나가 중대함 | 집단별 오류율 |
| 규제 승인, 확증 연구 | 집단별 오류율 |
| 탐색적 선별, 유전체 | 거짓발견율 |
| 후속 검증이 뒤따름 | 거짓발견율 |
을 정직하게 세는 것이 전제입니다. 151강 문제 5에서 본 대로 들여다본 모든 것이 이며, 유의한 것만 골라 보고하면 어떤 보정도 소용없습니다.
바로 확인 5.
확인 5-1. 보정 없이 개를 검정할 때의 거짓 발견 수를 쓰세요.
답. 검산에서 평균 개입니다.
확인 5-2. 세 가지 통제 대상을 쓰세요.
답. 개별 오류율, 집단별 오류율, 거짓발견율입니다.
확인 5-3. 벤야미니-호흐베르크가 통제하는 양을 쓰세요.
답. 거짓발견율이며 발견 중 틀린 비율의 기댓값입니다.
| 개념 | 식 또는 내용 |
|---|---|
| 1종 오류 | 참인 을 기각, 확률 |
| 2종 오류 | 거짓인 을 유지, 확률 |
| 검정력 | |
| 단측 검정 검정력 | |
| 네이만-피어슨 | 우도비 검정이 최강력 |
| 우도비 통계량 | (윌크스) |
| 값 | 아래 관측만큼 극단적일 확률 |
| 값의 분포 | 아래에서 균등 |
| 최소 베이즈 인자 | |
| 표본 크기 | (z_{1-\alpha/2}+z_{1-\beta})^{2}\sigma^{2}/\delta^ |
| 본페로니 | 각 검정을 으로 |
| 홀름 | 번째를 과 견줍니다 |
| 벤야미니-호흐베르크 | 인 최대 |
| 검정통계량 대 | 검정력 |
|---|---|
| 표본평균(우도비) | |
| 절사평균 | |
| 중앙값 | |
| 첫 관측 |
| 다중 검정 | 발견 | 거짓 | 거짓발견율 |
|---|---|---|---|
| 보정 없음 | |||
| 본페로니 | |||
| 벤야미니-호흐베르크 |
| 자주 하는 실수 | 바로잡기 |
|---|---|
| "유의하지 않다"를 "효과 없다"로 읽습니다 | 검정력이 낮으면 놓칩니다 |
| 값을 이 참일 확률로 읽습니다 | 에서 아래로 안 내려갑니다 |
| 값이 작으면 효과가 크다고 봅니다 | 이 크면 작은 효과도 유의합니다 |
| 사후 검정력을 계산합니다 | 값의 함수라 정보가 없습니다 |
| 유의할 때까지 자료를 더 모읍니다 | 명목 가 무너집니다 |
| 여러 검정을 보정 없이 보고합니다 | 절반이 거짓 발견이 됩니다 |
| 을 보고한 개수로 셉니다 | 들여다본 모든 것을 셉니다 |
문제 6. 두 종류의 오류를 쓰세요.
답. 참인 을 기각하는 1종 오류와 거짓인 을 유지하는 2종 오류입니다.
문제 7. 1종 오류가 효과크기에 의존하는지 쓰세요.
답. 의존하지 않으며 우리가 로 정합니다.
문제 8. 단측 검정의 검정력 공식을 쓰세요.
답. 입니다.
문제 9. 네이만-피어슨 보조정리를 쓰세요.
답. 단순가설에서 우도비 검정이 주어진 에서 최강력입니다.
문제 10. 정규 평균 검정에서 우도비가 무엇의 함수인지 쓰세요.
답. 의 일차식이라 의 단조함수입니다.
문제 11. 값의 정의를 쓰세요.
답. 아래에서 관측만큼 또는 그보다 극단적일 확률입니다.
문제 12. 이 참일 때 값의 분포와 그 근거를 쓰세요.
답. 균등분포이며 확률적분변환이 근거입니다.
문제 13. 최소 베이즈 인자와 의 값을 쓰세요.
답. 이며 입니다.
문제 14. 에서 의 사후확률 하한을 쓰세요.
답. 약 입니다.
문제 15. 표본 크기 공식과 효과크기 의존성을 쓰세요.
답. 이며 효과크기의 제곱에 반비례합니다.
문제 16. 사후 검정력 계산 대신 무엇을 보는지 쓰세요.
답. 신뢰구간의 폭과 위치를 봅니다.
문제 17. 세 가지 통제 대상을 쓰세요.
답. 개별 오류율, 집단별 오류율, 거짓발견율입니다.
문제 18. 벤야미니-호흐베르크 절차와 그것이 통제하는 양을 쓰세요.
답. 인 최대 까지 기각하며 거짓발견율을 통제합니다.
심화 1. 검정과 신뢰구간의 동치를 정리하세요.
151강 심화 1이 예고한 관계입니다.
동치. 유의수준 검정족에서 기각되지 않는 모수값을 모으면 신뢰수준 구간이 됩니다.
| 검정 | 대응하는 구간 |
|---|---|
| 검정 | 구간 |
| 점수 검정 | 윌슨 구간 |
| 정확 이항 검정 | 클로퍼-피어슨 구간 |
| 우도비 검정 | 프로파일 우도 구간 |
| 발트 검정 | 발트 구간 |
둘째 줄과 셋째 줄이 151강 문제 2의 답을 설명합니다. 윌슨 구간이 발트 구간보다 나은 것은 점수 검정이 발트 검정보다 나은 것과 같은 사실입니다.
세 검정이 점근적으로 같지만 유한 표본에서 다릅니다.
| 검정 | 무엇을 재는가 |
|---|---|
| 발트 | 추정값이 에서 얼마나 먼가 |
| 점수 | 에서 기울기가 얼마나 가파른가 |
| 우도비 | 로그 우도가 얼마나 떨어지는가 |
점수 검정은 을 구하지 않아도 됩니다. 에서만 계산하므로 최적화가 필요 없으며, 149강 심화 5의 완전 분리처럼 MLE가 발산해도 쓸 수 있습니다.
심화 2. 검정의 종류를 정리하세요.
| 검정 | 대상 | 근거 |
|---|---|---|
| 한 표본 | 평균 | 145강 |
| 두 표본 | 평균 차이 | 145강 |
| 대응 | 짝지은 차이 | 분산이 줄어듭니다 |
| 카이제곱 적합도 | 범주 분포 | 145강 |
| 카이제곱 독립성 | 두 범주의 관계 | 138강 |
| 검정 | 분산비, 분산분석 | 144강 심화 1 |
| 우도비 | 중첩 모형 | 윌크스 정리 |
| 순열 검정 | 무엇이든 | 교환가능성만 |
| 부호, 순위합 | 분포 자유 | 순서만 씁니다 |
여덟째 줄이 가장 가정이 약합니다. 두 집단의 라벨을 무작위로 섞어 통계량의 귀무분포를 직접 만들며, 아래 교환가능성만 있으면 정확한 검정입니다. 147강의 몬테카를로가 그 계산입니다.
아홉째 줄이 145강 문제 5의 대안입니다. 검정이 견고하다고 했지만 꼬리가 매우 두꺼우면 순위 기반이 낫습니다.
셋째 줄이 설계의 힘을 보여 줍니다. 같은 대상을 두 번 재면 개체 사이의 변동이 상쇄되어 147강 심화 2의 공통 난수와 같은 효과로 분산이 크게 줄어듭니다.
심화 3. 검정이 신뢰를 잃은 자리를 정리하세요.
| 관행 | 문제 |
|---|---|
| 해킹 | 여러 분석 중 유의한 것만 보고 |
| 선택적 보고 | 유의하지 않은 결과를 서랍에 |
| 결과를 보고 가설을 만듦 | 확증을 탐색으로 위장 |
| 유의할 때까지 표본 추가 | 명목 가 무너짐 |
| 문턱의 절대화 | 와 을 다르게 취급 |
| 검정력 낮은 연구의 양산 | 유의한 결과가 과대추정 |
넷째 줄이 정량적으로 심각합니다. 유의해질 때까지 자료를 더 모으면 이 참이어도 언젠가 반드시 유의해집니다. 142강의 반복로그법칙이 그 이유이며, 의 진동이 배로 커집니다.
대책이 셋입니다. 표본 크기를 미리 정하거나, 중간 분석에 알파 소비 함수를 쓰거나, 146강 심화 6의 언제나 유효한 구간을 씁니다.
여섯째 줄이 승자의 저주입니다. 검정력 인 연구에서 유의하게 나오려면 우연히 큰 값이 나와야 하므로, 보고된 효과크기가 참값보다 훨씬 큽니다. 후속 연구에서 재현되지 않는 주된 이유입니다.
심화 4. 등가성 검정과 비열등성 검정을 정리하세요.
보통의 검정은 "차이가 없다"를 증명하지 못합니다.
| 목표 | 귀무가설 | 대립가설 |
|---|---|---|
| 차이를 보임 | 차이가 | 차이가 이 아님 |
| 같음을 보임 | 차이가 이상 | 차이가 미만 |
| 열등하지 않음을 보임 | 차이가 이하 | 차이가 초과 |
둘째 줄이 등가성 검정입니다. 가설을 뒤집어 "같다"를 대립가설에 놓아야 증명할 수 있습니다.
실무에서 매우 자주 필요합니다. 새 모델이 기존 모델과 "비슷한데 훨씬 빠르다"를 주장하려면 성능이 같다는 것을 보여야 하는데, 유의하지 않다는 사실만으로는 부족합니다.
두 단측 검정 절차가 표준입니다. 안에 있음을 보이려면 양쪽 경계를 각각 단측으로 검정하며, 신뢰구간이 에 완전히 들어가는 것과 같습니다.
를 정하는 일이 통계가 아니라 판단입니다. 얼마나 차이 나면 실질적으로 다른 것인지는 도메인이 정합니다.
심화 5. 베이즈 관점의 검정을 정리하세요.
| 항목 | 빈도주의 | 베이즈 |
|---|---|---|
| 대상 | 값, 기각 여부 | 사후확률, 베이즈 인자 |
| 의 확률 | 말할 수 없습니다 | 직접 계산합니다 |
| 여러 가설 | 중첩이어야 편함 | 개수 제한 없음 |
| 다중 비교 | 보정이 필요합니다 | 계층모형이 자동 축소 |
| 자료를 보며 멈춤 | 무너집니다 | 문제없습니다 |
베이즈 인자. 두 가설의 주변우도 비입니다.
사후 오즈가 사전 오즈 곱하기 베이즈 인자이며, 문제 3의 계산이 이것입니다.
다섯째 줄이 큰 실용적 차이입니다. 사후확률은 정지 규칙에 의존하지 않으므로 언제 멈춰도 해석이 같습니다. 심화 3의 넷째 줄 문제가 베이즈에는 없습니다.
넷째 줄이 150강 심화 2의 계층모형입니다. 여러 집단을 함께 모형화하면 효과가 자동으로 축소되어 거짓 발견이 줄어듭니다. 보정을 따로 붙이지 않아도 됩니다.
대가는 사전분포입니다. 베이즈 인자는 사전분포의 폭에 민감하며, 넓게 잡을수록 에 유리해집니다. 무정보 사전을 쓰면 값이 정해지지 않습니다.
심화 6. 기계학습에서 검정이 쓰이는 자리를 정리하세요.
| 자리 | 어떤 검정 | 관련 강의 |
|---|---|---|
| 모델 비교 | 대응 , 순열 검정 | 212강 |
| A/B 테스트 | 비율 차이, 순차 검정 | 209강 |
| 특징 선택 | 카이제곱, | 216강 |
| 분포 이동 감지 | 콜모고로프-스미르노프, MMD | 218강 |
| 조건부 독립 판정 | 카이제곱, 커널 검정 | 213강 |
| 하이퍼파라미터 비교 | 다중 검정 보정 | 212강 |
| 공정성 감사 | 집단별 지표 차이 | 473강 |
| 생성모형 평가 | 두 표본 검정 | 259강 |
첫째 줄이 논문에서 가장 자주 잘못됩니다. 벤치마크 여러 개에서 두 모델을 비교하면서 보정을 하지 않으면, 문제 5에서 본 대로 거짓 발견이 쌓입니다. 벤치마크 개에서 개를 이겼다는 주장은 보정 없이는 약합니다.
넷째 줄이 운영에서 중요합니다. 배포한 모델의 입력 분포가 학습 때와 달라졌는지 판정하는 문제이며, 142강 심화 5의 분포 이동을 검정의 언어로 다룹니다.
여덟째 줄이 최근의 관심사입니다. 생성모형의 표본과 실제 자료를 구별할 수 있는지 검정하는 것이며, 구별할 수 없으면 좋은 모형입니다. 판별자를 학습해 검정통계량으로 쓰는 방식이 GAN의 발상과 같습니다.
정답.
| 기호 | 읽는 법 | 뜻 |
|---|---|---|
| H_ | 귀무가설 | 기각할 대상입니다 |
| H_ | 대립가설 | 보이고 싶은 것입니다 |
| 유의수준 | 허용하는 1종 오류입니다 | |
| 2종 오류 | 효과를 놓칠 확률입니다 | |
| 검정력 | 효과를 잡을 확률입니다 | |
| 값 | p-value | 자료의 극단성입니다 |
| 우도비 | 두 가설의 우도 비입니다 | |
| 네이만-피어슨 | Neyman-Pearson | 우도비가 최강력입니다 |
| 윌크스 정리 | Wilks' theorem | 가 카이제곱입니다 |
| 효과크기 | effect size | 입니다 |
| 집단별 오류율 | family-wise error rate | 하나라도 틀릴 확률입니다 |
| 거짓발견율 | false discovery rate | 발견 중 틀린 비율입니다 |
| 홀름 절차 | Holm procedure | 본페로니의 개선입니다 |
| 벤야미니-호흐베르크 | Benjamini-Hochberg | 거짓발견율을 통제합니다 |
| 베이즈 인자 | Bayes factor | 주변우도의 비입니다 |
| 등가성 검정 | equivalence test | 같음을 보이는 검정입니다 |
| 승자의 저주 | winner's curse | 유의한 효과가 과대추정됩니다 |
다음은 153강 선형회귀의 통계적 해석입니다. 82강에서 최소제곱을 기하로 풀었고, 149강 심화 2에서 그것이 정규 잡음의 최대우도추정임을 보았습니다.
153강은 그 계수에 오차 막대를 붙입니다. 144강의 자유도와 코크런 분해가 잔차분산을 주고, 145강의 분포가 계수 하나를, 분포가 여러 계수를 한꺼번에 검정합니다. 가 그 둘을 잇습니다.
이 단원이 만든 도구가 전부 한자리에 모입니다. 148강의 좋은 추정량, 149강의 최대우도, 150강의 정규화, 151강의 구간, 152강의 검정이 회귀라는 하나의 모형에서 동시에 쓰입니다.
import numpy as np
rng = np.random.default_rng(20260820)
zg = (np.arange(240001) - 120000) * 1e-4 # 표준정규 분포함수를 격자 누적으로 만듭니다
phig = np.exp(-zg * zg / 2) / np.sqrt(2 * np.pi)
cdfg = (np.cumsum(phig) - 0.5 * phig) * 1e-4
cdfg = cdfg - cdfg[120000] + 0.5
def Phi(z):
return np.interp(z, zg, cdfg)
def zq(q):
return float(np.interp(q, cdfg, zg))
z95, z975, z80 = zq(0.95), zq(0.975), zq(0.80)
# --- 문제 1: 두 종류의 오류 ---------------------------------------------
print(" H0: mu = 0 을 단측 5% 로 검정합니다. sigma = 1 을 안다고 둡니다")
print(" 기각역은 Xbar > z95 / sqrt(n) 이고 z95 = %.6f 입니다" % z95)
M = 200000
print(" n 효과 delta 1종 오류 수치 2종 오류 수치 검정력 수치 검정력 이론")
for n, d in [(10, 0.0), (10, 0.5), (10, 1.0), (40, 0.5), (160, 0.5)]:
c = z95 / np.sqrt(n)
x0 = rng.normal(0.0, 1.0, size=(M, n)).mean(1)
a = float((x0 > c).mean())
x1 = rng.normal(d, 1.0, size=(M, n)).mean(1)
pw = float((x1 > c).mean())
th = 1 - float(Phi(z95 - d * np.sqrt(n)))
b2 = " H0 가 참입니다" if d == 0 else "%13.6f" % (1 - pw)
print(" %9d %12.2f %13.6f %s %12.6f %12.6f"
% (n, d, a, b2, pw, th))
print(" 1종 오류는 delta 와 무관하게 5% 로 고정됩니다. 우리가 정한 값입니다")
print(" 2종 오류는 효과가 작거나 표본이 적을수록 커집니다. 통제되지 않습니다")
print(" 같은 delta = 0.5 에서 n 을 16 배 늘리면 검정력이 크게 올라갑니다")
# --- 문제 2: 가장 강한 검정은 무엇인가 ----------------------------------
print(" 단순가설 N(0,1) 대 N(1,1) 에서 네 검정을 같은 5% 로 맞춰 견줍니다")
n2, M2 = 10, 400000
X0 = rng.normal(0.0, 1.0, size=(M2, n2))
X1 = rng.normal(1.0, 1.0, size=(M2, n2))
def stat(X, kind):
if kind == "mean":
return X.mean(1)
if kind == "median":
return np.median(X, axis=1)
if kind == "trim":
s = np.sort(X, axis=1)
return s[:, 2:-2].mean(1)
return X[:, 0]
print(" 검정통계량 임계값 실제 1종 오류 검정력")
res = {}
for kind, name in [("mean", "표본평균(우도비)"), ("trim", "절사평균"),
("median", "중앙값"), ("first", "첫 관측")]:
s0 = stat(X0, kind)
c = float(np.quantile(s0, 0.95))
pw = float((stat(X1, kind) > c).mean())
res[kind] = pw
print(" %-16s %11.6f %14.6f %12.6f"
% (name, c, float((s0 > c).mean()), pw))
print(" 표본평균이 가장 강합니다. 우도비가 표본평균의 단조함수이기 때문입니다")
print(" 로그 우도비는 sum(x_i) 의 일차식이라 기각역이 Xbar > c 가 됩니다")
print(" 절사평균은 %.4f, 중앙값은 %.4f, 첫 관측은 %.4f 로 밀립니다"
% (res["trim"], res["median"], res["first"]))
print(" 같은 1종 오류에서 검정력이 가장 큰 검정이 네이만-피어슨의 답입니다")
# --- 문제 3: p 값은 무엇이고 무엇이 아닌가 ------------------------------
print(" 귀무가설이 참일 때 p 값의 분포를 봅니다. 양측 검정입니다")
n3 = 25
zz0 = rng.normal(0.0, 1.0, size=(M, n3)).mean(1) * np.sqrt(n3)
p0 = 2 * (1 - Phi(np.abs(zz0)))
print(" p 값의 평균 %.6f, 0.05 이하 비율 %.6f, 0.5 이하 비율 %.6f"
% (float(p0.mean()), float((p0 <= 0.05).mean()), float((p0 <= 0.5).mean())))
gq = np.arange(1, 100) / 100.0
print(" 균등분포와의 최대 거리 %.6f"
% float(np.max(np.abs(np.array([float((p0 <= q).mean()) for q in gq]) - gq))))
zz1 = rng.normal(0.4, 1.0, size=(M, n3)).mean(1) * np.sqrt(n3)
p1 = 2 * (1 - Phi(np.abs(zz1)))
print(" 대립가설에서는 0.05 이하 비율 %.6f 로 몰립니다" % float((p1 <= 0.05).mean()))
print(" p 값이 작다고 귀무가설이 거짓일 확률이 큰 것은 아닙니다")
print(" 사전 확률 반반에서 p 값이 딱 그 값일 때 사후 확률의 하한을 계산합니다")
print(" p 값 최소 베이즈 인자 H0 의 사후확률 하한")
for p in [0.05, 0.01, 0.005, 0.001]:
bf = -np.e * p * np.log(p)
print(" %9.3f %16.6f %20.6f" % (p, bf, bf / (1 + bf)))
print(" p = 0.05 여도 귀무가설이 참일 확률이 29% 아래로 내려가지 않습니다")
print(" p 값은 자료의 극단성이지 가설의 확률이 아닙니다")
# --- 문제 4: 표본을 얼마나 모아야 하는가 --------------------------------
print(" 검정력 80% 를 목표로 표본 크기를 설계합니다. 양측 5% 입니다")
print(" 공식 n = (z975 + z80)^2 / (delta/sigma)^2, z975 = %.6f, z80 = %.6f"
% (z975, z80))
print(" 효과크기 d 필요한 n 그 n 에서 검정력 수치 이론 검정력")
for d in [0.2, 0.5, 0.8, 1.2]:
nn = int(np.ceil((z975 + z80) ** 2 / d ** 2))
Y = rng.normal(d, 1.0, size=(100000, nn)).mean(1) * np.sqrt(nn)
pw = float((np.abs(Y) > z975).mean())
th = 1 - float(Phi(z975 - d * np.sqrt(nn))) + float(Phi(-z975 - d * np.sqrt(nn)))
print(" %13.1f %13d %19.6f %14.6f" % (d, nn, pw, th))
print(" 필요한 표본은 효과크기의 제곱에 반비례합니다. 절반이면 네 배가 듭니다")
print(" 효과크기 0.2 는 197 개가 필요한데 1.2 는 6 개면 됩니다")
print(" 검정력을 미리 정하지 않으면 유의하지 않은 결과를 해석할 수 없습니다")
# --- 문제 5: 많이 검정하면 무엇이 무너지는가 ----------------------------
print(" 가설 1000 개 중 50 개에만 효과가 있는 상황을 만듭니다. n = 20, delta = 1.0")
m, m1, n5, T5 = 1000, 50, 20, 400
rows = {k: [0.0, 0.0, 0.0] for k in ["none", "bonf", "holm", "bh"]}
for _ in range(T5):
mu = np.zeros(m)
mu[:m1] = 1.0
zz = rng.normal(mu[:, None], 1.0, size=(m, n5)).mean(1) * np.sqrt(n5)
pv = 2 * (1 - Phi(np.abs(zz)))
order = np.argsort(pv)
ps = pv[order]
rej = {}
rej["none"] = pv <= 0.05
rej["bonf"] = pv <= 0.05 / m
thr = 0.05 / (m - np.arange(m))
bad = np.where(ps > thr)[0]
k = bad[0] if len(bad) else m
r = np.zeros(m, bool)
r[order[:k]] = True
rej["holm"] = r
thr2 = 0.05 * (np.arange(1, m + 1)) / m
good = np.where(ps <= thr2)[0]
kk = good[-1] + 1 if len(good) else 0
r2 = np.zeros(m, bool)
r2[order[:kk]] = True
rej["bh"] = r2
for kname, rr in rej.items():
tp = int(rr[:m1].sum())
fp = int(rr[m1:].sum())
rows[kname][0] += tp
rows[kname][1] += fp
rows[kname][2] += 1.0 if fp > 0 else 0.0
print(" 방법 평균 발견 수 평균 거짓 발견 거짓발견율 한 번이라도 틀릴 확률")
for kname, name in [("none", "보정 없음"), ("bonf", "본페로니"),
("holm", "홀름"), ("bh", "벤야미니-호흐베르크")]:
tp, fp, fw = [v / T5 for v in rows[kname]]
fdr = fp / (tp + fp) if tp + fp > 0 else 0.0
print(" %-20s %10.3f %14.3f %11.4f %18.4f" % (name, tp + fp, fp, fdr, fw))
print(" 보정이 없으면 거짓 발견이 평균 47 개입니다. 진짜 50 개와 맞먹습니다")
print(" 본페로니와 홀름은 한 번이라도 틀릴 확률을 5% 아래로 누릅니다")
print(" 벤야미니-호흐베르크는 거짓발견율만 5% 로 누르고 발견을 훨씬 많이 합니다")
print(" 무엇을 통제할지 먼저 정해야 합니다. 목표가 다르면 방법도 다릅니다")
# H0: mu = 0 을 단측 5% 로 검정합니다. sigma = 1 을 안다고 둡니다
# 기각역은 Xbar > z95 / sqrt(n) 이고 z95 = 1.644854 입니다
# n 효과 delta 1종 오류 수치 2종 오류 수치 검정력 수치 검정력 이론
# 10 0.00 0.049550 H0 가 참입니다 0.050195 0.050000
# 10 0.50 0.050685 0.526010 0.473990 0.474599
# 10 1.00 0.050575 0.064120 0.935880 0.935420
# 40 0.50 0.050345 0.064220 0.935780 0.935420
# 160 0.50 0.050520 0.000005 0.999995 0.999999
# 1종 오류는 delta 와 무관하게 5% 로 고정됩니다. 우리가 정한 값입니다
# 2종 오류는 효과가 작거나 표본이 적을수록 커집니다. 통제되지 않습니다
# 같은 delta = 0.5 에서 n 을 16 배 늘리면 검정력이 크게 올라갑니다
# 단순가설 N(0,1) 대 N(1,1) 에서 네 검정을 같은 5% 로 맞춰 견줍니다
# 검정통계량 임계값 실제 1종 오류 검정력
# 표본평균(우도비) 0.520276 0.050000 0.935090
# 절사평균 0.554461 0.050000 0.907320
# 중앙값 0.611749 0.050000 0.852897
# 첫 관측 1.645768 0.050000 0.259985
# 표본평균이 가장 강합니다. 우도비가 표본평균의 단조함수이기 때문입니다
# 로그 우도비는 sum(x_i) 의 일차식이라 기각역이 Xbar > c 가 됩니다
# 절사평균은 0.9073, 중앙값은 0.8529, 첫 관측은 0.2600 로 밀립니다
# 같은 1종 오류에서 검정력이 가장 큰 검정이 네이만-피어슨의 답입니다
# 귀무가설이 참일 때 p 값의 분포를 봅니다. 양측 검정입니다
# p 값의 평균 0.498931, 0.05 이하 비율 0.049700, 0.5 이하 비율 0.502120
# 균등분포와의 최대 거리 0.002475
# 대립가설에서는 0.05 이하 비율 0.515820 로 몰립니다
# p 값이 작다고 귀무가설이 거짓일 확률이 큰 것은 아닙니다
# 사전 확률 반반에서 p 값이 딱 그 값일 때 사후 확률의 하한을 계산합니다
# p 값 최소 베이즈 인자 H0 의 사후확률 하한
# 0.050 0.407162 0.289350
# 0.010 0.125182 0.111254
# 0.005 0.072012 0.067174
# 0.001 0.018777 0.018431
# p = 0.05 여도 귀무가설이 참일 확률이 29% 아래로 내려가지 않습니다
# p 값은 자료의 극단성이지 가설의 확률이 아닙니다
# 검정력 80% 를 목표로 표본 크기를 설계합니다. 양측 5% 입니다
# 공식 n = (z975 + z80)^2 / (delta/sigma)^2, z975 = 1.959964, z80 = 0.841621
# 효과크기 d 필요한 n 그 n 에서 검정력 수치 이론 검정력
# 0.2 197 0.802150 0.801551
# 0.5 32 0.808180 0.807430
# 0.8 13 0.820150 0.822382
# 1.2 6 0.837530 0.836315
# 필요한 표본은 효과크기의 제곱에 반비례합니다. 절반이면 네 배가 듭니다
# 효과크기 0.2 는 197 개가 필요한데 1.2 는 6 개면 됩니다
# 검정력을 미리 정하지 않으면 유의하지 않은 결과를 해석할 수 없습니다
# 가설 1000 개 중 50 개에만 효과가 있는 상황을 만듭니다. n = 20, delta = 1.0
# 방법 평균 발견 수 평균 거짓 발견 거짓발견율 한 번이라도 틀릴 확률
# 보정 없음 96.760 47.080 0.4866 1.0000
# 본페로니 33.045 0.050 0.0015 0.0500
# 홀름 33.210 0.052 0.0016 0.0525
# 벤야미니-호흐베르크 48.550 2.255 0.0464 0.9050
# 보정이 없으면 거짓 발견이 평균 47 개입니다. 진짜 50 개와 맞먹습니다
# 본페로니와 홀름은 한 번이라도 틀릴 확률을 5% 아래로 누릅니다
# 벤야미니-호흐베르크는 거짓발견율만 5% 로 누르고 발견을 훨씬 많이 합니다
# 무엇을 통제할지 먼저 정해야 합니다. 목표가 다르면 방법도 다릅니다