148강부터 153강까지를 섞어 묻습니다. 모두 문항이며 세 부분으로 나뉩니다.
| 부분 | 범위 | 문항 |
|---|---|---|
| 1부 | 추정의 기준과 최대우도 | ~ |
| 2부 | 베이즈와 구간 | ~ |
| 3부 | 검정과 회귀 | ~ |
합격선은 문항입니다. 이 단원은 S8 기계학습의 이론적 뼈대이고, 특히 최대우도는 204강 손실함수의 유도와 249강 교차엔트로피로, 사전분포는 211강 정규화로, 다중 비교는 212강과 214강으로 이어집니다. 특히 불편성이 목표가 아니라는 점, 정규화가 사전분포라는 점, 값이 가설의 확률이 아니라는 점은 반드시 손으로 설명할 수 있어야 합니다.
문제 1. 평균제곱오차를 두 조각으로 쪼개 쓰세요.
답. 편향의 제곱과 분산의 합입니다.
문제 2. 좋은 추정량의 네 조건을 쓰세요.
답. 불편성, 효율, 일치성, 충분성입니다.
문제 3. 에서 최댓값의 기댓값과 불편 보정을 쓰세요.
답. 이며 을 곱합니다.
문제 4. 의 MSE를 최소로 만드는 와 그 함의를 쓰세요.
답. 이며 불편이 아닌 쪽이 더 낫습니다.
문제 5. 피셔 정보의 두 표현을 쓰세요.
답. 점수함수 제곱의 기댓값이며 로그 우도 이차도함수의 음의 기댓값입니다.
문제 6. 크라메르-라오 하한과 정보의 가법성을 쓰세요.
답. 이며 독립 표본의 정보가 더해집니다.
문제 7. 의 효율과 그 이유를 쓰세요.
답. 이며 평균을 추정하느라 자유도를 하나 잃기 때문입니다.
문제 8. 일치성의 정의와 불편이지만 일치가 아닌 예를 쓰세요.
답. 이며 첫 관측 이 반례입니다.
문제 9. 인수분해 정리와 균등분포의 충분통계량을 쓰세요.
답. 이며 입니다.
문제 10. 라오-블랙웰 정리와 증명 도구를 쓰세요.
답. 충분통계량으로 조건화하면 분산이 줄며 전체 분산 법칙으로 증명합니다.
문제 11. 최대우도추정량의 정의를 쓰세요.
답. 우도 또는 로그 우도를 최대로 만드는 모수입니다.
문제 12. 정규분포의 두 MLE와 편향을 쓰세요.
답. 와 이며 뒤쪽의 편향이 입니다.
문제 13. 로그를 쓰는 두 이유를 쓰세요.
답. 아래넘침을 피하고 미분이 항별 합으로 쪼개지기 때문입니다.
문제 14. 최대우도추정량의 점근 분포와 불변성을 쓰세요.
답. 이며 의 MLE가 입니다.
문제 15. 혼합모형에서 우도가 발산하는 방식을 쓰세요.
답. 성분 하나를 한 점에 붙이고 폭을 으로 보내면 무한대가 됩니다.
문제 16. 모형이 틀렸을 때 MLE가 가는 곳과 표준오차의 문제를 쓰세요.
답. KL 발산을 최소로 하는 모수로 가며 모형 기반 표준오차는 크게 과소평가합니다.
문제 17. 베이즈 갱신 식을 쓰세요.
답. 사후는 우도와 사전의 곱에 비례합니다.
문제 18. 최대사후추정의 목적함수를 쓰세요.
답. 로그 우도와 로그 사전의 합을 최대화합니다.
문제 19. 베타-이항 켤레의 사후분포와 두 요약값을 쓰세요.
답. 이며 MAP가 , 사후평균이 입니다.
문제 20. 의 유효 표본 크기와 그 해석을 쓰세요.
답. 이며 앞면 번 뒷면 번을 미리 본 것과 같습니다.
문제 21. 정규-정규 켤레의 사후 정밀도와 평균을 쓰세요.
답. 이며 평균은 정밀도 가중평균입니다.
문제 22. 릿지와 라소에 대응하는 사전을 쓰세요.
답. 정규 사전과 라플라스 사전입니다.
문제 23. 연성 문턱값 공식을 쓰세요.
답. 입니다.
문제 24. 제프리스 사전의 정의와 장점을 쓰세요.
답. 이며 재모수화에 불변입니다.
문제 25. MAP가 재모수화에 불변이 아닌 이유를 쓰세요.
답. 변수변환의 야코비가 밀도에 곱해져 봉우리를 옮기기 때문입니다.
문제 26. 신용구간과 신뢰구간의 차이를 쓰세요.
답. 신용구간은 모수를, 신뢰구간은 구간을 확률변수로 봅니다.
문제 27. 신뢰구간의 올바른 해석 문장을 쓰세요.
답. 같은 절차를 반복하면 의 구간이 참값을 덮습니다.
문제 28. 발트 구간이 나쁜 두 이유와 , 의 포함률을 쓰세요.
답. 분산에 추정값을 넣고 을 벗어나며 포함률이 입니다.
문제 29. 애그레스티-쿨 구간의 만드는 법을 쓰세요.
답. 성공과 실패에 각각 를 더하고 발트 공식을 씁니다.
문제 30. 부트스트랩의 핵심 발상과 이론적 근거를 쓰세요.
답. 표본에서 재표본을 뽑아 표본분포를 흉내 내며 글리벤코-칸텔리가 근거입니다.
문제 31. 부트스트랩이 실패하는 예를 쓰세요.
답. 최댓값처럼 극단에 의존하는 통계량입니다.
문제 32. 구간을 채점할 때 총 포함률 말고 무엇을 보는지 쓰세요.
답. 양쪽 꼬리로 벗어나는 비율을 나눠 봅니다.
문제 33. 두 종류의 오류와 검정력을 쓰세요.
답. 참인 을 기각하는 1종 오류, 거짓인 을 유지하는 2종 오류이며 검정력은 입니다.
문제 34. 검정력을 정하는 하나의 양을 쓰세요.
답. 입니다.
문제 35. 네이만-피어슨 보조정리를 쓰세요.
답. 단순가설에서 우도비 검정이 주어진 에서 최강력입니다.
문제 36. 정규 평균 검정에서 우도비가 무엇의 함수인지 쓰세요.
답. 의 일차식이라 의 단조함수입니다.
문제 37. 값의 정의와 아래 분포를 쓰세요.
답. 아래 관측만큼 극단적일 확률이며 균등분포입니다.
문제 38. 에서 의 사후확률 하한을 쓰세요.
답. 약 입니다.
문제 39. 표본 크기 공식과 효과크기 의존성을 쓰세요.
답. 이며 효과크기의 제곱에 반비례합니다.
문제 40. 세 가지 통제 대상과 각각의 대표 방법을 쓰세요.
답. 개별 오류율은 보정 없음, 집단별 오류율은 본페로니와 홀름, 거짓발견율은 벤야미니-호흐베르크입니다.
문제 41. 검정과 신뢰구간의 동치를 쓰세요.
답. 기각되지 않는 모수값을 모으면 신뢰구간이 됩니다.
문제 42. 최소제곱 계수의 분포를 쓰세요.
답. 입니다.
문제 43. 가우스-마르코프 정리를 쓰세요.
답. 선형 불편추정량 중 최소분산이며 정규성이 필요 없습니다.
문제 44. 회귀 잔차분산의 자유도와 그 분포를 쓰세요.
답. 이며 입니다.
문제 45. 부분 통계량과 과의 관계를 쓰세요.
답. 이며 입니다.
문제 46. 잡음 변수를 넣을 때 두 결정계수가 어떻게 되는지 쓰세요.
답. 은 반드시 올라가고 조정 은 일 때만 올라갑니다.
문제 47. 분산 팽창 인자와 표준오차의 관계, 그리고 무엇이 멀쩡한지 쓰세요.
답. 표준오차가 VIF의 제곱근만큼 커지고 예측과 적합값은 멀쩡합니다.
문제 48. 생략변수 편향의 식과 사라지는 조건을 쓰세요.
답. 이며 둘 중 하나가 이면 사라집니다.
틀린 문항이 어느 부분에 몰렸는지를 먼저 봅니다.
| 몰린 곳 | 다시 볼 것 |
|---|---|
| 1부 | 148강 문제 2와 문제 4, 149강 문제 3과 문제 5 |
| 2부 | 150강 문제 3과 문제 5, 151강 문제 1과 문제 2 |
| 3부 | 152강 문제 3과 문제 5, 153강 문제 3과 문제 5 |
문항 가 이 단원의 첫 관문입니다. 평균제곱오차를 최소로 만드는 추정량이 불편이 아니라는 사실이 낯설게 느껴진다면, 불편성을 목표로 착각하고 있는 것입니다. 편향을 조금 받아들이고 분산을 더 줄이는 거래가 210강과 211강의 중심 주제입니다.
문항 와 이 짝입니다. 에서 최댓값이 충분통계량이므로 관측 하나만 써도 정보를 잃지 않고, 그래서 전부를 쓴 를 배 이깁니다. 정보의 양이 아니라 질입니다.
문항 와 이 이 단원에서 가장 값어치 있는 대응입니다. 116강에서 손으로 붙인 정규화 항이 사전분포의 로그이며, 절댓값 밀도가 에서 미분되지 않는다는 사실이 계수를 정확히 으로 만드는 이유입니다. 두 문항을 이어서 설명할 수 있어야 합니다.
문항 과 을 함께 틀렸다면 반드시 돌아갑니다. 151강 문제 1에서 실제로 을 덮지 않는 구간을 보여 주었습니다. 그 구간에 대해 "확률 "라고 말하면 확률이 인 사건에 를 붙이는 것입니다.
문항 과 이 짝입니다. 값은 이고 우리가 알고 싶은 것은 입니다. 뒤집으려면 사전 확률과 대립가설이 필요하며, 가장 유리하게 잡아도 에서 가 남습니다.
문항 이 실무의 분기점입니다. 무엇을 통제할지 먼저 정하지 않으면 방법을 고를 수 없습니다. 규제 승인이면 집단별 오류율이고 탐색적 선별이면 거짓발견율입니다.
문항 을 틀렸다면 153강 문제 3으로 돌아갑니다. 잡음 변수를 넣어도 은 확률로 올라가고, 조정 조차 확률로 올라갑니다. 어느 쪽도 모형 선택의 기준이 될 수 없습니다.
문항 이 이 단원의 마지막 경고입니다. 회귀계수는 넣은 변수에 대한 조건부 관계일 뿐이며, 인과로 읽으려면 어떤 변수를 넣고 뺐는지가 정당해야 합니다. 그것은 통계가 아니라 도메인 지식이 정합니다.
다음은 154강부터 시작하는 07단원 확률과정입니다. 이 단원까지 관측은 모두 독립이었는데, 다음 단원은 시간을 넣어 서로 영향을 주는 경우를 다룹니다. 147강 문제 4에서 고차원 기각법이 무너진 자리를 마르코프 연쇄 몬테카를로가 메우며, 150강에서 세운 사후분포가 그제야 실제로 계산됩니다.