01단원부터 03단원까지가 주어진 자료로 무엇을 할 수 있는가였습니다. 이제 그 자료가 어떻게 만들어졌는지 묻습니다.
172강 문제 4가 이 문을 열었습니다. 그림에 없는 것을 물어야 한다고 했는데, 없는 것이 왜 없는지는 자료를 모은 방식이 정합니다.
그리고 이 단원은 앞의 세 단원과 성격이 다릅니다.
| 01~03단원 | 04단원 |
|---|---|
| 자료를 받아서 다룹니다 | 자료를 만드는 법을 다룹니다 |
| 계산을 고칠 수 있습니다 | 다시 모으는 것 말고 고칠 방법이 없습니다 |
| 그림이 잘못을 보입니다 | 잘못이 자료에 흔적을 안 남깁니다 |
둘째 줄이 이 강의의 무게입니다. 표본을 잘못 뽑으면 표본을 아무리 키워도 고쳐지지 않습니다. 문제 1에서 계산하겠지만, 만 명을 모아도 무작위 명만 못한 경우가 있습니다.
문제. 무작위로 뽑는 것과 그러지 않는 것을 비교합니다.
(1) 무작위 표본의 치우침을 표본 크기별로 구하세요.
(2) 응답 확률이 값에 따라 달라지면 어떻게 되는지 구하세요.
(3) 치우침의 크기를 식으로 갈라 쓰세요.
생각의 실마리. 표본이 크면 정확하다는 것이 상식입니다. 그런데 정확하다는 말에 두 가지가 섞여 있습니다. 흔들림이 작은 것과 치우침이 없는 것인데, 표본 크기가 줄여 주는 것은 앞의 것뿐입니다.
풀이. (1) 모집단 명의 평균이 입니다.
| 표본 크기 | 표본평균의 평균 | 참값과의 차이 | 표본평균의 표준편차 |
|---|---|---|---|
표본이 개여도 치우침이 없습니다. 흔들릴 뿐이며, 그 흔들림은 으로 줄어듭니다.
(2) 이번에는 응답할 확률이 값에 따라 조금 달라지게 둡니다.
| 무엇을 재는가 | 값 |
|---|---|
| 뽑힌 비율 | |
| 응답 여부와 값의 상관 | |
| 뽑힌 사람의 평균 | |
| 치우침 |
상관이 뿐인데 치우침이 입니다. 모집단 표준편차가 이므로 표준편차의 절반에 가깝습니다.
(3) 이 치우침이 정확히 세 가지의 곱입니다.
실현된 상관 , 실현된 비율 , 표준편차 을 넣으면 이며 수치와 정확히 같습니다.
가운데 항이 표본 비율만으로 정해집니다. 그리고 비율이 작을수록 커집니다.
| 표본 비율 | \sqrt | 상관 의 치우침 | 같은 값을 주는 무작위 표본 |
|---|---|---|---|
상관 인 자료는 표본 비율 에서 무작위 표본 명과 같습니다.
모집단이 억이면 그 비율은 만 명입니다. 만 명을 모았는데 무작위 명만 못합니다.
비율이 같으면 모은 사람이 몇 명이든 유효 표본이 같습니다. 크기가 치우침을 못 이깁니다.
이 문제에서 배우는 것. 무작위 추출이 보장하는 것은 정확도가 아니라 불편성입니다. 그리고 불편성은 표본 크기로 살 수 없습니다. 그래서 큰 자료가 저절로 좋은 자료가 아니며, 어떻게 모였는지 모르는 만 개보다 무작위로 뽑은 개가 낫습니다. 웹 로그, 앱 사용 기록, 소셜 미디어 자료가 전부 이 문제를 안고 있으며, 크기가 크다는 것이 오히려 방심하게 만듭니다.
바로 확인 1.
확인 1-1. 무작위 추출이 보장하는 것을 쓰세요.
답. 표본평균이 모평균을 치우침 없이 맞히는 불편성입니다.
확인 1-2. 치우침의 크기를 식으로 쓰세요.
답. 응답과 값의 상관, , 모집단 표준편차의 곱입니다.
확인 1-3. 검산에서 상관 이고 비율 일 때 유효 표본을 쓰세요.
답. 명이며 몇 명을 모았든 같습니다.
문제. 단순임의추출을 봅니다.
(1) 표본평균의 분산을 표본 크기별로 구하세요.
(2) 유한모집단 수정계수가 언제 중요한지 판정하세요.
(3) 모집단 크기가 정확도에 미치는 영향을 구하세요.
생각의 실마리. 모집단이 유한하면 뽑을수록 남은 것이 줄어듭니다. 극단적으로 다 뽑으면 표본평균이 곧 모평균이라 **흔들림이 **입니다. 그러면 분산 식이 일 수 없습니다.
풀이. (1) 모집단 개에서 비복원으로 뽑습니다.
| 표본 크기 | 표본평균의 분산 수치 | 유한모집단 수정 | |
|---|---|---|---|
에서 수치 가 의 절반이며, 수정계수 과 맞습니다.
표본이 모집단에 가까워지면 분산이 으로 갑니다. 다 세면 흔들림이 없다는 당연한 사실이 식에 들어 있습니다.
(2) 그런데 모집단이 크면 이 수정이 사라집니다.
| 모집단 | 의 수정계수 | 표준오차가 줄어드는 비율 |
|---|---|---|
모집단이 만을 넘으면 수정계수가 사실상 입니다.
(3) 그래서 놀라운 결론이 나옵니다.
| 모집단 | 표본 의 표준오차 | 표본 비율 |
|---|---|---|
모집단이 배 커져도 표준오차는 거의 그대로입니다.
여론조사에서 표본 명이면 나라 크기와 상관없이 비슷한 정확도인 이유가 이것입니다. 표본 크기가 정확도를 정하지 모집단 크기가 정하지 않습니다.
"만 명 중 명이면 너무 적지 않으냐"는 물음에 대한 답이 여기 있습니다. 다만 문제 1의 조건이 붙습니다. 무작위로 뽑았을 때만 그렇습니다.
이 문제에서 배우는 것. 표본 비율은 정확도와 거의 관계가 없고 표본 크기가 정합니다. 그런데 문제 1에서는 표본 비율이 치우침의 크기를 정했습니다. 두 결론이 모순처럼 보이지만 다른 것을 말하고 있습니다. 무작위로 뽑으면 비율이 상관없고, 치우쳐 뽑으면 비율이 전부입니다. 그래서 큰 자료를 다룰 때 "모집단의 상당 부분을 담았으니 괜찮다"는 논리가 정확히 거꾸로입니다.
바로 확인 2.
확인 2-1. 유한모집단 수정계수를 쓰세요.
답. 이며 표본이 모집단에 가까울수록 작아집니다.
확인 2-2. 검산에서 , 일 때 수정계수를 쓰세요.
답. 로 사실상 입니다.
확인 2-3. 여론조사에서 모집단 크기가 거의 상관없는 이유를 쓰세요.
답. 모집단이 크면 수정계수가 이 되어 표준오차가 표본 크기만으로 정해지기 때문입니다.
문제. 실무에서 쓰는 두 방법을 봅니다.
(1) 계통추출을 간격을 바꿔 가며 시험하세요.
(2) 군집추출의 설계효과를 구하세요.
생각의 실마리. 단순임의추출은 목록 전체에서 무작위로 골라야 하는데, 실무에서는 어렵습니다. 하나 뽑고 일정 간격으로 건너뛰거나, 뭉치째로 뽑는 것이 훨씬 싸게 먹힙니다. 그 대가가 무엇인지 봅니다.
풀이. (1) 모집단에 주기 인 규칙이 숨어 있습니다.
| 건너뛰는 간격 | 표본 크기 | 표본평균의 표준편차 | 단순임의 대비 |
|---|---|---|---|
간격이 주기와 같은 나 그 배수 이면 표준편차가 폭발합니다. 단순임의의 배입니다.
시작점 하나가 어느 위상을 뽑을지 정해 버리기 때문입니다. 시작점이 정해지면 뽑히는 값이 전부 같은 위상이라, 표본을 늘려도 그 위상의 평균으로 갈 뿐입니다.
반대로 주기와 안 맞는 이나 이면 단순임의보다 오히려 낫습니다. 목록 전체에 고르게 퍼지기 때문이며, 위험과 이득이 같은 자리에서 나옵니다.
(2) 군집추출을 봅니다. 뭉치 개에 각 명입니다.
| 뭉치 안 상관 | 설계효과 수치 | 이론 | 유효 표본 |
|---|---|---|---|
뭉치 안 상관이 이면 명을 모아도 유효 표본이 명입니다.
뭉치가 클수록 심합니다. 이 곱해지므로, 한 학교에서 명을 뽑으면 에서 설계효과가 입니다.
그래서 한 뭉치에서 더 뽑는 것보다 다른 뭉치를 하나 더 뽑는 것이 낫습니다. 같은 예산이면 뭉치를 많이, 뭉치당 적게가 원칙입니다.
이 문제에서 배우는 것. 싼 방법에는 대가가 있고 그 대가가 계산됩니다. 계통추출은 목록에 주기가 없으면 이득이고 있으면 파국인데, 주기가 있는지는 대개 모릅니다. 군집추출은 언제나 손해인데 비용이 훨씬 싸서 씁니다. 그래서 설계는 "어느 방법이 좋은가"가 아니라 **"주어진 비용에서 유효 표본을 얼마나 크게 만들 수 있는가"**의 문제입니다.
바로 확인 3.
확인 3-1. 계통추출이 위험한 경우를 검산 값과 함께 쓰세요.
답. 간격이 목록의 주기와 맞을 때이며 단순임의의 배가 되었습니다.
확인 3-2. 군집추출의 설계효과를 식으로 쓰세요.
답. 이며 은 뭉치 크기, 는 뭉치 안 상관입니다.
확인 3-3. 같은 예산에서 군집추출의 원칙을 쓰세요.
답. 뭉치를 많이 뽑고 뭉치당 적게 뽑습니다.
문제. 층화추출을 봅니다.
(1) 층 안 분산과 층 사이 분산을 구하세요.
(2) 비례 배분과 네이만 배분을 비교하세요.
(3) 군집추출과 무엇이 반대인지 정리하세요.
생각의 실마리. 모집단이 몇 개의 다른 덩어리로 되어 있다는 것을 미리 안다면, 그 정보를 버릴 이유가 없습니다. 각 덩어리에서 정해진 수만큼 뽑으면 덩어리 사이의 흔들림이 아예 없어집니다.
풀이. (1) 세 층의 크기가 이고 평균이 입니다.
| 항목 | 값 |
|---|---|
| 전체 평균 | |
| 층 안 분산 | |
| 층 사이 분산 | |
| 전체 분산 |
135강의 전체 분산의 법칙이 그대로입니다.
(2) 표본 을 배분합니다.
| 배분 방법 | 층별 표본 수 | 추정량의 분산 | 단순임의 대비 |
|---|---|---|---|
| 단순임의 | 없음 | ||
| 비례 배분 | |||
| 네이만 배분 |
비례 배분만으로도 층 사이 분산 가 통째로 빠집니다. 분산이 에서 로 절반 이하가 되며, 으로 층 안 분산만 남습니다.
네이만 배분은 흩어진 층에서 더 많이 뽑습니다.
셋째 층은 크기가 가장 작은데 표준편차가 으로 가장 커서 명이 배정되었고, 분산이 배까지 줄었습니다.
(3) 군집추출과 정확히 반대입니다.
| 방법 | 무엇이 비슷해야 좋은가 | 설계효과 |
|---|---|---|
| 층화 | 층 안이 비슷할수록 | 보다 작음 |
| 군집 | 뭉치 안이 다를수록 | 보다 큼 |
층화는 나눈 뒤 전부에서 뽑고, 군집은 나눈 뒤 일부만 뽑습니다. 그래서 층 사이 차이는 없어지고 뭉치 사이 차이는 그대로 남습니다.
이 문제에서 배우는 것. 아는 것을 설계에 넣으면 공짜로 정확해집니다. 층화는 추가 비용이 거의 없는데 분산을 절반 이하로 줄이며, 알고 있는 구조를 버리지 않는 것이 전부입니다. 다만 층을 나누는 변수를 미리 알아야 하고, 그 변수가 결과와 관련 있어야 이득이 있습니다. 관련 없는 변수로 층을 나누면 층 사이 분산이 이라 얻는 것이 없습니다. 175강이 이 이야기를 이어받습니다.
바로 확인 4.
확인 4-1. 비례 배분의 분산을 식으로 쓰세요.
답. 층 안 분산을 으로 나눈 값이며 층 사이 분산이 통째로 빠집니다.
확인 4-2. 네이만 배분의 규칙을 쓰세요.
답. 이며 흩어진 층에서 더 많이 뽑습니다.
확인 4-3. 층화와 군집이 반대인 점을 쓰세요.
답. 층화는 층 안이 비슷해야 좋고 군집은 뭉치 안이 달라야 좋습니다.
문제. 뽑기 전에 필요한 것을 봅니다.
(1) 표집틀의 문제를 정리하세요.
(2) 빠진 사람이 있으면 얼마나 치우치는지 구하세요.
(3) 다단 추출의 설계효과를 구하세요.
생각의 실마리. 무작위로 뽑으려면 뽑을 목록이 있어야 합니다. 그런데 "전국의 모든 사람"의 목록은 없습니다. 그러면 있는 목록으로 뽑을 수밖에 없고, 그 목록이 모집단과 어긋납니다.
풀이. (1) 표집틀의 문제가 넷입니다.
| 표집틀의 문제 | 무엇이 어긋나는가 |
|---|---|
| 빠짐 | 모집단에 있는데 목록에 없습니다 |
| 남음 | 목록에 있는데 모집단이 아닙니다 |
| 중복 | 한 사람이 여러 번 들어 있습니다 |
| 묶임 | 한 항목에 여러 사람이 들어 있습니다 |
첫째 줄이 가장 위험합니다. 나머지 셋은 확인하면 고칠 수 있는데, 빠진 사람은 목록에 없으므로 몇 명인지도 모릅니다.
(2) 빠진 사람들이 다르면 그 비율만큼 치우칩니다.
| 빠진 비율 | 빠진 집단과의 차이 | 치우침 |
|---|---|---|
빠진 비율이 이고 차이가 이면 치우침이 입니다.
표본을 아무리 늘려도 이 값은 그대로입니다. 문제 1과 같은 구조이며, 표본 크기가 줄이는 것은 흔들림뿐입니다.
(3) 현실에서는 여러 단계로 나눠 뽑습니다.
| 단계 | 무엇을 뽑는가 |
|---|---|
| 단계 | 지역을 뽑습니다 |
| 단계 | 그 안에서 동네를 뽑습니다 |
| 단계 | 그 안에서 가구를 뽑습니다 |
| 단계 | 그 안에서 사람을 뽑습니다 |
단계마다 군집추출이라 설계효과가 곱해집니다.
| 단계 수 | 단계별 설계효과 | 전체 |
|---|---|---|
네 단계면 설계효과가 입니다. 유효 표본이 분의 로 줄어듭니다.
그래도 이렇게 뽑습니다. 전국의 사람 목록이 없기 때문이며, 단계를 밟는 것 말고 닿을 방법이 없습니다.
이 문제에서 배우는 것. 이론적으로 옳은 설계와 실행할 수 있는 설계는 다릅니다. 단순임의추출이 가장 좋은데 목록이 없어 못 하고, 다단 추출은 설계효과가 인데 그것 말고 방법이 없습니다. 그래서 실무의 설계는 여러 제약 아래에서 유효 표본을 가장 크게 만드는 문제이며, 층화로 벌고 군집으로 잃는 것을 함께 계산합니다. 그리고 설계가 복잡해지면 추정도 그 설계를 반영해야 합니다. 단순임의로 뽑은 것처럼 평균을 내면 틀리며, 175강이 그 방법을 다룹니다.
바로 확인 5.
확인 5-1. 표집틀의 네 가지 문제를 쓰세요.
답. 빠짐, 남음, 중복, 묶임입니다.
확인 5-2. 빠진 사람이 있을 때의 치우침을 식으로 쓰세요.
답. 빠진 비율과 빠진 집단과의 차이의 곱입니다.
확인 5-3. 검산에서 네 단계 추출의 설계효과를 쓰세요.
답. 단계마다 이면 입니다.
| 방법 | 언제 쓰는가 | 설계효과 |
|---|---|---|
| 단순임의 | 목록이 있고 작을 때 | |
| 계통 | 목록이 줄지어 있을 때 | 주기가 없으면 보다 작음 |
| 층화 | 층을 미리 알 때 | 보다 작음 |
| 군집 | 접근 비용이 클 때 | |
| 다단 | 목록이 없을 때 | 단계마다 곱해짐 |
| 핵심 식 | 내용 |
|---|---|
| 치우침 | \rho_{R,X}\sqrt{(1-f)/f}\,\sigma_ |
| 유효 표본 | |
| 유한모집단 수정 | |
| 군집 설계효과 | |
| 비례 배분의 분산 | 층 안 분산 나누기 |
| 네이만 배분 | n_{h}\propto W_{h}\sigma_ |
| 표집틀 치우침 | 빠진 비율 곱하기 차이 |
| 자주 하는 실수 | 바로잡기 |
|---|---|
| 큰 자료면 정확하다고 봅니다 | 치우침은 크기로 못 줄입니다 |
| 모집단 대비 표본 비율을 봅니다 | 무작위면 비율이 상관없습니다 |
| 계통추출을 아무 데나 씁니다 | 목록에 주기가 있으면 파국입니다 |
| 한 뭉치에서 많이 뽑습니다 | 뭉치를 늘리는 편이 낫습니다 |
| 층화를 안 씁니다 | 아는 구조를 버리는 것입니다 |
| 표집틀을 확인 안 합니다 | 빠진 사람은 세어지지도 않습니다 |
| 복잡한 설계를 단순평균으로 냅니다 | 설계를 반영해야 합니다 |
문제 6. 무작위 추출이 보장하는 것을 쓰세요.
답. 불편성이며 정확도는 표본 크기가 정합니다.
문제 7. 치우침의 크기를 식으로 쓰세요.
답. 입니다.
문제 8. 검산에서 상관 이고 비율 일 때 유효 표본을 쓰세요.
답. 명입니다.
문제 9. 유효 표본을 식으로 쓰세요.
답. 입니다.
문제 10. 유한모집단 수정계수를 쓰고 , 일 때를 계산하세요.
답. 이며 입니다.
문제 11. 여론조사에서 모집단 크기가 거의 상관없는 이유를 쓰세요.
답. 모집단이 크면 수정계수가 이 되어 표본 크기만 남기 때문입니다.
문제 12. 검산에서 계통추출이 가장 나빴던 간격과 그때의 배수를 쓰세요.
답. 간격 이며 단순임의의 배입니다.
문제 13. 계통추출이 단순임의보다 나은 경우를 쓰세요.
답. 목록의 주기와 간격이 안 맞으면 고르게 퍼져 검산에서 배였습니다.
문제 14. 군집추출의 설계효과를 식으로 쓰고 검산 값을 쓰세요.
답. 이며 , 에서 수치 였습니다.
문제 15. 검산에서 층 안 분산과 층 사이 분산을 쓰세요.
답. 과 이며 합이 입니다.
문제 16. 비례 배분과 네이만 배분의 분산을 검산 값으로 쓰세요.
답. 과 로 단순임의의 배와 배입니다.
문제 17. 표집틀의 네 가지 문제를 쓰세요.
답. 빠짐, 남음, 중복, 묶임입니다.
문제 18. 검산에서 네 단계 추출의 설계효과를 쓰세요.
답. 입니다.
심화 1. 확률비례추출을 정리하세요.
문제 3에서 뭉치를 뽑을 때, 뭉치 크기가 다르면 문제가 생깁니다.
작은 마을과 큰 도시를 같은 확률로 뽑으면 도시 사람이 과소 대표됩니다. 그렇다고 크기에 비례해 뽑으면 각 사람의 뽑힐 확률이 달라집니다.
크기에 비례해 뭉치를 뽑고 뭉치마다 같은 수를 뽑으면 두 확률이 상쇄됩니다.
뭉치 크기 가 약분되어 모든 사람이 같은 확률이 됩니다. 이것을 확률비례추출이라 합니다.
| 얻는 것 | 내용 |
|---|---|
| 자기가중 | 모든 사람의 확률이 같아 가중치가 필요 없습니다 |
| 일정한 작업량 | 뭉치마다 같은 수를 조사합니다 |
둘째 줄이 실무에서 큽니다. 조사원 한 명이 한 뭉치를 맡으므로 작업량이 균등해야 관리가 됩니다.
크기를 미리 알아야 한다는 조건이 붙습니다. 최근 인구 자료가 없으면 옛 크기를 쓰게 되고, 그러면 확률이 어긋나 가중치로 보정해야 합니다. 175강의 주제입니다.
심화 2. 표본 크기를 정하는 법을 정리하세요.
174강에서 자세히 다루지만 설계와 얽힌 부분을 먼저 봅니다.
설계효과가 곱으로 들어갑니다. 단순임의로 명이 필요한 조사가 다단 추출이면 명이 필요합니다.
| 정하는 것 | 영향 |
|---|---|
| 허용 오차 | 제곱으로 들어가 절반이면 네 배 |
| 신뢰수준 | 의 제곱 |
| 설계효과 | 곱으로 |
| 무응답률 | 나눗셈으로 |
넷째 줄이 자주 빠집니다. 응답률이 이면 필요한 접촉 수가 세 배가 넘습니다. 그리고 무응답이 무작위가 아니면 문제 1의 치우침이 따로 생깁니다.
층마다 결과를 내야 하면 층별로 계산합니다. 전체 명으로 전국 추정은 되는데, 개 시도별 추정은 각 명이라 오차가 네 배입니다. 무엇을 몇 개나 추정할지가 표본 크기를 정합니다.
심화 3. 비확률 표본을 정리하세요.
문제 1에서 치우친 표본의 위험을 보았습니다. 그런데 현실에는 비확률 표본이 훨씬 많습니다.
| 방법 | 성격 |
|---|---|
| 편의 표본 | 닿기 쉬운 사람을 모읍니다 |
| 할당 표본 | 인구 비율에 맞춰 채웁니다 |
| 눈덩이 표본 | 참여자가 다음 사람을 소개합니다 |
| 자발 표본 | 참여하고 싶은 사람이 참여합니다 |
둘째 줄이 겉보기에 그럴듯합니다. 성별과 연령 비율을 맞췄으니 대표성이 있다는 것인데, 맞춘 변수 안에서 누구를 골랐는지는 여전히 조사원이 정합니다.
넷째 줄이 가장 위험합니다. 참여 의사가 결과와 연결되어 있으면 문제 1의 상관이 크고, 온라인 설문의 대부분이 여기 해당합니다.
그런데 비확률 표본도 쓸 수 있습니다. 조건은 응답 여부를 설명하는 변수를 관측했을 때이며, 161강 문제 1의 MAR과 같은 가정입니다. 그 변수로 가중치를 만들거나 모형으로 보정하는데, 가정이 맞는지는 자료로 확인할 수 없습니다.
심화 4. 시간과 공간의 표본을 정리하세요.
사람이 아니라 시점이나 지점을 뽑는 경우도 많습니다.
| 대상 | 뽑는 방법 |
|---|---|
| 시점 | 하루 중 시각, 요일, 계절을 층으로 |
| 지점 | 격자를 만들어 칸에서 뽑기 |
| 흐름 | 지나가는 것 중 일정 비율 |
| 사건 | 발생한 것 중 표본 |
첫째 줄에서 계통추출의 위험이 그대로 나타납니다. 매주 월요일 오전에만 측정하면 주기와 간격이 맞아 문제 3의 파국이 일어납니다.
셋째 줄에는 다른 함정이 있습니다. 지나가는 것을 일정 비율로 뽑으면 오래 머무는 것이 더 자주 뽑힙니다. 대기 시간을 조사할 때 줄 서 있는 사람을 뽑으면 긴 대기가 과대 대표되며, 이것을 길이 편향이라 합니다.
넷째 줄이 172강 문제 4와 이어집니다. 발생한 사건만 뽑으면 발생하지 않은 것이 분모에서 빠집니다.
공간에서는 자기상관이 군집 효과를 만듭니다. 가까운 지점끼리 비슷하므로 문제 3의 가 거리에 따라 정해지며, 지점을 흩어 놓는 것이 유효 표본을 키웁니다.
심화 5. 무작위성을 어떻게 만드는지 정리하세요.
무작위로 뽑는다는 것이 실행에서는 간단하지 않습니다.
| 방법 | 문제 |
|---|---|
| 사람이 고르기 | 무작위가 되지 않습니다 |
| 난수표 | 시작점을 사람이 고릅니다 |
| 의사난수 | 씨앗을 기록해야 재현됩니다 |
| 물리적 난수 | 장치가 치우칠 수 있습니다 |
첫째 줄이 오래된 교훈입니다. "아무 데나 고르라"고 하면 사람은 가운데를 피하거나 특정 자릿수를 선호합니다.
셋째 줄이 162강 문제 5와 이어집니다. 씨앗을 기록하지 않으면 같은 표본을 다시 만들 수 없고, 어떤 표본이 뽑혔는지 검증할 수 없습니다.
뽑은 뒤에 바꾸는 것이 가장 흔한 실수입니다. 뽑힌 사람이 응답을 거부했다고 옆 사람으로 바꾸면, 그 순간 확률 표본이 아니게 됩니다. 접근하기 쉬운 사람으로 대체되므로 문제 1의 상관이 생깁니다. 대체는 무응답 처리이지 표본추출이 아니며, 176강이 그 구별을 다룹니다.
심화 6. 이 강의가 어디에 쓰이는지 정리하세요.
| 분야 | 쓰임 | 이어지는 강의 |
|---|---|---|
| 표본 크기 | 설계효과를 넣어 계산합니다 | 174강 |
| 가중치 | 설계를 추정에 반영합니다 | 175강 |
| 무응답 | 뽑았는데 안 온 경우 | 176강 |
| 관측 자료 | 뽑은 적이 없는 자료 | 177강 |
넷째 줄이 이 단원의 끝입니다. 로그나 기록처럼 아무도 뽑지 않은 자료에는 표집틀도 확률도 없으며, 문제 1의 상관이 얼마인지 알 방법이 없습니다.
그리고 이 강의가 S8 전체의 전제가 됩니다. 회귀든 인과추론이든 **"이 표본이 무엇을 대표하는가"**가 결론의 범위를 정하며, 그것은 자료가 아니라 뽑은 방식이 답합니다.
정답.
| 기호 | 읽는 법 | 뜻 |
|---|---|---|
| 모집단 | population | 알고 싶은 대상 전체입니다 |
| 표집틀 | sampling frame | 뽑을 수 있는 목록입니다 |
| 표본 비율 | 입니다 | |
| \rho_ | 응답과 값의 상관 | 치우침의 크기를 정합니다 |
| 유효 표본 | effective sample size | 같은 정확도를 주는 무작위 표본 크기입니다 |
| 유한모집단 수정 | finite population correction | 입니다 |
| 단순임의추출 | SRS | 모든 조합이 같은 확률입니다 |
| 계통추출 | systematic sampling | 일정 간격으로 건너뜁니다 |
| 층화추출 | stratified sampling | 나눠 놓고 각 층에서 뽑습니다 |
| 군집추출 | cluster sampling | 뭉치째로 뽑습니다 |
| 설계효과 | design effect | 단순임의 대비 분산의 비입니다 |
| 급내상관 | intraclass correlation | 뭉치 안의 닮음 정도입니다 |
| 네이만 배분 | Neyman allocation | 입니다 |
| 다단 추출 | multistage sampling | 단계를 밟아 좁혀 갑니다 |
| 확률비례추출 | PPS sampling | 크기에 비례해 뭉치를 뽑습니다 |
다음은 174강 표본오차와 표본 크기입니다. 이 강의가 어떻게 뽑을지를 다뤘고, 다음은 몇 개나 뽑을지를 다룹니다.
심화 2에서 식만 보았습니다. 다음 강의는 그 식이 어디서 나오는지 유도하고, 허용 오차를 절반으로 줄이면 왜 표본이 네 배가 되는지를 다룹니다.
그리고 이 강의의 결론이 그 계산에 그대로 들어갑니다. 설계효과가 곱으로 붙고, 무응답률이 나눗셈으로 붙으며, 층마다 결과를 내야 하면 층별로 다시 계산해야 합니다. 표본 크기는 통계가 아니라 무엇을 몇 개나 추정할 것인지가 정합니다.
import numpy as np
rng = np.random.default_rng(20260910)
def pw(s, n):
k = n - sum(2 if ord(c) > 0x2FFF else 1 for c in str(s))
return str(s) + " " * max(k, 0)
def rw(s, n):
k = n - sum(2 if ord(c) > 0x2FFF else 1 for c in str(s))
return " " * max(k, 0) + str(s)
# --- 문제 1: 무작위가 무엇을 보장하는가 ---------------------------------
print(" 표본을 뽑는 이유는 전수조사가 비싸기 때문만이 아닙니다")
print(" %s %s" % (pw("전수조사의 문제", 22), rw("내용", 34)))
for a, b in [("비용과 시간", "다 세는 동안 대상이 바뀝니다"),
("접근 불가", "닿을 수 없는 대상이 남습니다"),
("파괴 검사", "다 검사하면 남는 것이 없습니다"),
("품질", "급하게 다 세면 오히려 부정확합니다")]:
print(" %s %s" % (pw(a, 22), rw(b, 34)))
print(" 무작위로 뽑으면 표본평균이 모평균을 치우침 없이 맞힙니다")
N1 = 200000
X = rng.normal(50.0, 10.0, N1)
mu = float(X.mean())
print(" 모집단 %d 명의 평균은 %.6f 입니다" % (N1, mu))
print(" %s %s %s %s" % (pw("표본 크기", 12), rw("표본평균의 평균", 18),
rw("참값과의 차이", 16), rw("표본평균의 표준편차", 20)))
for n in [50, 200, 1000, 5000]:
m = np.array([float(X[rng.choice(N1, n, replace=False)].mean()) for _ in range(3000)])
print(" %s %18.6f %16.6f %20.6f"
% (pw(str(n), 12), float(m.mean()), float(m.mean() - mu), float(m.std())))
print(" 표본이 작아도 치우침이 없습니다. 흔들릴 뿐입니다")
print(" 치우친 방식으로 뽑으면 표본을 아무리 키워도 치우침이 남습니다")
f1, rho = 0.01, 0.05
c = rho * np.sqrt(f1 * (1 - f1)) / float(X.std())
p = np.clip(f1 + c * (X - mu), 0.0, 1.0)
R = rng.random(N1) < p
print(" 응답할 확률이 값에 따라 조금 달라지는 경우를 만듭니다")
print(" %s %s" % (pw("무엇을 재는가", 30), rw("값", 16)))
print(" %s %16.6f" % (pw("뽑힌 비율", 30), float(R.mean())))
print(" %s %16.6f" % (pw("응답 여부와 값의 상관", 30), float(np.corrcoef(R.astype(float), X)[0, 1])))
print(" %s %16.6f" % (pw("뽑힌 사람의 평균", 30), float(X[R].mean())))
print(" %s %16.6f" % (pw("치우침", 30), float(X[R].mean() - mu)))
print(" 상관이 %.4f 뿐인데 치우침이 %.4f 로 모집단 표준편차의 절반에 가깝습니다"
% (float(np.corrcoef(R.astype(float), X)[0, 1]), float(X[R].mean() - mu)))
print(" 치우침의 크기는 세 가지의 곱으로 정확히 갈라집니다")
print(" 치우침 = (응답과 값의 상관) x sqrt((1-f)/f) x (모집단 표준편차)")
rr = float(np.corrcoef(R.astype(float), X)[0, 1])
ff = float(R.mean())
th = rr * np.sqrt((1 - ff) / ff) * float(X.std())
print(" 실현된 상관 %.6f, 실현된 비율 %.6f, 표준편차 %.4f 를 넣으면"
% (rr, ff, float(X.std())))
print(" 이론값 %.6f 이고 수치 %.6f 로 소수점 둘째 자리까지 맞습니다"
% (th, float(X[R].mean() - mu)))
print(" 가운데 항이 표본 비율만으로 정해집니다. 표본이 클수록 오히려 커집니다")
print(" %s %s %s %s" % (pw("표본 비율 f", 12), rw("sqrt((1-f)/f)", 16),
rw("상관 0.05 의 치우침", 22), rw("같은 값을 주는 무작위 표본", 28)))
for f in [0.001, 0.01, 0.1, 0.5]:
b = rho * np.sqrt((1 - f) / f) * 1.0
neff = f / (rho ** 2 * (1 - f))
print(" %s %16.4f %22.6f %28.2f"
% (pw("%.3f" % f, 12), np.sqrt((1 - f) / f), b, neff))
print(" 상관 0.05 인 자료는 표본 비율 0.01 에서 무작위 표본 4 명과 같습니다")
print(" 모집단이 1 억이면 그 비율은 100 만 명입니다. 100 만 명이 무작위 4 명만 못합니다")
print(" 비율이 같으면 모은 사람이 몇 명이든 유효 표본이 같습니다. 크기가 치우침을 못 이깁니다")
# --- 문제 2: 가장 단순한 방법 -------------------------------------------
print(" 단순임의추출은 모든 조합이 같은 확률로 뽑히도록 하는 것입니다")
N2 = 2000
Y = rng.normal(0, 1, N2)
s2 = float(Y.var(ddof=1))
print(" 모집단 %d 개에서 크기 n 을 비복원으로 뽑습니다" % N2)
print(" %s %s %s %s" % (pw("표본 크기", 12), rw("표본평균의 분산 수치", 22),
rw("s^2/n", 12), rw("유한모집단 수정", 16)))
for n in [50, 200, 1000, 1800]:
m = np.array([float(Y[rng.choice(N2, n, replace=False)].mean()) for _ in range(4000)])
fpc = (N2 - n) / (N2 - 1)
print(" %s %22.8f %12.8f %16.6f"
% (pw(str(n), 12), float(m.var()), s2 / n, fpc))
print(" 분산이 s^2/n 이 아니라 s^2/n 곱하기 (N-n)/(N-1) 입니다")
print(" 표본이 모집단에 가까워지면 분산이 0 으로 갑니다. 다 세면 흔들림이 없습니다")
print(" 복원과 비복원의 차이는 모집단이 클 때 사라집니다")
print(" %s %s %s" % (pw("모집단 N", 12), rw("n = 100 의 수정계수", 22),
rw("표준오차가 줄어드는 비율", 26)))
for N in [200, 1000, 10000, 1000000]:
fpc = (N - 100) / (N - 1)
print(" %s %22.6f %26.6f" % (pw(str(N), 12), fpc, np.sqrt(fpc)))
print(" 모집단이 10 만을 넘으면 수정계수가 사실상 1 입니다")
print(" 그래서 여론조사에서 모집단 크기는 거의 상관이 없습니다")
print(" 표본 크기가 정확도를 정하지 모집단 크기가 정하지 않습니다")
print(" %s %s %s" % (pw("모집단", 14), rw("표본 1000 의 표준오차", 24),
rw("표본 비율", 14)))
for N in [10000, 100000, 50000000]:
fpc = (N - 1000) / (N - 1)
print(" %s %24.8f %14.6f" % (pw(str(N), 14), np.sqrt(fpc / 1000), 1000 / N))
print(" 모집단이 5000 배 커져도 표준오차는 거의 그대로입니다")
# --- 문제 3: 줄지어 뽑기와 뭉치로 뽑기 ----------------------------------
print(" 계통추출은 하나 뽑고 일정 간격으로 건너뜁니다")
N3 = 3000
per = 12
Z = np.sin(2 * np.pi * np.arange(N3) / per) + rng.normal(0, 0.3, N3)
print(" 모집단에 주기 %d 인 규칙이 숨어 있습니다. 참 평균은 %.6f 입니다"
% (per, float(Z.mean())))
print(" %s %s %s %s" % (pw("건너뛰는 간격", 14), rw("표본 크기", 12),
rw("표본평균의 표준편차", 22), rw("단순임의 대비", 16)))
base3 = None
for k in [10, 12, 24, 25]:
n = N3 // k
est = np.array([float(Z[st::k][:n].mean()) for st in range(k)])
srs = np.array([float(Z[rng.choice(N3, n, replace=False)].mean()) for _ in range(2000)])
if base3 is None:
base3 = float(srs.std())
print(" %s %12d %22.6f %16.4f"
% (pw(str(k), 14), n, float(est.std()), float(est.std()) / float(srs.std())))
print(" 간격이 주기와 같은 12 나 그 배수 24 이면 표준편차가 폭발합니다")
print(" 시작점 하나가 어느 위상을 뽑을지 정해 버리기 때문입니다")
print(" 반대로 주기와 안 맞는 10 이나 25 이면 단순임의보다 오히려 낫습니다")
print(" 목록 전체에 고르게 퍼지기 때문입니다. 위험과 이득이 같은 자리에서 나옵니다")
print(" 군집추출은 뭉치째로 뽑습니다. 뭉치 안이 비슷하면 정보가 적습니다")
G, M = 400, 25
print(" 뭉치 %d 개에 각 %d 명입니다. 뭉치 안의 닮음 정도를 바꿔 봅니다" % (G, M))
print(" %s %s %s %s" % (pw("뭉치 안 상관", 14), rw("설계효과 수치", 16),
rw("이론 1+(m-1)rho", 20), rw("유효 표본", 14)))
for r in [0.0, 0.02, 0.10, 0.30]:
ga = rng.normal(0, np.sqrt(r), (G, 1))
ind = rng.normal(0, np.sqrt(1 - r), (G, M))
P = (ga + ind).ravel()
nc = 20
cl = np.array([float(P.reshape(G, M)[rng.choice(G, nc, replace=False)].mean())
for _ in range(3000)])
sr = np.array([float(P[rng.choice(G * M, nc * M, replace=False)].mean())
for _ in range(3000)])
deff = float(cl.var() / sr.var())
print(" %s %16.4f %20.4f %14.2f"
% (pw("%.2f" % r, 14), deff, 1 + (M - 1) * r, nc * M / deff))
print(" 뭉치 안 상관이 0.10 이면 500 명을 모아도 유효 표본이 훨씬 적습니다")
print(" 한 뭉치에서 25 명을 더 뽑는 것보다 다른 뭉치를 하나 더 뽑는 것이 낫습니다")
# --- 문제 4: 나눠서 뽑기 ------------------------------------------------
print(" 층화추출은 미리 나눠 놓고 각 층에서 따로 뽑습니다")
Ns = np.array([50000.0, 30000.0, 20000.0])
mus = np.array([40.0, 55.0, 70.0])
sds = np.array([5.0, 8.0, 20.0])
Wt = Ns / Ns.sum()
gm = float((Wt * mus).sum())
within = float((Wt * sds ** 2).sum())
between = float((Wt * (mus - gm) ** 2).sum())
print(" 세 층의 크기 %s 이고 평균 %s 입니다"
% (", ".join("%.0f" % t for t in Ns), ", ".join("%.0f" % t for t in mus)))
print(" 전체 평균 %.4f, 층 안 분산 %.4f, 층 사이 분산 %.4f, 전체 %.4f"
% (gm, within, between, within + between))
n4 = 1000
prop = Wt * n4
ney = n4 * (Wt * sds) / (Wt * sds).sum()
print(" %s %s %s %s" % (pw("배분 방법", 16), rw("층별 표본 수", 26),
rw("추정량의 분산", 18), rw("단순임의 대비", 16)))
v_srs = (within + between) / n4
v_prop = float((Wt ** 2 * sds ** 2 / prop).sum())
v_ney = float((Wt ** 2 * sds ** 2 / ney).sum())
print(" %s %26s %18.8f %16.4f"
% (pw("단순임의", 16), rw("-", 26), v_srs, 1.0))
print(" %s %26s %18.8f %16.4f"
% (pw("비례 배분", 16), rw(", ".join("%.0f" % t for t in prop), 26),
v_prop, v_prop / v_srs))
print(" %s %26s %18.8f %16.4f"
% (pw("네이만 배분", 16), rw(", ".join("%.0f" % t for t in ney), 26),
v_ney, v_ney / v_srs))
print(" 비례 배분만으로도 층 사이 분산 %.4f 가 통째로 빠집니다" % between)
print(" 네이만 배분은 흩어진 층에서 더 많이 뽑아 %.4f 배까지 줄입니다"
% (v_ney / v_srs))
print(" 층 사이 차이가 클수록 층화가 크게 이깁니다. 층 안이 비슷해야 좋습니다")
print(" 군집추출과 정확히 반대입니다")
print(" %s %s %s" % (pw("방법", 14), rw("무엇이 비슷해야 좋은가", 26),
rw("설계효과", 12)))
print(" %s %26s %12s" % (pw("층화", 14), rw("층 안이 비슷할수록", 26), rw("1 보다 작음", 12)))
print(" %s %26s %12s" % (pw("군집", 14), rw("뭉치 안이 다를수록", 26), rw("1 보다 큼", 12)))
# --- 문제 5: 목록과 현실 ------------------------------------------------
print(" 뽑기 전에 목록이 있어야 합니다. 그 목록을 표집틀이라 합니다")
print(" %s %s" % (pw("표집틀의 문제", 18), rw("무엇이 어긋나는가", 30)))
for a, b in [("빠짐", "모집단에 있는데 목록에 없습니다"),
("남음", "목록에 있는데 모집단이 아닙니다"),
("중복", "한 사람이 여러 번 들어 있습니다"),
("묶임", "한 항목에 여러 사람이 들어 있습니다")]:
print(" %s %s" % (pw(a, 18), rw(b, 30)))
print(" 빠진 사람들이 다르면 그 비율만큼 치우칩니다")
print(" %s %s %s" % (pw("빠진 비율 q", 14), rw("빠진 집단과의 차이 d", 22),
rw("치우침 q x d", 16)))
for q in [0.05, 0.10, 0.30]:
for d in [1.0, 5.0]:
print(" %s %22.4f %16.4f" % (pw("%.2f" % q, 14), d, q * d))
print(" 빠진 비율이 0.30 이고 차이가 5 이면 치우침이 1.5 입니다")
print(" 표본을 아무리 늘려도 이 값은 그대로입니다. 문제 1 과 같은 구조입니다")
print(" 현실에서는 여러 단계로 나눠 뽑습니다")
print(" %s %s" % (pw("단계", 20), rw("무엇을 뽑는가", 26)))
for a, b in [("1 단계", "지역을 뽑습니다"),
("2 단계", "그 안에서 동네를 뽑습니다"),
("3 단계", "그 안에서 가구를 뽑습니다"),
("4 단계", "그 안에서 사람을 뽑습니다")]:
print(" %s %s" % (pw(a, 20), rw(b, 26)))
print(" 단계마다 군집추출이라 설계효과가 곱해집니다")
print(" %s %s %s" % (pw("단계 수", 12), rw("단계별 설계효과 1.5", 22), rw("전체", 12)))
for k in [1, 2, 3, 4]:
print(" %s %22.4f %12.4f" % (pw(str(k), 12), 1.5, 1.5 ** k))
print(" 네 단계면 설계효과가 %.4f 입니다. 유효 표본이 5 분의 1 로 줄어듭니다"
% (1.5 ** 4))
print(" 그래도 이렇게 뽑습니다. 전국의 사람 목록이 없기 때문입니다")
print(" 설계가 복잡해지면 추정도 그 설계를 반영해야 합니다. 175강이 그 방법입니다")
# 표본을 뽑는 이유는 전수조사가 비싸기 때문만이 아닙니다
# 전수조사의 문제 내용
# 비용과 시간 다 세는 동안 대상이 바뀝니다
# 접근 불가 닿을 수 없는 대상이 남습니다
# 파괴 검사 다 검사하면 남는 것이 없습니다
# 품질 급하게 다 세면 오히려 부정확합니다
# 무작위로 뽑으면 표본평균이 모평균을 치우침 없이 맞힙니다
# 모집단 200000 명의 평균은 49.941417 입니다
# 표본 크기 표본평균의 평균 참값과의 차이 표본평균의 표준편차
# 50 49.932340 -0.009076 1.399249
# 200 49.958453 0.017036 0.711738
# 1000 49.941695 0.000278 0.315556
# 5000 49.938446 -0.002971 0.140864
# 표본이 작아도 치우침이 없습니다. 흔들릴 뿐입니다
# 치우친 방식으로 뽑으면 표본을 아무리 키워도 치우침이 남습니다
# 응답할 확률이 값에 따라 조금 달라지는 경우를 만듭니다
# 무엇을 재는가 값
# 뽑힌 비율 0.010120
# 응답 여부와 값의 상관 0.047694
# 뽑힌 사람의 평균 54.660308
# 치우침 4.718891
# 상관이 0.0477 뿐인데 치우침이 4.7189 로 모집단 표준편차의 절반에 가깝습니다
# 치우침의 크기는 세 가지의 곱으로 정확히 갈라집니다
# 치우침 = (응답과 값의 상관) x sqrt((1-f)/f) x (모집단 표준편차)
# 실현된 상관 0.047694, 실현된 비율 0.010120, 표준편차 10.0041 를 넣으면
# 이론값 4.718891 이고 수치 4.718891 로 소수점 둘째 자리까지 맞습니다
# 가운데 항이 표본 비율만으로 정해집니다. 표본이 클수록 오히려 커집니다
# 표본 비율 f sqrt((1-f)/f) 상관 0.05 의 치우침 같은 값을 주는 무작위 표본
# 0.001 31.6070 1.580348 0.40
# 0.010 9.9499 0.497494 4.04
# 0.100 3.0000 0.150000 44.44
# 0.500 1.0000 0.050000 400.00
# 상관 0.05 인 자료는 표본 비율 0.01 에서 무작위 표본 4 명과 같습니다
# 모집단이 1 억이면 그 비율은 100 만 명입니다. 100 만 명이 무작위 4 명만 못합니다
# 비율이 같으면 모은 사람이 몇 명이든 유효 표본이 같습니다. 크기가 치우침을 못 이깁니다
# 단순임의추출은 모든 조합이 같은 확률로 뽑히도록 하는 것입니다
# 모집단 2000 개에서 크기 n 을 비복원으로 뽑습니다
# 표본 크기 표본평균의 분산 수치 s^2/n 유한모집단 수정
# 50 0.02025712 0.02054044 0.975488
# 200 0.00447092 0.00513511 0.900450
# 1000 0.00050397 0.00102702 0.500250
# 1800 0.00005841 0.00057057 0.100050
# 분산이 s^2/n 이 아니라 s^2/n 곱하기 (N-n)/(N-1) 입니다
# 표본이 모집단에 가까워지면 분산이 0 으로 갑니다. 다 세면 흔들림이 없습니다
# 복원과 비복원의 차이는 모집단이 클 때 사라집니다
# 모집단 N n = 100 의 수정계수 표준오차가 줄어드는 비율
# 200 0.502513 0.708881
# 1000 0.900901 0.949158
# 10000 0.990099 0.995037
# 1000000 0.999901 0.999950
# 모집단이 10 만을 넘으면 수정계수가 사실상 1 입니다
# 그래서 여론조사에서 모집단 크기는 거의 상관이 없습니다
# 표본 크기가 정확도를 정하지 모집단 크기가 정하지 않습니다
# 모집단 표본 1000 의 표준오차 표본 비율
# 10000 0.03000150 0.100000
# 100000 0.03146442 0.010000
# 50000000 0.03162246 0.000020
# 모집단이 5000 배 커져도 표준오차는 거의 그대로입니다
# 계통추출은 하나 뽑고 일정 간격으로 건너뜁니다
# 모집단에 주기 12 인 규칙이 숨어 있습니다. 참 평균은 0.003683 입니다
# 건너뛰는 간격 표본 크기 표본평균의 표준편차 단순임의 대비
# 10 300 0.011369 0.2695
# 12 250 0.705355 14.8348
# 24 125 0.705761 10.5224
# 25 120 0.028627 0.4188
# 간격이 주기와 같은 12 나 그 배수 24 이면 표준편차가 폭발합니다
# 시작점 하나가 어느 위상을 뽑을지 정해 버리기 때문입니다
# 반대로 주기와 안 맞는 10 이나 25 이면 단순임의보다 오히려 낫습니다
# 목록 전체에 고르게 퍼지기 때문입니다. 위험과 이득이 같은 자리에서 나옵니다
# 군집추출은 뭉치째로 뽑습니다. 뭉치 안이 비슷하면 정보가 적습니다
# 뭉치 400 개에 각 25 명입니다. 뭉치 안의 닮음 정도를 바꿔 봅니다
# 뭉치 안 상관 설계효과 수치 이론 1+(m-1)rho 유효 표본
# 0.00 0.9908 1.0000 504.64
# 0.02 1.2619 1.4800 396.22
# 0.10 3.6702 3.4000 136.23
# 0.30 8.7559 8.2000 57.10
# 뭉치 안 상관이 0.10 이면 500 명을 모아도 유효 표본이 훨씬 적습니다
# 한 뭉치에서 25 명을 더 뽑는 것보다 다른 뭉치를 하나 더 뽑는 것이 낫습니다
# 층화추출은 미리 나눠 놓고 각 층에서 따로 뽑습니다
# 세 층의 크기 50000, 30000, 20000 이고 평균 40, 55, 70 입니다
# 전체 평균 50.5000, 층 안 분산 111.7000, 층 사이 분산 137.2500, 전체 248.9500
# 배분 방법 층별 표본 수 추정량의 분산 단순임의 대비
# 단순임의 - 0.24895000 1.0000
# 비례 배분 500, 300, 200 0.11170000 0.4487
# 네이만 배분 281, 270, 449 0.07921000 0.3182
# 비례 배분만으로도 층 사이 분산 137.2500 가 통째로 빠집니다
# 네이만 배분은 흩어진 층에서 더 많이 뽑아 0.3182 배까지 줄입니다
# 층 사이 차이가 클수록 층화가 크게 이깁니다. 층 안이 비슷해야 좋습니다
# 군집추출과 정확히 반대입니다
# 방법 무엇이 비슷해야 좋은가 설계효과
# 층화 층 안이 비슷할수록 1 보다 작음
# 군집 뭉치 안이 다를수록 1 보다 큼
# 뽑기 전에 목록이 있어야 합니다. 그 목록을 표집틀이라 합니다
# 표집틀의 문제 무엇이 어긋나는가
# 빠짐 모집단에 있는데 목록에 없습니다
# 남음 목록에 있는데 모집단이 아닙니다
# 중복 한 사람이 여러 번 들어 있습니다
# 묶임 한 항목에 여러 사람이 들어 있습니다
# 빠진 사람들이 다르면 그 비율만큼 치우칩니다
# 빠진 비율 q 빠진 집단과의 차이 d 치우침 q x d
# 0.05 1.0000 0.0500
# 0.05 5.0000 0.2500
# 0.10 1.0000 0.1000
# 0.10 5.0000 0.5000
# 0.30 1.0000 0.3000
# 0.30 5.0000 1.5000
# 빠진 비율이 0.30 이고 차이가 5 이면 치우침이 1.5 입니다
# 표본을 아무리 늘려도 이 값은 그대로입니다. 문제 1 과 같은 구조입니다
# 현실에서는 여러 단계로 나눠 뽑습니다
# 단계 무엇을 뽑는가
# 1 단계 지역을 뽑습니다
# 2 단계 그 안에서 동네를 뽑습니다
# 3 단계 그 안에서 가구를 뽑습니다
# 4 단계 그 안에서 사람을 뽑습니다
# 단계마다 군집추출이라 설계효과가 곱해집니다
# 단계 수 단계별 설계효과 1.5 전체
# 1 1.5000 1.5000
# 2 1.5000 2.2500
# 3 1.5000 3.3750
# 4 1.5000 5.0625
# 네 단계면 설계효과가 5.0625 입니다. 유효 표본이 5 분의 1 로 줄어듭니다
# 그래도 이렇게 뽑습니다. 전국의 사람 목록이 없기 때문입니다
# 설계가 복잡해지면 추정도 그 설계를 반영해야 합니다. 175강이 그 방법입니다