이 관문은 158강부터 200강까지를 범위로 합니다. S7 데이터 분석 탐색과 기술, S8 데이터 분석 추론과 모형 두 과목을 여덟 단원 전체에서 섞어 다시 묻습니다.
앞의 네 관문과 다른 점이 하나 있습니다. 여기서부터는 자료가 실제로 존재합니다. 121강까지의 확률은 분포를 주고 시작했지만, 158강부터는 자료가 어떻게 만들어졌는지를 먼저 따져야 하고 그 답이 이후의 모든 계산을 정합니다.
이 물음 하나가 두 과목을 관통합니다. 표본을 어떻게 뽑았는지가 표준오차를 정하고, 누가 처치를 받았는지가 인과 해석을 정하고, 관측이 이어져 있는지가 유효 표본을 정합니다.
| 자료가 만들어진 방식 | 무엇이 달라지는가 | 어디서 |
|---|---|---|
| 뭉치로 뽑음 | 설계효과가 곱해짐 | 강 |
| 결과를 보고 표본에 들어옴 | 선택편향 | 강, 강 |
| 처치를 스스로 고름 | 교란 | 강 |
| 관측이 시간으로 이어짐 | 유효 표본이 줄어듦 | 강 |
| 결측이 값에 따라 생김 | 어떤 보정도 못 고침 | 강, 강 |
한쪽 과목만 알아서는 풀리지 않는 문항이 곳곳에 있습니다. 그 자리가 이 관문의 숨은 채점 기준입니다.
| 정답 수 | 판정 |
|---|---|
| 개 이상 (약 ) | 통과입니다. 201강으로 넘어갑니다 |
| 개 | 틀린 문항이 몰린 단원만 다시 읽고 그 단원 문제집을 다시 풉니다 |
| 개 이하 | 통과하지 못했습니다. 아래 표를 보고 해당 단원을 다시 읽습니다 |
틀린 문항이 어느 부에 몰렸는지 세어 돌아갈 곳을 정합니다.
| 부 | 문항 | 되돌아갈 곳 |
|---|---|---|
| 1부 | 158~162강 (S7 01단원 데이터를 손에 넣기) | |
| 2부 | 163~167강 (S7 02단원 기술통계) | |
| 3부 | 168~172강 (S7 03단원 탐색과 시각화) | |
| 4부 | 173~177강 (S7 04단원 표본과 조사 설계) | |
| 5부 | 178~183강 (S8 01단원 검정의 실제) | |
| 6부 | 184~190강 (S8 02단원 회귀분석) | |
| 7부 | 191~195강 (S8 03단원 인과추론) | |
| 8부 | 196~200강 (S8 04단원 시계열) |
한 부에서 절반 이하를 맞혔다면 다른 부의 점수와 무관하게 그 단원으로 돌아갑니다.
문제 1. 명목, 순서, 구간, 비율 네 척도에서 각각 무엇까지 할 수 있는지 쓰세요.
답. 명목은 같다 다르다, 순서는 크다 작다까지, 구간은 덧셈 뺄셈, 비율은 곱셈 나눗셈까지입니다.
문제 2. 요일을 부터 의 정수로 넣으면 무엇이 깨지는지 쓰고 대안을 쓰세요.
답. 일요일과 월요일이 붙어 있는데 라벨 차이가 이 되어 거리가 뒤집히며, 사인과 코사인 두 열로 넣으면 순환 구조가 복원됩니다.
문제 3. 부동소수점에서 정수를 정확히 담을 수 있는 한계와 그 위에서 무슨 일이 생기는지 쓰세요.
답. 이며 그 위로는 정수도 건너뜁니다.
문제 4. 덧셈의 결합법칙이 깨지는 예를 하나 쓰세요.
답. 인데 입니다.
문제 5. 결측이 세 값 논리에서 어떻게 다뤄지는지 쓰고 판정 방법을 쓰세요.
답. 비교 결과가 참이 아니라 모름이며 결측은 IS NULL로만 판정합니다.
문제 6. 조인 조건을
ON이 아니라WHERE에 두면 바깥쪽 조인이 어떻게 되는지 쓰세요.
답. NULL인 행이 걸러져 안쪽 조인과 같아지므로 조건은 ON에 둡니다.
문제 7. 팬아웃이 무엇인지 쓰고 검산에서의 크기를 쓰세요.
답. 일대다 조인이 행을 복제해 값이 여러 번 더해지는 현상이며 원이 원으로 배였습니다.
문제 8. 관계대수에서 선택과 사영이 각각 무엇을 바꾸는지 쓰고 사영이 왜 중복을 만드는지 쓰세요.
답. 선택은 행의 개수를, 사영은 열의 개수를 바꾸며, 열을 버리면 서로 달랐던 행이 같아지기 때문입니다.
문제 9. 질의의 논리적 실행 순서를 쓰고 밀어내리기가 무엇을 줄이는지 쓰세요.
답. FROM, WHERE, GROUP BY, HAVING, SELECT, ORDER BY, LIMIT 순이며 밀어내리기로 중간 결과가 배 줄었습니다.
문제 10. 평균과 중앙값이 각각 무엇을 최소로 하는지 쓰세요.
답. 제곱의 합과 절댓값의 합을 각각 최소로 만드는 값입니다.
문제 11. 정규분포에서 MAD와 IQR을 표준편차로 쓰세요.
답. 와 이며 IQR이 MAD의 두 배입니다.
문제 12. 표본 범위가 왜 퍼짐의 지표로 못 쓰이는지 검산 값과 함께 쓰세요.
답. 표본이 에서 만으로 갈 때 에서 로 계속 자라기 때문입니다.
문제 13. 표본분산에서 로 나누는 이유를 항등식으로 쓰세요.
답. 이며 기댓값을 씌우면 입니다.
문제 14. 표본표준편차가 왜 불편이 아닌지 쓰세요.
답. 제곱근이 오목함수라 젠센 부등식으로 이기 때문입니다.
문제 15. 왜도가 양수면 평균이 중앙값보다 크다는 말이 규칙인지 판정하고 검산 값을 쓰세요.
답. 대체로 맞지만 규칙이 아니며 검산에서 왜도 인데 평균이 중앙값보다 작았습니다.
문제 16. 분포의 첨도가 존재하는 조건과 값을 쓰세요.
답. 일 때만 존재하고 입니다.
문제 17. 표본 왜도와 첨도의 상한을 표본 크기로 쓰세요.
답. 과 입니다.
문제 18. 사분위수의 정의가 여럿인 이유와 검산에서 몇 가지가 나왔는지 쓰세요.
답. 경험분포함수가 계단이라 비율이 정확히 인 값이 없기 때문이며 부터 까지 여섯 가지였습니다.
문제 19. 정규 자료에서 상자그림의 점이 몇 퍼센트 찍히는지 쓰세요.
답. 퍼센트이며 검산에서 였습니다.
문제 20. 값을 가장 정확히 읽히는 시각 채널 셋을 순서대로 쓰세요.
답. 공통 축 위의 위치, 다른 축 위의 위치, 길이입니다.
문제 21. 원의 크기로 값을 나타낼 때 반지름을 무엇에 비례시키는지 쓰고 이유를 쓰세요.
답. 값의 제곱근이며 넓이가 값에 비례해야 하기 때문입니다.
문제 22. 막대그래프의 축을 에서 시작해야 하는 이유를 선그래프와 견주어 쓰세요.
답. 막대는 길이가 값이고 선은 기울기를 읽기 때문입니다.
문제 23. 로그 축에서 이웃 간격이 일정하면 무엇을 뜻하는지 검산 값과 함께 쓰세요.
답. 일정한 비율의 성장이며 이웃 차이가 전부 이었습니다.
문제 24. 히스토그램이 정하는 두 가지와 그것이 왜 결론을 바꾸는지 쓰세요.
답. 구간의 폭과 시작점이며 검산에서 폭 일 때 봉우리가 개로도 개로도 보였습니다.
문제 25. 세 가지 구간 개수 규칙을 쓰고 어느 것이 큰 자료에서 나쁜지 쓰세요.
답. 구간 개, , 이며 스터지스는 큰 자료에서 뭉갭니다.
문제 26. 심슨의 역설이 산점도에서 어떻게 나타나는지 검산 값과 함께 쓰세요.
답. 토막 상관이 거의 인데 전체 상관은 입니다.
문제 27. 겹치는 점을 투명도로 다룰 때 개가 겹친 자리의 불투명도를 쓰세요.
답. 입니다.
문제 28. 무작위 추출이 무엇을 보장하고 무엇을 보장하지 않는지 쓰세요.
답. 불편성을 보장하고 정확도는 보장하지 않으며 정확도는 표본 크기가 정합니다.
문제 29. 유효 표본이 실제 인원과 무관해지는 예를 검산 값과 함께 쓰세요.
답. 자기선택 표본에서 명이며 실제로 몇 명을 모았든 같습니다.
문제 30. 유한모집단 수정계수를 쓰고 언제 무시할 수 있는지 쓰세요.
답. 이며 모집단이 만을 넘으면 사실상 입니다.
문제 31. 군집 설계효과를 식으로 쓰고 무엇이 커지면 나빠지는지 쓰세요.
답. 이며 뭉치 크기와 급내상관이 커지면 나빠집니다.
문제 32. 네이만 배분을 쓰고 그 뜻을 한 문장으로 쓰세요.
답. 이며 흩어진 층에서 더 많이 뽑습니다.
문제 33. 표본 크기 식을 쓰고 허용 오차와 표준편차가 각각 어떻게 들어가는지 쓰세요.
답. 이며 허용 오차는 제곱에 반비례하고 표준편차는 제곱에 비례합니다.
문제 34. 비율 추정에서 를 가정하는 이유와 그때의 식을 쓰세요.
답. 이며 분산이 최대인 지점이기 때문입니다.
문제 35. 여러 문항을 동시에 보고할 때 표본이 몇 배 필요한지 검산 값과 함께 쓰세요.
답. 배가 되며 개면 배입니다.
문제 36. 치우침이 있을 때 표본을 늘리는 것이 어디까지 유효한지 식으로 쓰세요.
답. 오차가 이므로 에서 두 항이 같아지고 그 뒤로는 치우침이 지배합니다.
문제 37. 가중치의 유효 표본과 설계효과를 식으로 쓰세요.
답. 이고 설계효과는 입니다.
문제 38. 응답이 무작위로 빠질 때 가중치 보정이 무엇을 하는지 쓰세요.
답. 치우침은 안 줄고 분산만 늘어 손해뿐입니다.
문제 39. 두 표본 검정에서 합동과 웰치 중 어느 쪽을 기본으로 쓰는지 쓰고 이유를 쓰세요.
답. 웰치를 기본으로 쓰며 등분산이 성립할 때의 손해가 작고 깨질 때의 이득이 크기 때문입니다.
문제 40. 짝지은 자료를 짝을 무시하고 분석하면 무엇을 잃는지 검산 값과 함께 쓰세요.
답. 짝의 상관을 잃으며 에서 표준오차가 일 것이 이 됐습니다.
문제 41. 중간에 결과를 보고 유의하면 멈추는 규칙의 오류율을 검산 값으로 쓰세요.
답. 한 번 볼 때 이 다섯 번에 이 됐습니다.
문제 42. 순열검정이 무엇을 재배치하고 왜 정확한지 쓰세요.
답. 귀무가설 아래에서 라벨을 바꿔도 분포가 같으므로 가능한 모든 배치를 세면 정확한 유의확률이 나옵니다.
문제 43. 세 집단에서 분산이 다를 때 크기가 같으면 괜찮은지 판정하고 검산 값을 쓰세요.
답. 안 괜찮으며 분산이 세 배 다르면 오류율이 였습니다.
문제 44. 본페로니와 홀름의 FWER이 완전 귀무 아래 왜 같은지 쓰세요.
답. 어떤 기각이라도 일어나려면 가장 작은 유의확률이 아래여야 하는데 그 조건이 두 방법에서 같기 때문입니다.
문제 45. FDR과 FWER의 차이를 한 문장으로 쓰세요.
답. FWER은 하나라도 잘못 기각할 확률을 통제하고 FDR은 기각한 것 중 잘못된 것의 기대 비율을 통제합니다.
문제 46. 카이제곱 독립성 검정의 자유도를 쓰고 근사가 언제 나쁜지 쓰세요.
답. 이며 기대도수가 작으면 이산성 때문에 보수적으로 나옵니다.
문제 47. 검출력을 정의하고 무엇이 그것을 정하는지 넷을 쓰세요.
답. 대립이 참일 때 기각할 확률이며 효과 크기, 표본 크기, 유의수준, 분산이 정합니다.
문제 48. 기저 비율이 낮아질 때 절대 차이를 검출하는 데 필요한 표본이 어떻게 되는지 검산 값과 함께 쓰세요.
답. 오히려 줄어들며 에서 을 거쳐 가 됐습니다. 분산이 함께 줄기 때문입니다.
문제 49. 최소 검출 가능 효과가 표본 크기에 어떻게 의존하는지 검산 값과 함께 쓰세요.
답. 에 비례하며 , , , 였습니다.
문제 50. 유의하지 않다는 결과를 "차이가 없다"로 읽으면 안 되는 이유를 쓰세요.
답. 검출력이 낮으면 실제 차이가 있어도 기각하지 못하므로 구간의 폭을 함께 봐야 합니다.
문제 51. 최소제곱의 기울기와 절편을 식으로 쓰세요.
답. 와 입니다.
문제 52. 잔차와 의 상관이 왜 검사할 값이 아닌지 쓰세요.
답. 최소제곱 조건이 그것을 으로 강제하기 때문입니다.
문제 53. 를 두 배 퍼뜨렸을 때 기울기의 표준오차가 어떻게 되는지 검산 값과 함께 쓰세요.
답. 에서 로 절반이 됩니다.
문제 54. 두 집단 비교와 단순회귀의 대응을 검산 값과 함께 쓰세요.
답. 절편이 A의 평균 이고 기울기가 차이 이며 도 둘 다 입니다.
문제 55. 다중회귀에서 계수의 뜻이 무엇에 달렸는지 검산 값과 함께 쓰세요.
답. 함께 넣은 변수에 달렸으며 만 넣으면 이던 것이 를 넣으면 가 됐습니다.
문제 56. 의 원인이고 와 무관한 변수를 넣으면 무엇이 달라지는지 쓰고 그 반대 경우도 쓰세요.
답. 표준오차가 배로 줄고, 의 원인이고 와 무관한 변수를 넣으면 배로 늘어납니다.
문제 57. 더미변수 함정이 무엇인지 쓰고 왜 예측은 그대로인지 쓰세요.
답. 모든 범주에 더미를 주면 절편과 선형종속이 되며, 절편에 를 더하고 모든 더미에서 를 빼도 예측이 같기 때문입니다.
문제 58. 곱 항이 있을 때 주효과 계수가 무엇을 뜻하는지 검산 값과 함께 쓰세요.
답. 에서의 집단 차이일 뿐이며 를 옮기면 이 이 됐습니다.
문제 59. 공선성에서 무엇이 무너지고 무엇이 멀쩡한지 검산 값과 함께 쓰세요.
답. 개별 계수가 와 로 무너지는데 합 와 예측은 정확합니다.
문제 60. 이분산이 계수와 표준오차 중 무엇을 건드리는지 쓰고 방향을 무엇이 정하는지 쓰세요.
답. 계수는 불편이고 표준오차만 틀리며 방향은 와 레버리지의 상관이 정합니다.
문제 61. 수정 결정계수의 식을 쓰고 흔한 실수를 쓰세요.
답. 이며 을 자리에 넣는 실수가 흔합니다.
문제 62. 변수를 고른 뒤 그 계수로 구간을 만들면 포함률이 어떻게 되는지 검산 값과 함께 쓰세요.
답. 일 것이 로 떨어지며 구간의 폭은 거의 같습니다.
문제 63. 릿지에서 벌점을 키울 때 계수의 평균과 흩어짐이 어떻게 되는지 검산 값과 함께 쓰세요.
답. 흩어짐이 에서 로 줄고 평균이 에서 로 눌리며 예측오차는 에서 최소였습니다.
문제 64. 로지스틱에서 평균 한계효과와 평균에서의 한계효과가 왜 다른지 검산 값과 함께 쓰세요.
답. 젠센 부등식 때문이며 과 로 뒤가 퍼센트 큽니다.
문제 65. 인과추론의 근본 문제를 한 문장으로 쓰세요.
답. 한 사람에게서 두 잠재결과 중 하나만 볼 수 있습니다.
문제 66. 관측된 차이가 무엇으로 분해되는지 쓰세요.
답. 처치받은 사람의 효과에 선택 치우침을 더한 값입니다.
문제 67. 안 잰 교란이 있을 때 회귀와 층화와 성향점수가 어떻게 되는지 검산 값과 함께 쓰세요.
답. , , 으로 셋이 거의 같게 실패합니다.
문제 68. 균형표가 왜 품질의 증거가 못 되는지 검산 값과 함께 쓰세요.
답. 잰 변수만 담기기 때문이며 가 일 때 는 였습니다.
문제 69. 겹침이 무너질 때의 신호 둘을 검산 값과 함께 쓰세요.
답. 가중치 최댓값이 까지 뛰고 유효 표본 비율이 로 떨어집니다.
문제 70. 겹침을 자르는 것과 가중치를 자르는 것의 차이를 검산 값과 함께 쓰세요.
답. 앞은 대상을 좁혀 치우침이 에서 로 줄고, 뒤는 같은 대상에 대해 치우침이 으로 커집니다.
문제 71. 불멸 시간 치우침이 무엇인지 쓰고 검산에서의 크기를 쓰세요.
답. 처치를 받으려면 그때까지 살아 있어야 해서 생기는 치우침이며 대 이었습니다.
문제 72. 이중차분이 지우는 두 가지를 각각 어느 뺄셈이 지우는지 쓰세요.
답. 전후 차이가 대상 고유의 것을, 대조군의 전후 차이가 모두에게 공통인 변화를 지웁니다.
문제 73. 평행 추세가 깨지면 치우침이 어떻게 되는지 검산 값과 함께 쓰세요.
답. 어긋난 만큼 그대로 들어가며 어긋나면 이었습니다.
문제 74. 도구변수가 무엇을 추정하는지 쓰고 전체 평균과 다른 예를 검산 값으로 쓰세요.
답. 도구가 처치를 바꾼 사람의 효과이며 전체 평균 일 때 이 나왔습니다.
문제 75. 유효 표본 식을 쓰고 이웃 상관 일 때 개가 몇 개 값을 하는지 쓰세요.
답. 이며 개입니다.
문제 76. 가짜 회귀가 표본을 늘리면 어떻게 되는지 쓰고 검산 값을 쓰세요.
답. 더 나빠지며 누적합 둘에서 유의 비율이 이었습니다.
문제 77. 자기상관과 부분자기상관이 되먹임과 이동평균에서 어떻게 뒤집히는지 쓰세요.
답. 되먹임은 부분자기상관이 차수 뒤로 끊기고 이동평균은 자기상관이 차수 뒤로 끊깁니다.
문제 78. 단위근 검정의 검정력이 왜 문제인지 검산 값과 함께 쓰세요.
답. 되먹임 를 정상이라 가려내는 비율이 으로 누적합의 과 거의 같기 때문입니다.
문제 79. 정상 자료와 누적 자료와 계절 자료의 예측 기준선을 각각 쓰세요.
답. 평균, 바로 앞 값, 지난 주기의 같은 자리입니다.
문제 80. 달력이 만드는 가짜 계절의 예를 검산 값과 함께 쓰세요.
답. 하루 매출이 일정해도 월 합계가 월의 이 되며 하루 평균으로 고치면 입니다.
통과하지 못했다면 되돌아갈 곳 표를 보고 해당 단원의 강의와 문제집을 다시 풉니다. 관문을 다시 볼 때는 답을 외운 상태이므로 판정이 정확하지 않습니다. 최소 일주일 뒤에 다시 봅니다.
두 과목을 잇는 문항을 따로 셉니다. 문제 , , , , , , , , , , , 이 그런 유형입니다. 이 중 절반 이상을 틀렸다면 두 과목을 따로따로 외운 상태입니다. 점수가 통과선을 넘었더라도 다음 표의 대응을 손으로 다시 써 보십시오.
| S7에서 세운 것 | S8에서 무엇이 되는가 | 확인 문항 |
|---|---|---|
| 강 유효 표본 | 성향점수 가중의 유효 표본 | , |
| 강 설계효과 | 군집 배정의 표본 크기 | |
| 강 가중치 자르기 | 극단 성향점수 자르기 | , |
| 강 무작위 결측 | 이중차분의 구성 변화 | |
| 강 측정 오차 | 회귀계수의 감쇠 | |
| 강 교환가능성 | 성향점수의 전제 | |
| 강 양수성 | 겹침 조건 | |
| 강 민감도 분석 | 안 잰 교란의 강도 | |
| 강 유효 표본 | 시계열의 유효 표본 | |
| 강 승자의 저주 | 변수 선택 뒤의 계수 |
문제 이 이 관문에서 가장 중요한 한 문항입니다. 회귀와 층화와 성향점수와 매칭이 대에 나란히 서는 그 표가 03단원 전체의 결론이며, 방법을 바꿔 답을 고칠 수 없다는 사실이 S8 후반의 모든 강의를 지탱합니다. 이 표를 스스로 재구성할 수 있으면 강부터 강이 한 덩어리로 붙은 것입니다.
문제 과 문제 를 이어서 설명할 수 있는지 확인하십시오. 어느 변수를 넣느냐가 정확도를 정한다는 사실과 고른 뒤의 추론이 무너진다는 사실이 같은 이야기입니다. 변수를 자료를 보고 고르는 순간 두 문제가 겹치며, S9의 정규화와 교차검증이 그것을 훨씬 큰 규모로 반복합니다.
문제 과 문제 을 함께 보십시오. 시계열에서는 표본을 늘리는 것이 답이 아닐 때가 있습니다. 가짜 회귀는 표본이 커질수록 심해지고, 단위근 검정은 표본을 열 배로 늘려도 를 겨우 가려냅니다. "자료가 많으니 믿을 만하다"가 통하지 않는 두 자리이며, 이것이 S9에서 대규모 자료를 다룰 때 되풀이해 필요합니다.
S9부터는 목표가 바뀝니다. 여기까지가 "무엇이 참인가"를 물었다면 다음은 "무엇이 잘 맞는가"를 묻습니다. 그런데 문제 의 가짜 회귀와 문제 의 균형표가 보였듯 잘 맞는다고 참인 것은 아니며, 이 관문에서 세운 가정 목록이 S9 내내 필요합니다. 특히 문제 의 잠재결과와 문제 의 겹침은 추천과 정책 평가에서 그대로 다시 나옵니다.