168강부터 171강까지가 그림을 만드는 법이었습니다. 이제 그림을 의심하는 법을 봅니다.
168강 심화 6에서 예고한 그대로입니다. 이 단원에서 세운 규칙 하나하나가 어기는 방법의 목록이기도 하며, 그래서 이 강의는 새로운 내용이 아니라 앞의 네 강의를 역방향으로 읽는 것입니다.
다만 진단에는 순서가 있습니다.
| 순서 | 무엇을 묻는가 | 알 수 있는가 |
|---|---|---|
| ~ | 축, 인코딩, 척도 | 그림만 보면 압니다 |
| ~ | 분모, 범위, 빠진 자료 | 자료를 봐야 압니다 |
| 보여 주지 않은 그림 | 물어봐야 압니다 |
마지막 줄이 가장 위험합니다. 그림 자체는 아무것도 조작하지 않았는데 여러 장 중 가장 눈에 띄는 하나를 고른 것이라면, 그림 안에 흔적이 남지 않습니다.
문제. 축으로 할 수 있는 조작을 봅니다.
(1) 축 자르기의 한계를 구하세요.
(2) 두 축을 쓰면 무엇을 정할 수 있는지 보세요.
(3) 축 방향을 확인하세요.
생각의 실마리. 168강 문제 3에서 아래끝을 로 자르면 배가 된다고 했습니다. 더 자르면 어떻게 되는지를 봅니다.
풀이. (1) 값 을 막대로 그립니다.
| 축의 아래끝 | 길이의 비 | 값의 비 | 부풀린 배수 |
|---|---|---|---|
부풀림에 한계가 없습니다. 아래끝을 값에 가깝게 붙일수록 무한히 커집니다.
그래서 막대그림을 볼 때 가장 먼저 세로축의 아래끝을 봅니다. 아래끝이 이 아니면 그 그림의 길이는 값이 아닙니다.
(2) 두 축을 쓰는 그림을 봅니다. 서로 독립인 두 계열을 만들었고 상관이 입니다.
둘째 축의 눈금을 배 하고 을 더하면 같은 띠에 놓입니다. 상관이 없으므로 아무리 맞춰도 평균 간격이 첫째 계열 높이의 배로 남습니다.
눈금이 상관을 만들어 내지는 못합니다. 그런데 두 선이 얼마나 얽혀 보이는지는 정할 수 있습니다.
| 둘째 축을 올리는 양 | 두 선의 교차 횟수 | 평균 간격 |
|---|---|---|
올리는 양 하나로 교차가 없다가 번 얽히게 만들 수 있습니다. 여러 번 교차하는 두 선은 함께 움직이는 것처럼 읽힙니다.
그리고 읽는 사람은 두 축의 눈금을 확인할 방법이 없습니다. 단위가 다르므로 어느 눈금이 옳은지 판단할 근거가 그림 안에 없습니다.
(3) 축을 뒤집으면 부호가 뒤집혀 보입니다.
| 어떻게 그리는가 | 보이는 관계 |
|---|---|
| 둘 다 보통 방향 | |
| 세로축을 뒤집으면 |
값은 그대로인데 부호가 반대로 보입니다.
이 문제에서 배우는 것. 축은 자료의 일부가 아니라 선택이고, 그 선택에 제약이 거의 없습니다. 아래끝으로 부풀림을 무한히 키울 수 있고, 두 축으로 얽힘을 정할 수 있고, 방향으로 부호를 바꿀 수 있습니다. 그래서 진단의 첫 세 걸음이 전부 축에 관한 것이며, 다행히 이 셋은 그림만 보고 확인할 수 있습니다.
바로 확인 1.
확인 1-1. 검산에서 아래끝을 로 잘랐을 때 부풀린 배수를 쓰세요.
답. 배이며 아래끝을 붙일수록 한계가 없습니다.
확인 1-2. 두 축을 쓰는 그림에서 분석자가 정할 수 있는 것을 쓰세요.
답. 두 선이 놓이는 띠와 교차 횟수이며 검산에서 번과 번 사이를 오갔습니다.
확인 1-3. 축 방향을 확인해야 하는 이유를 쓰세요.
답. 뒤집으면 같은 자료의 상관이 에서 로 보이기 때문입니다.
문제. 추세가 없는 자료에서 추세를 만듭니다.
(1) 무작위 걸음에서 가장 가파른 구간을 고르면 어떻게 되는지 구하세요.
(2) 시작 시점을 바꿔 보세요.
생각의 실마리. 156강에서 무작위 걸음이 으로 퍼진다고 했습니다. 추세가 전혀 없어도 구간마다 기울기가 다르며, 그중 가장 가파른 것을 고르면 무슨 일이 일어날지 봅니다.
풀이. (1) 길이 인 무작위 걸음입니다. 참 추세는 입니다.
| 고르는 구간 길이 | 기울기가 양수일 확률 | 가장 가파른 기울기 평균 | 전체 기울기 평균 |
|---|---|---|---|
전체 기울기의 평균은 인데 가장 가파른 구간을 고르면 언제나 양수입니다.
구간이 짧을수록 더 가파른 것을 고를 수 있습니다. 길이 이면 평균 이고 길이 이면 입니다. 짧은 구간일수록 흔들림이 크므로 극단값도 큽니다.
기울기가 양수일 확률은 어느 길이에서도 입니다. 자료 자체는 공평한데, 고르는 사람이 공평하지 않은 것입니다.
(2) 시작 시점 하나만 바꿔도 이야기가 달라집니다.
| 보는 구간 | 시작과 끝의 차이 | 연간 변화율 |
|---|---|---|
| 전체 | ||
| 앞 | ||
| 가운데 | ||
| 뒤 |
같은 자료인데 어느 토막을 보이느냐로 오름과 내림이 갈립니다. 가운데 만 보이면 연 씩 오르는 자료가 됩니다.
그래서 시작과 끝이 왜 그 시점인지를 물어야 합니다. 자료가 있는 전체 기간을 보여 주지 않았다면 이유가 있어야 합니다.
이 문제에서 배우는 것. 범위를 고르는 것은 그림을 조작하지 않고도 결론을 바꾸는 방법입니다. 축을 자르면 그림에 흔적이 남는데, 범위를 고르는 것은 흔적이 없습니다. 그리고 이것은 171강 문제 5의 다중성과 같은 구조입니다. 여러 구간 중 하나를 고르는 것이 여러 검정 중 하나를 고르는 것과 같으며, 고른 횟수를 세지 않으면 우연을 발견으로 읽게 됩니다.
바로 확인 2.
확인 2-1. 검산에서 길이 인 구간을 골랐을 때 가장 가파른 기울기의 평균을 쓰세요.
답. 이며 참 추세가 인 자료에서 나온 값입니다.
확인 2-2. 짧은 구간일수록 더 가파른 것을 고를 수 있는 이유를 쓰세요.
답. 구간이 짧으면 기울기의 흔들림이 커서 극단값도 크기 때문입니다.
확인 2-3. 검산에서 같은 자료의 네 구간이 보인 변화율을 쓰세요.
답. 전체 , 앞 , 가운데 , 뒤 입니다.
문제. 무엇으로 나눠야 하는지 봅니다.
(1) 절대수와 비율을 비교하세요.
(2) 명목과 실질을 비교하세요.
(3) 쌓아 그린 그림의 문제를 계산하세요.
생각의 실마리. 167강 문제 1에서 분할표의 한 칸을 무엇으로 나누느냐에 따라 세 가지 비율이 나온다고 했습니다. 그림에서도 같은 물음이 있습니다.
풀이. (1) 인구가 다른 세 지역입니다.
| 지역 | 인구 | 건수 | 만 명당 | 건수 순위 |
|---|---|---|---|---|
| 가 | ||||
| 나 | ||||
| 다 |
만 명당 순위는 가 위, 나 위, 다 위입니다.
건수로는 가 지역이 위인데 비율로는 꼴찌입니다. 순위가 완전히 뒤집힙니다.
지도에 건수를 칠하면 인구 지도가 됩니다. 168강 심화 4에서 본 그대로입니다.
(2) 금액은 물가를 빼야 견줄 수 있습니다.
| 연도 | 명목 | 물가지수 | 실질 |
|---|---|---|---|
명목은 년에 퍼센트 올랐는데 실질은 퍼센트뿐입니다.
연 퍼센트 오르는 값과 연 퍼센트 오르는 물가라 실제 차이는 연 퍼센트인데, 명목만 보이면 큰 성장으로 보입니다.
(3) 쌓아 그린 그림을 봅니다. 세 계열을 쌓았고 셋째 계열은 일정하게 오르는 값입니다.
| 계열 | 자기 표준편차 | 바닥선의 표준편차 | 신호 대 바닥 |
|---|---|---|---|
| 첫째 | 바닥이 | ||
| 둘째 | |||
| 셋째 |
셋째 계열은 자기 변화보다 바닥선의 출렁임이 배 큽니다.
일정하게 오르는 값인데 위아래로 출렁이는 것처럼 보입니다. 읽는 사람은 위 계열의 두께를 봐야 하는데, 눈은 위 가장자리의 높이를 봅니다.
168강 문제 1의 정확도 순위에서 공통 바닥선이 위인 이유가 이것입니다. 바닥이 움직이면 길이를 읽는 것이 훨씬 어려워집니다.
이 문제에서 배우는 것. 그림이 정직해도 기준이 틀리면 결론이 틀립니다. 그리고 기준을 고르는 것은 자료를 봐야 알 수 있습니다. 그림 안에는 인구가 얼마인지, 물가가 얼마나 올랐는지, 쌓인 계열의 바닥이 어떻게 움직이는지가 적혀 있지 않습니다. 그래서 진단의 넷째 걸음부터는 그림 밖으로 나가야 합니다.
바로 확인 3.
확인 3-1. 검산에서 건수 순위와 비율 순위를 쓰세요.
답. 건수는 가, 나, 다 순인데 만 명당은 다, 나, 가 순으로 완전히 뒤집힙니다.
확인 3-2. 검산에서 명목과 실질의 년 상승률을 쓰세요.
답. 퍼센트와 퍼센트입니다.
확인 3-3. 쌓아 그린 그림에서 위 계열이 읽기 어려운 이유를 쓰세요.
답. 바닥선이 움직여 검산에서 자기 변화보다 배 크게 출렁이기 때문입니다.
문제. 빠진 자료를 찾습니다.
(1) 살아남은 것만 봤을 때의 차이를 구하세요.
(2) 분모가 빠진 그림의 유형을 정리하세요.
(3) 보여 주지 않은 그림의 효과를 계산하세요.
생각의 실마리. 지금까지는 그림에 있는 것을 의심했습니다. 그런데 그림에 없는 것이 더 큰 문제일 수 있습니다. 없는 것은 보이지 않으므로 의심할 계기조차 없습니다.
풀이. (1) 펀드 개를 년 돌리고 누적이 절반 아래로 가면 닫습니다.
| 무엇을 보는가 | 개수 | 연평균 수익률 |
|---|---|---|
| 모든 펀드 | ||
| 살아남은 펀드만 |
살아남은 것만 보면 연 만큼 높게 나옵니다. 년이면 누적으로 퍼센트 가까운 차이입니다.
닫힌 펀드는 목록에서 사라지므로 그림에 아예 없습니다. 자료를 모을 때 "현재 운용 중인 펀드"를 받으면 자동으로 이렇게 됩니다.
(2) 분모가 빠진 그림도 같은 문제입니다.
| 그림이 보이는 것 | 빠진 분모 |
|---|---|
| 합격자의 특징 | 지원자 전체의 특징 |
| 사고 난 기계의 이력 | 사고 안 난 기계의 이력 |
| 성공한 회사의 습관 | 같은 습관으로 망한 회사 |
| 응답자의 의견 | 응답하지 않은 사람의 의견 |
166강 문제 4의 버크슨과 같은 뿌리입니다. 걸러 낸 자료만 보고 있으며, 거른 조건이 두 변수 모두와 연결되어 있으면 없던 관계가 생깁니다.
셋째 줄이 가장 흔합니다. 성공한 회사 곳이 모두 어떤 습관을 가졌다는 것은, 같은 습관을 가지고 망한 회사가 몇 곳인지 모르면 아무 뜻이 없습니다.
(3) 보여 주지 않은 그림도 세어야 합니다.
무관한 변수 개 중 가장 상관이 큰 하나만 그리면, 그 상관의 평균이 이고 최댓값이 입니다.
한 장만 보면 관계가 있어 보입니다. 산점도에 점들이 뚜렷한 기울기로 늘어서 있고, 그 기울기가 우연이라는 표시는 그림 어디에도 없습니다.
171강 문제 5가 그림으로 나타난 것입니다. 눈으로 훑어 고른 것도 검정한 것과 같습니다.
이 문제에서 배우는 것. 그림은 자기가 무엇을 빼놓았는지 말하지 않습니다. 그리고 빼놓은 것이 자료를 모으는 단계에서 이미 빠졌다면 분석자도 모릅니다. 그래서 이 부분의 진단은 그림이 아니라 자료가 어떻게 만들어졌는지를 묻는 것이며, 04단원 전체가 그 물음을 다룹니다. 표본이 어떻게 뽑혔는지가 답할 수 있는 질문의 범위를 정합니다.
바로 확인 4.
확인 4-1. 검산에서 생존 편향의 크기를 쓰세요.
답. 살아남은 펀드만 보면 연평균 수익률이 에서 으로 높아집니다.
확인 4-2. 분모가 빠진 그림의 예를 하나 쓰세요.
답. 성공한 회사의 습관만 보이고 같은 습관으로 망한 회사를 안 보이는 경우입니다.
확인 4-3. 검산에서 무관한 변수 개 중 최대 상관의 평균을 쓰세요.
답. 이며 그 하나만 그리면 관계가 있어 보입니다.
문제. 진단을 절차로 만듭니다.
(1) 이 단원에서 잰 왜곡의 크기를 모으세요.
(2) 묻는 순서를 정하세요.
(3) 고칠 수 있는 것과 없는 것을 가르세요.
생각의 실마리. 확인할 것이 많으므로 큰 것부터 보는 것이 효율적입니다. 그러려면 각 조작이 얼마나 크게 왜곡하는지 알아야 합니다.
풀이. (1) 이 단원에서 잰 왜곡을 한자리에 모읍니다.
| 조작 | 왜곡의 크기 | 어디서 |
|---|---|---|
| 막대 축을 로 자름 | 배 | 168강 문제 3 |
| 동그라미 반지름을 값에 비례 | 배 | 168강 문제 1 |
| 배 차이를 밝기로 표현 | 배로 축소 | 168강 문제 2 |
| 무지개 색표 | 밝기 번 뒤집힘 | 168강 문제 4 |
| 빨강 초록으로 구분 | 배로 축소 | 168강 문제 4 |
| 히스토그램 시작점 이동 | 봉우리 개와 개 | 169강 문제 1 |
| 좁은 대역폭으로 선 얹기 | 표준편차의 배 | 170강 문제 3 |
| 좁은 범위의 로그로그 | 170강 문제 4 | |
| 집단을 안 나눔 | 기울기 부호 반전 | 170강 문제 5 |
| 설명 비율만 보고 축소 | 군집 분의 | 171강 문제 4 |
| 가장 눈에 띈 것만 보임 | 상관 | 171강 문제 5 |
축과 인코딩이 가장 크게 왜곡합니다. 그래서 그것부터 확인합니다.
(2) 그림을 볼 때 순서대로 묻습니다.
| 순서 | 무엇을 묻는가 |
|---|---|
| 세로축의 아래끝이 인가 | |
| 축이 몇 개이고 눈금이 고른가 | |
| 값이 어떤 성질에 실렸는가 | |
| 분모가 무엇이고 왜 그것인가 | |
| 이 범위를 왜 골랐는가 | |
| 빠진 자료는 무엇인가 | |
| 보여 주지 않은 그림이 몇 장인가 |
앞의 셋은 그림만 보면 알 수 있고 뒤의 넷은 물어봐야 압니다.
(3) 고칠 수 있는 것과 없는 것을 가릅니다.
| 고칠 수 있는가 | 무엇이 그런가 |
|---|---|
| 고칠 수 있음 | 축, 인코딩, 색, 대역폭 |
| 자료를 봐야 함 | 범위 고르기, 분모, 집단 |
| 알 수 없음 | 빠진 자료, 안 보여 준 그림 |
첫째 줄은 다시 그리면 됩니다. 축을 부터 그리고, 반지름 대신 넓이를 맞추고, 색표를 바꾸면 왜곡이 사라집니다.
둘째 줄은 원자료가 있어야 합니다. 다른 범위로 그려 보고, 분모를 바꿔 보고, 집단을 나눠 봐야 합니다.
셋째 줄이 가장 위험합니다. 그림 안에 흔적이 남지 않으므로, 그린 사람에게 묻는 것 말고 방법이 없습니다.
이 문제에서 배우는 것. 그림을 의심하는 것은 그리는 사람을 의심하는 것이 아닙니다. 이 단원에서 본 왜곡의 대부분은 의도 없이 도구의 기본값으로 생깁니다. 히스토그램의 시작점은 아무도 고르지 않고, 무지개 색표는 오랫동안 기본값이었으며, 이중 축은 편해서 씁니다. 그래서 진단은 비난이 아니라 절차이며, 자기 그림에도 같은 순서로 적용해야 합니다. 가장 자주 속는 사람은 그린 사람 자신입니다.
바로 확인 5.
확인 5-1. 이 단원에서 가장 큰 왜곡 둘을 쓰세요.
답. 동그라미 반지름을 값에 비례시키는 배와 축 자르기의 배입니다.
확인 5-2. 그림만 보고 알 수 있는 것과 물어봐야 아는 것을 나누세요.
답. 축과 인코딩과 척도는 보면 알고 분모와 범위와 빠진 자료는 물어봐야 압니다.
확인 5-3. 진단이 비난이 아니라 절차인 이유를 쓰세요.
답. 왜곡의 대부분이 의도 없이 도구의 기본값으로 생기기 때문입니다.
| 진단 순서 | 확인할 것 | 어기면 |
|---|---|---|
| 세로축의 아래끝 | 부풀림에 한계가 없습니다 | |
| 축의 개수와 눈금 | 얽힘을 마음대로 정합니다 | |
| 값이 실린 성질 | 넓이면 제곱으로 왜곡됩니다 | |
| 분모 | 순위가 뒤집힙니다 | |
| 범위 | 없는 추세가 생깁니다 | |
| 빠진 자료 | 생존 편향이 생깁니다 | |
| 안 보여 준 그림 | 우연을 발견으로 읽습니다 |
| 조작 | 흔적이 남는가 |
|---|---|
| 축 자르기 | 남습니다. 눈금을 보면 압니다 |
| 이중 축 | 남습니다. 축이 둘입니다 |
| 반지름 인코딩 | 남습니다. 범례를 보면 압니다 |
| 범위 고르기 | 안 남습니다 |
| 생존 편향 | 안 남습니다 |
| 여러 장 중 하나 | 안 남습니다 |
| 자주 하는 실수 | 바로잡기 |
|---|---|
| 막대 축의 아래끝을 안 봅니다 | 가장 큰 왜곡이 거기 있습니다 |
| 이중 축의 눈금을 믿습니다 | 확인할 근거가 그림에 없습니다 |
| 절대수를 지도에 칠합니다 | 인구 지도가 됩니다 |
| 명목 금액을 그대로 견줍니다 | 물가를 빼야 합니다 |
| 쌓은 그림에서 위 계열을 읽습니다 | 바닥이 움직입니다 |
| 살아남은 것만 봅니다 | 사라진 것이 그림에 없습니다 |
| 한 장만 보고 판단합니다 | 몇 장 중 하나인지 물어야 합니다 |
문제 6. 검산에서 아래끝을 로 잘랐을 때 부풀린 배수를 쓰세요.
답. 배입니다.
문제 7. 두 축을 쓰는 그림에서 분석자가 정할 수 있는 것을 쓰세요.
답. 두 선이 놓이는 띠와 교차 횟수이며 검산에서 번과 번 사이를 오갔습니다.
문제 8. 축을 뒤집으면 무엇이 달라지는지 검산 값으로 쓰세요.
답. 상관이 에서 로 보입니다.
문제 9. 검산에서 길이 인 구간을 골랐을 때 가장 가파른 기울기를 쓰세요.
답. 평균 이며 참 추세는 입니다.
문제 10. 짧은 구간일수록 더 가파른 것을 고를 수 있는 이유를 쓰세요.
답. 구간이 짧으면 기울기의 흔들림이 커서 극단값도 크기 때문입니다.
문제 11. 검산에서 같은 자료의 네 구간이 보인 변화율을 쓰세요.
답. 전체 , 앞 , 가운데 , 뒤 입니다.
문제 12. 검산에서 건수 순위와 만 명당 순위를 쓰세요.
답. 가, 나, 다 순에서 다, 나, 가 순으로 완전히 뒤집힙니다.
문제 13. 검산에서 명목과 실질의 년 상승률을 쓰세요.
답. 퍼센트와 퍼센트입니다.
문제 14. 쌓아 그린 그림에서 위 계열이 읽기 어려운 이유를 검산 값과 함께 쓰세요.
답. 바닥선의 출렁임이 자기 변화의 배이기 때문입니다.
문제 15. 검산에서 생존 편향의 크기를 쓰세요.
답. 연평균 수익률이 에서 으로 높아집니다.
문제 16. 분모가 빠진 그림의 예를 둘 쓰세요.
답. 성공한 회사의 습관과 응답자의 의견입니다.
문제 17. 검산에서 무관한 변수 개 중 최대 상관의 평균과 최댓값을 쓰세요.
답. 과 입니다.
문제 18. 흔적이 남지 않는 조작 셋을 쓰세요.
답. 범위 고르기, 생존 편향, 여러 장 중 하나만 보이기입니다.
심화 1. 그림에서 값을 되돌리는 법을 정리하세요.
진단의 마지막 수단은 그림에서 숫자를 복원하는 것입니다.
| 그림 | 복원 방법 |
|---|---|
| 막대 | 길이의 비와 축 눈금으로 값을 냅니다 |
| 선 | 격자와 눈금으로 좌표를 읽습니다 |
| 원 | 넓이인지 반지름인지 먼저 정합니다 |
| 쌓은 그림 | 위 가장자리의 차로 각 계열을 냅니다 |
셋째 줄이 어렵습니다. 범례에 적혀 있지 않으면 두 해석 중 어느 것인지 알 수 없고, 168강 문제 1에서 본 대로 값이 제곱만큼 달라집니다.
복원한 값으로 할 수 있는 것이 많습니다. 다른 축으로 다시 그려 보고, 분모를 바꿔 보고, 범위를 넓혀 보면 원래 그림이 무엇을 감췄는지 드러납니다.
그런데 복원의 정확도에도 한계가 있습니다. 168강 문제 2에서 본 채널별 정확도가 그대로 적용되어, 색으로 그린 값은 복원할 수 없습니다.
그래서 자료를 함께 공개하는 것이 가장 좋은 답입니다. 그림은 주장이고 자료는 근거입니다.
심화 2. 통계 조작의 오래된 목록을 정리하세요.
그림 밖에서도 같은 일이 일어납니다.
| 방법 | 내용 |
|---|---|
| 평균의 종류 바꾸기 | 산술과 중앙값 중 유리한 쪽 |
| 기준 연도 바꾸기 | 낮은 해를 기준으로 삼기 |
| 단위 바꾸기 | 퍼센트와 퍼센트포인트 섞기 |
| 반올림 위치 | 를 올려 큰 수 만들기 |
| 표본 바꾸기 | 유리한 집단만 세기 |
셋째 줄이 자주 나옵니다. 지지율이 퍼센트에서 퍼센트가 되면 퍼센트포인트 오른 것이고 퍼센트 오른 것인데, 둘 다 사실이라 큰 쪽을 골라 쓸 수 있습니다.
163강 문제 5가 여기에 걸립니다. 평균 속도를 산술평균으로 내면 언제나 실제보다 큽니다. 산술이 셋 중 가장 크므로 유리한 쪽이 정해져 있습니다.
모든 항목이 "거짓말이 아니다"는 공통점을 가집니다. 각각은 정확한 계산이며, 고르는 것이 조작입니다. 그래서 반박하려면 다른 계산도 함께 보여 주는 것 말고 방법이 없습니다.
심화 3. 자기 그림을 진단하는 법을 정리하세요.
가장 자주 속는 사람은 그린 사람 자신입니다. 자기 그림을 검사하는 방법이 필요합니다.
| 방법 | 내용 |
|---|---|
| 반대 결론으로 그려 보기 | 같은 자료로 반대 이야기를 만들어 봅니다 |
| 기본값 바꿔 보기 | 폭, 시작점, 범위, 색표를 흔들어 봅니다 |
| 남에게 먼저 보이기 | 설명 없이 무엇으로 읽는지 봅니다 |
| 자료를 함께 두기 | 그림과 표를 같이 놓습니다 |
첫째 줄이 가장 강력합니다. 같은 자료로 반대 결론의 그림을 만들 수 있다면, 그 그림은 자료가 아니라 선택을 보여 주고 있는 것입니다.
셋째 줄이 가장 자주 빠집니다. 그린 사람은 자료를 알고 보므로 의도한 대로 읽히는지 판단할 수 없습니다. 설명 없이 보여 주고 무엇이 보이는지 물어야 합니다.
162강 심화 5의 민감도 분석과 같은 발상입니다. 선택을 흔들어 결과가 흔들리는지 보는 것이며, 흔들린다면 그것 자체가 결과입니다.
심화 4. 애니메이션과 상호작용의 진단을 정리하세요.
168강 심화 5에서 시간을 축으로 쓰면 비교가 어려워진다고 했습니다. 진단은 더 어렵습니다.
| 문제 | 내용 |
|---|---|
| 되돌려 볼 수 없음 | 지나간 장면을 다시 보기 어렵습니다 |
| 축이 바뀜 | 장면마다 축이 다시 맞춰질 수 있습니다 |
| 속도 | 빠르면 확인할 시간이 없습니다 |
| 처음 화면 | 조작하지 않으면 그것만 봅니다 |
둘째 줄이 조용한 문제입니다. 장면마다 축을 다시 맞추면 모든 장면이 화면을 가득 채워 변화가 안 보이거나 과장됩니다.
상호작용에는 다른 문제가 있습니다. 기본 화면이 무엇을 보이는지가 사실상 전부이며, 읽는 사람의 대부분은 조작하지 않습니다. 그래서 "필터를 바꾸면 다른 그림도 볼 수 있다"는 것은 변명이 되지 못합니다.
정적인 그림으로 옮겨 보는 것이 진단 방법입니다. 핵심 장면 몇 개를 작은 배수로 늘어놓으면 감춰진 것이 드러납니다.
심화 5. 좋은 그림의 조건을 정리하세요.
진단만 하면 그림을 못 그리게 됩니다. 반대쪽도 정리합니다.
| 조건 | 내용 |
|---|---|
| 답할 질문이 하나 | 그림 하나에 메시지 하나 |
| 비교가 정해져 있음 | 무엇과 무엇을 견주는지 분명함 |
| 채널이 알맞음 | 중요한 값이 정확한 채널에 |
| 맥락이 있음 | 기준선, 이전 값, 다른 집단 |
| 불확실성이 보임 | 신뢰띠나 표본 크기 |
둘째 줄이 가장 자주 빠집니다. 값 하나를 크게 보여 주는 그림은 무엇과 견주는지가 없어 크다는 것인지 작다는 것인지 알 수 없습니다.
다섯째 줄은 이 단원 전체가 요구한 것입니다. 165강의 극단 분위수, 169강의 양끝 순서통계량, 170강의 국소 회귀가 전부 불확실성을 함께 보이지 않으면 오독된다고 했습니다.
그리고 조건을 다 지켜도 요약이라는 사실은 남습니다. 02단원과 03단원이 함께 도달한 결론이며, 그림은 자료가 아니라 자료에 대한 주장입니다.
심화 6. 이 강의가 어디에 쓰이는지 정리하세요.
| 분야 | 쓰임 | 이어지는 강의 |
|---|---|---|
| 조사 설계 | 표본이 어떻게 뽑혔는지 | 173강 |
| 응답 편향 | 응답하지 않은 사람 | 176강 |
| 관측 자료 | 빠진 집단과 교란 | 177강 |
| 모형 보고 | 성능 그림의 진단 | S9 |
앞의 셋이 04단원입니다. 문제 4에서 그림에 없는 것을 물어야 한다고 했는데, 없는 것이 왜 없는지는 자료를 모은 방식이 정합니다. 04단원 전체가 그 물음입니다.
넷째 줄이 실무에서 매일 나옵니다. 모형의 성능 그림에도 같은 조작이 전부 가능합니다. 축을 잘라 개선을 크게 보이고, 유리한 구간만 보이고, 여러 실험 중 가장 좋은 하나만 보입니다. 진단의 순서가 그대로 적용됩니다.
정답.
| 기호 | 읽는 법 | 뜻 |
|---|---|---|
| 축 자르기 | truncated axis | 아래끝을 이 아닌 곳에 둡니다 |
| 이중 축 | dual axis | 한 판에 두 세로축을 씁니다 |
| 체리 피킹 | cherry picking | 유리한 범위만 골라 보입니다 |
| 생존 편향 | survivorship bias | 살아남은 것만 자료에 남습니다 |
| 빠진 분모 | missing denominator | 걸러 낸 쪽만 보입니다 |
| 명목과 실질 | nominal and real | 물가를 뺐는지의 차이입니다 |
| 퍼센트포인트 | percentage point | 비율의 차이입니다 |
| 쌓은 그림 | stacked chart | 계열을 위로 쌓습니다 |
| 공통 바닥선 | common baseline | 모두 같은 곳에서 시작합니다 |
| 자료 복원 | data extraction | 그림에서 값을 되돌립니다 |
| 민감도 분석 | sensitivity analysis | 선택을 흔들어 결과를 봅니다 |
| 사전 등록 | preregistration | 볼 것을 미리 정합니다 |
| 작은 배수 | small multiples | 같은 축의 작은 판들입니다 |
| 신뢰띠 | confidence band | 불확실성을 폭으로 보입니다 |
| 진단 절차 | diagnostic checklist | 순서대로 확인할 목록입니다 |
여기서 03단원 탐색과 시각화가 끝납니다. 168강에서 문법을 세우고, 169강에서 분포를, 170강에서 관계를, 171강에서 여러 변수를 그리고, 172강에서 그것을 뒤집어 진단했습니다.
02단원과 03단원이 함께 하나의 결론에 닿습니다.
02단원이 요약값이 같아도 자료는 다를 수 있다고 했고, 03단원이 그림도 요약이라 같은 일이 일어난다고 했습니다. 그림이 요약보다 많이 보여 주지만, 여전히 고른 것만 보여 줍니다.
다음은 04단원 표본과 조사 설계입니다. 여기까지가 주어진 자료로 무엇을 할 수 있는가였고, 다음은 그 자료가 어떻게 만들어졌는가를 묻습니다.
172강 문제 4가 그 문을 엽니다. 그림에 없는 것을 물어야 한다고 했는데, 없는 것이 왜 없는지는 자료를 모은 방식이 정합니다. 173강이 표본을 뽑는 방법부터 시작해, 177강에서 관측 자료로는 답할 수 없는 질문이 무엇인지로 단원을 맺습니다.
import numpy as np
rng = np.random.default_rng(20260909)
def pw(s, n):
k = n - sum(2 if ord(c) > 0x2FFF else 1 for c in str(s))
return str(s) + " " * max(k, 0)
def rw(s, n):
k = n - sum(2 if ord(c) > 0x2FFF else 1 for c in str(s))
return " " * max(k, 0) + str(s)
def pear(a, b):
return float(np.corrcoef(a, b)[0, 1])
# --- 문제 1: 축을 어떻게 조작하는가 -------------------------------------
print(" 168강 문제 3 의 축 자르기를 진단 쪽에서 다시 봅니다")
a1 = np.array([96.0, 98.0, 100.0])
print(" %s %s %s %s" % (pw("축의 아래끝", 12), rw("길이의 비", 12),
rw("값의 비", 12), rw("부풀린 배수", 14)))
for lo in [0.0, 95.5, 95.9, 95.99]:
L = a1 - lo
print(" %s %12.4f %12.4f %14.4f"
% (pw("%.2f" % lo, 12), L[2] / L[0], a1[2] / a1[0],
(L[2] / L[0]) / (a1[2] / a1[0])))
print(" 아래끝을 값에 가깝게 붙일수록 부풀림에 한계가 없습니다")
print(" 그래서 막대그림을 볼 때 가장 먼저 세로축의 아래끝을 봅니다")
print(" 두 축을 쓰는 그림은 눈금을 정하는 규칙이 없습니다")
T = 60
u1 = np.cumsum(rng.normal(0, 1, T)) + 50.0
u2 = np.cumsum(rng.normal(0, 1, T)) + 20.0
print(" 서로 독립인 두 계열을 만들었습니다. 상관은 %.6f 입니다" % pear(u1, u2))
b = np.polyfit(u2, u1, 1)
u2t = b[0] * u2 + b[1]
rngv = float(u1.max() - u1.min())
print(" 둘째 축의 눈금을 %.4f 배 하고 %.4f 를 더하면 같은 띠에 놓입니다"
% (b[0], b[1]))
print(" 상관이 없으므로 아무리 맞춰도 평균 간격이 첫째 계열 높이의 %.4f 배로 남습니다"
% float(np.abs(u1 - u2t).mean() / rngv))
print(" 눈금은 못 만들어 내지만 두 선이 얼마나 얽혀 보이는지는 정할 수 있습니다")
print(" %s %s %s" % (pw("둘째 축을 올리는 양", 22), rw("두 선의 교차 횟수", 18),
rw("평균 간격", 14)))
for off in [-12.0, -5.0, 0.0, 5.0, 12.0]:
z = u2t + off
cr = int((np.diff(np.sign(u1 - z)) != 0).sum())
print(" %s %18d %14.4f"
% (pw("%.1f" % off, 22), cr, float(np.abs(u1 - z).mean() / rngv)))
print(" 올리는 양 하나로 교차가 없다가 여러 번 얽히게 만들 수 있습니다")
print(" 읽는 사람은 두 축의 눈금을 확인할 방법이 없습니다")
print(" 축을 뒤집으면 부호가 뒤집혀 보입니다")
v1 = rng.normal(0, 1, 200)
v2 = -0.7 * v1 + np.sqrt(1 - 0.49) * rng.normal(0, 1, 200)
print(" %s %s" % (pw("어떻게 그리는가", 26), rw("보이는 관계", 16)))
print(" %s %16.6f" % (pw("둘 다 보통 방향", 26), pear(v1, v2)))
print(" %s %16.6f" % (pw("세로축을 뒤집으면", 26), pear(v1, -v2)))
print(" 값은 그대로인데 부호가 반대로 보입니다. 축 방향을 확인해야 합니다")
print(" 진단은 세 가지를 보는 것으로 시작합니다")
print(" %s %s" % (pw("확인할 것", 20), rw("무엇을 의심하는가", 28)))
for a, b2 in [("세로축의 아래끝", "막대인데 0 이 아니면 부풀림입니다"),
("축이 몇 개인가", "둘이면 눈금을 맞춘 것입니다"),
("축의 방향", "뒤집혀 있으면 부호가 반대입니다"),
("눈금 간격", "고르지 않으면 로그이거나 조작입니다")]:
print(" %s %s" % (pw(a, 20), rw(b2, 28)))
# --- 문제 2: 범위를 골라 추세를 만드는 법 -------------------------------
print(" 추세가 전혀 없는 자료에서 원하는 추세를 골라낼 수 있습니다")
N2 = 400
M2 = 2000
print(" 길이 %d 인 무작위 걸음입니다. 참 추세는 0 입니다" % N2)
print(" %s %s %s %s" % (pw("고르는 구간 길이", 16), rw("기울기가 양수일 확률", 22),
rw("가장 가파른 기울기 평균", 26), rw("전체 기울기 평균", 20)))
for L in [20, 50, 100, 200]:
best = np.empty(M2)
pos = np.empty(M2)
full = np.empty(M2)
for m in range(M2):
w = np.cumsum(rng.normal(0, 1, N2))
sl = []
for s0 in range(0, N2 - L, max(L // 4, 1)):
seg = w[s0:s0 + L]
sl.append(float(np.polyfit(np.arange(L), seg, 1)[0]))
sl = np.array(sl)
best[m] = sl.max()
pos[m] = float((sl > 0).mean())
full[m] = float(np.polyfit(np.arange(N2), w, 1)[0])
print(" %s %22.6f %26.6f %20.6f"
% (pw(str(L), 16), float(pos.mean()), float(best.mean()), float(full.mean())))
print(" 전체 기울기의 평균은 0 인데 가장 가파른 구간을 고르면 언제나 양수입니다")
print(" 구간이 짧을수록 더 가파른 것을 고를 수 있습니다")
print(" 시작 시점 하나만 바꿔도 이야기가 달라집니다")
w2 = np.cumsum(rng.normal(0, 1, N2)) + 100.0
print(" %s %s %s" % (pw("보는 구간", 22), rw("시작과 끝의 차이", 20),
rw("연간 변화율", 16)))
for s0, e0, nm in [(0, N2, "전체"), (0, 100, "앞 100"), (100, 200, "가운데 100"),
(N2 - 100, N2, "뒤 100")]:
d = w2[e0 - 1] - w2[s0]
print(" %s %20.4f %16.6f"
% (pw(nm, 22), d, d / (e0 - s0)))
print(" 같은 자료인데 어느 토막을 보이느냐로 오름과 내림이 갈립니다")
print(" 그래서 시작과 끝이 왜 그 시점인지를 물어야 합니다")
# --- 문제 3: 비교의 기준이 맞는가 ---------------------------------------
print(" 절대수와 비율은 다른 이야기를 합니다")
reg = [("가", 1000000.0, 520.0), ("나", 200000.0, 160.0), ("다", 50000.0, 55.0)]
print(" %s %s %s %s %s" % (pw("지역", 8), rw("인구", 12), rw("건수", 10),
rw("10 만 명당", 14), rw("건수 순위", 12)))
rate = [(nm, p, c, c / p * 100000) for nm, p, c in reg]
ordc = {nm: i + 1 for i, (nm, p, c, r) in
enumerate(sorted(rate, key=lambda z: -z[2]))}
ordr = {nm: i + 1 for i, (nm, p, c, r) in
enumerate(sorted(rate, key=lambda z: -z[3]))}
for nm, p, c, r in rate:
print(" %s %12.0f %10.0f %14.4f %12d" % (pw(nm, 8), p, c, r, ordc[nm]))
print(" %s %s" % (pw("10 만 명당 순위", 20),
rw(", ".join("%s %d" % (nm, ordr[nm]) for nm, _, _, _ in rate), 24)))
print(" 건수로는 가 지역이 1 위인데 비율로는 꼴찌입니다. 순위가 완전히 뒤집힙니다")
print(" 금액은 물가를 빼야 견줄 수 있습니다")
yrs = np.arange(2015, 2026)
nom = 100.0 * (1.04 ** (yrs - 2015))
cpi = 100.0 * (1.035 ** (yrs - 2015))
real = nom / cpi * 100.0
print(" %s %s %s %s" % (pw("연도", 8), rw("명목", 12), rw("물가지수", 12),
rw("실질", 12)))
for i in [0, 5, 10]:
print(" %s %12.4f %12.4f %12.4f" % (pw(str(int(yrs[i])), 8), nom[i], cpi[i], real[i]))
print(" 명목은 10 년에 %.2f 퍼센트 올랐는데 실질은 %.2f 퍼센트뿐입니다"
% ((nom[-1] / nom[0] - 1) * 100, (real[-1] / real[0] - 1) * 100))
print(" 쌓아 그린 그림은 아래 계열만 읽기 쉽습니다")
T3 = 200
s1 = 10 + np.cumsum(rng.normal(0, 0.5, T3))
s2 = 10 + np.cumsum(rng.normal(0, 0.5, T3))
s3 = 10 + 0.02 * np.arange(T3)
print(" 세 계열을 쌓습니다. 셋째 계열은 일정하게 오르는 값입니다")
print(" %s %s %s %s" % (pw("계열", 12), rw("자기 표준편차", 14),
rw("바닥선의 표준편차", 18), rw("신호 대 바닥", 14)))
base = [np.zeros(T3), s1, s1 + s2]
for i, (nm, v) in enumerate([("첫째", s1), ("둘째", s2), ("셋째", s3)]):
bs = float(base[i].std())
print(" %s %14.4f %18.4f %s"
% (pw(nm, 12), float(v.std()), bs,
rw("바닥이 0", 14) if bs == 0 else "%14.4f" % (float(v.std()) / bs)))
print(" 셋째 계열은 자기 변화보다 바닥선의 출렁임이 %.1f 배 큽니다"
% (float(base[2].std()) / float(s3.std())))
print(" 일정하게 오르는 값인데 위아래로 출렁이는 것처럼 보입니다")
print(" 168강 문제 1 의 정확도 순위에서 공통 바닥선이 1 위인 이유입니다")
# --- 문제 4: 그림에 없는 것을 어떻게 아는가 -----------------------------
print(" 살아남은 것만 그리면 성적이 저절로 좋아집니다")
n4, Y4 = 4000, 10
r4 = rng.normal(0.05, 0.20, (n4, Y4))
cum = np.cumprod(1 + r4, axis=1)
alive = np.ones(n4, dtype=bool)
for y in range(Y4):
alive &= cum[:, y] > 0.5
print(" 펀드 %d 개를 %d 년 돌리고 누적이 절반 아래로 가면 닫습니다" % (n4, Y4))
print(" %s %s %s" % (pw("무엇을 보는가", 24), rw("개수", 10), rw("연평균 수익률", 16)))
allr = float(np.exp(np.log(cum[:, -1]).mean() / Y4) - 1)
alv = float(np.exp(np.log(cum[alive, -1]).mean() / Y4) - 1)
print(" %s %10d %16.6f" % (pw("모든 펀드", 24), n4, allr))
print(" %s %10d %16.6f" % (pw("살아남은 펀드만", 24), int(alive.sum()), alv))
print(" 살아남은 것만 보면 연 %.4f 만큼 높게 나옵니다" % (alv - allr))
print(" 닫힌 펀드는 목록에서 사라지므로 그림에 아예 없습니다")
print(" 분모가 안 보이는 그림도 같은 문제입니다")
print(" %s %s" % (pw("그림이 보이는 것", 22), rw("빠진 분모", 26)))
for a, b2 in [("합격자의 특징", "지원자 전체의 특징"),
("사고 난 기계의 이력", "사고 안 난 기계의 이력"),
("성공한 회사의 습관", "같은 습관으로 망한 회사"),
("응답자의 의견", "응답하지 않은 사람의 의견")]:
print(" %s %s" % (pw(a, 22), rw(b2, 26)))
print(" 166강 문제 4 의 버크슨과 같은 뿌리입니다. 걸러 낸 자료만 보고 있습니다")
print(" 보여 주지 않은 그림이 몇 장인지도 물어야 합니다")
P4 = 200
sig = np.empty(1000)
for t in range(1000):
Xr = rng.normal(0, 1, (100, P4))
yr = rng.normal(0, 1, 100)
Xz = (Xr - Xr.mean(0)) / Xr.std(0)
yz = (yr - yr.mean()) / yr.std()
r = (Xz * yz[:, None]).mean(0)
sig[t] = float(np.abs(r).max())
print(" 무관한 변수 %d 개 중 가장 상관이 큰 하나만 그리면" % P4)
print(" 그 상관의 평균이 %.4f 이고 최댓값이 %.4f 입니다"
% (float(sig.mean()), float(sig.max())))
print(" 한 장만 보면 관계가 있어 보입니다. 171강 문제 5 가 그림으로 나타난 것입니다")
# --- 문제 5: 진단 절차 --------------------------------------------------
print(" 이 단원에서 잰 왜곡의 크기를 한자리에 모읍니다")
print(" %s %s %s" % (pw("조작", 26), rw("왜곡의 크기", 16), rw("어디서", 12)))
rows = [("막대 축을 95.5 로 자름", "8.64 배", "168강 문제 3"),
("동그라미 반지름을 값에 비례", "16 배", "168강 문제 1"),
("10 배 차이를 밝기로 표현", "3.16 배로 축소", "168강 문제 2"),
("무지개 색표", "밝기 3 번 뒤집힘", "168강 문제 4"),
("빨강 초록으로 구분", "0.56 배로 축소", "168강 문제 4"),
("히스토그램 시작점 이동", "봉우리 1 개와 2 개", "169강 문제 1"),
("좁은 대역폭으로 선 얹기", "표준편차의 0.86 배", "170강 문제 3"),
("좁은 범위의 로그로그", "R^2 0.9923", "170강 문제 4"),
("집단을 안 나눔", "기울기 부호 반전", "170강 문제 5"),
("설명 비율만 보고 축소", "군집 44 분의 1", "171강 문제 4"),
("가장 눈에 띈 것만 보임", "상관 0.30", "171강 문제 5")]
for a, b2, c in rows:
print(" %s %s %s" % (pw(a, 26), rw(b2, 16), rw(c, 12)))
print(" 큰 것부터 확인하면 빠릅니다. 축과 인코딩이 가장 크게 왜곡합니다")
print(" 그림을 볼 때 순서대로 묻습니다")
print(" %s %s" % (pw("순서", 8), rw("무엇을 묻는가", 40)))
for i, q in enumerate([
"세로축의 아래끝이 0 인가",
"축이 몇 개이고 눈금이 고른가",
"값이 어떤 성질에 실렸는가",
"분모가 무엇이고 왜 그것인가",
"이 범위를 왜 골랐는가",
"빠진 자료는 무엇인가",
"보여 주지 않은 그림이 몇 장인가"]):
print(" %s %s" % (pw(str(i + 1), 8), rw(q, 40)))
print(" 앞의 셋은 그림만 보면 알 수 있고 뒤의 넷은 물어봐야 압니다")
print(" 고칠 수 없는 것도 있습니다")
print(" %s %s" % (pw("고칠 수 있는가", 16), rw("무엇이 그런가", 34)))
print(" %s %s" % (pw("고칠 수 있음", 16), rw("축, 인코딩, 색, 대역폭", 34)))
print(" %s %s" % (pw("자료를 봐야 함", 16), rw("범위 고르기, 분모, 집단", 34)))
print(" %s %s" % (pw("알 수 없음", 16), rw("빠진 자료, 안 보여 준 그림", 34)))
print(" 마지막 줄이 가장 위험합니다. 그림 안에 흔적이 남지 않기 때문입니다")
# 168강 문제 3 의 축 자르기를 진단 쪽에서 다시 봅니다
# 축의 아래끝 길이의 비 값의 비 부풀린 배수
# 0.00 1.0417 1.0417 1.0000
# 95.50 9.0000 1.0417 8.6400
# 95.90 41.0000 1.0417 39.3600
# 95.99 401.0000 1.0417 384.9600
# 아래끝을 값에 가깝게 붙일수록 부풀림에 한계가 없습니다
# 그래서 막대그림을 볼 때 가장 먼저 세로축의 아래끝을 봅니다
# 두 축을 쓰는 그림은 눈금을 정하는 규칙이 없습니다
# 서로 독립인 두 계열을 만들었습니다. 상관은 0.038308 입니다
# 둘째 축의 눈금을 0.0220 배 하고 51.1026 를 더하면 같은 띠에 놓입니다
# 상관이 없으므로 아무리 맞춰도 평균 간격이 첫째 계열 높이의 0.1961 배로 남습니다
# 눈금은 못 만들어 내지만 두 선이 얼마나 얽혀 보이는지는 정할 수 있습니다
# 둘째 축을 올리는 양 두 선의 교차 횟수 평균 간격
# -12.0 0 2.2579
# -5.0 0 0.9408
# 0.0 12 0.1961
# 5.0 0 0.9408
# 12.0 0 2.2579
# 올리는 양 하나로 교차가 없다가 여러 번 얽히게 만들 수 있습니다
# 읽는 사람은 두 축의 눈금을 확인할 방법이 없습니다
# 축을 뒤집으면 부호가 뒤집혀 보입니다
# 어떻게 그리는가 보이는 관계
# 둘 다 보통 방향 -0.671480
# 세로축을 뒤집으면 0.671480
# 값은 그대로인데 부호가 반대로 보입니다. 축 방향을 확인해야 합니다
# 진단은 세 가지를 보는 것으로 시작합니다
# 확인할 것 무엇을 의심하는가
# 세로축의 아래끝 막대인데 0 이 아니면 부풀림입니다
# 축이 몇 개인가 둘이면 눈금을 맞춘 것입니다
# 축의 방향 뒤집혀 있으면 부호가 반대입니다
# 눈금 간격 고르지 않으면 로그이거나 조작입니다
# 추세가 전혀 없는 자료에서 원하는 추세를 골라낼 수 있습니다
# 길이 400 인 무작위 걸음입니다. 참 추세는 0 입니다
# 고르는 구간 길이 기울기가 양수일 확률 가장 가파른 기울기 평균 전체 기울기 평균
# 20 0.500743 0.554661 0.000878
# 50 0.503733 0.280761 0.000916
# 100 0.491125 0.144442 -0.001879
# 200 0.503500 0.054379 0.000588
# 전체 기울기의 평균은 0 인데 가장 가파른 구간을 고르면 언제나 양수입니다
# 구간이 짧을수록 더 가파른 것을 고를 수 있습니다
# 시작 시점 하나만 바꿔도 이야기가 달라집니다
# 보는 구간 시작과 끝의 차이 연간 변화율
# 전체 -8.9126 -0.022282
# 앞 100 -22.5182 -0.225182
# 가운데 100 15.7214 0.157214
# 뒤 100 -4.6736 -0.046736
# 같은 자료인데 어느 토막을 보이느냐로 오름과 내림이 갈립니다
# 그래서 시작과 끝이 왜 그 시점인지를 물어야 합니다
# 절대수와 비율은 다른 이야기를 합니다
# 지역 인구 건수 10 만 명당 건수 순위
# 가 1000000 520 52.0000 1
# 나 200000 160 80.0000 2
# 다 50000 55 110.0000 3
# 10 만 명당 순위 가 3, 나 2, 다 1
# 건수로는 가 지역이 1 위인데 비율로는 꼴찌입니다. 순위가 완전히 뒤집힙니다
# 금액은 물가를 빼야 견줄 수 있습니다
# 연도 명목 물가지수 실질
# 2015 100.0000 100.0000 100.0000
# 2020 121.6653 118.7686 102.4389
# 2025 148.0244 141.0599 104.9373
# 명목은 10 년에 48.02 퍼센트 올랐는데 실질은 4.94 퍼센트뿐입니다
# 쌓아 그린 그림은 아래 계열만 읽기 쉽습니다
# 세 계열을 쌓습니다. 셋째 계열은 일정하게 오르는 값입니다
# 계열 자기 표준편차 바닥선의 표준편차 신호 대 바닥
# 첫째 3.7596 0.0000 바닥이 0
# 둘째 5.1236 3.7596 1.3628
# 셋째 1.1547 8.6333 0.1337
# 셋째 계열은 자기 변화보다 바닥선의 출렁임이 7.5 배 큽니다
# 일정하게 오르는 값인데 위아래로 출렁이는 것처럼 보입니다
# 168강 문제 1 의 정확도 순위에서 공통 바닥선이 1 위인 이유입니다
# 살아남은 것만 그리면 성적이 저절로 좋아집니다
# 펀드 4000 개를 10 년 돌리고 누적이 절반 아래로 가면 닫습니다
# 무엇을 보는가 개수 연평균 수익률
# 모든 펀드 4000 0.030615
# 살아남은 펀드만 3524 0.044331
# 살아남은 것만 보면 연 0.0137 만큼 높게 나옵니다
# 닫힌 펀드는 목록에서 사라지므로 그림에 아예 없습니다
# 분모가 안 보이는 그림도 같은 문제입니다
# 그림이 보이는 것 빠진 분모
# 합격자의 특징 지원자 전체의 특징
# 사고 난 기계의 이력 사고 안 난 기계의 이력
# 성공한 회사의 습관 같은 습관으로 망한 회사
# 응답자의 의견 응답하지 않은 사람의 의견
# 166강 문제 4 의 버크슨과 같은 뿌리입니다. 걸러 낸 자료만 보고 있습니다
# 보여 주지 않은 그림이 몇 장인지도 물어야 합니다
# 무관한 변수 200 개 중 가장 상관이 큰 하나만 그리면
# 그 상관의 평균이 0.2938 이고 최댓값이 0.4543 입니다
# 한 장만 보면 관계가 있어 보입니다. 171강 문제 5 가 그림으로 나타난 것입니다
# 이 단원에서 잰 왜곡의 크기를 한자리에 모읍니다
# 조작 왜곡의 크기 어디서
# 막대 축을 95.5 로 자름 8.64 배 168강 문제 3
# 동그라미 반지름을 값에 비례 16 배 168강 문제 1
# 10 배 차이를 밝기로 표현 3.16 배로 축소 168강 문제 2
# 무지개 색표 밝기 3 번 뒤집힘 168강 문제 4
# 빨강 초록으로 구분 0.56 배로 축소 168강 문제 4
# 히스토그램 시작점 이동 봉우리 1 개와 2 개 169강 문제 1
# 좁은 대역폭으로 선 얹기 표준편차의 0.86 배 170강 문제 3
# 좁은 범위의 로그로그 R^2 0.9923 170강 문제 4
# 집단을 안 나눔 기울기 부호 반전 170강 문제 5
# 설명 비율만 보고 축소 군집 44 분의 1 171강 문제 4
# 가장 눈에 띈 것만 보임 상관 0.30 171강 문제 5
# 큰 것부터 확인하면 빠릅니다. 축과 인코딩이 가장 크게 왜곡합니다
# 그림을 볼 때 순서대로 묻습니다
# 순서 무엇을 묻는가
# 1 세로축의 아래끝이 0 인가
# 2 축이 몇 개이고 눈금이 고른가
# 3 값이 어떤 성질에 실렸는가
# 4 분모가 무엇이고 왜 그것인가
# 5 이 범위를 왜 골랐는가
# 6 빠진 자료는 무엇인가
# 7 보여 주지 않은 그림이 몇 장인가
# 앞의 셋은 그림만 보면 알 수 있고 뒤의 넷은 물어봐야 압니다
# 고칠 수 없는 것도 있습니다
# 고칠 수 있는가 무엇이 그런가
# 고칠 수 있음 축, 인코딩, 색, 대역폭
# 자료를 봐야 함 범위 고르기, 분모, 집단
# 알 수 없음 빠진 자료, 안 보여 준 그림
# 마지막 줄이 가장 위험합니다. 그림 안에 흔적이 남지 않기 때문입니다