163강이 중심과 퍼짐을 다뤘습니다. 이제 그 둘로 잡히지 않는 것을 다룹니다.
평균과 표준편차가 같아도 분포가 전혀 다를 수 있습니다. 정규분포와 자유도 인 분포는 둘 다 대칭이고 중심이 같은데, 표준편차를 넘을 확률이 배 다릅니다.
두 숫자를 더 씁니다.
| 값 | 재는 것 | 정규분포에서 |
|---|---|---|
| 왜도 | 좌우 비대칭 | |
| 첨도 | 꼬리의 두께 |
그런데 이 두 값은 앞의 둘과 성격이 다릅니다.
차수가 높아 꼬리에 훨씬 민감합니다. 그리고 여기서 순환이 생깁니다. 재려는 것이 꼬리인데, 꼬리가 두꺼우면 재는 도구 자체가 망가집니다. 163강 문제 2에서 의 표본표준편차가 시행마다 배 흔들린 것이 그 예고였습니다.
이 강의의 절반이 그 순환을 다룹니다. 문제 3에서 보겠지만, 표본이 개면 첨도가 을 넘을 수 없습니다. 참 첨도가 이든 무한이든 상관없이 그렇습니다.
문제. 좌우 치우침을 하나의 숫자로 만듭니다.
(1) 다섯 분포의 왜도를 구하고 부호를 해석하세요.
(2) 왜도가 인데 대칭이 아닌 분포를 만드세요.
(3) 왜도가 양수인데 평균이 중앙값보다 작은 분포를 찾으세요.
생각의 실마리. 대칭이면 평균 위아래의 편차가 서로 상쇄됩니다. 그런데 제곱하면 부호가 사라져 상쇄되지 않습니다. 세제곱하면 부호가 남으므로 어느 쪽이 더 큰지가 결과에 드러납니다.
풀이. (1) 표준화한 편차의 세제곱을 평균합니다.
| 분포 | 왜도 수치 | 이론 | 치우친 쪽 |
|---|---|---|---|
| 표준정규 | 없음 | ||
| 균등 | 없음 | ||
| 지수 | 오른쪽 | ||
| 로그정규 | 오른쪽 | ||
| 좌우 뒤집은 지수 | 왼쪽 |
부호가 긴 꼬리의 방향을 가리킵니다. 지수분포를 좌우로 뒤집으면 왜도의 부호만 바뀝니다.
(2) 그런데 왜도 은 대칭의 필요조건일 뿐입니다.
값 에 확률 을 줍니다.
| 항목 | 값 |
|---|---|
| 평균 | |
| 차 중심적률 | |
| 왜도 |
값도 확률도 좌우가 전혀 다른데 왜도는 정확히 입니다. 왼쪽의 많은 점이 가까이 있고 오른쪽의 한 점이 멀리 있어, 세제곱 기여가 우연히 상쇄된 것입니다.
(3) "왜도가 양수면 평균이 중앙값보다 크다"는 흔한 규칙에도 반례가 있습니다.
값 에 확률 를 줍니다.
| 항목 | 값 |
|---|---|
| 왜도 | |
| 평균 | |
| 중앙값 |
오른쪽으로 치우쳤는데 평균이 중앙값보다 작습니다. 이산분포에서 중앙값이 한 값에 걸려 있을 때 쉽게 일어납니다.
이 문제에서 배우는 것. 왜도는 비대칭의 요약이지 판정이 아닙니다. 하나의 숫자로 줄이는 순간 서로 다른 비대칭이 같은 값으로 접히며, 이라는 값은 대칭이라는 뜻이 아니라 세제곱 기여가 상쇄되었다는 뜻입니다. 163강 문제 4의 교훈이 그대로입니다. 요약값은 자료를 재구성하지 못하고, 왜도도 요약값입니다.
바로 확인 1.
확인 1-1. 왜도의 정의를 쓰세요.
답. 표준화한 편차의 세제곱의 기댓값입니다.
확인 1-2. 왜도가 인데 대칭이 아닌 예를 쓰세요.
답. 값 에 확률 을 주면 왜도가 정확히 입니다.
확인 1-3. 왜도의 부호와 평균 중앙값 순서의 관계를 쓰세요.
답. 대체로 맞지만 규칙이 아니며 검산에서 왜도 인데 평균이 중앙값보다 작았습니다.
문제. 꼬리의 두께를 하나의 숫자로 만듭니다.
(1) 네 분포의 첨도를 구하세요.
(2) 첨도가 봉우리의 뾰족함이 아님을 보이세요.
(3) 첨도가 존재하지 않는 경우를 확인하세요.
생각의 실마리. 세제곱이 부호를 남겼다면 네제곱은 크기만 남깁니다. 그리고 차수가 높으므로 멀리 있는 점의 기여가 압도적입니다. 편차 는 편차 보다 네제곱에서 배 기여합니다.
풀이. (1) 표준화한 편차의 네제곱을 평균합니다.
| 분포 | 첨도 수치 | 이론 | 초과첨도 |
|---|---|---|---|
| 균등 | |||
| 표준정규 | |||
| 라플라스 | |||
| 자유도 인 |
정규분포의 을 빼고 부르는 값이 초과첨도입니다. 양수면 정규보다 꼬리가 두껍습니다.
마지막 줄이 이론값 에 못 미칩니다. 표본이 만 개인데도 그렇습니다. 문제 3이 그 이유를 다룹니다.
(2) 첨도를 봉우리의 뾰족함으로 읽는 오해가 흔합니다. 균등분포를 보면 바로 깨집니다.
균등분포는 봉우리 자체가 없이 평평한데 첨도가 로 정규보다 작습니다. 뾰족함으로 읽으면 설명이 되지 않습니다.
꼬리를 잘라 확인합니다.
| 자유도 인 | 첨도 | IQR | 표본 크기 |
|---|---|---|---|
| 전체 | |||
| 양끝 퍼센트를 뺌 |
자료의 퍼센트는 그대로인데 첨도가 에서 로 떨어집니다. 같은 자료에서 IQR은 에서 으로 거의 그대로입니다.
첨도는 가장 바깥 퍼센트가 거의 다 정합니다. 가운데 모양은 보지 않습니다.
(3) 꼬리가 아주 두꺼우면 첨도가 존재하지 않습니다.
| 자유도 | 이론 첨도 | 차 적률 |
|---|---|---|
| 없음 | 없음 | |
| 없음 | 없음 | |
| 존재 | ||
| 존재 | ||
| 존재 |
는 차수가 보다 작은 적률만 가집니다. 자유도가 이하이면 네제곱의 기댓값이 발산합니다.
그런데 자료를 넣으면 어쨌든 숫자는 나옵니다. 표본의 첨도를 계산하면 오류 없이 값이 나오는데, 그 값은 아무것도 추정하지 않습니다. 존재하지 않는 것을 추정한 숫자입니다.
이 문제에서 배우는 것. 첨도는 중심이 아니라 극단을 재는 값입니다. 그래서 첨도가 크다는 말은 "봉우리가 뾰족하다"가 아니라 **"평균에서 아주 먼 값이 정규보다 자주 나온다"**로 읽어야 합니다. 그리고 이것이 실무에서 중요한 이유는 먼 값이 곧 사고이기 때문입니다. 금융의 폭락, 장비의 고장, 트래픽의 급증은 모두 꼬리에 있습니다.
바로 확인 2.
확인 2-1. 초과첨도가 무엇인지 쓰세요.
답. 첨도에서 정규분포의 값 을 뺀 것입니다.
확인 2-2. 첨도가 뾰족함이 아니라는 근거를 검산에서 쓰세요.
답. 평평한 균등분포의 첨도가 이고 에서 양끝 퍼센트만 빼면 가 로 떨어집니다.
확인 2-3. 의 첨도가 존재할 조건을 쓰세요.
답. 자유도가 보다 커야 하며 이하이면 차 적률이 발산합니다.
문제. 표본에서 계산한 왜도와 첨도의 한계를 봅니다.
(1) 표본 크기가 정하는 상한을 구하세요.
(2) 한 점을 아주 멀리 두어 상한에 닿는지 확인하세요.
(3) 에서 표본 크기별로 첨도가 어떻게 나오는지 보세요.
생각의 실마리. 표본 왜도와 첨도는 비율입니다. 분자도 분모도 같은 자료에서 나오므로, 한 점을 멀리 보내면 분자만 커지는 것이 아니라 분모도 함께 커집니다. 그러면 비율이 어디까지 갈 수 있을지 생각해 봅니다.
풀이. (1)(2) 검산 결과입니다. 개를 에 두고 한 점만 에 둔 경우입니다.
| 표본 크기 | 왜도의 상한 | 한 점을 멀리 둠 | 첨도의 상한 | 한 점을 멀리 둠 |
|---|---|---|---|---|
한 점을 아무리 멀리 보내도 정확히 그 상한에서 멈춥니다. 값을 로 두든 으로 두든 같습니다.
상한은 자료가 아니라 이 정합니다. 이면 첨도의 상한이 이므로, 참 첨도가 인 분포에서 개를 뽑아도 그 값을 볼 수 없습니다. 참 첨도가 무한이어도 마찬가지입니다.
(3) 에서 표본 크기를 바꿔 가며 번씩 뽑았습니다. 참 첨도는 입니다.
| 표본 크기 | 첨도 평균 | 첨도 표준편차 | 참값 를 넘은 비율 |
|---|---|---|---|
에서 평균이 입니다. 참값 의 삼분의 일도 되지 않으며, 번 중 한 번도 를 넘지 못했습니다.
표준편차가 표본이 커질수록 오히려 커집니다. 에서 이고 에서 입니다. 상한이 풀리면서 드물게 아주 큰 값이 나올 수 있게 되기 때문입니다.
이 문제에서 배우는 것. 작은 표본의 왜도와 첨도는 추정값이 아니라 상한에 눌린 값입니다. 그래서 짜리 자료에서 "첨도가 이니 꼬리가 약간 두껍다"고 읽으면 안 됩니다. 참 첨도가 여도 무한이어도 그 정도 값이 나옵니다. 163강 문제 2에서 본 것과 같은 뿌리이며, 차수가 높은 적률일수록 추정이 나빠진다는 일반 사실의 극단적 사례입니다.
바로 확인 3.
확인 3-1. 표본 첨도의 상한을 식으로 쓰세요.
답. 입니다.
확인 3-2. 에서 첨도가 넘을 수 없는 값을 쓰세요.
답. 이며 참 첨도가 여도 볼 수 없습니다.
확인 3-3. 검산에서 의 일 때 첨도 평균을 쓰세요.
답. 로 참값 에 한참 못 미칩니다.
문제. 자료가 정규분포에서 나왔는지 봅니다.
(1) 표본 분위수와 이론 분위수를 맞대어 보세요.
(2) 왜도와 첨도를 함께 쓰는 검정을 표본 크기별로 돌려 보세요.
생각의 실마리. 정규분포를 가정한 절차가 아주 많으므로 가정이 맞는지 보는 방법이 필요합니다. 그런데 문제 3을 본 뒤라면, 작은 표본에서는 어떤 방법도 힘이 없을 것이라 짐작할 수 있습니다.
풀이. (1) 표본을 정렬해 이론 분위수와 짝지었습니다. 표본은 개입니다.
| 표본이 나온 분포 | 이론 분위수와의 상관 | 최대 차이 |
|---|---|---|
| 표준정규 | ||
| 자유도 인 | ||
| 지수 | ||
| 균등 |
상관은 넷 다 을 넘고 셋은 을 넘습니다. 상관 하나만 보면 지수분포도 균등분포도 정규처럼 보입니다.
최대 차이가 이야기를 바꿉니다. 정규는 이고 나머지는 에서 입니다. 그리고 그 차이는 전부 양끝에서 벌어집니다.
그래서 분위수 그림에서는 양끝을 봅니다. 가운데가 직선을 잘 따르는 것은 거의 언제나 그렇습니다.
(2) 왜도와 첨도를 함께 쓰는 자르크-베라 검정입니다.
귀무가설이 참이면 자유도 인 카이제곱을 따르므로 기준값은 입니다. 오염은 퍼센트를 표준편차 배로 바꾼 것입니다.
| 표본 크기 | 참으로 정규일 때 기각률 | 퍼센트만 오염될 때 | 목표 |
|---|---|---|---|
두 방향으로 읽어야 합니다.
에서는 정규일 때 기각률이 로 목표 에 못 미칩니다. 카이제곱 근사가 작은 표본에서 나쁘기 때문이며, 검정 자체가 제대로 작동하지 않습니다. 그리고 오염을 잡는 힘도 뿐입니다.
에서는 퍼센트 오염을 언제나 잡아냅니다. 그런데 그 오염이 실무적으로 문제인지는 검정이 말해 주지 않습니다.
이 문제에서 배우는 것. 검정이 말하는 것은 증거의 세기이지 이탈의 크기가 아닙니다. 표본이 크면 아주 작은 이탈도 유의해지고, 표본이 작으면 큰 이탈도 잡히지 않습니다. 어느 쪽이든 값은 자료의 양을 재는 값이지 정규에서 얼마나 멀리 있는지를 재는 값이 아닙니다. 크기는 왜도와 첨도의 값 자체로 봐야 하며, 그림을 함께 보는 것이 언제나 낫습니다.
바로 확인 4.
확인 4-1. 분위수 대조에서 상관만 보면 안 되는 이유를 쓰세요.
답. 검산에서 지수분포도 상관이 이라 넷을 구별하지 못하기 때문입니다.
확인 4-2. 자르크-베라 통계량을 쓰세요.
답. 이며 자유도 인 카이제곱을 따릅니다.
확인 4-3. 검정의 값이 이탈의 크기를 말하지 못하는 이유를 쓰세요.
답. 표본이 크면 작은 이탈도 유의해지고 작으면 큰 이탈도 잡히지 않기 때문입니다.
문제. 꼬리의 두께가 실제 계산을 얼마나 바꾸는지 봅니다.
(1) 표준편차를 넘을 확률을 분포별로 구하세요.
(2) 표본평균이 정규에 가까워지는 속도를 비교하세요.
(3) 꼬리가 아주 두꺼운 자료에서 상위 몇 퍼센트가 차지하는 몫을 구하세요.
생각의 실마리. 첨도가 몇이라는 말은 추상적입니다. 그것이 실제로 얼마짜리 차이인지를 확률로 바꿔 보면 뜻이 분명해집니다.
풀이. (1) 평균 , 표준편차 로 맞춘 뒤 인 비율을 셉니다. 표본은 만 개입니다.
| 분포 | 시그마 초과 비율 | 정규 대비 배수 |
|---|---|---|
| 표준정규 | ||
| 라플라스 | ||
| 자유도 인 | ||
| 자유도 인 |
같은 표준편차인데 확률이 배 다릅니다.
정규를 가정하고 위험을 재면 크게 과소평가합니다. " 시그마 사건이니 만 번에 한 번"이라고 계산했는데 실제로는 번에 한 번 일어나는 것입니다.
(2) 표본평균의 분포가 정규에 얼마나 가까운지 봅니다.
| 표본 크기 | 정규 자료의 최대 차이 | 자료의 최대 차이 |
|---|---|---|
143강 중심극한정리는 에서도 성립합니다. 분산이 유한하므로 차이가 계속 줄어듭니다.
그런데 같은 에서 정확도가 다릅니다. 에서도 의 차이가 정규 자료의 네 배가 넘습니다. "이 이면 중심극한정리를 써도 된다"는 흔한 규칙에 근거가 없다는 것이 이 표의 뜻입니다.
(3) 꼬리가 아주 두꺼운 자료를 봅니다. 파레토 지수 입니다.
| 상위 비율 | 전체 합에서 차지하는 몫 |
|---|---|
| 퍼센트 | |
| 퍼센트 | |
| 퍼센트 | |
| 퍼센트 | |
| 퍼센트 |
상위 퍼센트가 전체의 퍼센트를 차지합니다.
지수 이면 평균은 있고 분산은 없습니다. 평균이 있으니 큰 수의 법칙은 성립하는데, 얼마나 빨리 수렴하는지를 봅니다.
| 표본 크기 | 표본평균 번의 흩어짐 | 직전 대비 줄어든 배수 |
|---|---|---|
| 없음 | ||
표본을 배 늘렸는데 배만 좋아졌습니다. 분산이 유한하면 배 좋아져야 합니다.
이론값 와 맞습니다. 평균은 수렴하지만 이 아니라 입니다.
이 문제에서 배우는 것. 분포의 모양을 모르면 평균이 얼마나 믿을 만한지 알 수 없습니다. 163강에서 표준오차를 으로 썼는데, 그 식 자체가 분산이 유한하다는 가정 위에 있습니다. 가정이 깨지면 신뢰구간의 폭도 표본 크기 계산도 전부 틀립니다. 그래서 요약보다 모양을 먼저 봐야 하며, 다음 두 강의가 그 모양을 보는 도구를 다룹니다.
바로 확인 5.
확인 5-1. 검산에서 의 시그마 초과 비율이 정규의 몇 배인지 쓰세요.
답. 배입니다.
확인 5-2. 이면 중심극한정리를 써도 된다는 규칙의 문제를 쓰세요.
답. 꼬리의 두께에 따라 정확도가 다르며 은 에서도 차이가 정규의 네 배가 넘습니다.
확인 5-3. 분산이 없는 자료에서 표본평균의 수렴 속도를 쓰세요.
답. 파레토 지수 일 때 이며 이면 입니다.
| 값 | 정의 | 정규분포에서 |
|---|---|---|
| 왜도 g_ | 표준화 편차의 세제곱의 평균 | |
| 첨도 g_ | 표준화 편차의 네제곱의 평균 | |
| 초과첨도 |
| 분포 | 왜도 | 첨도 |
|---|---|---|
| 균등 | ||
| 정규 | ||
| 라플라스 | ||
| 지수 | ||
| 이며 일 때만 | ||
| 로그정규 |
| 표본 크기가 정하는 상한 | 식 | |
|---|---|---|
| 왜도 | (n-2)/\sqrt | |
| 첨도 |
| 자주 하는 실수 | 바로잡기 |
|---|---|
| 왜도 이면 대칭이라고 봅니다 | 반례가 있습니다 |
| 왜도가 양수면 평균이 크다고 봅니다 | 대체로 맞을 뿐입니다 |
| 첨도를 봉우리의 뾰족함으로 읽습니다 | 꼬리의 두께입니다 |
| 작은 표본의 첨도를 그대로 믿습니다 | 상한에 눌린 값입니다 |
| 의 첨도를 추정합니다 | 존재하지 않는 값입니다 |
| 값으로 이탈의 크기를 읽습니다 | 자료의 양을 재는 값입니다 |
| 이면 정규 근사가 된다고 봅니다 | 꼬리의 두께에 달려 있습니다 |
문제 6. 왜도와 첨도의 정의를 쓰세요.
답. 표준화한 편차의 세제곱과 네제곱의 기댓값입니다.
문제 7. 검산에서 지수분포의 왜도와 그 부호의 뜻을 쓰세요.
답. 이며 오른쪽 꼬리가 길다는 뜻입니다.
문제 8. 왜도가 인데 대칭이 아닌 예를 쓰세요.
답. 값 에 확률 을 주면 됩니다.
문제 9. 검산에서 왜도가 양수인데 평균이 작은 예를 쓰세요.
답. 값 에 확률 이며 왜도 , 평균 , 중앙값 입니다.
문제 10. 균등분포의 첨도가 정규보다 작은 것이 무엇을 뜻하는지 쓰세요.
답. 첨도가 봉우리가 아니라 꼬리를 재며 균등은 꼬리가 아예 없다는 뜻입니다.
문제 11. 검산에서 의 양끝 퍼센트를 뺀 첨도를 쓰세요.
답. 에서 로 떨어지고 IQR은 거의 그대로입니다.
문제 12. 의 첨도가 존재할 조건과 값을 쓰세요.
답. 일 때만 존재하고 입니다.
문제 13. 표본 왜도와 첨도의 상한을 쓰세요.
답. 과 입니다.
문제 14. 검산에서 를 으로 뽑았을 때 첨도 평균을 쓰세요.
답. 이며 참값 를 한 번도 넘지 못했습니다.
문제 15. 표본이 커질 때 첨도의 표준편차가 커지는 이유를 쓰세요.
답. 상한이 풀리면서 드물게 아주 큰 값이 나올 수 있게 되기 때문입니다.
문제 16. 자르크-베라 검정이 에서 보인 문제를 쓰세요.
답. 정규일 때 기각률이 로 목표 에 못 미쳐 근사가 나쁩니다.
문제 17. 검산에서 의 시그마 초과 비율과 배수를 쓰세요.
답. 이며 정규의 배입니다.
문제 18. 파레토 지수 에서 표본평균의 수렴 속도를 쓰세요.
답. 이며 표본을 배 늘려도 배만 좋아집니다.
심화 1. 로버스트한 모양 척도를 정리하세요.
문제 3에서 왜도와 첨도가 상한에 눌린다는 것을 보았습니다. 분위수로 만든 대안이 있습니다.
분자가 위쪽 사분위와 아래쪽 사분위의 중앙값으로부터의 거리 차입니다. 대칭이면 이고, 값이 항상 안에 있습니다.
여기서 는 번째 팔분위수입니다. 정규분포에서 이며 그보다 크면 꼬리가 두껍습니다.
| 척도 | 붕괴점 | 상한에 눌리는가 |
|---|---|---|
| 왜도 g_ | 눌립니다 | |
| 첨도 g_ | 눌립니다 | |
| 보울리 왜도 | 언제나 | |
| 무어스 첨도 | 눌리지 않습니다 |
분위수 기반이라 적률이 없는 분포에서도 계산됩니다. 의 첨도는 존재하지 않지만 무어스 첨도는 정의되고 유한합니다.
대가는 민감도입니다. 사분위수만 보므로 가장 극단적인 퍼센트 안쪽의 정보를 버립니다. 꼬리의 아주 먼 쪽 차이는 잡지 못합니다. 163강 문제 2에서 본 효율과 강건함의 맞바꿈이 여기서도 그대로입니다.
심화 2. 꼬리 지수를 직접 추정하는 방법을 정리하세요.
첨도가 존재하지 않는 자료에서는 꼬리 자체를 모형화합니다.
가 꼬리 지수이며 작을수록 두껍습니다. 이것을 추정하면 적률의 존재 여부도 함께 알 수 있습니다.
| 존재하는 적률 | |
|---|---|
| 평균도 없습니다 | |
| 평균은 있고 분산이 없습니다 | |
| 분산은 있고 첨도가 없습니다 | |
| 첨도까지 있습니다 |
힐 추정량이 표준적입니다. 상위 개의 값에 로그를 씌워 평균 차이를 냅니다.
를 고르는 것이 어렵습니다. 작게 잡으면 자료가 부족해 흔들리고, 크게 잡으면 꼬리가 아닌 부분이 섞여 치우칩니다. 에 따라 추정값을 그린 그림에서 평평한 구간을 찾는 것이 실무의 방법인데, 평평한 구간이 없는 경우도 흔합니다.
꼬리 지수 추정은 언제나 외삽입니다. 관측한 것보다 더 먼 곳을 말하는 것이므로, 가정 없이는 아무것도 말할 수 없습니다.
심화 3. 정규성 검정을 언제 쓰고 언제 쓰지 않을지 정리하세요.
문제 4에서 표본 크기에 따라 검정의 성격이 달라졌습니다. 그러면 언제 쓰는 것이 옳은지를 정리합니다.
| 상황 | 판단 |
|---|---|
| 작은 표본에서 정규 가정을 확인 | 힘이 없어 통과해도 근거가 안 됩니다 |
| 큰 표본에서 정규 가정을 확인 | 언제나 기각되므로 물을 필요가 없습니다 |
| 모양 자체가 관심사 | 그림과 요약값을 봅니다 |
첫 두 줄이 역설을 이룹니다. 검정이 도움이 되는 표본 크기가 사실상 없습니다.
더 중요한 것은 무엇을 위한 정규성인가입니다.
| 쓰려는 절차 | 정규성이 필요한 정도 |
|---|---|
| 표본평균의 신뢰구간 | 거의 필요 없습니다. 중심극한정리가 대신합니다 |
| 분산의 신뢰구간 | 아주 민감합니다 |
| 예측구간 | 꼬리가 그대로 들어오므로 민감합니다 |
둘째 줄이 자주 잊힙니다. 평균의 추론은 정규성에 둔감한데, 분산이나 분위수의 추론은 그렇지 않습니다. 문제 3에서 본 것처럼 차 적률이 개입하기 때문입니다.
그래서 순서를 뒤집는 것이 낫습니다. "정규인가"를 묻는 대신 **"내가 쓰려는 절차가 이 정도 이탈에 얼마나 민감한가"**를 묻고, 필요하면 붓스트랩처럼 가정이 적은 방법으로 갑니다.
심화 4. 적률생성함수와 큐뮬런트를 정리하세요.
왜도와 첨도를 하나의 틀에서 보는 방법입니다.
로그를 씌운 것이 요점입니다. 이 함수의 테일러 계수를 큐뮬런트라 부릅니다.
| 차수 | 큐뮬런트 | 정체 |
|---|---|---|
| \kappa_ | 평균 | |
| \kappa_ | 분산 | |
| \kappa_ | 차 중심적률 | |
| \kappa_ | \mu_{4}-3\mu_{2}^ |
넷째 줄에서 이 나옵니다. 초과첨도가 인 이유가 이것이며, 관습이 아니라 큐뮬런트의 정의에서 자동으로 나오는 값입니다.
큐뮬런트의 성질이 강력합니다. 독립인 두 확률변수의 합에서 큐뮬런트가 그냥 더해집니다.
적률은 이렇게 되지 않습니다. 로그가 곱을 합으로 바꿔 주기 때문이며, 143강에서 특성함수로 중심극한정리를 증명한 것과 같은 구조입니다.
그리고 정규분포는 차 이상의 큐뮬런트가 전부 입니다. 정규분포가 유일하게 그렇습니다. 왜도와 첨도로 정규성을 재는 것이 자연스러운 이유가 여기 있습니다.
심화 5. 변환으로 모양을 바꾸는 것을 정리하세요.
162강 문제 3에서 로그가 왜도를 거의 으로 만드는 것을 보았습니다. 일반화한 방법이 있습니다.
박스-콕스 변환이며 를 자료에서 정합니다.
| 하는 일 | |
|---|---|
| 아무것도 하지 않습니다 | |
| 제곱근입니다 | |
| 로그입니다 | |
| 역수입니다 |
가 작을수록 오른쪽 꼬리를 세게 당깁니다.
그런데 세 가지를 함께 봐야 합니다.
| 문제 | 내용 |
|---|---|
| 양수만 가능 | 음수가 있으면 이동시켜야 하고 그 상수가 결과를 바꿉니다 |
| 해석이 바뀜 | 이면 계수가 무엇을 뜻하는지 말하기 어렵습니다 |
| 도 추정값 | 자료에서 골랐으므로 뒤의 추론에 그 불확실성이 들어가야 합니다 |
셋째 줄이 조용한 문제입니다. 를 자료로 고른 뒤 그것을 고정된 값처럼 쓰면, 162강 문제 2의 누출과 같은 구조가 됩니다. 훈련부에서만 정하고 나머지에는 적용만 해야 합니다.
변환으로 왜도를 없애도 첨도는 남는 경우가 많습니다. 대칭으로 만드는 것과 꼬리를 얇게 만드는 것은 다른 일이며, 박스-콕스는 앞을 겨냥한 도구입니다.
심화 6. 이 강의가 어디에 쓰이는지 정리하세요.
| 분야 | 쓰임 | 이어지는 강의 |
|---|---|---|
| 분위수 | 상자그림이 모양을 다섯 수로 보입니다 | 165강 |
| 시각화 | 히스토그램과 분위수 그림 | 169강 |
| 표본 크기 | 꼬리가 두꺼우면 더 많이 필요합니다 | 174강 |
| 위험 관리 | 꼬리 확률을 정규로 재면 과소평가합니다 | 문제 5 |
첫째 줄이 다음 강의입니다. 왜도와 첨도가 적률로 모양을 재는 길이었다면, 분위수는 순위로 모양을 재는 길입니다. 심화 1에서 본 것처럼 상한에 눌리지 않고 적률이 없어도 계산됩니다.
넷째 줄이 이 강의의 실무적 값어치입니다. 검산에서 시그마 사건의 확률이 배 차이 났습니다. 정규 가정 하나가 "만 번에 한 번"을 "번에 한 번"으로 바꾸며, 그 차이가 드러나는 것은 언제나 사고가 난 뒤입니다.
정답.
| 기호 | 읽는 법 | 뜻 |
|---|---|---|
| g_ | 지 원 | 왜도입니다 |
| g_ | 지 투 | 첨도이며 정규에서 입니다 |
| \mu_ | 뮤 케이 | 차 중심적률입니다 |
| 초과첨도 | excess kurtosis | 입니다 |
| 자유도 뉴인 t 분포 | 꼬리가 두꺼운 대칭 분포입니다 | |
| 라플라스분포 | Laplace distribution | 양쪽이 지수로 감소합니다 |
| 파레토분포 | Pareto distribution | 꼬리가 거듭제곱으로 감소합니다 |
| 알파 | 꼬리 지수이며 작을수록 두껍습니다 | |
| 자르크-베라 | Jarque-Bera | 왜도와 첨도를 함께 쓰는 정규성 검정입니다 |
| 분위수 대조 | Q-Q plot | 표본 분위수와 이론 분위수를 맞댑니다 |
| 보울리 왜도 | Bowley skewness | 사분위수로 만든 왜도입니다 |
| 무어스 첨도 | Moors kurtosis | 팔분위수로 만든 첨도입니다 |
| 힐 추정량 | Hill estimator | 꼬리 지수를 상위 값으로 추정합니다 |
| 큐뮬런트 | cumulant | 로그 적률생성함수의 테일러 계수입니다 |
| 박스-콕스 | Box-Cox | 거듭제곱으로 모양을 바꾸는 변환입니다 |
다음은 165강 분위수와 상자그림입니다. 이 강의가 적률로 모양을 쟀고, 다음은 순위로 모양을 잽니다.
심화 1에서 이미 이유를 보았습니다. 적률로 만든 왜도와 첨도는 표본 크기가 정한 상한에 눌리고 적률이 없으면 아예 정의되지 않는데, 분위수는 둘 다 겪지 않습니다.
그리고 그림으로 가는 다리가 됩니다. 다섯 개의 수만으로 자료의 중심과 퍼짐과 비대칭과 이상치를 한 번에 보이는 것이 상자그림이며, 163강의 IQR과 161강의 이상치 판정이 그 안에서 만납니다. 다만 상자그림도 요약이라 봉우리가 둘인 자료를 하나처럼 보이게 만드는데, 그 한계와 대안이 다음 강의의 마지막 주제입니다.
import numpy as np
rng = np.random.default_rng(20260901)
def pw(s, n):
k = n - sum(2 if ord(c) > 0x2FFF else 1 for c in str(s))
return str(s) + " " * max(k, 0)
def rw(s, n):
k = n - sum(2 if ord(c) > 0x2FFF else 1 for c in str(s))
return " " * max(k, 0) + str(s)
def g1(v):
c = (v - v.mean()) / v.std()
return float((c ** 3).mean())
def g2(v):
c = (v - v.mean()) / v.std()
return float((c ** 4).mean())
# --- 문제 1: 비대칭을 어떻게 재는가 -------------------------------------
print(" 표준화한 편차의 세제곱을 평균한 값이 왜도입니다")
n1 = 2000000
data = [("표준정규", rng.normal(0, 1, n1), 0.0),
("균등", rng.uniform(0, 1, n1), 0.0),
("지수", rng.exponential(1.0, n1), 2.0),
("로그정규", np.exp(rng.normal(0, 1, n1)), 6.184877),
("좌우 뒤집은 지수", -rng.exponential(1.0, n1), -2.0)]
print(" %s %s %s %s" % (pw("분포", 20), rw("왜도 수치", 12),
rw("이론", 12), rw("치우친 쪽", 12)))
for nm, v, t in data:
s = g1(v)
print(" %s %12.6f %12.6f %s"
% (pw(nm, 20), s, t, rw("오른쪽" if s > 0.05 else ("왼쪽" if s < -0.05 else "없음"), 12)))
print(" 세제곱은 부호를 남기므로 어느 쪽 꼬리가 긴지가 그대로 드러납니다")
print(" 그런데 왜도가 0 이라고 대칭인 것은 아닙니다. 반례를 만듭니다")
vals = np.array([-2.0, 1.0, 4.0])
pr = np.array([10.0, 16.0, 1.0]) / 27.0
m1 = float((pr * vals).sum())
m3 = float((pr * vals ** 3).sum())
sd = float(np.sqrt((pr * (vals - m1) ** 2).sum()))
print(" 값 %s 에 확률 %s 로 둡니다"
% (", ".join("%.0f" % t for t in vals), ", ".join("%.0f/27" % (p * 27) for p in pr)))
print(" 평균 %.10f, 3 차 중심적률 %.10f, 왜도 %.10f"
% (m1, float((pr * (vals - m1) ** 3).sum()),
float((pr * (vals - m1) ** 3).sum()) / sd ** 3))
print(" 값도 확률도 좌우가 전혀 다른데 왜도는 정확히 0 입니다")
print(" 왜도가 0 이면 왼쪽 꼬리와 오른쪽 꼬리의 세제곱 기여가 상쇄된 것뿐입니다")
print(" 평균과 중앙값의 순서로 왜도를 읽는 규칙에도 반례가 있습니다")
found = None
for a in range(1, 9):
for b in range(a + 1, 12):
for w in range(1, 20):
for w2 in range(1, 20):
p = np.array([w, w2, 1.0], dtype=float)
p = p / p.sum()
vv = np.array([0.0, float(a), float(b)])
mu = float((p * vv).sum())
cc = np.sqrt(float((p * (vv - mu) ** 2).sum()))
sk = float((p * (vv - mu) ** 3).sum()) / cc ** 3
cum = np.cumsum(p)
mdn = float(vv[int(np.searchsorted(cum, 0.5))])
if sk > 0.2 and mu < mdn - 1e-9:
found = (vv, p, mu, mdn, sk)
break
if found:
break
if found:
break
if found:
break
vv, p, mu, mdn, sk = found
print(" 값 %s 에 확률 %s 로 둡니다"
% (", ".join("%.0f" % t for t in vv), ", ".join("%.4f" % t for t in p)))
print(" 왜도는 %.6f 로 양수인데 평균은 %.6f 이고 중앙값은 %.6f 입니다" % (sk, mu, mdn))
print(" 오른쪽으로 치우쳤는데 평균이 중앙값보다 작습니다")
print(" 왜도의 부호와 평균 중앙값의 순서는 대체로 맞을 뿐 언제나 맞지는 않습니다")
# --- 문제 2: 꼬리의 두께를 어떻게 재는가 --------------------------------
print(" 네제곱을 평균하면 첨도입니다. 정규분포에서 3 이고 이것을 기준으로 씁니다")
n2 = 2000000
rows = [("균등", rng.uniform(0, 1, n2), 1.8),
("표준정규", rng.normal(0, 1, n2), 3.0),
("라플라스", rng.laplace(0, 1, n2), 6.0),
("자유도 5 인 t", rng.standard_t(5, n2), 9.0)]
print(" %s %s %s %s" % (pw("분포", 20), rw("첨도 수치", 12),
rw("이론", 12), rw("초과첨도", 12)))
for nm, v, t in rows:
k = g2(v)
print(" %s %12.6f %12.6f %12.6f" % (pw(nm, 20), k, t, k - 3))
print(" 자유도 5 인 t 의 첨도가 이론 9 에 못 미칩니다. 문제 3 이 그 이유를 다룹니다")
print(" 첨도는 봉우리가 뾰족한 정도가 아닙니다. 꼬리가 두꺼운 정도입니다")
print(" 균등분포는 봉우리가 없이 평평한데 첨도가 1.8 로 정규보다 작습니다")
tv = rng.standard_t(5, n2)
lo, hi = np.quantile(tv, [0.005, 0.995])
inner = tv[(tv >= lo) & (tv <= hi)]
print(" %s %s %s %s" % (pw("자유도 5 인 t", 22), rw("첨도", 12),
rw("IQR", 12), rw("표본 크기", 12)))
print(" %s %12.6f %12.6f %12d"
% (pw("전체", 22), g2(tv), float(np.quantile(tv, 0.75) - np.quantile(tv, 0.25)), len(tv)))
print(" %s %12.6f %12.6f %12d"
% (pw("양끝 0.5 퍼센트를 뺌", 22), g2(inner),
float(np.quantile(inner, 0.75) - np.quantile(inner, 0.25)), len(inner)))
print(" 자료의 99 퍼센트는 그대로인데 첨도가 %.4f 에서 %.4f 로 떨어집니다"
% (g2(tv), g2(inner)))
print(" IQR 은 %.6f 에서 %.6f 로 거의 그대로입니다"
% (float(np.quantile(tv, 0.75) - np.quantile(tv, 0.25)),
float(np.quantile(inner, 0.75) - np.quantile(inner, 0.25))))
print(" 첨도는 가장 바깥 1 퍼센트가 거의 다 정합니다. 가운데는 보지 않습니다")
print(" 자유도가 작으면 첨도가 아예 존재하지 않습니다")
print(" %s %s %s" % (pw("자유도", 10), rw("이론 첨도", 14), rw("4 차 적률", 14)))
for df, s in [(3, "없음"), (4, "없음"), (5, "9.0"), (10, "4.0"), (30, "3.2308")]:
print(" %s %s %s" % (pw(str(df), 10), rw(s, 14),
rw("존재" if df > 4 else "없음", 14)))
print(" 자유도가 4 이하이면 네제곱의 기댓값이 발산합니다")
# --- 문제 3: 왜 이 둘은 재기 어려운가 -----------------------------------
print(" 표본이 작으면 왜도와 첨도가 원리적으로 어느 값 이상 나올 수 없습니다")
print(" %s %s %s %s %s" % (pw("표본 크기 n", 12), rw("왜도의 상한", 14),
rw("한 점을 멀리 둠", 16),
rw("첨도의 상한", 14), rw("한 점을 멀리 둠", 16)))
for n in [5, 10, 30, 100, 1000]:
sb = (n - 2) / np.sqrt(n - 1)
kb = (1 + (n - 1) ** 3) / (n * (n - 1))
w = np.zeros(n)
w[0] = 1e9
print(" %s %14.6f %16.6f %14.6f %16.6f"
% (pw(str(n), 12), sb, g1(w), kb, g2(w)))
print(" 한 점을 아무리 멀리 보내도 그 상한에서 멈춥니다. 상한은 자료가 아니라 n 이 정합니다")
print(" n = 10 이면 첨도의 상한이 %.4f 입니다" % ((1 + 9 ** 3) / (10 * 9)))
print(" 참 첨도가 9 인 분포에서 10 개를 뽑아도 그 값을 볼 수 없습니다")
print(" 참 첨도가 무한인 분포에서도 마찬가지입니다")
print(" 그래서 작은 표본의 왜도와 첨도는 추정값이 아니라 상한에 눌린 값입니다")
print(" %s %s %s %s" % (pw("표본 크기 n", 12), rw("첨도 평균", 12),
rw("첨도 표준편차", 14), rw("참값 9 를 넘은 비율", 20)))
for n in [10, 30, 100, 1000, 10000]:
S = rng.standard_t(5, (4000, n))
c = (S - S.mean(axis=1, keepdims=True)) / S.std(axis=1, keepdims=True)
kk = (c ** 4).mean(axis=1)
print(" %s %12.4f %14.4f %20.4f"
% (pw(str(n), 12), float(kk.mean()), float(kk.std()), float((kk > 9).mean())))
print(" n = 10 에서 평균이 참값 9 근처에도 못 갑니다. 상한 8.11 에 막혀 있습니다")
print(" 163강 문제 2 에서 본 것과 같은 뿌리입니다. 높은 차수일수록 추정이 나빠집니다")
# --- 문제 4: 정규성을 어떻게 판정하는가 ---------------------------------
print(" 분위수를 맞대어 보는 방법부터 봅니다")
gz = np.arange(200001)
zg = (gz - 100000) * 1e-4
phi = np.exp(-zg * zg / 2) / np.sqrt(2 * np.pi)
cdf = (np.cumsum(phi) - 0.5 * phi) * 1e-4
cdf = cdf - cdf[100000] + 0.5
def zq(q):
return float(np.interp(q, cdf, zg))
n4 = 4000
pp = (np.arange(1, n4 + 1) - 0.5) / n4
th = np.array([zq(q) for q in pp])
print(" %s %s %s" % (pw("표본이 나온 분포", 20), rw("이론 분위수와의 상관", 22),
rw("최대 차이", 12)))
for nm, v in [("표준정규", rng.normal(0, 1, n4)),
("자유도 5 인 t", rng.standard_t(5, n4)),
("지수", rng.exponential(1.0, n4)),
("균등", rng.uniform(0, 1, n4))]:
s = np.sort((v - v.mean()) / v.std())
print(" %s %22.6f %12.6f"
% (pw(nm, 20), float(np.corrcoef(s, th)[0, 1]), float(np.max(np.abs(s - th)))))
print(" 상관은 넷 다 0.97 을 넘습니다. 상관만 보면 차이를 놓칩니다")
print(" 최대 차이는 꼬리에서 벌어집니다. 그림에서 양끝을 봐야 하는 이유입니다")
print(" 왜도와 첨도를 함께 쓰는 검정도 있습니다. 자르크-베라입니다")
print(" JB = n (왜도^2/6 + 초과첨도^2/24) 이고 귀무가설에서 자유도 2 인 카이제곱입니다")
crit = 5.991465
print(" %s %s %s %s" % (pw("표본 크기 n", 12), rw("참으로 정규일 때 기각률", 24),
rw("1 퍼센트만 오염될 때", 22), rw("목표", 8)))
for n in [20, 100, 1000, 10000]:
A = rng.normal(0, 1, (3000, n))
B = rng.normal(0, 1, (3000, n))
m = rng.random((3000, n)) < 0.01
B = np.where(m, B * 5.0, B)
out = []
for S in [A, B]:
c = (S - S.mean(axis=1, keepdims=True)) / S.std(axis=1, keepdims=True)
s3 = (c ** 3).mean(axis=1)
s4 = (c ** 4).mean(axis=1) - 3.0
jb = n * (s3 ** 2 / 6 + s4 ** 2 / 24)
out.append(float((jb > crit).mean()))
print(" %s %24.4f %22.4f %8.2f" % (pw(str(n), 12), out[0], out[1], 0.05))
print(" 표본이 크면 1 퍼센트의 오염도 거의 언제나 잡아냅니다")
print(" 그런데 n 이 작으면 같은 오염을 거의 잡지 못합니다")
print(" 검정이 말하는 것은 정규가 아니라는 증거의 세기이지 이탈의 크기가 아닙니다")
print(" 크기는 왜도와 첨도의 값 자체로 봐야 합니다")
# --- 문제 5: 모양이 결정을 어떻게 바꾸는가 ------------------------------
print(" 꼬리가 두꺼우면 드문 사건의 확률이 크게 달라집니다")
n5 = 4000000
print(" 평균 0, 표준편차 1 로 맞춘 뒤 5 표준편차를 넘을 확률을 셉니다")
print(" %s %s %s" % (pw("분포", 20), rw("5 시그마 초과 비율", 20),
rw("정규 대비 배수", 16)))
base = None
for nm, v in [("표준정규", rng.normal(0, 1, n5)),
("라플라스", rng.laplace(0, 1, n5)),
("자유도 5 인 t", rng.standard_t(5, n5)),
("자유도 3 인 t", rng.standard_t(3, n5))]:
w = (v - v.mean()) / v.std()
r = float((np.abs(w) > 5).mean())
if base is None:
base = r
print(" %s %20.8f %16.2f" % (pw(nm, 20), r, r / base if base > 0 else 0.0))
print(" 정규를 가정하고 위험을 재면 두꺼운 꼬리에서 크게 과소평가합니다")
print(" 꼬리가 두꺼우면 표본평균이 정규에 가까워지는 속도도 느립니다")
print(" %s %s %s" % (pw("표본 크기 n", 12), rw("정규 자료의 최대 차이", 22),
rw("t(3) 자료의 최대 차이", 22)))
gr = np.linspace(-4, 4, 801)
Fg = np.array([float(np.interp(t, zg, cdf)) for t in gr])
for n in [1, 5, 30, 200]:
o = []
for kind in ["n", "t"]:
S = (rng.normal(0, 1, (200000, n)) if kind == "n"
else rng.standard_t(3, (200000, n)))
m = S.mean(axis=1)
m = (m - m.mean()) / m.std()
ms = np.sort(m)
Fn = np.searchsorted(ms, gr, side="right") / len(ms)
o.append(float(np.max(np.abs(Fn - Fg))))
print(" %s %22.6f %22.6f" % (pw(str(n), 12), o[0], o[1]))
print(" 143강 중심극한정리는 성립하지만 n 이 같아도 근사의 정확도가 다릅니다")
print(" 아주 두꺼우면 상위 몇 퍼센트가 전체의 대부분을 차지합니다")
al = 1.5
u5 = rng.random(2000000)
par = (1.0 - u5) ** (-1.0 / al)
srt = np.sort(par)[::-1]
tot = float(srt.sum())
print(" 파레토 지수 %.1f 인 자료 200 만 개입니다" % al)
print(" %s %s" % (pw("상위 비율", 14), rw("전체 합에서 차지하는 몫", 24)))
for q in [0.01, 0.05, 0.10, 0.20, 0.50]:
kq = int(len(srt) * q)
print(" %s %24.6f" % (pw("%.0f 퍼센트" % (q * 100), 14), float(srt[:kq].sum()) / tot))
print(" 지수가 %.1f 이면 평균은 있고 분산은 없습니다" % al)
print(" 평균이 있으니 큰 수의 법칙은 성립합니다. 다만 아주 느립니다")
print(" %s %s %s" % (pw("표본 크기", 14), rw("표본평균 20 번의 흩어짐", 24),
rw("직전 대비 줄어든 배수", 22)))
prev5 = None
for n in [1000, 100000, 2000000]:
mm = np.array([float(((1.0 - rng.random(n)) ** (-1.0 / al)).mean()) for _ in range(20)])
sp = float(mm.std() / mm.mean())
print(" %s %24.6f %22s"
% (pw(str(n), 14), sp, "-" if prev5 is None else "%.4f" % (prev5 / sp)))
prev5 = sp
print(" 분산이 없으므로 흩어짐이 1/sqrt(n) 로 줄지 않습니다")
print(" 지수 %.1f 이면 이론상 n 의 %.4f 제곱에 반비례해 줄어듭니다" % (al, 1 - 1 / al))
print(" 표본을 100 배 늘리면 1/sqrt(n) 이면 10 배 좋아지는데 여기서는 %.2f 배입니다"
% (100 ** (1 - 1 / al)))
print(" 모양을 모르면 평균이 얼마나 믿을 만한지 알 수 없습니다. 요약 전에 모양을 봐야 합니다")
# 표준화한 편차의 세제곱을 평균한 값이 왜도입니다
# 분포 왜도 수치 이론 치우친 쪽
# 표준정규 -0.000166 0.000000 없음
# 균등 -0.000893 0.000000 없음
# 지수 2.009472 2.000000 오른쪽
# 로그정규 6.269648 6.184877 오른쪽
# 좌우 뒤집은 지수 -1.998313 -2.000000 왼쪽
# 세제곱은 부호를 남기므로 어느 쪽 꼬리가 긴지가 그대로 드러납니다
# 그런데 왜도가 0 이라고 대칭인 것은 아닙니다. 반례를 만듭니다
# 값 -2, 1, 4 에 확률 10/27, 16/27, 1/27 로 둡니다
# 평균 0.0000000000, 3 차 중심적률 0.0000000000, 왜도 0.0000000000
# 값도 확률도 좌우가 전혀 다른데 왜도는 정확히 0 입니다
# 왜도가 0 이면 왼쪽 꼬리와 오른쪽 꼬리의 세제곱 기여가 상쇄된 것뿐입니다
# 평균과 중앙값의 순서로 왜도를 읽는 규칙에도 반례가 있습니다
# 값 0, 1, 2 에 확률 0.4000, 0.4000, 0.2000 로 둡니다
# 왜도는 0.343622 로 양수인데 평균은 0.800000 이고 중앙값은 1.000000 입니다
# 오른쪽으로 치우쳤는데 평균이 중앙값보다 작습니다
# 왜도의 부호와 평균 중앙값의 순서는 대체로 맞을 뿐 언제나 맞지는 않습니다
# 네제곱을 평균하면 첨도입니다. 정규분포에서 3 이고 이것을 기준으로 씁니다
# 분포 첨도 수치 이론 초과첨도
# 균등 1.799854 1.800000 -1.200146
# 표준정규 3.001921 3.000000 0.001921
# 라플라스 6.019435 6.000000 3.019435
# 자유도 5 인 t 8.658074 9.000000 5.658074
# 자유도 5 인 t 의 첨도가 이론 9 에 못 미칩니다. 문제 3 이 그 이유를 다룹니다
# 첨도는 봉우리가 뾰족한 정도가 아닙니다. 꼬리가 두꺼운 정도입니다
# 균등분포는 봉우리가 없이 평평한데 첨도가 1.8 로 정규보다 작습니다
# 자유도 5 인 t 첨도 IQR 표본 크기
# 전체 7.847713 1.452148 2000000
# 양끝 0.5 퍼센트를 뺌 3.572736 1.434313 1980000
# 자료의 99 퍼센트는 그대로인데 첨도가 7.8477 에서 3.5727 로 떨어집니다
# IQR 은 1.452148 에서 1.434313 로 거의 그대로입니다
# 첨도는 가장 바깥 1 퍼센트가 거의 다 정합니다. 가운데는 보지 않습니다
# 자유도가 작으면 첨도가 아예 존재하지 않습니다
# 자유도 이론 첨도 4 차 적률
# 3 없음 없음
# 4 없음 없음
# 5 9.0 존재
# 10 4.0 존재
# 30 3.2308 존재
# 자유도가 4 이하이면 네제곱의 기댓값이 발산합니다
# 표본이 작으면 왜도와 첨도가 원리적으로 어느 값 이상 나올 수 없습니다
# 표본 크기 n 왜도의 상한 한 점을 멀리 둠 첨도의 상한 한 점을 멀리 둠
# 5 1.500000 1.500000 3.250000 3.250000
# 10 2.666667 2.666667 8.111111 8.111111
# 30 5.199469 5.199469 28.034483 28.034483
# 100 9.849371 9.849371 98.010101 98.010101
# 1000 31.575323 31.575323 998.001001 998.001001
# 한 점을 아무리 멀리 보내도 그 상한에서 멈춥니다. 상한은 자료가 아니라 n 이 정합니다
# n = 10 이면 첨도의 상한이 8.1111 입니다
# 참 첨도가 9 인 분포에서 10 개를 뽑아도 그 값을 볼 수 없습니다
# 참 첨도가 무한인 분포에서도 마찬가지입니다
# 그래서 작은 표본의 왜도와 첨도는 추정값이 아니라 상한에 눌린 값입니다
# 표본 크기 n 첨도 평균 첨도 표준편차 참값 9 를 넘은 비율
# 10 2.8064 1.0455 0.0000
# 30 4.1103 2.1175 0.0405
# 100 5.4602 3.8011 0.0872
# 1000 7.3368 7.7430 0.1385
# 10000 8.2761 11.6390 0.1658
# n = 10 에서 평균이 참값 9 근처에도 못 갑니다. 상한 8.11 에 막혀 있습니다
# 163강 문제 2 에서 본 것과 같은 뿌리입니다. 높은 차수일수록 추정이 나빠집니다
# 분위수를 맞대어 보는 방법부터 봅니다
# 표본이 나온 분포 이론 분위수와의 상관 최대 차이
# 표준정규 0.999874 0.330212
# 자유도 5 인 t 0.983175 3.678899
# 지수 0.907596 3.768879
# 균등 0.977166 1.937298
# 상관은 넷 다 0.97 을 넘습니다. 상관만 보면 차이를 놓칩니다
# 최대 차이는 꼬리에서 벌어집니다. 그림에서 양끝을 봐야 하는 이유입니다
# 왜도와 첨도를 함께 쓰는 검정도 있습니다. 자르크-베라입니다
# JB = n (왜도^2/6 + 초과첨도^2/24) 이고 귀무가설에서 자유도 2 인 카이제곱입니다
# 표본 크기 n 참으로 정규일 때 기각률 1 퍼센트만 오염될 때 목표
# 20 0.0207 0.1040 0.05
# 100 0.0460 0.3817 0.05
# 1000 0.0457 0.9847 0.05
# 10000 0.0503 1.0000 0.05
# 표본이 크면 1 퍼센트의 오염도 거의 언제나 잡아냅니다
# 그런데 n 이 작으면 같은 오염을 거의 잡지 못합니다
# 검정이 말하는 것은 정규가 아니라는 증거의 세기이지 이탈의 크기가 아닙니다
# 크기는 왜도와 첨도의 값 자체로 봐야 합니다
# 꼬리가 두꺼우면 드문 사건의 확률이 크게 달라집니다
# 평균 0, 표준편차 1 로 맞춘 뒤 5 표준편차를 넘을 확률을 셉니다
# 분포 5 시그마 초과 비율 정규 대비 배수
# 표준정규 0.00000050 1.00
# 라플라스 0.00083650 1673.00
# 자유도 5 인 t 0.00132850 2657.00
# 자유도 3 인 t 0.00328375 6567.50
# 정규를 가정하고 위험을 재면 두꺼운 꼬리에서 크게 과소평가합니다
# 꼬리가 두꺼우면 표본평균이 정규에 가까워지는 속도도 느립니다
# 표본 크기 n 정규 자료의 최대 차이 t(3) 자료의 최대 차이
# 1 0.001145 0.080939
# 5 0.001630 0.044240
# 30 0.001086 0.017833
# 200 0.001659 0.007124
# 143강 중심극한정리는 성립하지만 n 이 같아도 근사의 정확도가 다릅니다
# 아주 두꺼우면 상위 몇 퍼센트가 전체의 대부분을 차지합니다
# 파레토 지수 1.5 인 자료 200 만 개입니다
# 상위 비율 전체 합에서 차지하는 몫
# 1 퍼센트 0.209309
# 5 퍼센트 0.363791
# 10 퍼센트 0.460455
# 20 퍼센트 0.582051
# 50 퍼센트 0.792340
# 지수가 1.5 이면 평균은 있고 분산은 없습니다
# 평균이 있으니 큰 수의 법칙은 성립합니다. 다만 아주 느립니다
# 표본 크기 표본평균 20 번의 흩어짐 직전 대비 줄어든 배수
# 1000 0.186980 -
# 100000 0.043737 4.2751
# 2000000 0.017380 2.5165
# 분산이 없으므로 흩어짐이 1/sqrt(n) 로 줄지 않습니다
# 지수 1.5 이면 이론상 n 의 0.3333 제곱에 반비례해 줄어듭니다
# 표본을 100 배 늘리면 1/sqrt(n) 이면 10 배 좋아지는데 여기서는 4.64 배입니다
# 모양을 모르면 평균이 얼마나 믿을 만한지 알 수 없습니다. 요약 전에 모양을 봐야 합니다