추론통계

통계적 가설검정의 절차와 유의수준

미학습

읽고 나면 회독 완료

추론통계는 표본에서 얻은 값으로 모집단에 대해 말하는 통계다. 그 중심 절차가 가설검정이며, 순서는 정해져 있다. 먼저 영가설(귀무가설)과 대립가설(연구가설)을 세운다. 영가설은 「차이가 없다·관계가 없다」는 진술이고, 대립가설은 연구자가 주장하려는 진술이다. 검정은 늘 영가설을 겨냥해 이루어지는데, 「없다」는 진술이라야 자료로 반박할 수 있기 때문이다. 다음으로 유의수준을 정한다. 보통 0.05나 0.01을 쓰며, 영가설이 참인데도 기각하는 잘못을 얼마까지 감수할지 미리 정해 두는 값이다. 그리고 자료로 검정통계량과 유의확률(p값)을 구해, p값이 유의수준보다 작으면 영가설을 기각하고 크면 기각하지 못한다. 판단에는 두 가지 잘못이 따른다. 제1종 오류는 영가설이 참인데 기각하는 것으로 「없는 것을 있다고 하는」 잘못이며, 그 확률이 곧 유의수준이다. 제2종 오류는 영가설이 거짓인데 기각하지 못하는 것으로 「있는 것을 없다고 하는」 잘못이다. 둘은 맞바꿈 관계여서 유의수준을 낮추면 제1종 오류는 줄지만 제2종 오류가 는다. 제2종 오류를 범하지 않을 확률을 검정력이라 하며, 표본이 클수록 커진다. 마지막으로 읽는 법이 중요하다. 기각하지 못했다는 것은 영가설이 참이라는 증명이 아니라 반박할 근거가 모자랐다는 뜻이다. 또 통계적으로 유의하다는 말이 효과가 크다는 뜻도 아니다. 표본이 아주 크면 사소한 차이도 유의해지므로, 유의확률과 함께 효과크기를 보아야 한다. 한 가지 더, 가설은 자료를 보기 전에 세워야 한다. 자료를 훑어 눈에 띄는 차이를 발견한 뒤 그것을 애초의 가설이었던 양 검정하면, 우연히 생긴 차이를 발견으로 둔갑시키게 된다. 여러 변수를 이것저것 검정해 보다가 유의하게 나온 것만 골라 보고하는 일도 같은 잘못이며, 검정 횟수가 늘수록 우연한 유의가 반드시 섞여 들기 때문이다.
가설검정은 「우연히 이럴 수도 있었을까」를 따지는 절차다. 두 집단의 평균이 다르게 나왔을 때, 정말 다른 것인지 아니면 표본을 뽑다 보니 우연히 그렇게 된 것인지 가려야 한다. 그래서 「차이가 없다」고 가정해 놓고, 그 가정 아래에서 지금 같은 자료가 나올 법한지 계산한다. 좀처럼 나오기 어려운 자료라면 애초의 가정을 버리고, 흔히 나올 만한 자료라면 가정을 버릴 근거가 없다고 말한다.
  1. 추론통계는 표본의 값으로 모집단을 말하는 통계이며 그 중심 절차가 가설검정이다.
  2. 영가설은 「차이·관계가 없다」는 진술이고, 검정은 늘 이 영가설을 겨냥해 이루어진다.
  3. 유의수준은 영가설이 참인데 기각하는 잘못을 얼마까지 감수할지 미리 정한 값이다.
  4. 제1종 오류는 없는 것을 있다고 하는 잘못이고 그 확률이 곧 유의수준이다.
  5. 제2종 오류는 있는 것을 없다고 하는 잘못이며, 이를 범하지 않을 확률이 검정력이다.
  6. 기각하지 못한 것은 참임의 증명이 아니고, 유의하다는 말도 효과가 크다는 뜻이 아니다.
  1. 「기각하지 못했다」를 「차이가 없음이 증명되었다」로 읽는 것 — 근거가 모자랐을 뿐이다.
  2. 유의확률이 작으면 효과가 크다고 읽는 것 — 표본이 크면 사소한 차이도 유의해진다.
  3. 자료를 본 뒤에 유의수준을 고쳐 잡는 것 — 유의수준은 미리 정해 두는 값이다.
영가설과 대립가설을 세운다유의수준을 정한다검정통계량과 p값을 구한다기각 여부를 판단한다효과크기와 함께 해석한다
두 가지 오류
실제기각했다기각하지 못했다
영가설이 참제1종 오류(없는 것을 있다고 함)옳은 판단
영가설이 거짓옳은 판단(검정력)제2종 오류(있는 것을 없다고 함)

더 알아보기

두 오류 가운데 무엇을 더 두려워할 것인가

유의수준을 0.05로 잡는 것은 관례일 뿐 법칙이 아니다. 어느 오류가 더 값비싼지에 따라 달리 정할 수 있다. 새 약의 부작용을 검증하는 자리라면 없는 효과를 있다고 하는 제1종 오류가 위험하므로 유의수준을 0.01로 조인다. 반대로 위험 아동을 선별하는 검사라면 있는 위험을 놓치는 제2종 오류가 더 무거우므로 기준을 느슨히 잡고 뒤에 정밀 평가로 걸러 낸다. 사회복지 실천에서는 이 판단이 자주 필요하다. 개입이 효과 없다는 결론이 서비스 중단으로 이어진다면 제2종 오류의 대가는 이용자가 치른다. 그래서 표본이 작아 검정력이 낮은 연구에서 「효과가 없었다」는 결론을 내릴 때는 특히 조심해야 하며, 검정력이 얼마였는지를 함께 밝히는 것이 옳다. 두 오류를 함께 줄이는 유일한 길은 표본을 키우는 것이다.

유의확률이 답해 주지 않는 것

p값은 「영가설이 참이라면 지금 같은 자료 또는 그보다 극단적인 자료가 나올 확률」이다. 이 정의에서 곧바로 나오는 사실이 몇 가지 있다. 첫째, p값은 영가설이 참일 확률이 아니다. 둘째, p값은 효과의 크기를 말해 주지 않는다. 표본이 만 명이면 평균 차이가 0.1점이어도 유의해지고, 표본이 스무 명이면 큰 차이도 유의하지 않게 나온다. 셋째, p값은 그 결과가 실천에서 중요한지를 말해 주지 않는다. 그래서 오늘날 보고 관행은 p값 하나만 적는 것을 피하고, 효과크기와 신뢰구간을 함께 싣도록 요구한다. 신뢰구간은 차이가 어느 범위에 있을 법한지를 보여 주므로 크기와 불확실성을 한꺼번에 전한다. 실무 보고서라면 여기에 더해 그 크기의 차이가 이용자의 생활에서 무엇을 뜻하는지까지 적어야 읽는 사람이 판단할 수 있다.

0개

이 기출이 도움이 됐다면, 봄기출 앱에서도 공부해 보세요.