영가설과 대립가설을 세운다→유의수준을 정한다→검정통계량과 p값을 구한다→기각 여부를 판단한다→효과크기와 함께 해석한다
두 가지 오류| 실제 | 기각했다 | 기각하지 못했다 |
|---|
| 영가설이 참 | 제1종 오류(없는 것을 있다고 함) | 옳은 판단 |
|---|
| 영가설이 거짓 | 옳은 판단(검정력) | 제2종 오류(있는 것을 없다고 함) |
|---|
더 알아보기
두 오류 가운데 무엇을 더 두려워할 것인가
유의수준을 0.05로 잡는 것은 관례일 뿐 법칙이 아니다. 어느 오류가 더 값비싼지에 따라 달리 정할 수 있다. 새 약의 부작용을 검증하는 자리라면 없는 효과를 있다고 하는 제1종 오류가 위험하므로 유의수준을 0.01로 조인다. 반대로 위험 아동을 선별하는 검사라면 있는 위험을 놓치는 제2종 오류가 더 무거우므로 기준을 느슨히 잡고 뒤에 정밀 평가로 걸러 낸다. 사회복지 실천에서는 이 판단이 자주 필요하다. 개입이 효과 없다는 결론이 서비스 중단으로 이어진다면 제2종 오류의 대가는 이용자가 치른다. 그래서 표본이 작아 검정력이 낮은 연구에서 「효과가 없었다」는 결론을 내릴 때는 특히 조심해야 하며, 검정력이 얼마였는지를 함께 밝히는 것이 옳다. 두 오류를 함께 줄이는 유일한 길은 표본을 키우는 것이다.
유의확률이 답해 주지 않는 것
p값은 「영가설이 참이라면 지금 같은 자료 또는 그보다 극단적인 자료가 나올 확률」이다. 이 정의에서 곧바로 나오는 사실이 몇 가지 있다. 첫째, p값은 영가설이 참일 확률이 아니다. 둘째, p값은 효과의 크기를 말해 주지 않는다. 표본이 만 명이면 평균 차이가 0.1점이어도 유의해지고, 표본이 스무 명이면 큰 차이도 유의하지 않게 나온다. 셋째, p값은 그 결과가 실천에서 중요한지를 말해 주지 않는다. 그래서 오늘날 보고 관행은 p값 하나만 적는 것을 피하고, 효과크기와 신뢰구간을 함께 싣도록 요구한다. 신뢰구간은 차이가 어느 범위에 있을 법한지를 보여 주므로 크기와 불확실성을 한꺼번에 전한다. 실무 보고서라면 여기에 더해 그 크기의 차이가 이용자의 생활에서 무엇을 뜻하는지까지 적어야 읽는 사람이 판단할 수 있다.