통계적 검증은 두 개의 가설을 세워 놓고 진행한다. 연구가설(대립가설, H1)은 연구자가 주장하려는 것으로 「차이가 있다」, 「관계가 있다」는 진술이다. 영가설(귀무가설, H0)은 그 반대로 「차이가 없다」, 「관계가 없다」는 진술이다.
검증의 방식이 특이하다. 연구가설을 직접 증명하는 것이 아니라 영가설을 기각할 수 있는지를 따진다. 자료가 「차이가 없다」로는 설명하기 어려울 만큼 강하면 영가설을 기각하고 연구가설을 채택한다. 반대로 기각할 만큼 강하지 않으면 영가설을 기각하지 못한다. 이때 「영가설이 참임을 증명했다」고 말하지 않는다는 점이 중요하다.
판단에는 언제나 틀릴 가능성이 따르며, 두 방향의 오류가 있다. 제1종 오류(Type I error, α) — 영가설이 참인데 기각하는 오류다. 실제로는 차이가 없는데 있다고 판정하는 것이며, 없는 효과를 있다고 하는 잘못이다. 제2종 오류(Type II error, β) — 영가설이 거짓인데 기각하지 못하는 오류다. 실제로는 차이가 있는데 없다고 판정하는 것이며, 있는 효과를 놓치는 잘못이다.
유의수준(α)은 제1종 오류를 얼마나 허용할지 미리 정해 둔 기준이며 흔히 .05나 .01을 쓴다. 유의수준을 낮추면 제1종 오류는 줄지만 제2종 오류는 늘어난다 — 둘은 서로 맞바꾸는 관계다. 검정력(power, 1−β)은 실제로 있는 차이를 찾아내는 능력이며, 표본 크기를 늘리면 두 오류를 함께 줄일 수 있다.
결과를 읽을 때는 유의성과 효과 크기를 함께 본다. 유의성은 「우연으로 보기 어려운가」를 답할 뿐 「얼마나 큰 차이인가」는 말해 주지 않으며, 표본이 크면 실질적으로 무의미한 차이도 유의하게 나온다. 그래서 효과 크기와 신뢰구간을 함께 보고하는 것이 원칙이다.
02이해하기
통계 검증은 내 주장을 증명하는 방식이 아니라 반대 주장을 무너뜨리는 방식으로 진행된다. 차이가 없다는 가정을 세워 놓고 자료가 그것으로 설명되지 않을 만큼 강한지를 따지는 것이다. 그래서 결론도 조심스럽다. 기각하지 못했다는 것은 차이가 없다는 뜻이 아니라 차이가 있다고 말할 만큼의 근거가 없다는 뜻이다.
03핵심 포인트
통계적 검증은 연구가설(대립가설, H1)과 영가설(귀무가설, H0) 둘을 세워 놓고 진행한다.
연구가설은 연구자가 주장하려는 「차이가 있다·관계가 있다」는 진술을 말한다.
영가설은 그 반대로 「차이가 없다·관계가 없다」는 진술이며 검증의 실제 대상이다.
검증은 연구가설을 직접 증명하지 않고 영가설을 기각할 수 있는지를 따지는 방식으로 한다.
기각하지 못했을 때 「영가설이 참임을 증명했다」고 말하지 않는 것이 중요한 원칙이다.
제1종 오류(α) — 영가설이 참인데 기각하는 오류로 없는 효과를 있다고 하는 잘못이다.
제2종 오류(β) — 영가설이 거짓인데 기각하지 못하는 오류로 있는 효과를 놓치는 잘못이다.
유의수준(α)은 제1종 오류를 얼마나 허용할지 미리 정한 기준이며 흔히 .05나 .01을 쓴다.
유의수준을 낮추면 제1종 오류는 줄지만 제2종 오류는 늘어나 둘은 맞바꾸는 관계에 있다.
검정력(1−β)은 실제 차이를 찾아내는 능력이며 표본을 늘리면 두 오류를 함께 줄일 수 있다.
04한 줄 예시
05시험 함정
제1종과 제2종 오류를 뒤바꾸기 쉽다. 없는 것을 있다고 하면 제1종, 있는 것을 없다고 하면 제2종이다.
「영가설을 채택했다」고 쓰지 않는다. 정확한 표현은 「기각하지 못했다」이며, 차이가 없음을 증명한 것이 아니다.
통계적 유의성을 실질적 중요성과 같은 것으로 놓지 않는다. 표본이 크면 아주 작은 차이도 유의하게 나오며, 그 차이가 실천에서 뜻이 있는지는 따로 판단한다.
유의수준을 결과를 보고 나서 정하지 않는다. 자료를 보기 전에 정해 두어야 하며, 뒤에 바꾸면 검증의 의미가 사라진다.
유의하지 않다는 결과를 「효과가 없다」로 단정하지 않는다. 표본이 작아 검정력이 부족했을 가능성을 먼저 살펴야 한다.
06한눈에 보기
영가설을 세운다→유의수준을 정한다→자료를 모아 검정한다→기각 여부를 판단한다→결론을 조심스럽게 적는다
두 오류의 자리
실제 상태 \\ 판단
영가설을 기각한다
영가설을 기각하지 못한다
**영가설이 참**(차이가 없다)
제1종 오류(α) — 없는 효과를 있다고
옳은 판단
**영가설이 거짓**(차이가 있다)
옳은 판단 — 검정력(1−β)
제2종 오류(β) — 있는 효과를 놓침
더 알아보기
두 오류 가운데 무엇이 더 위험한가
제1종과 제2종 오류 가운데 어느 것을 더 경계할지는 상황이 정한다. 전통적으로 과학은 제1종 오류를 더 무겁게 보아 유의수준을 낮게 잡아 왔다 — 없는 효과를 있다고 주장하는 것이 학문에 더 해롭다고 보았기 때문이다. 그러나 실천의 자리에서는 다를 수 있다. 효과가 있는 개입을 없다고 판정하면(제2종) 도움이 될 서비스가 중단되고, 그 대가는 이용자가 치른다. 반대로 효과가 없는 개입을 있다고 판정하면(제1종) 쓸모없는 사업에 자원이 계속 들어가고, 더 나은 대안이 밀린다. 위험이 큰 개입(부작용이 있는 처치, 강제성이 따르는 조치)에서는 제1종 오류를 특히 경계해야 하고, 위험이 낮고 비용이 적은 개입에서는 제2종 오류를 더 걱정하는 편이 합리적이다. 실무적으로 중요한 것은 검정력을 미리 확보하는 것이다. 표본이 너무 작으면 실제로 효과가 있어도 유의하게 나오지 않으며, 그 결과 「효과 없음」으로 보고되어 사업이 중단된다. 그래서 평가 설계 단계에서 필요한 표본 크기를 미리 계산해 두는 것이 두 오류를 함께 줄이는 가장 실용적인 방법이다.
통계적 유의성과 실질적 중요성
통계 결과를 읽을 때 가장 자주 저지르는 잘못이 유의성과 중요성을 같은 것으로 보는 것이다. 「p < .05」는 「이 정도의 차이가 우연히 나올 가능성이 낮다」는 뜻이지 「이 차이가 크다」거나 「실천에서 뜻이 있다」는 뜻이 아니다. 두 가지가 이 오해를 부른다. 첫째, 표본 크기의 효과. 표본이 아주 크면 실질적으로 무의미한 차이도 통계적으로 유의하게 나온다. 만 명을 조사하면 척도 점수 0.3점 차이도 유의해질 수 있는데, 그 0.3점이 삶에서 무엇을 뜻하는지는 통계가 답하지 않는다. 둘째, 「유의하지 않다」의 오독. 유의하지 않은 결과는 「차이가 없다」가 아니라 「차이가 있다고 말할 근거가 부족하다」이며, 표본이 작았을 가능성이 크다. 이 둘을 막는 방법이 효과 크기(effect size)를 함께 보고하는 것이다. 유의성은 「우연인가」를 답하고 효과 크기는 「얼마나 큰가」를 답하므로, 둘을 함께 보아야 실천으로 옮길 판단이 선다. 여기에 신뢰구간을 덧붙이면 그 추정이 얼마나 정확한지까지 알 수 있다.