표집오차

표집오차와 표준오차, 신뢰수준과 신뢰구간

미학습

읽고 나면 회독 완료

표집오차는 전체가 아닌 일부만 조사했기 때문에 생기는, 표본의 값과 모집단의 값 사이의 어긋남이다. 잘못해서 생기는 것이 아니라 표집을 하는 한 반드시 따라오는 것이며, 그래서 없애는 것이 아니라 크기를 계산하고 밝히는 것이 목표가 된다. 같은 방식으로 표본을 여러 번 뽑으면 표본평균은 그때마다 조금씩 다르게 나온다. 그 값들이 흩어진 정도를 나타내는 것이 표준오차이며, 표집오차의 크기를 재는 잣대 노릇을 한다. 표준오차는 표본이 클수록 작아지고, 모집단의 흩어짐이 클수록 커진다. 다만 표본을 네 배로 늘려야 표준오차가 절반이 되는 관계여서, 표본을 키워 오차를 줄이는 일은 점점 더 비싸진다. 신뢰수준은 그렇게 만든 구간이 모수를 담을 것이라고 말하는 확신의 정도로, 보통 95퍼센트나 99퍼센트를 쓴다. 신뢰구간은 그 확신을 붙여 「모수가 이 사이에 있을 것」이라고 제시하는 범위다. 지지율 42퍼센트에 오차 범위 ±3퍼센트포인트를 붙였다면 39에서 45퍼센트가 신뢰구간이다. 둘은 맞바꿈 관계에 있다. 같은 표본에서 신뢰수준을 95에서 99퍼센트로 높이면 더 확신하려는 만큼 구간이 넓어져 말이 뭉툭해지고, 구간을 좁히려면 확신을 낮추거나 표본을 키워야 한다. 「확신은 높이면서 범위는 좁히는」 길은 표본을 키우는 것뿐이다. 마지막으로 표집오차는 확률표집에서만 계산된다. 그리고 표집오차는 조사가 안는 여러 오차 가운데 하나일 뿐이어서, 무응답과 측정오류처럼 표집 밖에서 생기는 비표집오차는 표본을 키워도 줄지 않는다. 오차를 줄이는 길이 표본을 키우는 것만 있는 것도 아니다. 층화표집을 쓰면 같은 인원으로도 오차가 줄고, 반대로 집락표집을 쓰면 같은 인원이라도 오차가 커진다. 곧 표집오차의 크기는 표본 수와 모집단의 흩어짐, 그리고 어떤 설계로 뽑았는가가 함께 정하는 값이며, 표본 수만 적어 놓고 오차를 논하는 보고는 그 절반만 말한 셈이 된다.
국에서 한 숟갈을 떠 간을 보면 그 맛은 냄비 전체의 맛과 조금 다르다. 이 어긋남이 표집오차이고, 여러 번 떠 보았을 때 맛이 얼마나 들쭉날쭉한지가 표준오차다. 숟갈을 크게 뜰수록 편차는 줄지만 두 배 크게 떠도 편차가 절반이 되지는 않는다. 신뢰수준을 높인다는 것은 「이 사이 어딘가입니다」라고 말하는 범위를 넓혀 틀릴 여지를 줄이는 일이어서, 확신과 정밀함은 한 표본 안에서 서로를 갉아먹는다.
  1. 표집오차는 일부만 조사했기에 생기는 어긋남으로, 없앨 수 없고 크기를 밝히는 것이 목표다.
  2. 표준오차는 표본평균들이 흩어진 정도이며 표집오차의 크기를 재는 잣대가 된다.
  3. 표준오차는 표본이 클수록 작아지지만, 절반으로 줄이려면 표본을 네 배로 키워야 한다.
  4. 신뢰수준은 구간이 모수를 담으리라는 확신의 정도이고 신뢰구간은 제시하는 범위다.
  5. 같은 표본에서 신뢰수준을 높이면 구간이 넓어진다 — 확신과 정밀함은 맞바꿈이다.
  6. 비표집오차(무응답·측정오류)는 표본을 키워도 줄지 않는다는 점을 함께 기억한다.
  1. 표본을 두 배로 늘리면 오차가 절반이 된다고 보는 것 — 네 배를 늘려야 절반이 된다.
  2. 신뢰수준을 높이면 결과가 더 정밀해진다고 읽는 것 — 확신이 오르는 만큼 구간은 넓어진다.
  3. 편의표본에 오차 범위를 붙이는 것 — 표집오차는 확률표집에서만 계산된다.
확률표집으로 뽑는다표본에서 통계치를 구한다표준오차를 계산한다신뢰수준을 정해 구간을 붙인다
오차를 움직이는 것들
바꾸는 것표집오차비고
표본을 키운다작아진다네 배 키워야 절반이 된다
모집단이 더 흩어져 있다커진다이질적일수록 크다
신뢰수준을 높인다구간이 넓어진다확신과 정밀함의 맞바꿈
층화를 한다작아진다층 안이 비슷할수록 효과가 크다

더 알아보기

신뢰구간을 읽는 정확한 말

「95퍼센트 신뢰구간이 39에서 45퍼센트」라는 말은 흔히 「모수가 이 사이에 있을 확률이 95퍼센트」로 읽히지만, 엄밀히는 그런 뜻이 아니다. 모수는 이미 정해진 하나의 값이므로 확률을 갖지 않으며, 확률을 갖는 것은 표본을 뽑을 때마다 달라지는 구간 쪽이다. 정확히 말하면 같은 방식으로 표본을 뽑아 구간을 만드는 일을 백 번 되풀이했을 때 그 가운데 대략 아흔다섯 개의 구간이 모수를 담는다는 뜻이다. 이 차이가 사소해 보여도 해석에서는 크게 갈린다. 특히 두 집단의 신뢰구간이 조금 겹친다고 해서 곧바로 「차이가 없다」고 말할 수 없는 것도 이 때문이며, 차이를 따지려면 차이 자체에 대한 구간을 따로 구해야 한다. 조사 보도에서 오차 범위 안의 격차를 두고 앞섰다고 말하는 것도 같은 잘못이다.

표본을 키워도 줄지 않는 오차

조사의 오차를 표집오차 하나로 생각하면 표본만 키우면 되는 문제처럼 보인다. 그러나 실제 조사에서 결과를 더 크게 망치는 것은 대개 표집 밖에서 생기는 오차다. 응답을 거절한 사람들이 특정 성향으로 치우쳐 있으면 무응답 편향이 생기는데, 이것은 응답자를 아무리 늘려도 그대로 남는다. 문항이 유도적이거나 응답자가 좋게 보이려 답하면 측정오류가 얹히고, 자료를 옮겨 적는 과정에서 실수가 끼기도 한다. 이런 것들을 비표집오차라 하며, 표집오차와 달리 계산해 밝힐 방법이 마땅치 않다는 점이 더 곤란하다. 그래서 조사의 질은 표본 크기보다 응답률, 문항의 품질, 실시 절차의 관리에 더 크게 달려 있다. 표본 1,000명에 응답률 20퍼센트인 조사보다 500명에 응답률 70퍼센트인 조사가 대개 더 믿을 만하다.

0개

이 기출이 도움이 됐다면, 봄기출 앱에서도 공부해 보세요.