표본의 크기

표본의 크기를 정하는 것들

미학습

읽고 나면 회독 완료

표본을 얼마나 뽑아야 하는가에는 정답으로 정해진 수가 없고, 몇 가지 조건이 함께 정한다. 첫째는 원하는 정밀도다. 오차 범위를 좁게 잡을수록 표본이 커야 하며, 표준오차가 표본 크기의 제곱근에 반비례하므로 오차를 절반으로 줄이려면 표본을 네 배로 늘려야 한다. 둘째는 신뢰수준으로, 95퍼센트에서 99퍼센트로 올리면 같은 정밀도를 지키기 위해 표본이 커진다. 셋째는 모집단의 이질성이다. 구성원이 서로 비슷하면 적게 뽑아도 되고, 흩어져 있으면 많이 뽑아야 한다. 넷째는 분석 계획이다. 전체 평균만 볼 것인지, 성별·연령대별로 쪼개 볼 것인지에 따라 필요한 수가 크게 달라진다. 쪼갤 칸이 많아질수록 각 칸에 최소 인원이 필요하므로, 흔히 표본 크기를 정하는 실제 이유가 여기에 있다. 다섯째는 표집방법이다. 집락표집은 설계효과 때문에 같은 정밀도를 얻으려면 더 많이 뽑아야 하고, 층화표집은 더 적게 뽑아도 된다. 여섯째는 예상 응답률과 탈락률로, 최종에 필요한 수를 응답률로 나누어 처음 접촉할 수를 정한다. 마지막은 예산과 시간이라는 현실 조건이다. 한 가지 흔한 오해를 짚어 둘 만하다. 모집단이 크다고 표본을 그 비율만큼 키워야 하는 것은 아니다. 모집단이 어느 정도 이상 커지면 표준오차는 모집단 크기와 거의 무관해지고 표본 크기에만 달린다. 전국 조사와 한 도시 조사의 표본이 비슷한 규모인 까닭이 여기에 있다. 반대로 모집단이 작을 때는 표본이 그 상당 부분을 차지해 오차가 줄어드는데, 이를 유한모집단 수정이라 한다. 정리하면 표본 크기를 정하는 순서는 분석 계획을 그리고, 그 계획이 요구하는 정밀도를 정하고, 설계효과와 응답률로 수를 부풀린 뒤, 예산과 맞대어 조정하는 것이다. 공식은 이 순서의 세 번째 자리에서 쓰이는 도구일 뿐, 첫 자리를 대신해 주지 않는다.
표본 크기는 「몇 명이면 충분한가」가 아니라 「무엇을 얼마나 정밀하게 말하고 싶은가」에서 거꾸로 계산되는 값이다. 전체 만족도만 대략 알고 싶다면 적은 수로도 되지만, 성별과 연령대와 지역으로 쪼개어 각 칸을 비교하고 싶다면 칸 수만큼 사람이 필요하다. 그래서 표본 크기를 정하는 일은 통계 계산이기 이전에 분석 계획을 미리 그려 보는 일이다.
  1. 표본 크기는 정해진 정답이 없고 정밀도·신뢰수준·이질성·분석계획이 함께 정한다.
  2. 오차 범위를 절반으로 줄이려면 표본을 네 배로 늘려야 한다는 관계를 기억한다.
  3. 모집단이 이질적일수록, 곧 흩어짐이 클수록 같은 정밀도를 얻는 데 더 많은 표본이 든다.
  4. 하위집단별로 쪼개어 볼 계획이 있으면 칸마다 최소 인원이 필요해 표본이 커진다.
  5. 집락표집은 설계효과 때문에 같은 정밀도를 얻으려면 더 많은 표본을 뽑아야 한다.
  6. 모집단이 크다고 표본을 비례해 키울 필요는 없다 — 오차는 표본 크기에 주로 달렸다.
  1. 「모집단의 10퍼센트」처럼 비율로 표본 크기를 정하는 것 — 오차는 비율이 아니라 크기에 달렸다.
  2. 전체 인원만 채우고 하위집단 인원을 확인하지 않는 것 — 쪼개는 순간 칸이 텅 빈다.
  3. 응답률을 셈에 넣지 않고 목표 인원만큼만 접촉하는 것 — 최종 표본이 모자란다.
분석 계획을 그린다필요한 정밀도를 정한다설계효과와 응답률을 감안한다접촉할 인원을 정한다
표본을 키워야 하는 조건
조건표본 크기까닭
오차 범위를 좁힌다커진다제곱근에 반비례한다
신뢰수준을 높인다커진다같은 정밀도를 지키려면
모집단이 이질적이다커진다흩어짐이 클수록 오차가 크다
하위집단을 나눠 본다커진다칸마다 최소 인원이 필요하다
집락표집을 쓴다커진다설계효과만큼 실질 표본이 준다

더 알아보기

분석 계획이 표본 크기를 정하는 실제 과정

보고서에 실을 표를 미리 그려 보면 필요한 표본이 저절로 드러난다. 전체 만족도 평균 하나만 낼 것이라면 몇백 명으로도 넉넉하지만, 성별 두 칸과 연령대 네 칸을 교차해 여덟 칸을 견주겠다고 하면 이야기가 달라진다. 각 칸에서 의미 있는 비교를 하려면 최소한 서른에서 쉰 명은 있어야 하고, 여덟 칸이면 그것만으로 사백 명 가까이 필요하다. 게다가 칸마다 인원이 고르게 채워지지 않아 어떤 칸은 모집단에서 원래 드물다. 이럴 때는 전체를 무작정 키우기보다 그 칸을 따로 넉넉히 뽑는 비비례층화를 쓰고 나중에 가중치로 되돌리는 편이 값싸다. 요컨대 표본 크기 계산은 공식에 숫자를 넣는 일이 아니라, 어떤 표를 낼 것인지 정하는 일에서 시작한다. 계획 없이 뽑아 놓고 나중에 쪼개려 들면 칸이 비어 아무것도 말하지 못한다.

모집단 크기와 표본 크기가 거의 무관한 이유

직관과 어긋나 보이지만, 전국민을 대상으로 하든 한 도시를 대상으로 하든 필요한 표본 수는 크게 다르지 않다. 표준오차 공식에서 모집단 크기는 거의 등장하지 않고 표본 크기만이 분모에 들어가기 때문이다. 국을 간볼 때 냄비가 크든 작든 잘 저었다면 한 숟갈이면 된다는 비유가 여기에 들어맞는다. 다만 모집단이 표본에 비해 그리 크지 않을 때는 사정이 다르다. 모집단이 300명인데 200명을 조사했다면 이미 대부분을 본 셈이므로 오차가 줄어드는데, 이 감소를 반영하는 것이 유한모집단 수정이다. 대체로 표본이 모집단의 5퍼센트를 넘어서면 이 수정을 적용할 만하다. 한 기관의 이용자 전수에 가까운 조사를 할 때 마주치는 상황이며, 이때는 표본 크기 공식을 그대로 쓰면 필요 인원이 과대하게 나온다.

0개

이 기출이 도움이 됐다면, 봄기출 앱에서도 공부해 보세요.