확률표집은 모집단의 각 구성원이 뽑힐 확률을 알 수 있게 표본을 고르는 방식이다. 확률을 알 수 있으므로 표집오차를 계산할 수 있고, 그래야 표본의 값으로 모집단의 값을 추정하고 신뢰구간을 붙일 수 있다. 통계적 추론이 가능한가를 가르는 분수령이 여기다.
단순무작위표집은 표집틀에 있는 모두에게 같은 확률을 주고 제비뽑기하듯 뽑는 방식이다. 난수표나 컴퓨터의 난수 생성으로 실시하며, 확률표집의 원형이자 다른 방법들을 견주는 기준이 된다. 이해하기 쉽고 편향이 끼어들 여지가 적지만, 완전한 표집틀이 있어야 하고 대상이 넓게 흩어져 있으면 찾아다니는 비용이 크다.
계통표집(체계적 표집)은 표집틀에 번호를 매기고 일정한 간격으로 뽑는 방식이다. 모집단이 1,000명이고 100명을 뽑는다면 간격은 10이 되고, 1부터 10 사이에서 무작위로 시작점을 정한 뒤 열 번째마다 뽑는다. 실행이 간편해 명부가 길 때 특히 편하고, 시작점만 무작위라면 결과는 단순무작위표집과 거의 같다.
계통표집에는 한 가지 고유한 위험이 있다. 명부가 뽑는 간격과 맞아떨어지는 주기로 배열되어 있으면 특정 성격의 사람만 계속 뽑힌다. 열 가구가 한 동을 이루고 명부가 동별로 정렬되어 있는데 간격이 10이면 매번 같은 자리의 가구만 뽑히는 식이다. 이를 주기성 문제라 하며, 대비책은 뽑기 전에 명부의 정렬 순서를 확인하고 필요하면 순서를 뒤섞는 것이다. 반대로 명부가 소득순처럼 재려는 변수와 관련된 순서로 정렬되어 있으면, 계통표집이 오히려 고르게 퍼진 표본을 만들어 층화와 비슷한 이점을 낸다.
두 방법 모두 표집틀이 있어야 성립한다는 점은 같다. 명부 없이 길에서 만난 사람을 「무작위로」 골랐다는 말은 확률표집이 아니며, 그렇게 모은 표본에는 오차를 붙일 근거가 없다. 확률표집이라는 이름은 뽑는 사람의 마음가짐이 아니라 절차가 확률 구조를 갖추었는가에 붙는다는 점을 기억해 둘 만하다.
02이해하기
단순무작위표집은 이름을 적은 쪽지를 통에 넣고 잘 흔든 뒤 꺼내는 일이고, 계통표집은 줄 세워 놓고 열 명마다 한 명씩 짚어 가는 일이다. 대개 두 방법의 결과는 다르지 않지만, 줄이 어떤 규칙으로 서 있느냐가 문제가 된다. 열 명마다 조장이 서 있는 줄에서 열 번째마다 짚으면 조장만 뽑히게 된다. 짚는 간격과 줄의 주기가 맞아떨어지는 순간 무작위는 사라진다.
03핵심 포인트
확률표집은 뽑힐 확률을 알 수 있는 방식이며, 그래야 표집오차 계산과 추정이 가능하다.
단순무작위표집은 모두에게 같은 확률을 주는 방식으로 확률표집의 원형이다.
단순무작위표집은 완전한 표집틀이 있어야 하고 대상이 흩어져 있으면 비용이 크다.
계통표집은 번호를 매겨 일정 간격으로 뽑으며, 시작점을 무작위로 정해야 한다.
계통표집의 고유한 위험은 명부의 배열이 간격과 맞아떨어지는 주기성 문제다.
명부가 관련 변수 순으로 정렬되어 있으면 계통표집이 층화와 비슷한 이점을 내기도 한다.
04한 줄 예시
05시험 함정
계통표집에서 시작점을 1로 고정하는 것 — 시작점이 무작위여야 확률표집이 된다.
명부의 정렬 순서를 보지 않고 간격을 정하는 것 — 주기성에 걸리면 표본이 통째로 치우친다.
「무작위로 아무나 골랐다」를 단순무작위표집이라 부르는 것 — 틀과 난수 절차가 있어야 한다.
06한눈에 보기
단순무작위와 계통
단순무작위표집
모두에게 같은 확률. 난수로 뽑는다. 확률표집의 기준이 되나 완전한 표집틀이 필요하고 흩어진 대상에는 비용이 크다.
VS
계통표집
번호를 매겨 일정 간격으로 뽑는다. 시작점만 무작위면 결과가 거의 같고 실행이 간편하다. 주기성에 걸리면 통째로 치우친다.
두 방법의 실행
방법
실행
주의
단순무작위
난수로 표집틀에서 직접 뽑는다
완전한 표집틀·이동 비용
계통
간격을 정하고 시작점을 무작위로 잡는다
명부 배열의 주기성
더 알아보기
확률표집이라야 표집오차를 말할 수 있는 까닭
표본에서 얻은 평균은 모집단의 평균과 얼마쯤 어긋나기 마련이고, 그 어긋남의 크기를 가늠하는 것이 표집오차다. 오차를 계산하려면 「같은 방식으로 표본을 여러 번 뽑았다면 그 평균들이 어떻게 흩어졌을까」를 알아야 하는데, 이 물음에 답하려면 뽑히는 확률 구조가 정해져 있어야 한다. 확률표집은 바로 그 구조를 만들어 주므로 표준오차와 신뢰구간을 계산할 근거가 생긴다. 반대로 비확률표집에서는 각자가 뽑힐 확률을 알 수 없어 이 계산이 성립하지 않는다. 그럼에도 통계 프로그램은 자료만 넣으면 신뢰구간을 찍어 주는데, 편의표본에 붙은 그 구간은 계산은 되었으되 근거가 없는 숫자다. 그래서 표집방법을 밝히지 않은 조사 결과에 붙은 오차 범위는 그 자체로 의심할 만한 자리가 된다.
계통표집의 주기성을 실제로 만나는 자리
주기성은 이론상의 걱정처럼 들리지만 실무에서 드물지 않게 나타난다. 아파트 명부가 동·호수 순으로 정렬되어 있고 한 층에 네 가구가 있다면, 간격을 4나 8로 잡는 순간 같은 라인의 가구만 뽑힌다. 같은 라인은 향과 평형이 같아 가구 구성과 소득이 닮아 있을 수 있으므로 표본이 조용히 치우친다. 병원 일지가 요일 순으로 이어져 있는데 간격이 7의 배수면 늘 같은 요일만 뽑히고, 요일마다 내원하는 환자층이 다르면 그 차이가 그대로 표본에 새겨진다. 대비는 어렵지 않다. 뽑기 전에 명부가 무슨 기준으로 정렬되어 있는지 확인하고, 주기가 의심되면 순서를 무작위로 섞거나 간격을 주기와 어긋나게 잡거나 시작점을 구간마다 새로 뽑는다. 정렬 기준을 확인하지 않은 채 간격만 계산하는 것이 실제 위험이다.
07기출 지문
O
신뢰수준을 높이면 1종 오류를 줄일 수 있다.
신뢰수준을 95%에서 99%로 올리면 유의수준이 5%에서 1%로 내려가 1종 오류 확률이 준다.