확률표집

단순무작위표집과 계통표집

미학습

읽고 나면 회독 완료

확률표집은 모집단의 각 구성원이 뽑힐 확률을 알 수 있게 표본을 고르는 방식이다. 확률을 알 수 있으므로 표집오차를 계산할 수 있고, 그래야 표본의 값으로 모집단의 값을 추정하고 신뢰구간을 붙일 수 있다. 통계적 추론이 가능한가를 가르는 분수령이 여기다. 단순무작위표집은 표집틀에 있는 모두에게 같은 확률을 주고 제비뽑기하듯 뽑는 방식이다. 난수표나 컴퓨터의 난수 생성으로 실시하며, 확률표집의 원형이자 다른 방법들을 견주는 기준이 된다. 이해하기 쉽고 편향이 끼어들 여지가 적지만, 완전한 표집틀이 있어야 하고 대상이 넓게 흩어져 있으면 찾아다니는 비용이 크다. 계통표집(체계적 표집)은 표집틀에 번호를 매기고 일정한 간격으로 뽑는 방식이다. 모집단이 1,000명이고 100명을 뽑는다면 간격은 10이 되고, 1부터 10 사이에서 무작위로 시작점을 정한 뒤 열 번째마다 뽑는다. 실행이 간편해 명부가 길 때 특히 편하고, 시작점만 무작위라면 결과는 단순무작위표집과 거의 같다. 계통표집에는 한 가지 고유한 위험이 있다. 명부가 뽑는 간격과 맞아떨어지는 주기로 배열되어 있으면 특정 성격의 사람만 계속 뽑힌다. 열 가구가 한 동을 이루고 명부가 동별로 정렬되어 있는데 간격이 10이면 매번 같은 자리의 가구만 뽑히는 식이다. 이를 주기성 문제라 하며, 대비책은 뽑기 전에 명부의 정렬 순서를 확인하고 필요하면 순서를 뒤섞는 것이다. 반대로 명부가 소득순처럼 재려는 변수와 관련된 순서로 정렬되어 있으면, 계통표집이 오히려 고르게 퍼진 표본을 만들어 층화와 비슷한 이점을 낸다. 두 방법 모두 표집틀이 있어야 성립한다는 점은 같다. 명부 없이 길에서 만난 사람을 「무작위로」 골랐다는 말은 확률표집이 아니며, 그렇게 모은 표본에는 오차를 붙일 근거가 없다. 확률표집이라는 이름은 뽑는 사람의 마음가짐이 아니라 절차가 확률 구조를 갖추었는가에 붙는다는 점을 기억해 둘 만하다.
단순무작위표집은 이름을 적은 쪽지를 통에 넣고 잘 흔든 뒤 꺼내는 일이고, 계통표집은 줄 세워 놓고 열 명마다 한 명씩 짚어 가는 일이다. 대개 두 방법의 결과는 다르지 않지만, 줄이 어떤 규칙으로 서 있느냐가 문제가 된다. 열 명마다 조장이 서 있는 줄에서 열 번째마다 짚으면 조장만 뽑히게 된다. 짚는 간격과 줄의 주기가 맞아떨어지는 순간 무작위는 사라진다.
  1. 확률표집은 뽑힐 확률을 알 수 있는 방식이며, 그래야 표집오차 계산과 추정이 가능하다.
  2. 단순무작위표집은 모두에게 같은 확률을 주는 방식으로 확률표집의 원형이다.
  3. 단순무작위표집은 완전한 표집틀이 있어야 하고 대상이 흩어져 있으면 비용이 크다.
  4. 계통표집은 번호를 매겨 일정 간격으로 뽑으며, 시작점을 무작위로 정해야 한다.
  5. 계통표집의 고유한 위험은 명부의 배열이 간격과 맞아떨어지는 주기성 문제다.
  6. 명부가 관련 변수 순으로 정렬되어 있으면 계통표집이 층화와 비슷한 이점을 내기도 한다.
  1. 계통표집에서 시작점을 1로 고정하는 것 — 시작점이 무작위여야 확률표집이 된다.
  2. 명부의 정렬 순서를 보지 않고 간격을 정하는 것 — 주기성에 걸리면 표본이 통째로 치우친다.
  3. 「무작위로 아무나 골랐다」를 단순무작위표집이라 부르는 것 — 틀과 난수 절차가 있어야 한다.

단순무작위와 계통

단순무작위표집

모두에게 같은 확률. 난수로 뽑는다. 확률표집의 기준이 되나 완전한 표집틀이 필요하고 흩어진 대상에는 비용이 크다.

계통표집

번호를 매겨 일정 간격으로 뽑는다. 시작점만 무작위면 결과가 거의 같고 실행이 간편하다. 주기성에 걸리면 통째로 치우친다.

두 방법의 실행
방법실행주의
단순무작위난수로 표집틀에서 직접 뽑는다완전한 표집틀·이동 비용
계통간격을 정하고 시작점을 무작위로 잡는다명부 배열의 주기성

더 알아보기

확률표집이라야 표집오차를 말할 수 있는 까닭

표본에서 얻은 평균은 모집단의 평균과 얼마쯤 어긋나기 마련이고, 그 어긋남의 크기를 가늠하는 것이 표집오차다. 오차를 계산하려면 「같은 방식으로 표본을 여러 번 뽑았다면 그 평균들이 어떻게 흩어졌을까」를 알아야 하는데, 이 물음에 답하려면 뽑히는 확률 구조가 정해져 있어야 한다. 확률표집은 바로 그 구조를 만들어 주므로 표준오차와 신뢰구간을 계산할 근거가 생긴다. 반대로 비확률표집에서는 각자가 뽑힐 확률을 알 수 없어 이 계산이 성립하지 않는다. 그럼에도 통계 프로그램은 자료만 넣으면 신뢰구간을 찍어 주는데, 편의표본에 붙은 그 구간은 계산은 되었으되 근거가 없는 숫자다. 그래서 표집방법을 밝히지 않은 조사 결과에 붙은 오차 범위는 그 자체로 의심할 만한 자리가 된다.

계통표집의 주기성을 실제로 만나는 자리

주기성은 이론상의 걱정처럼 들리지만 실무에서 드물지 않게 나타난다. 아파트 명부가 동·호수 순으로 정렬되어 있고 한 층에 네 가구가 있다면, 간격을 4나 8로 잡는 순간 같은 라인의 가구만 뽑힌다. 같은 라인은 향과 평형이 같아 가구 구성과 소득이 닮아 있을 수 있으므로 표본이 조용히 치우친다. 병원 일지가 요일 순으로 이어져 있는데 간격이 7의 배수면 늘 같은 요일만 뽑히고, 요일마다 내원하는 환자층이 다르면 그 차이가 그대로 표본에 새겨진다. 대비는 어렵지 않다. 뽑기 전에 명부가 무슨 기준으로 정렬되어 있는지 확인하고, 주기가 의심되면 순서를 무작위로 섞거나 간격을 주기와 어긋나게 잡거나 시작점을 구간마다 새로 뽑는다. 정렬 기준을 확인하지 않은 채 간격만 계산하는 것이 실제 위험이다.

O

신뢰수준을 높이면 1종 오류를 줄일 수 있다.

신뢰수준을 95%에서 99%로 올리면 유의수준이 5%에서 1%로 내려가 1종 오류 확률이 준다.

2017년 제15회 4번 문제 보기 →
X

유의수준을 낮추면 1종 오류가 늘어난다.

유의수준(α)은 1종 오류 확률의 상한이라 낮추면 1종 오류는 준다 — 대신 2종 오류가 는다.

2017년 제15회 4번 문제 보기 →
O

유의확률이 유의수준보다 낮으면 영가설이 기각된다.

유의확률(p값)이 미리 정한 유의수준보다 작으면 영가설을 기각하고 연구가설을 받아들인다.

2017년 제15회 4번 문제 보기 →
O

2종 오류가 증가하면 통계적 검정력은 감소한다.

통계적 검정력은 1−β(2종 오류 확률)라서 2종 오류가 늘면 검정력은 준다.

2017년 제15회 4번 문제 보기 →
O

2종 오류는 실제로는 참이 아닌 영가설을 기각하지 못하는 것을 말한다.

2종 오류는 거짓인 영가설을 기각하지 못하는 것이고, 1종 오류는 참인 영가설을 기각하는 것이다.

2017년 제15회 4번 문제 보기 →
O

모집단으로부터 표본으로 추출될 확률을 알 수 있다.

확률표집은 각 요소가 뽑힐 확률을 알 수 있어 표집오차를 계산하고 모집단을 추정할 수 있다.

2017년 제15회 13번 문제 보기 →
O

비비례층화(disproportionate stratified)표집은 확률표집이다.

비비례층화표집은 층별 비율과 다르게 뽑아도 층 안에서는 무작위로 뽑으므로 확률표집이다.

2017년 제15회 13번 문제 보기 →
X

신뢰수준이 높을수록 표본오차는 감소한다.

신뢰수준을 높이면 신뢰구간이 넓어져 표본오차는 커진다 — 같은 오차를 유지하려면 표본을 늘려야 한다.

2017년 제15회 13번 문제 보기 →
O

표본의 수가 증가할수록 표본오차는 감소한다.

표본크기가 커질수록 표본오차는 준다 — 오차는 표본크기의 제곱근에 반비례해 4배로 늘려야 절반이 된다.

2017년 제15회 13번 문제 보기 →
O

표집오차는 모집단의 모수와 표본의 통계치 간의 차이다.

표집오차는 모수와 통계치의 차이로, 일부만 뽑았기 때문에 생기며 전수조사에는 없다.

2018년 제16회 9번 문제 보기 →
O

표준오차는 무수히 많은 표본평균의 통계치가 모집단의 모수로부터 평균적으로 떨어진 거리를 의미한다.

표준오차는 표본평균들의 분포(표집분포)의 표준편차로, 표본평균이 모평균에서 평균적으로 떨어진 정도다.

2018년 제16회 9번 문제 보기 →
0개

이 기출이 도움이 됐다면, 봄기출 앱에서도 공부해 보세요.