확률표집

층화표집과 집락표집

미학습

읽고 나면 회독 완료

층화표집은 모집단을 성격이 비슷한 층으로 나눈 뒤 각 층에서 따로 뽑는 방식이다. 성별·연령대·지역·소득분위처럼 결과와 관련이 깊은 기준으로 층을 나누고, 층 안에서는 무작위로 뽑는다. 각 층이 반드시 표본에 들어가므로 표집오차가 줄고 대표성이 높아진다. 층 크기에 비례해 뽑으면 비례층화, 작은 층을 따로 충분히 뽑으면 비비례층화이며, 소수집단을 따로 분석해야 할 때 후자를 쓴다. 집락표집(군집표집)은 모집단을 여러 요소가 묶인 덩어리로 나눈 뒤 덩어리째 뽑고, 뽑힌 덩어리 안을 전부 또는 다시 표집해 조사하는 방식이다. 학교·마을·복지관처럼 이미 존재하는 묶음을 그대로 쓰며, 전국 조사처럼 완전한 표집틀이 없고 대상이 널리 흩어져 있을 때 비용을 크게 줄여 준다. 덩어리를 뽑고 그 안에서 다시 뽑는 것을 다단계 집락표집이라 한다. 두 방법은 겉모습이 닮아 헷갈리지만 발상이 반대다. 층화는 층 안이 비슷하고 층끼리 다르도록 나누어 모든 층에서 뽑고, 집락은 덩어리 안이 다양하고 덩어리끼리 비슷하도록 보아 일부 덩어리만 뽑는다. 그래서 층화는 층을 잘 나눌수록, 집락은 덩어리 안이 다양할수록 좋다. 정확성과 비용의 맞바꿈도 반대다. 층화는 오차를 줄이는 대신 층을 나눌 정보와 층별 표집틀이 필요하고, 집락은 표집틀 없이도 실행할 수 있어 비용이 싸지만 오차가 커진다. 한 덩어리 안의 사람들이 서로 닮아 있어 실제로 얻는 정보가 표본 수만큼 되지 못하기 때문이다. 둘을 함께 쓰는 일도 흔하다. 전국 조사에서 시도별로 층을 나눈 뒤 각 층 안에서 읍면동을 집락으로 뽑고, 그 안에서 다시 가구를 뽑는 식이다. 이렇게 여러 방법을 단계마다 갈아 쓰는 것을 다단계 표집이라 하며, 층화로 대표성을 붙들고 집락으로 비용을 줄이는 절충이 된다. 실제 대규모 사회조사는 거의 이 꼴을 취한다.
과일 상자로 견주면 갈림이 분명해진다. 사과·배·감을 종류별로 나누어 각 칸에서 몇 개씩 집어 오면 층화이고, 상자 몇 개를 통째로 골라 그 안을 다 보는 것이 집락이다. 앞의 방식은 어느 종류도 빠지지 않게 하려는 것이고, 뒤의 방식은 상자마다 안이 골고루 섞여 있으리라 믿고 옮기는 품을 아끼는 것이다. 그래서 종류별로 나눌 정보가 있으면 층화가 낫고, 그런 정보 없이 넓은 곳을 조사해야 하면 집락이 현실적이다.
  1. 층화표집은 관련 있는 기준으로 층을 나눈 뒤 모든 층에서 뽑아 오차를 줄인다.
  2. 층 크기에 비례하면 비례층화, 소수집단을 따로 넉넉히 뽑으면 비비례층화다.
  3. 집락표집은 이미 있는 덩어리를 일부만 뽑아 그 안을 조사하며 비용을 크게 던다.
  4. 층화는 층 안이 비슷하고 층끼리 다를수록, 집락은 덩어리 안이 다양할수록 좋다.
  5. 층화는 층별 정보와 표집틀이 필요하고, 집락은 완전한 표집틀 없이도 실행할 수 있다.
  6. 같은 표본 수라면 층화는 오차가 작고 집락은 커진다는 것이 둘의 맞바꿈이다.
  1. 층화와 집락을 나누고 뽑는 방향으로 가르지 못하는 것 — 층화는 다 뽑고 집락은 일부만 뽑는다.
  2. 결과와 무관한 기준으로 층을 나누는 것 — 관련 없는 층화는 오차를 줄이지 못한다.
  3. 집락표집 자료를 단순무작위처럼 분석하는 것 — 덩어리 안의 닮음을 무시하면 오차가 과소평가된다.

층화와 집락

층화표집

층 안은 비슷하게, 층끼리는 다르게 나눈다. 모든 층에서 뽑는다. 오차가 작아지지만 층별 정보와 표집틀이 필요하다.

집락표집

덩어리 안은 다양하게 본다. 일부 덩어리만 뽑는다. 표집틀 없이 넓은 지역을 조사할 수 있으나 오차가 커진다.

두 방법의 성질
구분무엇을 뽑나오차쓰는 자리
층화모든 층에서 조금씩작다층을 나눌 정보가 있을 때
집락일부 덩어리를 통째로크다표집틀이 없고 넓게 흩어졌을 때

더 알아보기

비비례층화가 필요한 자리

비례층화는 층의 크기에 맞추어 표본을 배분하므로 전체 모집단을 닮은 표본이 된다. 그런데 소수집단을 따로 분석해야 할 때는 이 방식이 곤란해진다. 지역 주민 가운데 결혼이민자가 2퍼센트라면 1,000명을 비례로 뽑아도 20명뿐이라, 그 집단만 떼어 분석하기에는 너무 적다. 이때는 결혼이민자 층에서 일부러 더 많이 뽑아 분석에 필요한 수를 확보하는데 이것이 비비례층화다. 대신 표본 전체의 구성이 모집단과 달라지므로, 전체를 대상으로 한 추정치를 낼 때는 각 층의 실제 비중에 맞추어 가중치를 주어 되돌려야 한다. 가중치를 빠뜨리면 소수집단의 값이 과대 반영된 전체 평균이 나오는데, 이 실수는 표가 그럴듯해 보여 좀처럼 눈에 띄지 않는다. 그래서 비비례로 뽑았다면 보고서에 배분과 가중 방법을 반드시 함께 적는다.

집락표집이 오차를 키우는 구조

같은 덩어리에 속한 사람들은 서로 닮아 있기 마련이다. 같은 마을 주민은 소득 수준과 생활환경이 비슷하고, 같은 학급 학생은 교사와 수업 환경을 공유한다. 그래서 한 덩어리에서 열 명을 조사해도 얻는 정보는 서로 다른 열 곳에서 한 명씩 조사한 것보다 적다. 이 닮음의 정도를 급내상관이라 하고, 그만큼 실제 표본 크기가 줄어드는 효과를 설계효과라 한다. 설계효과가 2라면 집락표집으로 뽑은 1,000명이 단순무작위 500명 몫밖에 하지 못한다는 뜻이다. 그래서 집락표집을 쓸 때는 같은 예산에서 덩어리 수를 늘리고 덩어리당 인원을 줄이는 쪽이 대체로 유리하다. 분석 단계에서도 덩어리 구조를 반영해야 하며, 그러지 않으면 표준오차가 실제보다 작게 잡혀 없는 차이를 있다고 말하게 된다.

O

신뢰수준을 높이면 1종 오류를 줄일 수 있다.

신뢰수준을 95%에서 99%로 올리면 유의수준이 5%에서 1%로 내려가 1종 오류 확률이 준다.

2017년 제15회 4번 문제 보기 →
X

유의수준을 낮추면 1종 오류가 늘어난다.

유의수준(α)은 1종 오류 확률의 상한이라 낮추면 1종 오류는 준다 — 대신 2종 오류가 는다.

2017년 제15회 4번 문제 보기 →
O

유의확률이 유의수준보다 낮으면 영가설이 기각된다.

유의확률(p값)이 미리 정한 유의수준보다 작으면 영가설을 기각하고 연구가설을 받아들인다.

2017년 제15회 4번 문제 보기 →
O

2종 오류가 증가하면 통계적 검정력은 감소한다.

통계적 검정력은 1−β(2종 오류 확률)라서 2종 오류가 늘면 검정력은 준다.

2017년 제15회 4번 문제 보기 →
O

2종 오류는 실제로는 참이 아닌 영가설을 기각하지 못하는 것을 말한다.

2종 오류는 거짓인 영가설을 기각하지 못하는 것이고, 1종 오류는 참인 영가설을 기각하는 것이다.

2017년 제15회 4번 문제 보기 →
O

모집단으로부터 표본으로 추출될 확률을 알 수 있다.

확률표집은 각 요소가 뽑힐 확률을 알 수 있어 표집오차를 계산하고 모집단을 추정할 수 있다.

2017년 제15회 13번 문제 보기 →
O

비비례층화(disproportionate stratified)표집은 확률표집이다.

비비례층화표집은 층별 비율과 다르게 뽑아도 층 안에서는 무작위로 뽑으므로 확률표집이다.

2017년 제15회 13번 문제 보기 →
X

신뢰수준이 높을수록 표본오차는 감소한다.

신뢰수준을 높이면 신뢰구간이 넓어져 표본오차는 커진다 — 같은 오차를 유지하려면 표본을 늘려야 한다.

2017년 제15회 13번 문제 보기 →
O

표본의 수가 증가할수록 표본오차는 감소한다.

표본크기가 커질수록 표본오차는 준다 — 오차는 표본크기의 제곱근에 반비례해 4배로 늘려야 절반이 된다.

2017년 제15회 13번 문제 보기 →
O

표집오차는 모집단의 모수와 표본의 통계치 간의 차이다.

표집오차는 모수와 통계치의 차이로, 일부만 뽑았기 때문에 생기며 전수조사에는 없다.

2018년 제16회 9번 문제 보기 →
O

표준오차는 무수히 많은 표본평균의 통계치가 모집단의 모수로부터 평균적으로 떨어진 거리를 의미한다.

표준오차는 표본평균들의 분포(표집분포)의 표준편차로, 표본평균이 모평균에서 평균적으로 떨어진 정도다.

2018년 제16회 9번 문제 보기 →
0개

이 기출이 도움이 됐다면, 봄기출 앱에서도 공부해 보세요.