층화표집은 모집단을 성격이 비슷한 층으로 나눈 뒤 각 층에서 따로 뽑는 방식이다. 성별·연령대·지역·소득분위처럼 결과와 관련이 깊은 기준으로 층을 나누고, 층 안에서는 무작위로 뽑는다. 각 층이 반드시 표본에 들어가므로 표집오차가 줄고 대표성이 높아진다. 층 크기에 비례해 뽑으면 비례층화, 작은 층을 따로 충분히 뽑으면 비비례층화이며, 소수집단을 따로 분석해야 할 때 후자를 쓴다.
집락표집(군집표집)은 모집단을 여러 요소가 묶인 덩어리로 나눈 뒤 덩어리째 뽑고, 뽑힌 덩어리 안을 전부 또는 다시 표집해 조사하는 방식이다. 학교·마을·복지관처럼 이미 존재하는 묶음을 그대로 쓰며, 전국 조사처럼 완전한 표집틀이 없고 대상이 널리 흩어져 있을 때 비용을 크게 줄여 준다. 덩어리를 뽑고 그 안에서 다시 뽑는 것을 다단계 집락표집이라 한다.
두 방법은 겉모습이 닮아 헷갈리지만 발상이 반대다. 층화는 층 안이 비슷하고 층끼리 다르도록 나누어 모든 층에서 뽑고, 집락은 덩어리 안이 다양하고 덩어리끼리 비슷하도록 보아 일부 덩어리만 뽑는다. 그래서 층화는 층을 잘 나눌수록, 집락은 덩어리 안이 다양할수록 좋다.
정확성과 비용의 맞바꿈도 반대다. 층화는 오차를 줄이는 대신 층을 나눌 정보와 층별 표집틀이 필요하고, 집락은 표집틀 없이도 실행할 수 있어 비용이 싸지만 오차가 커진다. 한 덩어리 안의 사람들이 서로 닮아 있어 실제로 얻는 정보가 표본 수만큼 되지 못하기 때문이다.
둘을 함께 쓰는 일도 흔하다. 전국 조사에서 시도별로 층을 나눈 뒤 각 층 안에서 읍면동을 집락으로 뽑고, 그 안에서 다시 가구를 뽑는 식이다. 이렇게 여러 방법을 단계마다 갈아 쓰는 것을 다단계 표집이라 하며, 층화로 대표성을 붙들고 집락으로 비용을 줄이는 절충이 된다. 실제 대규모 사회조사는 거의 이 꼴을 취한다.
02이해하기
과일 상자로 견주면 갈림이 분명해진다. 사과·배·감을 종류별로 나누어 각 칸에서 몇 개씩 집어 오면 층화이고, 상자 몇 개를 통째로 골라 그 안을 다 보는 것이 집락이다. 앞의 방식은 어느 종류도 빠지지 않게 하려는 것이고, 뒤의 방식은 상자마다 안이 골고루 섞여 있으리라 믿고 옮기는 품을 아끼는 것이다. 그래서 종류별로 나눌 정보가 있으면 층화가 낫고, 그런 정보 없이 넓은 곳을 조사해야 하면 집락이 현실적이다.
03핵심 포인트
층화표집은 관련 있는 기준으로 층을 나눈 뒤 모든 층에서 뽑아 오차를 줄인다.
층 크기에 비례하면 비례층화, 소수집단을 따로 넉넉히 뽑으면 비비례층화다.
집락표집은 이미 있는 덩어리를 일부만 뽑아 그 안을 조사하며 비용을 크게 던다.
층화는 층 안이 비슷하고 층끼리 다를수록, 집락은 덩어리 안이 다양할수록 좋다.
층화는 층별 정보와 표집틀이 필요하고, 집락은 완전한 표집틀 없이도 실행할 수 있다.
같은 표본 수라면 층화는 오차가 작고 집락은 커진다는 것이 둘의 맞바꿈이다.
04한 줄 예시
05시험 함정
층화와 집락을 나누고 뽑는 방향으로 가르지 못하는 것 — 층화는 다 뽑고 집락은 일부만 뽑는다.
결과와 무관한 기준으로 층을 나누는 것 — 관련 없는 층화는 오차를 줄이지 못한다.
집락표집 자료를 단순무작위처럼 분석하는 것 — 덩어리 안의 닮음을 무시하면 오차가 과소평가된다.
06한눈에 보기
층화와 집락
층화표집
층 안은 비슷하게, 층끼리는 다르게 나눈다. 모든 층에서 뽑는다. 오차가 작아지지만 층별 정보와 표집틀이 필요하다.
VS
집락표집
덩어리 안은 다양하게 본다. 일부 덩어리만 뽑는다. 표집틀 없이 넓은 지역을 조사할 수 있으나 오차가 커진다.
두 방법의 성질
구분
무엇을 뽑나
오차
쓰는 자리
층화
모든 층에서 조금씩
작다
층을 나눌 정보가 있을 때
집락
일부 덩어리를 통째로
크다
표집틀이 없고 넓게 흩어졌을 때
더 알아보기
비비례층화가 필요한 자리
비례층화는 층의 크기에 맞추어 표본을 배분하므로 전체 모집단을 닮은 표본이 된다. 그런데 소수집단을 따로 분석해야 할 때는 이 방식이 곤란해진다. 지역 주민 가운데 결혼이민자가 2퍼센트라면 1,000명을 비례로 뽑아도 20명뿐이라, 그 집단만 떼어 분석하기에는 너무 적다. 이때는 결혼이민자 층에서 일부러 더 많이 뽑아 분석에 필요한 수를 확보하는데 이것이 비비례층화다. 대신 표본 전체의 구성이 모집단과 달라지므로, 전체를 대상으로 한 추정치를 낼 때는 각 층의 실제 비중에 맞추어 가중치를 주어 되돌려야 한다. 가중치를 빠뜨리면 소수집단의 값이 과대 반영된 전체 평균이 나오는데, 이 실수는 표가 그럴듯해 보여 좀처럼 눈에 띄지 않는다. 그래서 비비례로 뽑았다면 보고서에 배분과 가중 방법을 반드시 함께 적는다.
집락표집이 오차를 키우는 구조
같은 덩어리에 속한 사람들은 서로 닮아 있기 마련이다. 같은 마을 주민은 소득 수준과 생활환경이 비슷하고, 같은 학급 학생은 교사와 수업 환경을 공유한다. 그래서 한 덩어리에서 열 명을 조사해도 얻는 정보는 서로 다른 열 곳에서 한 명씩 조사한 것보다 적다. 이 닮음의 정도를 급내상관이라 하고, 그만큼 실제 표본 크기가 줄어드는 효과를 설계효과라 한다. 설계효과가 2라면 집락표집으로 뽑은 1,000명이 단순무작위 500명 몫밖에 하지 못한다는 뜻이다. 그래서 집락표집을 쓸 때는 같은 예산에서 덩어리 수를 늘리고 덩어리당 인원을 줄이는 쪽이 대체로 유리하다. 분석 단계에서도 덩어리 구조를 반영해야 하며, 그러지 않으면 표준오차가 실제보다 작게 잡혀 없는 차이를 있다고 말하게 된다.
07기출 지문
O
신뢰수준을 높이면 1종 오류를 줄일 수 있다.
신뢰수준을 95%에서 99%로 올리면 유의수준이 5%에서 1%로 내려가 1종 오류 확률이 준다.