등간척도는 순서에 더해 눈금 사이의 간격이 같다는 것까지 보장하는 척도다. 섭씨온도와 지능지수, 시험 원점수가 여기에 든다. 간격이 같으므로 더하고 빼는 일과 평균·표준편차를 내는 일이 모두 허락된다. 다만 절대영점이 없어 곱하기와 나누기는 뜻을 잃는다. 섭씨 0도는 온도가 없다는 뜻이 아니라 물이 어는 자리를 0으로 삼은 약속이므로, 20도가 10도의 두 배라는 말은 성립하지 않는다.
비율척도는 여기에 절대영점까지 갖춘다. 소득·연령·자녀 수·서비스 이용 횟수·상담 시간처럼 0이 「그 속성이 없음」을 가리키는 것들이다. 그래서 「두 배」·「절반」 같은 비율로 말하는 진술이 처음으로 허락되고, 기하평균과 변동계수처럼 비율에 기대는 통계도 쓸 수 있다. 네 수준 가운데 정보가 가장 많아, 사회복지 조사에서 되도록 이 수준으로 재 두려 하는 까닭이 여기에 있다.
둘을 가르는 물음은 언제나 하나다. 0이 없음을 뜻하는가. 소수점이 있는지, 값이 촘촘한지, 음수가 나오는지는 갈림의 기준이 아니다. 음수가 나올 수 있다는 것은 절대영점이 없다는 강한 신호이긴 하나, 음수가 없다고 해서 곧 비율인 것은 아니다.
수준별로 허락되는 통계는 계단처럼 쌓인다. 명목은 빈도·백분율·최빈값과 교차표·카이제곱까지, 서열은 여기에 중앙값·사분위수·순위상관이 더해지고, 등간부터 평균·표준편차·피어슨 상관·티검정·분산분석·회귀분석이 열린다. 비율은 등간이 하는 것을 모두 하면서 비율 진술과 기하평균을 더한다. 아래 수준의 통계는 위 수준 자료에도 늘 쓸 수 있지만 그 반대는 안 된다는 것이 이 계단의 규칙이다.
통계 프로그램은 수준을 묻지 않고 시키는 대로 계산한다. 돌아갔다는 사실이 옳다는 증거가 아니라는 것, 그것이 이 단원을 배우는 실질적인 이유다.
02이해하기
온도계와 저울의 차이라고 보면 쉽다. 온도계는 눈금 사이가 고르게 새겨져 있어 차이를 재고 평균을 내는 데 아무 문제가 없지만, 0도를 사람이 정한 자리라서 두 배라는 말만은 하지 못한다. 저울은 0이 정말로 아무것도 없는 자리여서 비로소 두 배라는 말이 성립한다. 눈금이 고른 것과 바닥이 진짜인 것은 다른 문제이고, 등간과 비율은 바로 그 바닥에서 갈린다.
03핵심 포인트
등간척도는 간격이 같다는 것까지 보장하되 절대영점이 없어 배수로 말하지 못한다.
비율척도는 절대영점을 갖추어 두 배·절반 같은 비율 진술과 기하평균이 허락된다.
둘을 가르는 기준은 오직 0이 「없음」을 뜻하는가이며, 소수점이나 연속성이 아니다.
등간부터 평균·표준편차·피어슨 상관·티검정·분산분석·회귀를 쓸 수 있다.
아래 수준의 통계는 위 수준 자료에 늘 쓸 수 있으나 그 반대는 안 된다는 계단 규칙이 있다.
통계 프로그램은 수준을 묻지 않으므로 계산이 돌아간 것이 옳다는 증거가 되지 못한다.
04한 줄 예시
05시험 함정
지능지수 140을 70의 두 배로 읽는 것 — 등간에는 절대영점이 없어 배수 진술이 성립하지 않는다.
「소수점이 있으니 비율」·「연속이니 등간」처럼 갈림의 기준을 값의 모양에서 찾는 것.
명목변수 코드에 평균과 상관을 대는 것 — 계단을 거꾸로 올라가는 계산은 뜻을 갖지 못한다.
06한눈에 보기
등간과 비율
등간척도
간격은 같다. 절대영점 없음. 더하기·빼기와 평균은 되지만 두 배라는 말은 못 한다. 섭씨온도·지능지수·원점수.
VS
비율척도
간격도 같고 0이 「없음」이다. 곱하기·나누기까지 되어 비율로 말할 수 있다. 소득·연령·자녀 수·이용 횟수.
수준별로 허락되는 통계
수준
대표값
쓸 수 있는 분석
명목
최빈값
빈도·백분율·교차표·카이제곱
서열
중앙값
사분위수·순위상관(스피어만)
등간
평균
표준편차·피어슨 상관·티검정·분산분석·회귀
비율
평균·기하평균
등간의 모든 것 + 비율 진술·변동계수
더 알아보기
허락되는 통계가 계단처럼 쌓이는 까닭
통계는 자료에서 무엇을 읽어 낼지에 따라 필요한 정보량이 다르다. 최빈값은 어느 칸이 가장 붐비는지만 세면 되므로 이름표만 있어도 구할 수 있고, 중앙값은 줄을 세워 가운데를 짚어야 하니 순서가 있어야 하며, 평균은 값들을 더해 나누어야 하니 간격이 고르다는 보장이 있어야 뜻을 갖는다. 그래서 필요 정보가 적은 통계일수록 낮은 수준에서도 쓸 수 있고, 위 수준 자료에는 아래 수준의 통계가 언제나 함께 허락된다. 비율자료인 소득에 중앙값을 쓰는 일은 전혀 문제가 없고, 분포가 한쪽으로 길게 늘어졌을 때는 오히려 평균보다 중앙값이 사실을 더 잘 전한다. 반대 방향, 곧 서열자료에 평균을 대는 일만이 없는 정보를 있다고 가정하는 잘못이 된다. 그러므로 분석 방법을 고르는 첫 물음은 언제나 「이 변수는 어느 수준으로 재었는가」이고, 그 답이 쓸 수 있는 도구의 목록을 미리 좁혀 준다.
등간처럼 다루어도 되는가를 판단하는 실무 기준
엄밀히 따지면 사회복지 조사에서 쓰는 심리척도의 총점은 대부분 등간이라는 보장이 없다. 그럼에도 평균과 회귀를 쓰는 까닭은, 문항 수가 넉넉하고 응답이 한쪽으로 몰리지 않으면 등간 가정에서 오는 왜곡이 결론을 뒤집을 만큼 크지 않다고 보기 때문이다. 그래서 판단은 성질이 아니라 조건을 본다. 문항이 대여섯 개 이상 합쳐졌는가, 응답 범주가 다섯 칸 이상인가, 점수가 천장이나 바닥에 몰려 있지는 않은가, 신뢰도는 충분한가. 이 조건들이 무너진 자료에 평균과 회귀를 대면 계수는 나오되 믿기 어렵다. 그럴 때는 순위 기반 방법이나 범주형 분석으로 옮기고, 옮긴 이유를 보고서에 적는 것이 정직한 처리다. 어느 쪽을 골랐든 척도의 문항 수와 응답 범주 수, 점수 분포의 모양을 함께 밝혀 두면 읽는 사람이 그 판단을 스스로 검토할 수 있다.