측정의 수준

명목척도와 서열척도

미학습

읽고 나면 회독 완료

명목척도는 대상을 서로 겹치지 않는 범주로 나누고 이름을 붙이는 척도다. 성별·거주지역·장애유형·서비스 이용 여부가 여기에 든다. 붙인 수는 순서도 크기도 뜻하지 않으므로 더하거나 평균 낼 수 없고, 쓸 수 있는 것은 빈도와 백분율, 최빈값, 그리고 교차표와 카이제곱 검정 정도다. 명목척도를 만들 때는 두 가지를 지켜야 한다. 포괄성은 모든 응답자가 들어갈 칸이 있어야 한다는 요구이고, 상호배타성은 어떤 응답자도 두 칸에 동시에 들어가면 안 된다는 요구다. 「기타」를 두는 것은 포괄성을 지키는 흔한 장치이며, 혼인상태를 「미혼·기혼·이혼·사별」로 나눌 때 별거를 어디에 넣을지 미리 정해 두는 것이 상호배타성을 지키는 일이다. 서열척도는 여기에 순서를 더한다. 만족도의 상·중·하, 장애등급, 학력, 소득분위처럼 어느 쪽이 더 큰지는 말하지만 얼마나 더 큰지는 말하지 않는다. 1등과 2등의 차이가 2등과 3등의 차이와 같다는 보장이 없다는 뜻이다. 그래서 서열자료에서는 평균 대신 중앙값을 쓰고, 순위상관인 스피어만 계수처럼 순서만 쓰는 방법을 고른다. 두 척도의 갈림은 순서를 뒤바꾸면 뜻이 달라지는가로 가려도 된다. 명목은 칸의 나열 차례를 바꿔도 잃는 것이 없지만, 서열은 차례를 흐트러뜨리는 순간 담고 있던 정보가 사라진다. 이 물음은 얼핏 순서처럼 보이는 변수를 가려낼 때 특히 쓸모가 있다. 실무에서 가장 자주 어긋나는 자리는 서열자료에 평균을 대는 일이다. 학력을 1부터 5로 코딩해 평균 3.4를 냈다면 그 3.4가 무엇인지 말할 수 없다. 다만 리커트 문항 여러 개를 합한 총점은 관행적으로 등간에 가깝게 다루는데, 이는 문항 하나는 서열이지만 여러 문항의 합은 간격이 고르게 펴진다고 보는 가정에 기댄 것이므로 가정임을 알고 쓰는 것과 모르고 쓰는 것은 다르다.
이름표와 줄 세우기의 차이다. 명목은 서로 다른 상자에 담는 일이고, 서열은 그 상자들을 앞뒤로 세우는 일이다. 세워 놓았다고 해서 상자 사이의 거리가 같아지는 것은 아니어서, 1등과 2등 사이가 손가락 하나 차이든 열 걸음 차이든 순위는 똑같이 한 칸으로 적힌다. 서열자료에 평균을 내는 순간 그 고르지 않은 거리를 고르다고 우기는 셈이 된다.
  1. 명목척도는 겹치지 않는 범주에 이름을 붙일 뿐, 붙은 수에 크기의 뜻이 없다.
  2. 명목척도는 포괄성(빠지는 사람이 없을 것)과 상호배타성(두 칸에 걸치지 않을 것)을 지켜야 한다.
  3. 명목자료에 쓸 수 있는 것은 빈도·백분율·최빈값과 교차표·카이제곱 정도다.
  4. 서열척도는 순서를 말하지만 간격이 같다고는 말하지 않는다는 것이 핵심 제약이다.
  5. 서열자료의 대표값은 평균이 아니라 중앙값이며, 상관은 순위상관을 쓴다.
  6. 리커트 문항의 합산 총점을 등간처럼 다루는 것은 관행이자 가정이지 성질이 아니다.
  1. 서열로 코딩한 학력·등급에 평균을 내는 것 — 나온 숫자를 해석할 말이 없다.
  2. 「기타」를 빠뜨려 포괄성이 깨지는 것, 또는 범주가 겹쳐 상호배타성이 깨지는 것.
  3. 명목변수에 붙인 코드 번호(남 1, 여 2)를 크기로 읽어 회귀식에 그대로 넣는 것.

명목과 서열

명목척도

다름만 말한다. 순서 없음. 빈도·백분율·최빈값, 교차표와 카이제곱. 포괄성과 상호배타성이 요건이다.

서열척도

순서까지 말한다. 간격은 보장하지 않음. 중앙값과 순위상관을 쓴다. 평균을 대면 없는 간격을 있다고 우기는 셈이다.

두 수준의 보기와 대표값
수준보기대표값
명목성별·종교·장애유형최빈값
서열만족도 상중하·소득분위·학력중앙값

더 알아보기

포괄성과 상호배타성이 무너지는 실제 자리

혼인상태를 「미혼·기혼·이혼·사별」로 물으면 별거 중인 사람과 사실혼 관계인 사람이 갈 곳을 잃는다. 이들이 임의로 기혼이나 미혼을 고르면 그 칸의 뜻이 흐려지고, 응답을 건너뛰면 결측이 된다. 반대로 「기혼·유배우」처럼 뜻이 겹치는 칸을 나란히 두면 같은 사람이 다른 칸을 고를 수 있어 같은 조사 안에서 서로 다른 값이 섞인다. 그래서 범주를 만들 때는 먼저 모집단에 실제로 어떤 상태가 있는지 훑고, 겹치는 자리는 정의로 잘라 두며, 남는 자리는 기타로 받되 기타가 지나치게 커지면 범주 설계를 다시 본다. 기타가 10퍼센트를 넘으면 그 조사의 범주는 현실을 못 담고 있다는 신호로 읽는 것이 안전하다. 여러 답을 함께 고를 수 있는 항목이라면 상호배타성을 억지로 지키기보다 문항을 여러 개의 예·아니오로 쪼개는 편이 낫다.

서열을 등간처럼 쓰는 관행을 어디까지 허용할 것인가

문항 하나짜리 만족도를 1에서 5로 받아 평균을 내는 것은 엄밀히 서열자료에 평균을 대는 일이다. 그럼에도 실무와 논문에서 널리 쓰이는 까닭은, 문항이 여러 개 모여 합산될수록 점수 분포가 고르게 펴져 등간 가정에서 오는 왜곡이 작아진다고 보기 때문이다. 그래서 한 문항짜리 서열값과 여러 문항을 합한 척도 점수는 다르게 다루는 것이 옳다. 전자는 중앙값과 빈도로 보고하고, 후자는 평균과 표준편차를 쓰되 신뢰도를 함께 밝힌다. 어느 쪽이든 보고서에는 몇 개 문항을 어떻게 합했는지 적어야 하며, 그것이 없으면 읽는 사람은 그 평균이 무엇의 평균인지 알 수 없다. 응답 범주가 서너 칸으로 적거나 응답이 한쪽 끝에 몰려 있을 때는 이 관행이 특히 위태로우므로, 그럴 때는 순위를 쓰는 방법으로 돌아가는 것이 안전하다.

0개

이 기출이 도움이 됐다면, 봄기출 앱에서도 공부해 보세요.