기술통계

집중경향과 산포

미학습

읽고 나면 회독 완료

기술통계는 모은 자료를 요약해 보여 주는 통계다. 모집단을 추정하는 추론통계와 달리, 손에 쥔 자료가 어떻게 생겼는지를 정리해 전하는 것이 목적이다. 요약은 두 축으로 이루어진다. 자료가 어디에 모여 있는가(집중경향)와 얼마나 흩어져 있는가(산포)다. 집중경향의 대표값은 셋이다. 최빈값은 가장 많이 나온 값으로 명목수준부터 쓸 수 있다. 중앙값은 값을 줄 세웠을 때 한가운데에 놓이는 값으로 서열수준부터 쓸 수 있고, 극단값의 영향을 받지 않는다. 평균은 모두 더해 나눈 값으로 등간수준부터 쓸 수 있으며 가장 많은 정보를 쓰지만 극단값에 끌려간다. 소득처럼 한쪽으로 길게 늘어진 분포에서는 평균이 다수의 형편을 대표하지 못하므로 중앙값을 함께 보는 것이 옳다. 산포의 대표값도 여럿이다. 범위는 최댓값과 최솟값의 차이로 간단하지만 극단값 둘에 좌우된다. 사분위 범위는 가운데 절반이 걸치는 폭이라 극단값에 강하다. 분산은 각 값이 평균에서 떨어진 거리를 제곱해 평균한 값이고, 표준편차는 그 제곱근이라 원래 단위로 돌아와 해석하기 쉽다. 두 축을 함께 보아야 하는 까닭은 분명하다. 평균이 같아도 흩어짐이 다르면 전혀 다른 집단이다. 평균 50점에 표준편차가 5인 반과 25인 반은 지도 방법이 달라야 한다. 그래서 보고서에는 평균과 표준편차를 늘 짝지어 적고, 분포가 치우쳐 있으면 중앙값과 사분위 범위를 함께 밝힌다. 요약에 앞서 분포의 모양을 그림으로 한번 보는 일도 기술통계의 일부다. 히스토그램이나 상자그림을 그려 보면 값이 한쪽으로 쏠렸는지, 봉우리가 둘인지, 유난히 동떨어진 값이 있는지가 곧바로 드러난다. 이런 것들은 평균과 표준편차라는 두 숫자만으로는 결코 보이지 않으며, 그림을 건너뛰고 표부터 만들면 자료가 무슨 말을 하고 있는지 놓치기 쉽다.
자료를 요약한다는 것은 한 무리의 사람을 두 마디로 설명하는 일이다. 「대체로 이쯤에 모여 있고, 이만큼 벌어져 있다.」 둘 가운데 하나만 말하면 그림이 서지 않는다. 평균만 말하면 모두 비슷한 줄 알게 되고, 흩어짐만 말하면 어디쯤인지 알 수 없다. 그래서 통계표에서 평균 옆에는 늘 표준편차가 붙어 다니고, 둘을 함께 읽는 습관이 자료를 보는 눈을 만든다.
  1. 기술통계는 손에 쥔 자료를 요약해 보여 주는 통계로, 모집단 추정과는 목적이 다르다.
  2. 최빈값은 명목수준부터, 중앙값은 서열수준부터, 평균은 등간수준부터 쓸 수 있다.
  3. 평균은 극단값에 끌려가고 중앙값은 그렇지 않아, 치우친 분포에서는 함께 본다.
  4. 범위는 극단값 둘에 좌우되고 사분위 범위는 가운데 절반을 보아 극단값에 강하다.
  5. 표준편차는 분산의 제곱근으로, 원래 단위로 돌아와 해석하기 쉬운 산포 지표다.
  6. 평균이 같아도 흩어짐이 다르면 다른 집단이므로 둘을 짝지어 보고해야 한다.
  1. 소득처럼 치우친 분포를 평균만으로 말하는 것 — 소수의 큰 값이 평균을 끌어올린다.
  2. 서열자료에 평균을 대는 것 — 대표값은 중앙값이어야 뜻을 갖는다.
  3. 평균만 적고 표준편차를 빠뜨리는 것 — 흩어짐을 모르면 그 평균을 해석할 수 없다.

평균과 중앙값

평균

모든 값을 쓰므로 정보가 많고 뒤의 분석과 이어진다. 대신 극단값 하나에 크게 흔들려 치우친 분포에서는 다수를 대표하지 못한다.

중앙값

순서만 쓰므로 극단값에 흔들리지 않는다. 소득이나 재산처럼 한쪽으로 길게 늘어진 분포에서 형편을 더 잘 전한다.

수준별로 쓸 수 있는 대표값과 산포
수준대표값산포
명목최빈값빈도의 분포
서열중앙값(최빈값도 가능)사분위 범위
등간·비율평균(앞의 둘도 가능)분산·표준편차·범위

더 알아보기

평균이 사실을 가리는 자리

평균은 모든 값을 쓰기 때문에 정보가 많지만, 바로 그 성질 때문에 극단값 하나에 크게 흔들린다. 열 사람 가운데 아홉이 월 200만 원을 벌고 한 사람이 2억 원을 번다면 평균은 2,180만 원이 되어 아무의 형편도 나타내지 못하고, 중앙값 200만 원이 실상을 전한다. 소득과 재산, 서비스 이용 횟수, 입원 일수처럼 한쪽으로 길게 늘어지는 분포는 사회복지 자료에 흔하므로 이 문제를 자주 만난다. 그래서 이런 변수는 평균과 중앙값을 함께 적고, 분포의 모양을 보여 주는 그림을 곁들이는 것이 관례다. 반대로 좌우가 고른 분포에서는 평균과 중앙값이 비슷해지므로 어느 쪽을 써도 무방하다. 곧 대표값을 고르는 일은 규칙을 외우는 일이 아니라 분포의 모양을 먼저 보는 일이며, 그림 한 장을 그려 보는 것이 판단의 출발점이다.

표준편차를 읽는 감각

표준편차는 값들이 평균에서 평균적으로 얼마나 떨어져 있는지를 원래 단위로 알려 준다. 우울점수 평균이 20점이고 표준편차가 3이라면 대부분이 17점에서 23점 사이에 몰려 있다는 뜻이고, 표준편차가 10이라면 같은 평균이라도 사람마다 형편이 크게 다르다는 뜻이다. 실천에서는 이 차이가 곧 개입 계획의 차이가 된다. 앞의 집단에는 같은 프로그램을 함께 제공할 수 있지만, 뒤의 집단에는 수준을 나누어 다르게 접근해야 한다. 또 표준편차는 개입 효과의 크기를 견주는 데도 쓰인다. 두 집단의 평균 차이를 표준편차로 나눈 값을 효과크기라 하며, 단위가 다른 척도들 사이에서도 효과의 크기를 비교할 수 있게 해 준다. 평균 차이가 통계적으로 유의하다는 말보다 효과크기가 얼마인지가 실천에서는 더 쓸모 있는 정보인 경우가 많다.

0개

이 기출이 도움이 됐다면, 봄기출 앱에서도 공부해 보세요.