기준타당도는 새로 만든 척도의 점수가 이미 인정받은 다른 잣대와 얼마나 맞아떨어지는가로 타당도를 확인하는 방식이다. 그 다른 잣대를 기준(준거)이라 하며, 검증된 기존 척도일 수도 있고 실제로 일어난 결과일 수도 있다. 확인 방법은 두 값의 상관계수여서, 판단에 기대는 내용타당도와 달리 수치로 나온다는 것이 특징이다.
기준을 언제 재느냐에 따라 둘로 갈린다.
동시타당도는 새 척도와 기준을 같은 시점에 재어 상관을 본다. 새로 만든 짧은 우울 선별도구의 점수를 이미 검증된 긴 우울척도 점수와 견주는 것이 대표적이다. 지금 상태를 얼마나 잘 짚어 내는가를 보는 것이므로 현재를 진단하는 도구에 어울린다.
예측타당도는 기준을 나중에 재어, 척도 점수가 앞날의 결과를 얼마나 잘 맞히는가를 본다. 입사시험 점수가 뒤이은 근무 성적을 얼마나 예측하는지, 재범위험 평가 점수가 실제 재범과 얼마나 맞는지가 여기에 든다. 시간이 지나기를 기다려야 하므로 확인에 오래 걸리고 그 사이 이탈이 생기지만, 선발·배치·위험 예측처럼 앞날을 다루는 도구에는 이것이 본령이다.
기준타당도의 약점은 분명하다. 믿을 만한 기준이 있어야만 쓸 수 있다. 기준 자체가 부실하면 상관이 낮게 나와도 새 척도 탓인지 기준 탓인지 가릴 수 없고, 애초에 기준이 없는 새로운 개념에는 이 방법을 쓸 수 없다. 그런 자리에서 필요한 것이 구성타당도다.
기준을 무엇으로 삼을지는 그 자체가 판단이라는 점도 짚어 둘 만하다. 서비스 만족을 재는 척도의 기준으로 재이용 여부를 삼을 수도 있고 담당자의 평가를 삼을 수도 있는데, 어느 것을 고르느냐에 따라 상관의 크기가 달라진다. 그래서 무엇을 기준으로 삼았고 왜 그것이 적절한지를 밝히지 않은 기준타당도 수치는 해석할 근거가 없다. 상관계수 하나만 덩그러니 적힌 보고는 검증한 것처럼 보일 뿐 아무것도 말해 주지 않는다.
02이해하기
새로 산 체중계가 믿을 만한지 알아보려면 병원 저울과 같은 날 함께 재 보면 된다. 두 값이 잘 맞으면 새 체중계를 쓸 만하다고 본다. 이것이 동시타당도의 발상이다. 반면 신입사원을 뽑는 시험은 지금 무엇을 맞히는지가 아니라 뽑힌 사람이 나중에 일을 잘하는지로 값이 매겨지고, 그래서 결과가 나올 때까지 기다려 견주어야 한다. 이것이 예측타당도다. 언제 견주는가가 다를 뿐 발상은 같다.
03핵심 포인트
기준타당도는 인정받은 다른 잣대와의 상관으로 확인하는 타당도 근거다.
판단에 기대는 내용타당도와 달리 상관계수라는 수치로 나온다는 점이 다르다.
동시타당도는 기준을 같은 시점에 재며, 현재 상태를 짚는 도구에 어울린다.
예측타당도는 기준을 더 나중에 재어, 척도가 앞날의 결과를 얼마나 맞히는지 본다.
선발·배치·위험 예측에 쓰는 도구는 예측타당도가 본령이며 확인에 시간이 걸린다.
기준타당도는 믿을 만한 기준이 있어야만 쓸 수 있다는 근본적 제약을 안는다.
04한 줄 예시
05시험 함정
동시와 예측을 재는 시점이 아니라 목적으로 가르려는 것 — 갈림은 기준을 언제 재는가다.
상관이 낮게 나왔을 때 곧바로 새 척도를 탓하는 것 — 기준이 부실할 가능성이 남는다.
기준이 없는 새 개념에 기준타당도를 요구하는 것 — 그 자리에는 구성타당도가 필요하다.
06한눈에 보기
동시타당도와 예측타당도
동시타당도
기준을 같은 시점에 잰다. 검증된 기존 척도와 나란히 실시해 상관을 본다. 현재 상태를 선별·진단하는 도구에 어울린다.
VS
예측타당도
기준을 나중에 잰다. 앞날의 결과를 얼마나 맞히는지 본다. 선발·배치·위험 예측 도구의 본령이며 확인에 시간이 걸린다.
두 기준타당도
구분
기준을 재는 때
보기
동시타당도
새 척도와 같은 시점
짧은 선별도구 대 검증된 긴 척도
예측타당도
새 척도보다 나중
입사시험 점수 대 뒤의 근무 성적
더 알아보기
기준이 부실할 때 상관은 무엇을 말하는가
기준타당도의 값은 두 측정의 관계이므로, 기준 쪽이 흔들리면 새 척도가 아무리 좋아도 상관이 낮게 잡힌다. 기준 자체의 신뢰도가 낮으면 상관은 그 낮은 신뢰도만큼 눌리며, 이 눌림을 감쇠라 부른다. 그래서 상관이 기대보다 낮게 나왔을 때 던져야 할 첫 물음은 「새 척도가 나쁜가」가 아니라 「기준은 얼마나 믿을 만한가」이다. 기준의 신뢰도가 함께 보고되어 있으면 그 눌림을 어림해 볼 수 있고, 보고되어 있지 않으면 해석 자체를 유보하는 편이 옳다. 사회복지 현장에서는 기준으로 삼을 만한 잣대가 애초에 넉넉하지 않아 이 문제가 자주 생긴다. 서비스 만족을 재는 새 척도의 기준으로 재이용 여부를 삼는 식의 대체 기준을 쓰기도 하는데, 그런 대체 기준은 개념과 어긋나는 부분이 있으므로 무엇을 기준으로 삼았고 왜 그것을 골랐는지를 반드시 밝혀야 한다.
예측타당도를 확인할 때 생기는 함정
예측타당도는 시간이 지나야 확인되므로 그 사이에 여러 가지가 끼어든다. 가장 흔한 것은 선발 효과다. 입사시험으로 뽑은 사람만 근무 성적을 낼 수 있으므로, 점수가 낮아 떨어진 사람들의 성적은 애초에 존재하지 않는다. 남은 사람들의 점수 폭이 좁아진 상태에서 상관을 구하면 실제보다 작게 나오는데, 이를 범위 축소라 한다. 두 번째는 자기충족적 예측이다. 위험이 높다고 평가된 사람에게 감독이 집중되면 그 사실 자체가 결과를 바꾸어, 예측이 맞은 것처럼 보이게 만든다. 세 번째는 시간이 흐르며 생기는 탈락으로, 남은 사람들이 특정한 성향으로 치우쳐 있으면 상관이 왜곡된다. 그래서 예측타당도를 보고할 때는 얼마나 시간이 지났는지, 누가 빠졌는지, 그 사이 어떤 개입이 있었는지를 함께 적어야 값이 해석된다.