코헨 카파(Cohen's Kappa), 이차 가중 카파(QWK)

2026. 7. 3. 08:48카테고리 없음

 

APTOS ViT 리뷰하다가 평가지표 설명이 너무 길어질 것 같아서 따로 정리하려고 합니다.


1.코헨 카파(Cohen's Kappa)

두 평가자의 범주형 데이터를 비교할 때, 그 평가 결과가 우연이 아니라 얼마나 실제로 일치하는지 평가하는 지표.

왜 그냥 비교($P_o$)를 하지 않고 이 지표를 사용하는지 예시를 들어 비교해보겠습니다.

$$\begin{aligned}
\kappa &= \frac{P_o - P_e}{1 - P_e} \\
&= 1 - \frac{1 - P_o}{1 - P_e} \\
&= 1 - \frac{\text{실제 불일치할 확률}}{\text{우연히 불일치할 확률}}
\end{aligned}$$

 

예를 들어 클래스가 2개(양성/음성)뿐인 문제를 생각해봅시다. 두 평가자 A, B가 100개 샘플을 각각 평가했는데, 우연히 둘 다 "거의 항상 양성"이라고 찍는 경향이 있다고 하면,

  • A는 95개를 양성, 5개를 음성이라고 판정
  • B도 95개를 양성, 5개를 음성이라고 판정
  • 실제로 둘이 같은 샘플에 동의한 게 90개

$P_o=90%$. 그런데 둘 다 그냥 "무조건 양성"이라고 찍는 성향이 강해서, 실제로 각 샘플을 제대로 판단해서 일치한 게 아니라 둘 다 편향되게 같은 답을 자주 냈을 뿐입니다. 즉 우연히 겹칠 확률 자체가 이미 높은 상황

$P_e$가 하는 일

는 "두 평가자가 각자의 라벨 분포를 유지한 채, 완전히 독립적으로 무작위로 라벨을 매겼다면 우연히 일치했을 확률"을 계산합니다. 위 예시라면 대략:

$$P_e = (0.95 \times 0.95) + (0.05 \times 0.05) = 0.905$$

즉 아무 실력 없이 그냥 분포만 맞춰서 찍어도 90.5%는 우연히 일치합니다.

그런데 이때 실제 관측된 일치율이 90%였으므로

카파 값이 아주 작게 나와서, 실제로는 거의 일치하지 않는다고 판단할 수 있습니다.

 

 

 

2.이차 가중 카파(Quadretic weighted kappa)

코헨 카파에서 나온 평가지표로, 정답과 예측값의 거리 차이의 제곱(Quadratic)만큼 페널티를 부여하게 됩니다.

이때 행렬 $O$는 정답 예측 결과를 비교한  $k \times k$행렬
  • $k$: 전체 클래스의 개수 (APTOS 대회의 경우 0, 1, 2, 3, 4 총 5개이므로 $k = 5$)
행렬 $W$는 가중치 행렬($k \times k$)로
$$W_{ij} = \frac{(i - j)^2}{(k - 1)^2}$$

 

  • $i$: 실제 정답의 클래스 번호 (0부터 시작)
  • $j$: 모델이 예측한 클래스 번호 (0부터 시작)

 

행렬 $E$는 코헨 카파의 ​$P_e$와 같은 역할을 합니다. $E_{ij}$는 정답은 $i$인데 모델이 $j$라고 우연히 예측할 '예상 빈도수'를 의미합니다.

$$E_{ij} = \frac{(\text{정답이 } i\text{인 실제 개수}) \times (\text{모델이 } j\text{라고 예측한 총 개수})}{N}$$

예를 들어 클래스를 3개(0, 1, 2)라 치고, 전체 데이터 $N = 100$장이라고 해봅시다.

  • 정답은 100장 중: 0을 60장, 1을 30장, 2를 10장 입니다.
  • 모델은 100장 중: 0을 50장, 1을 40장, 2를 10장 예측했습니다.

이제 두 평가자가 아무 생각 없이 막 던졌을 때 만들어질 기댓값 행렬 $E$의 각 칸을 채워보면 이렇습니다.

  • $E_{00}$ 칸 (정답 0, 예측 0): $\frac{60 \times 50}{100} = 30$
  • $E_{01}$ 칸 (정답 0, 예측 1): $\frac{60 \times 40}{100} = 24$
  • $E_{21}$ 칸 (정답 2, 예측 1): $\frac{10 \times 40}{100} = 4$

이런 식으로 $3 \times 3$의 모든 칸을 채우면 행렬 $E$가 완성됩니다.

최종 QWK 점수는 이 세 행렬을 가지고 아래 공식을 거쳐 계산됩니다.

$$QWK = 1 - \frac{\sum W_{ij} O_{ij}}{\sum W_{ij} E_{ij}}$$
 
이는 곧
 
$$QWK = 1 - \frac{\text{모델 예측값이 발생하는 총 패널티}}{\text{찍었을 때 발생하는 총 패널티}}$$
를 의미합니다.