← 최신 논문
💬 NLP

Quantifying and Predicting Disagreement in Graded Human Ratings

본 논문은 부적절한 언어에 대한 등급 매기기 인간 평가에서의 불일치 패턴을 조사하기 위해 관점 차이를 정량화하는 반대 지수를 제안하고, 텍스트 특징이 인간 평가 간 불일치와 의견이 대립하는 사례의 난이도를 모두 중간 정도 예측할 수 있음을 입증합니다.

원저자: Leixin Zhang, Çağrı Çöltekin

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Leixin Zhang, Çağrı Çöltekin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 문장이 얼마나 '무례한지' 평가하는 대회를 운영한다고 상상해 보세요. 다섯 명의 다른 심사위원에게 같은 문장을 보여주고 0(전혀 무례하지 않음) 에서 4(매우 무례함) 점까지 점수를 매기게 합니다.

가끔은 다섯 명의 심사위원이 완벽하게 일치합니다. 모두 '0'점을 줍니다. 다른 때는 심사위원들이 반반으로 나뉩니다. 두 명은 '0'점이라고 생각하고, 세 명은 '4'점이라고 생각합니다. 이것이 바로 이 논문에서 불일치라고 부르는 것입니다.

연구자들은 두 가지 사항을 알고 싶어 했습니다:

  1. 문장 자체를 보고 심사위원들이 얼마나 불일치할지 추측할 수 있을까요? (그들이 모두 동의할까요, 아니면 싸울까요?)
  2. 심사위원들이 완전히 상반된 의견을 가질지 추측할 수 있을까요? (방의 절반은 해롭지 않다고 생각하면서, 나머지 절반은 끔찍하다고 생각할까요?)

다음은 그들이 단순한 비유를 사용하여 이 문제를 어떻게 접근했는지입니다:

1. 문제: 모든 논쟁은 동일하지 않습니다

과거에는 연구자들이 모든 불일치를 동일하게 취급했습니다. 하지만 이 논문은 그것을 저녁 메뉴에 대한 경미한 의견 차이와 격렬한 정치적 논쟁을 동일하게 취급하는 것과 같다고 말합니다. 어떤 문장은 너무 명확해서 모두가 동의합니다 (낮은 불일치). 다른 문장들은 까다롭고 모호하거나 개인의 가치관에 의존하여 심사위원들의 표가 나뉩니다 (높은 불일치).

연구자들은 사람들의 의견이 가장 첨예하게 대립하는 영역인 '부적절한 언어' (혐오 표현이나 독성 댓글 등) 에 집중했습니다.

2. 새로운 도구: '대립 지수 (Opposition Index)'

심사위원들이 얼마나 싸우고 있는지를 측정하기 위해 연구자들은 대립 지수라는 새로운 자를 발명했습니다.

  • 비유: 시소를 상상해 보세요.
    • 모두가 중앙에 앉아 있으면 시소는 평평합니다. 이것이 합의 (낮은 지수) 입니다.
    • 모두가 한쪽 끝에 앉아 있으면 시소는 기울어졌지만 안정적입니다. 이것이 한쪽의 강력한 동의 (낮은 지수) 입니다.
    • 절반의 사람들이 가장 왼쪽에, 나머지 절반이 가장 오른쪽에 앉아 있으면 시소는 완벽하게 균형을 이루지만 혼란스럽습니다. 이것이 양극화 (높은 지수) 입니다.

'대립 지수'는 그 혼란이 얼마나 '균형 잡혀 있는지'를 정확히 계산합니다. 점수가 1 이라는 것은 그룹이 두 가지 극단적인 견해 사이에서 완벽하게 나뉘어 있다는 뜻입니다. 점수가 0 이라는 것은 모두가 같은 페이지에 있다는 뜻입니다.

3. 실험: 혼란을 추측하기

연구자들은 인간이 점수를 매기기 전에 문장을 보고 다음을 예측하도록 컴퓨터 모델 (AI) 을 구축했습니다:

  • 분산: 점수가 얼마나 퍼져 있을까요? (모두가 가까이 모여 있을까, 아니면 흩어져 있을까?)
  • 대립: 점수가 두 개의 대립하는 진영으로 나뉠까요?

그들은 AI 를 가르치는 두 가지 주요 방법을 시도했습니다:

  • 방법 A (직접): AI 에게 "불일치를 나타내는 숫자를 그냥 추측해 보라"고 말합니다.
  • 방법 B (분포): AI 에게 "0 을 선택할 사람, 1 을 선택할 사람 등의 전체 내역을 추측한 뒤, 그로부터 불일치를 계산하라"고 말합니다.

4. 그들이 발견한 것

  • AI 는 '퍼짐'을 추측하는 데는 그럭저럭 하지만 완벽하지는 않습니다. 컴퓨터 모델은 불일치 수준을 '중간' 정도의 성공률로 예측할 수 있었습니다. 마치 "비가 올 가능성이 있다"고 말하는 날씨 예보가 "반드시 비가 온다"고 말하는 것이 아닌 것과 같습니다.
  • 방법 B 가 약간 더 좋았습니다. AI 에게 최종 불일치 숫자만 가르치는 것이 아니라, 전체 그림 (투표 분포) 을 예측하도록 가르치는 것이 더 도움이 되었습니다. 투표의 형태를 이해함으로써 AI 는 불일치의 구조를 더 잘 학습했습니다.
  • AI 는 극심한 싸움을 어려워합니다. 모델은 사람들이 동의하거나 경미하게 불일치할 때를 잘 찾아냈습니다. 그러나 심사위원들이 극단적으로 양극화되었을 때 (시소가 양쪽 끝에 사람들이 앉아 완벽하게 균형을 이룰 때), AI 는 이를 과소평가하는 경향이 있었습니다. 실제로는 '거대한' 싸움인데 '중간' 정도의 싸움이라고 예측했습니다.

5. 왜 이런 일이 일어날까요?

논문은 AI 가 이러한 극심한 싸움을 완벽하게 예측하지 못하는 몇 가지 이유를 제시합니다:

  • 희귀 사건: AI 가 패턴을 학습할 만큼 훈련 데이터에 극단적인 양극화의 예시가 충분하지 않았습니다.
  • 숨겨진 요인: 때로는 불일치가 화면에 있는 단어에 관한 것이 아닙니다. 그것은 심사위원의 개인적인 삶, 정치적 견해, 또는 문화에 관한 것입니다. AI 는 텍스트만 읽을 수 있을 뿐 심사위원의 마음을 읽을 수는 없습니다.
  • 노이즈: 한 명의 심사위원이 안 좋은 하루를 보내고 이상하게 점수를 매기면 수학이 엉망이 되어 AI 를 혼란스럽게 만들 수 있습니다.

결론

이 논문은 텍스트만 읽어서 인간의 논쟁을 완벽하게 예측할 수는 없지만, 적절한 추정은 가능하다고 결론 내립니다. 가장 중요한 교훈은 어떤 문장들은 다른 문장들보다 본질적으로 판단하기 어렵다는 점입니다.

연구자들은 미래에 데이터에 라벨을 붙일 때 (예: AI 를 훈련시켜 혐오 표현을 탐지하는 경우) 모든 문장을 동일하게 취급해서는 안 된다고 제안합니다. AI 가 가장 많은 불일치를 일으킬 것으로 예측하는 문장에는 더 많은 시간과 더 많은 인간 심사위원을 투입하고, 모두가 동의하는 쉬운 것들에는 시간을 아껴야 한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →