LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task
NLPerspectives의 세 번째 LeWiDi 공유 태스크는 서열 척도(ordinal labeling schemes)를 가진 네 가지 다양한 NLP 태스크로 벤치마크를 확장하고, 새로운 지표와 함께 소프트 레이블(soft-label) 및 관점주의적(perspectivist) 평가 패러다임을 도입하며, 새로운 리소스와 인간 판단 변동성 모델링에 대한 통찰을 제공함으로써 불일치 인지 AI(disagreement-aware AI)의 발전을 진전시킵니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 인간의 언어를 이해하는 법을 가르치고 있다고 상상해 보세요. 오랫동안 우리는 로봇에게 모두가 정답에 동의하는 예시, 예를 들어 "2 + 2 = 4"와 같은 것을 보여주며 가르쳤습니다. 하지만 현실 세계에서 인간은 자주 의견이 갈립니다. 어떤 사람은 농담이 정말 웃기다고 생각하는 반면, 다른 사람은 그 농담이 불쾌하다고 생각할 수 있습니다. 어떤 사람은 어떤 문장을 거짓말이라고 보는 반면, 다른 사람은 해롭지 않은 의견이라고 볼 수도 있습니다.
이 논문은 AI 모델이 이러한 의견 차이를 존재하지 않는 것처럼 꾸미는 대신, 어떻게 다룰 것인지를 가르치기 위해 설계된 "콘테스트"(LeWiDi-2025라고 불리는)의 세 번째 에디션을 설명합니다.
다음은 일상적인 비유를 사용하여 그들이 무엇을 했는지 쉽게 풀어낸 내용입니다.
1. 목표: 군중의 목소리에 귀 기울이는 법을 AI에게 가르치기
조직자들은 AI에게 단 하나의 "정답"을 고르도록 강요하는 대신, 인간의 의견이라는 전체 그림을 이해할 수 있는지 확인하고 싶었습니다.
- 과거의 방식: 만약 10명이 영화에 투표했을 때 6명이 "좋음", 4명이 "나쁨"이라고 했다면, 과거의 AI는 단순히 "정답은 좋음이다"라고 말했습니다. 이는 4명의 의견을 무시하는 것입니다.
- 새로운 방식: AI에게 "전체 이야기는 이렇습니다: 6명은 좋아했고, 4명은 좋아하지 않았습니다. 당신의 임무는 왜 그들이 그렇게 느꼈는지 이해하고 의견의 혼합을 예측하는 것입니다"라고 알려줍니다.
2. 네 가지 "게임" (데이터셋)
콘테스트는 참가자들에게 인간의 불일치를 나타내는 서로 다른 네 가지 유형의 퍼즐을 제공했습니다.
- 사르카즘(비꼬기) 게임 (CSC): 문자 메시지를 읽는다고 상상해 보세요. 이것은 진심 어린 칭찬인가요, 아니면 비꼬는 공격인가요? 사람들은 이것이 얼마나 "비꼬는 듯한지"를 1점에서 6점 사이의 척도로 평가합니다.
- 아이러니 게임 (MP): 짧은 게시글과 그에 대한 답글입니다. 답글이 아이러니한가요? 이 게임은 영어, 스페인어, 아랍어를 포함한 9가지 다른 언어로 진행되었으며, 이는 아이러니가 전 세계적인 문제임을 보여줍니다.
- 패러프레이즈(의미 재진술) 게임 (Par): 두 질문이 주어집니다. 두 질문이 같은 것을 묻고 있나요? 단순한 "예/아니오" 대신, 사람들은 유사성을 -5에서 5 사이의 척도로 평가했습니다.
- 논리 게임 (VEN): 문장과 사실이 주어집니다. 이 사실이 문장을 증명하나요, 모순되나요, 아니면 아무 관련이 없나요? 여기서 사람들은 답변과 함께 설명도 작성해야 했습니다.
3. 두 가지 플레이 방식 (태스크)
참가자들은 AI의 이해도를 보여주기 위해 두 가지 방식 중 하나를 선택해야 했습니다.
- 태스크 A: "기상 캐스터" (Soft-Label)
AI가 특정 답을 추측하는 대신 기상 캐스터처럼 행동합니다. 단순히 "비가 올 것이다"라고 말하는 것이 아니라, "비가 올 확률 60%, 맑을 확률 30%, 눈이 올 확률 10%입니다"라고 말합니다. AI는 인간이 투표할 분포를 예측합니다. - 태스크 B: "독심술사" (Perspectivist)
이것은 더 어렵습니다. AI는 특정한 사람이 무엇이라고 말할지 추측해야 합니다. 만약 당신이 AI에게 "여기 X라는 사람이 평소에 생각하는 방식이 있습니다"라고 알려준다면, AI는 "X의 이력을 바탕으로 볼 때, 그들은 이 질문에 이렇게 답할 것입니다"라고 예측해야 합니다. 이는 당신의 까칠한 삼촌이 농담에 동의할지, 아니면 낙천적인 이모가 동의할지를 예측하는 것과 같습니다.
4. 새로운 성적표 (지표)
과거에는 심사위원들이 AI가 얼마나 틀렸는지를 측정하기 위해 단순한 자(ruler)를 사용했습니다. 하지만 그 자는 "사르카즘 척도"나 "다국어"를 측정하기에는 적합하지 않았습니다.
- 새로운 자: 그들은 새로운 측정 방식을 발명했습니다.
- "척도"(예: 1~6점)의 경우, 5 대신 4라고 말하는 것이 5 대신 1이라고 말하는 것보다 더 낫다는 점을 이해하는 지표를 사용했습니다.
- "독심술사" 태스크의 경우, AI가 개별 사람의 편향과 습관을 얼마나 잘 흉내 내는지 측정했습니다.
5. 결과: 누가 승리했나?
약 15개의 팀이 콘테스트에 참여했습니다. 결과는 다음과 같습니다.
- "거대 뇌" 접근법: 상위 팀들은 대규모 언어 모델(LLM)—에세이를 쓰고 대화를 나누는 것과 같은 똑똑한 AI—을 사용했습니다. 이 모델들은 다양한 사람들이 어떻게 투표했는지 예시를 살펴보고 그 패턴을 복제하는 데 매우 뛰어났습니다.
- "작지만 강한" 접근법: 일부 팀은 더 작고 특화된 모델을 사용했습니다. 이 모델들은 작고 까다로운 데이터셋에서 놀라운 성과를 거두었습니다.
- 비밀 재료: 우승한 시스템들은 단순히 텍스트만 본 것이 아니라, 누가 그 글을 썼는지도 살펴보았습니다. 그들은 더 나은 예측을 하기 위해 작성자의 연령, 성별, 또는 과거 투표 이력과 같은 단서들을 활용했습니다.
- "설명" 보너스: 논리 게임에서, 사람들이 작성한 답변뿐만 아니라 설명까지 AI에게 입력한 팀들이 훨씬 더 좋은 성과를 냈습니다. 이는 누군가가 어떻게 투표했는지가 아니라, 왜 그렇게 투표했는지를 이해하는 것과 같습니다.
6. 한계 (제한 사항)
저자들은 자신들이 테스트하지 못한 부분에 대해서도 솔직하게 밝혔습니다.
- "새로운 얼굴" 문제: 현실 세계에서는 한 번도 본 적 없는 낯선 사람을 만날 수 있습니다. 이 콘테스트에서 AI는 훈련 과정에서 이미 "만나본 적 있는" 사람들에 대해 테스트되었습니다. 이 모델들이 완전히 새로운 사람을 다룰 수 있는지는 아직 알 수 없습니다.
- 텍스트 전용: 이 콘테스트는 읽기와 쓰기에 관한 것이었습니다. 이러한 방식이 이미지, 영상 또는 음성에도 작동하는지는 아직 알 수 없습니다.
요약
이 논문은 AI에게 모든 사람이 동의한다고 가정하지 말라고 가르친 콘테스트의 성적표입니다. 새로운 측정 방식을 사용하고 인간의 불일치라는 복잡한 현실에 집중함으로써, 우승자들은 최고의 AI 모델이 군중을 바라보고, 그 안의 다양한 목소리를 이해하며, 단순히 하나의 승자를 뽑는 것이 아니라 의견의 혼합을 예측하는 모델임을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.