← 최신 논문
💬 NLP

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

이 논문은 응답을 원자적 주장들로 분해하고 상충하는 증거와 지지하는 증거 사이의 균형 및 상충하는 주장의 비율을 모두 측정함으로써, 언어 모델이 근거 문서에 포함된 상충하는 증거를 얼마나 잘 인지하는지 정량화하기 위해 설계된 새로운 지표이자 벤치마크인 ConflictScore를 소개한다.

원저자: Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려는 탐정이라고 상상해 보십시오. 하지만 단 한 명의 목격자가 아니라, 열 명의 사람들이 모여 있는 방에서 증언을 듣고 있습니다. 어떤 이들은 용의자가 공원에 있었다고 말하고, 다른 이들은 그가 도서관에 있는 것을 보았다고 확언합니다.

문제점: "예, 하지만..."이라는 사각지대
현재의 AI 모델들(당신이 사용하는 챗봇 같은 것들)은 정보를 찾는 데는 뛰어납니다. 하지만 상충하는 이야기들을 마주했을 때, 이들은 가장 큰 목소리를 내는 쪽을 선택하고 나머지는 무시해 버리는 고집 센 아이처럼 행동하곤 합니다. 그들은 "용의자는 공원에 있었습니다!"라고 말하며 멈춰버릴 수 있고, 그 과정에서 다섯 명의 다른 목격자들이 그와 다르게 말했다는 사실은 완전히 잊어버립니다.

AI가 진실을 말하고 있는지 확인하는 기존의 도구들은 단순한 "합격/불합격" 테스트와 같습니다. 그들은 "어떤 목격자라도 이 이야기를 지지하는가?"라고 묻습니다. 만약 한 사람이 "공원"이라고 말했다면, 나머지 아홉 명이 "도서관"이라고 했더라도 AI는 합격 점수를 받게 됩니다. 이는 잘못된 안도감을 줍니다.

해결책: ConflictScore
이 논문의 저자들은 ConflictScore라는 새로운 도구를 소개합니다. ConflictScore를 단순히 이야기가 뒷받념되는지를 묻는 것이 아니라, **"이 이야기에 대해 다른 목격자들이 반박하고 있는가?"**라고 묻는 "갈등 탐정"이라고 생각하십시오.

작동 방식은 다음과 같이 세 단계로 간단히 나뉩니다:

  1. 세분화하기 (Claim Decomposition):
    AI가 긴 문단을 작성한다고 가정해 봅시다. ConflictScore는 이 문단을 아주 작은 개별 문장(원자적 주장)으로 쪼갭니다. 이것은 마치 커다란 케이크를 조각조각 잘라 하나하나 검사하는 것과 같습니다.

  2. 증언대 (Evidence Evaluation):
    모든 문장에 대해, 이 도구는 AI가 사용한 모든 문서를 대조하여 확인합니다. 도구는 다음과 같이 묻습니다: "문서 A가 이 문장을 지지하는가? 문서 B가 이 문장과 모순되는가?"

  • 지지 (Support): 문서가 동의함.
  • 모순 (Contradict): 문서가 반대함.
  • 무관 (Irrelevant): 문서가 해당 내용에 대해 언급하지 않음.
  1. 성적표 (The Metrics):
    이 도구는 두 가지 점수를 제공합니다:
  • ConflictScore-Count (CS-C): 이것은 "문제 발생 횟수"와 같습니다. AI의 문장 중 몇 퍼센트가 증거와 충돌하고 있는지를 알려줍니다. 만약 6개의 문장 중 4개가 반대 의견에 부딪혔다면, 점수가 높게 나타납니다 (즉, AI가 곤경에 처했다는 뜻입니다).
  • ConflictScore-Ratio (CS-R): 이것은 "저울"입니다. 증거가 어떻게 나뉘어 있는지를 측정합니다. 50 대 50의 비율(진정한 논쟁)인지, 아니면 9 대 1(압도적인 차이)인지를 측정합니다. 이를 통해 불일치의 심각성을 이해할 수 있습니다.

테스트 드라이브: ConflictBench
새로운 탐정 도구가 제대로 작동하는지 확인하기 위해, 저자들은 ConflictBench라는 체육관을 만들었습니다. 그들은 답이 복잡하게 얽힌 수천 개의 질문을 모았습니다:

  • 모호성 (Ambiguity): "클리블랜드는 얼마나 큰가?"와 같은 질문 (클리블랜드라는 이름을 가진 도시가 많습니다).
  • 모순 (Contradiction): 문서들이 명시적으로 반대되는 내용을 담고 있는 경우 (예: "행사는 1990년에 열렸다" vs "행사는 1995년에 열렸다").
  • 의견 (Opinion): 사람들이 진심으로 의견이 갈리는 경우 (예: "이 웹 디자인 기법이 좋은가?").

그들은 이 체육관에서 도구를 테스트했고, AI가 논쟁 중인 목격자들을 무시하고 있을 때 이를 포착하는 능력이 매우 뛰어나다는 것을 발견했습니다.

발견한 사실

  • AI는 과도하게 자신만만하다: 문서들이 명확하게 상충할 때조차, AI 모델들은 한쪽 편을 들어 그것이 절대적인 진실인 것처럼 행동하는 경향이 있었습니다. 그들은 "도서관"을 말하는 목격자들을 무시한 채 "공원"에 대해서만 소리 높여 외치곤 했습니다.
  • 말로는 해결되지 않는다: 저자들은 AI에게 지침(예: "주의를 기울이고 모든 측면을 고려해 주세요")을 통해 "부드러운 상기"를 시켜보았습니다. 이것은 약간의 도움이 되었지만, AI는 여전히 자주 틀렸습니다. 이는 마치 고집 센 개에게 "착하게 굴어"라고 말하지만, 그 개는 여전히 우체부에게 달려드는 것과 같습니다.
  • "재시도" 기술: 가장 흥ende로운 발견은 TruthfulQA 실험에서 나타났습니다. ConflictScore를 사용하여 AI에게 "이봐, 네가 모순점을 놓쳤어, 다시 해봐"라고 말했을 때, AI는 실제로 더 나아졌습니다. 이것은 마치 학생이 시험을 보고 빨간 펜 교정을 받은 뒤, 자신의 실수를 깨닫고 정답을 다시 쓰는 것과 같았습니다.

결론
ConflictScore는 AI가 현실 세계의 복잡함에 대해 정직한지를 측정하는 새로운 방법입니다. 이 도구는 AI가 어떤 증거를 가지고 있는지만 확인하는 것이 아니라, 그 증거가 혼란스럽고 상충할 때 AI가 그 사실을 인정할 만큼 용기 있는지 확인합니다.

한계점 (주의할 점)
저자들은 이 도구가 모든 문장을 모든 문서와 대조해야 하기 때문에 실행하는 데 많은 컴퓨터 자원이 필요하다는 점을 인정합니다. 이는 마치 단 하나의 문단을 검토하기 위해 100명의 변호사를 고용하는 것과 같습니다. 정확하지만, 비용이 많이 들고 느립니다. 또한, 이 도구는 모든 문서를 동등하게 취급합니다. 즉, 어떤 문서가 유명 신문사인지 아니면 이름 없는 블로그인지 구분하지 못합니다. 그저 "문서 A" 대 "문서 B"로 볼 뿐입니다.

요약하자면, ConflictScore는 AI가 바로 눈앞에 있는 논쟁들을 무시했기 때문에 왜 자신만만하게 틀린 말을 하는지를 보여주는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →