← 최신 논문
💬 NLP

Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation

이 논문은 LLM 기반 판별사들이 제공된 정답이 모델의 내부 파라미터 지식과 충돌할 때 QA 평가 시 해당 정답을 준수하는 데 빈번히 실패하며, 이로 인해 일반적인 완화 전략에도 불구하고 신뢰할 수 없는 점수 산출이 지속된다는 점을 밝혀낸다.

원저자: Dongryeol Lee, Yerin Hwang, Taegwan Kang, Minwoo Lee, Younhyung Chae, Kyomin Jung

게시일 2026-06-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dongryeol Lee, Yerin Hwang, Taegwan Kang, Minwoo Lee, Younhyung Chae, Kyomin Jung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하고 박학다식한 사서 한 명을 고용하여 학생들의 에세이를 채점하게 한다고 상상해 보십시오. 당신의 규칙은 간단합니다. "내가 주는 정답지를 기준으로만 학생을 채점하라. 당신의 기억 속에 있는 지식은 사용하지 마라."

이 논문은 그 사서가 AI(대규모 언어 모델, LLM)이고, 정답지에 '함정'이 들어있을 때 어떤 일이 벌어지는지를 조사합니다.

설정: "뒤바뀐" 정답지

연구진은 특별한 테스트를 만들었습니다. 일련의 질문과 그에 대한 정답(골드 스탠다드)을 가져온 뒤, 정답을 그럴듯해 보이는 오답과 몰래 바꿔치기했습니다.

  • 원래 시나리오:

    • 질문: 2024년 F1 챔피언십 우승자는 누구인가?
    • 정답지 (골드): 맥스 페르스타펜.
    • 학생의 답: 맥스 페르스타펜.
    • AI 판정: ✅ 정답. (식은 죽 먹기).
  • "뒤바뀐" 시나리오:

    • 질문: 2024년 F1 챔피언십 우승자는 누구인가?
    • 정답지 (골드): 랜도 노리스. (참고: 실제로는 틀린 답이지만, 이 테스트를 위해 AI에게 이것이 "골드" 진실이라고 알려줌)
    • 학생의 답: 랜도 노리스.
    • AI 판정: ❌ 오답.

네? 이게 왜 이렇죠? 학생은 정답지와 완벽하게 일치했습니다! 그런데 AI는 오답 처리를 했습니다! 왜일까요? AI의 내부 기억(매개변수 지식)이 *"안 돼! 맥스 페르스타펜이 우승했어! 랜도 노리스는 아니라고!"*라고 외쳤기 때문입니다. AI는 지시 사항과 정답지를 무시하고 자신의 기억을 더 신뢰했습니다.

핵심 발견: "척척박사" 문제

논문은 이를 **"지식 주도적 실패(Knowledge-Driven Failure)"**라고 부릅니다.

이 AI 판정을 고등학교 시절 암기한 내용과 선생님의 정답지가 충돌할 때, 정답지를 따르기를 거부하는 '척척박사' 학생에 비유해 보십시오. 선생님이 "이번 시험에서는 답이 X이다"라고 말해도, 학생은 "아니요, 저는 분명히 Y라는 걸 알고 있어요"라고 주장하며 Y를 기준으로 채점을 하는 것과 같습니다.

연구진은 다음을 발견했습니다:

  1. 모두에게 일어나는 현상입니다: GPT-4o, GPT-5, 그리고 거대한 Llama 모델과 같은 가장 똑똑하고 강력한 AI 모델들도 이 현상을 보입니다.
  2. 유명할수록 심해집니다: 만약 정답지의 "오답"이 유명한 인물이나 사실(예: "일론 머스크" 또는 "달")이라면, AI는 정답지를 무시할 가능성이 더 높아집니다. 사실이 유명할수록 AI의 내부적 믿음이 강해지며, 이를 덮어쓰기가 더 어려워집니다.
  3. 덩치가 크다고 해결되지 않습니다: AI 모델을 더 크게 만드는 것(더 많은 "두뇌 능력"을 추가하는 것)은 이 문제를 해결하지 못했습니다. 사실, 때때로 더 큰 모델들이 의존할 내부 지식이 더 많기 때문에 더 고집스러워지기도 했습니다.

"마법 주문"은 통하지 않았습니다

연구진은 AI에게 "마법 주문"(프롬프트)을 주어 이를 해결하려 노력했습니다. 다음과 같은 시도를 했습니다:

  • 직접적인 명령: "당신의 지식을 무시하고 오직 정답지만 보세요!"
  • 생각하며 말하기: "채점하기 전에 단계별로 생각해보세요."
  • 예시 제공: AI에게 어떻게 해야 하는지 예시를 보여줌.

결과: 이 중 어느 것도 효과가 없었습니다. 정답지와 충돌할 때 AI는 여전히 자신의 기억을 지시 사항보다 우선시했습니다. 이는 마치 사나운 개에게 "저 다람쥐를 쫓지 말고 공을 봐!"라고 말하는 것과 같습니다. 개의 본능(매개변수 지식)이 명령을 압도하는 것입니다.

이것이 왜 중요한가

현실 세계에서 우리는 학교 시험부터 의료 조언에 이르기까지 모든 것을 채점하기 위해 이러한 AI 판정을 사용합니다. 우리는 AI가 공정하고 규칙을 따를 것이라고 가정합니다.

이 논문은 결정적인 결함을 보여줍니다. 만약 "규칙"(참조 정답)이 AI가 "믿는 것"(훈련 데이터)과 충돌하면, AI는 규칙을 어깁니다.

예를 들어, 데이터셋이 업데이트되어 (예: "2025년 선거 승자는 인물 B이다")라고 되어 있는데, AI가 여전히 인물 A를 "기억"하고 있다면, AI는 인물 B가 새로운 데이터에 따른 정답임에도 불구하고 인물 B라고 답한 모든 답변에 불공정하게 낙제점을 줄 것입니다.

결론

이 논문은 정답지가 AI의 내부 기억과 충돌할 경우, AI 판정이 정답지를 엄격하게 따를 것이라고 현재로서는 신뢰할 수 없다고 결론짓습니다. 이것은 코드의 버그가 아니라, 이 모델들이 사고하는 방식의 근본적인 습성입니다. 그들은 자신의 "지식"에 너무 확신이 차 있어서, 사실 관계가 변했을 때 중립적인 심판 역할을 수행하는 데 어려움을 겪습니다.

요약하자면: AI 판정은 도서관의 목록이 자신이 인터넷에서 읽은 내용과 다르다고 해서 그 목록을 사용하기를 거부하는 똑똑한 사서와 같습니다. 이 문제가 해결되기 전까지, 우리는 특정 참조 자료를 바탕으로 답을 채점하도록 그들을 완전히 신뢰할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →