← 최신 논문
💻 computer science

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

이 논문은 코드 및 도구 출력과 같은 다양한 구조화된 입력에 걸친 스팬 수준(span-level) 환각 탐지를 위한 통합 벤치마크를 소개하며, 미세 조정된 Qwen3.5-2B 모델이 자연어 RAG 벤치마크에서 경쟁력을 유지하는 동시에 이러한 복잡한 도메인에서 기존의 탐지기 및 제로샷 판별기보다 성능이 크게 뛰어남을 입증한다.

원저자: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

게시일 2026-07-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하고 말이 빠른 비서에게 보고서를 작성하도록 고용했다고 상상해 보세요. 당신은 그들에게 참고 서적 더미(즉, "컨텍스트")와 특정 질문을 건네줍니다. 비서는 빠르게 답변을 타이핑합니다.

문제는 무엇일까요? 때때로 아주 똑똑한 비서조차도 약간의 창의성을 발휘할 때가 있습니다. 사실을 지어내거나, 숫자를 뒤섞거나, 당신의 책에는 존재하지 않는 페이지를 인용하기도 합니다. 이것을 **환각(hallucination)**이라고 부릅니다.

오랫동안 연구자들은 이러한 실수를 잡아내기 위해 "팩트 체크 도구"를 만들어 왔지만, 이 도구들은 주로 역사나 과학 같은 일반적인 주제에 대해 평이한 텍스트로 글을 쓸 때만 제대로 작동했습니다.

이 논문은 현대의 세계, 즉 비서가 컴퓨터 코드를 작성하거나, 소프트웨어 도구 로그를 요약하거나, 표와 매뉴얼 같은 구조화된 문서를 읽어야 하는 환경에 맞춰 설계된 훨씬 더 강력한 새로운 팩트 체크 도구를 소개합니다.

다음은 일상적인 비유를 사용하여 그들이 수행한 작업을 정리한 내용입니다.

1. 문제점: "코드"와 "로그"라는 사각지대

당신의 비서가 정비사라고 상상해 보세요.

  • 기존의 팩트 체크 도구들: 정비사가 "자동차는 파란색이다"라고 말해야 할 때 "자동차는 빨간색이다"라고 잘못 말하는 것을 잡아내는 데는 뛰어납니다.
  • 새로운 현실: 이제 정비사는 복잡한 수리 매뉴얼(코드)을 작성하거나 디지털 진단 화면(도구 출력값)을 읽고 있습니다. 만약 정비사가 turn_on_engine 대신 turn_off_engine과 같은 단 하나의 잘못된 명령어를 적는다면, 자동차 전체가 고장 날 수도 있습니다. 또는 존재하지 않는 부품 번호를 나열한다면 주문이 실패할 것입니다.
  • 공백: 기존의 팩트 체크 도구들은 소설을 읽는 사람과 같았습니다. 그들은 컴퓨터 프로그램의 단 한 줄의 오류나 소프트웨어 로그의 특정 오류를 식별하는 방법을 몰랐습니다. 그들은 실제 기술 용어와 가짜 용어를 구분할 수 없었습니다.

2. 해결책: "틀린 그림 찾기" 게임

저자들은 컴퓨터가 이러한 전문적인 팩트 체크 요원이 되는 법을 배울 수 있도록 거대한 새로운 훈련장(벤치마크)을 구축했습니다.

  • 데이터 제작 방식: 그들은 완벽하고 정확한 답변(예: 완벽한 수리 매뉴얼)에서 시작했습니다. 그런 다음 "환각 주입기"(심술궂은 편집가라고 생각하세요)를 사용하여 아주 미세하고 국소적인 거짓말을 몰래 끼워 넣었습니다.
    • 예시: 실제 함수 이름인 set_device를 가짜 이름인 set_active_device로 변경했습니다.
    • 그들은 단순히 "이 답변은 틀렸다"라고 말하는 데 그치지 않았습니다. 거짓말이 발생한 정확한 문자 구간을 표시했습니다.
  • 다양성: 그들은 다음과 같은 내용을 포함하여 74,000개 이상의 사례를 만들었습니다.
    • 코드: 실제 GitHub 소프트웨어 수정 사항.
    • 도구 출력: 소프트웨어 도구의 로그(에러 메시지나 검색 결과 등).
    • 구조화된 문서: 표와 리스트가 포함된 연구 논문, README 파일, 위키피디아 페이지.
    • 일반 텍스트: 일반적인 질문과 답변(일반 텍스트를 확인하는 능력을 잊지 않도록 하기 위함).

3. 새로운 탐정: "LettuceDetect"

그들은 새로운 AI 모델(Qwen이라는 모델의 20억 파라미터 버전)을 탐정 역할을 하도록 훈련시켰습니다.

  • 임무: 탐정은 요청(Request), 참고 서적(Reference Books), 그리고 비서의 답변(Answer)을 살펴봅니다. 탐정은 정확히 어느 부분이 거짓인지 지목하며 "이 특정 단어는 지어낸 것입니다" 또는 "이 숫자는 틀렸습니다"라고 말해야 합니다.
  • 결과:
    • 코드 및 도구 분야: 이 새로운 탐정은 슈퍼히어로 수준입니다. 코드에서의 거짓말을 60% 잡아냈습니다.
    • 경쟁 상대: 기존의 "기성품" 팩트 체크 도구들(LettuceDetect-large 등)과 심지어 거대하고 똑똑한 AI 판사들(Zero-shot LLMs)은 코드에서의 거짓말을 약 17%에서 22% 정도밖에 잡아내지 못했습니다. 그들은 기술적 오류에 대해 거의 눈 먼 상태였습니다.
    • 일반 텍스트 분야: 새로운 탐정은 일반 텍스트를 확인하는 데에도 매우 뛰어납니다(기존 최고의 시스템들과 유사한 점수를 기록함). 이는 코드를 읽는 법을 배우면서도 일반적인 지식을 잃지 않았음을 증명합니다.

4. 왜 "스팬 레벨(Span-Level)"이 중요한가

이 논문은 단순히 "이 답변을 거부하라"고 말하는 것이 아니라 **"스팬 레벨 탐지(Span-Level Detection)"**를 강조합니다.

  • 비유: 어떤 학생이 10페이지 분량의 에세이를 썼다고 가정해 봅시다. 그중 딱 한 문장이 거짓말입니다.
    • 기존 방식: "에세이 전체를 낙제 처리하라." (너무 가혹합니다. 나머지 9페이지는 완벽할 수도 있기 때문입니다.)
    • 새로운 방식: "거짓말인 그 한 문장을 하이라이트 하라." (정밀하고 유용합니다.)
  • 코드에서도 이 방식은 결정적입니다. 프로그램이 100줄인데 단 한 줄만 틀렸다면, 프로그램 전체를 버리는 것이 아니라 그 한 줄만 고치고 싶을 것입니다.

요약

이 논문은 현대의 AI 비서가 마주하는 복잡하고 기술적인 현실을 다룰 수 있는 새로운 통합 "진실 탐지기"를 제시합니다. 이 모델은 단순한 텍스트 확인을 넘어 코드, 소프트웨어 로그, 구조화된 문서에서 발생하는 아주 작고 위험한 오류를 찾아내는 단계로 나아갑니다.

그들의 새로운 모델인 LettuceDetect-Qwen-2B는 특히 비서가 코드를 작성하거나 소프트웨어 로그를 읽을 때, 기존의 도구들보다 기술적 거짓말을 찾아내는 데 훨씬 뛰어난 성능을 보였으며, 동시에 일반 언어에 대해서도 최상위권의 팩트 체크 능력을 유지하고 있습니다. 그들은 다른 이들이 더 나은, 더 신뢰할 수 있는 AI 시스템을 구축할 수 있도록 이 "틀린 그림 찾기" 게임에 관한 모든 데이터와 모델을 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →