← 최신 논문
💻 computer science

Hallucination Span Detection with Input-Side Evidence Alignment

이 논문은 입력된 근거로부터 충실한 토큰의 예측 가능성을 활용하여 환각을 식별하는 동시에 이를 출처와 정렬함으로써, LLM이 생성한 텍스트 내의 환각 스팬을 탐지하기 위한 새로운 태스크와 인코더 기반 방법을 소개한다.

원저자: Miyu Yamada, Yuki Arase

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Miyu Yamada, Yuki Arase

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 뉴스를 요약하고, 복잡한 질문에 답하며, 문서를 초안하는 강력한 엔진 역할을 수행함으로써 우리가 컴퓨터와 상호작나하는 방식을 변화시켰습니다. 이 시스템들은 방대한 양의 텍스트에서 학습한 패턴을 바탕으로 문장에서 다음에 올 단어를 예측함으로써 작동합니다. 그러나 지속적인 결함이 이들의 신뢰성을 저해합니다. 바로 모델이 때때로 사실을 지어낸다는 점입니다. '환각(hallucination)'이라고 알려진 이 현상은 모델이 그럴듯하게 들리지만 원문 자료에 근거가 없거나 원문과 직접적으로 모순되는 정보를 생성할 때 발생합니다. 이러한 도구에 의존하여 중요한 업무를 수행하는 사용자들에게, 유용한 요약과 조작된 이야기를 구별하는 것은 어려운 일입니다. 핵심적인 과제는 단순히 오류가 존재한다는 것을 아는 것에 그치지 않고, 정확히 어떤 단어가 틀렸는지 찾아내고 그 단어가 틀렸음을 증명하는 원문의 특정 부분을 찾아내는 데 있습니다. 이러한 세밀한 수준의 상세 정보 없이는 긴 문서의 진실성을 검증하는 작업이 지루하고 수동적인 과정으로 남게 됩니다.

도쿄 과학 대학(Institute of Science Tokyo)의 연구진은 전체 텍스트를 판단하는 것에서 개별 단어를 조사하는 것으로 초점을 전환하여 이 문제를 해결하는 새로운 접근 방식을 개발했습니다. 이들의 방법은 컴퓨터에게 단순히 한 단락 전체를 참 또는 거짓으로 라벨링하라고 요청하는 대신, 마치 돋보기처럼 생성된 결과물을 한 단어씩 스캔하여 그것이 원문으로 추적될 수 있는지 확인합니다. 연구팀은 단순하지만 강력한 관찰에 기반하여 작동합니다. 만약 요약문의 단어가 원문에 충실하다면, 컴퓨터는 오직 원문만을 가이드로 삼아 그 단어를 예측할 수 있어야 한다는 것입니다. 반대로, 만약 어떤 단어가 환각이라면, 그 정보가 원문에 존재하지 않기 때문에 원문으로부터 예측하는 것이 불가능할 것입니다. 연구진은 이 예측 가능성을 테스트하도록 모델을 훈련함으로써, 지어낸 단어를 표시할 뿐만 아니라 올바른 정보를 뒷받침하는 입력값의 구체적인 근거를 강조해 보여주는 시스템을 만들었습니다.

이 과정은 생성된 텍스트를 하나의 덩어리로 취급하는 대신 구절이나 절과 같은 의미 있는 단위로 나누는 것부터 시작됩니다. 그런 다음 시스템은 이 덩어리 중 하나의 단어를 가져와 일시적으로 숨긴 뒤, 오직 원래의 입력 텍스트만을 바탕으로 모델에게 그 단어가 무엇이어야 하는지 추측하도록 요청합니다. 만약 모델이 원문을 사용하여 숨겨진 단어를 자신 있게 추측할 수 있다면, 시스템은 이를 '충실함'으로 표시합니다. 만약 모델이 추측에 어려움을 겪거나 확신 점수가 낮다면, 시스템은 해당 단어를 잠재적 환각으로 표시합니다. 결정적으로, 모델이 추측을 위해 원문 텍스트를 살펴보아야 했기 때문에, 이 방식은 자연스럽게 출력된 단어와 그를 도와준 입력값의 특정 부분 사이에 연결 고리를 만들어냅니다. 이는 사용자가 모델이 어디에서 정보를 찾았는지, 혹은 오류가 발생했을 경우 어디에서 근거를 찾지 못했는지를 정확히 보여주는 증거 지도를 생성합니다.

이 아이디어를 테스트하기 위해 연구진은 인간이 생성된 답변의 어느 부분이 사실과 다른지 이미 식별해 놓은 수천 개의 사례가 포함된 데이터셋을 사용했습니다. 그들은 텍스트를 읽고 판단하기 위해 거대하고 복잡한 모델에 의존하는 기존 기술들과 그들의 새로운 방법을 비교했습니다. 결과는 그들의 더 가볍고 집중적인 접근 방식이 오류를 찾아내는 데 매우 뛰어나다는 것을 보여주었습니다. 다른 방법들이 때때로 실수를 놓치는 반면, 이 새로운 시스템은 지어낸 단어들, 특히 완전히 새로 만들어진 단어들을 성공적으로 식별해 냈습니다. 또한 요약문의 올바른 단어들을 원문의 적절한 문장들과 연결하는 데에도 효과적임을 입증하여, 사용자가 따라갈 수 있는 명확한 증거의 흔적을 제공했습니다.

그러나 이 연구는 특정 유형의 오류를 탐지하는 데 있어 시스템의 구체적인 약점 또한 드러냈습니다. 모델이 환각을 일으킨 내용이 원문과 문법적으로나 맥락적으로 유사하면서도 내용을 바꾸는 방식, 예를 들어 숫자를 "4(four)"에서 "20(twenty)"으로 바꾸는 식의 직접적인 모순일 때 시스템은 어려움을 겪었습니다. 이러한 경우, 모델은 주변 맥락이 원문과 너무 유사하다고 판단하여 예측에 대한 확신을 유지했고, 결국 미세한 의미의 변화를 인식하지 못했습니다. 연구진은 이 시스템이 원문에 전혀 없는 정보를 포착하는 데는 탁ex월하지만, 더 기만적인 형태의 상충하는 오류를 잡아내기 위해서는 추가적인 정교화가 필요하다고 언급했습니다. 이러한 한계에도 불구하고, 이 연구는 모든 주장을 직접 원문과 연결함으로써 인공지능을 더욱 투명하게 만들고, 기계가 생성한 콘텐츠의 진실성을 검증하는 실질적인 방법을 제시했다는 점에서 중요한 진전을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →