← 최신 논문
💬 NLP

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

SIRA 는 후기 레이어의 마스크된 어텐션을 통해 동일한 트랜스포머 내에서 언어 사전에 우세한 반사실적 참조를 생성함으로써 대규모 비전-언어 모델의 환각을 완화하는 훈련 불필요 내부 대비적 디코딩 프레임워크로, 기술적 설명 범위를 유지하면서 외부 도구와 추가 순전파에 대한 의존성을 줄입니다.

원저자: Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 방금 보여 준 그림을 설명하려는 매우 똑똑하고 잘 읽은 조수 (대형 시각-언어 모델) 가 있다고 가정해 봅시다. 때때로 이 조수는 실제로 있는 것이 아니라 그들이 생각하는 것에 대해 지나치게 자신감을 갖게 됩니다. 그림이 실제로는 자전거일 수도 있는 흐릿한 형태일 뿐인데 "빨간 자전거가 보입니다"라고 말하거나, 자전거에 대한 이야기를 너무 많이 읽어서 뇌가 빈틈을 메꾸기 때문에 세부 사항을 만들어내기도 합니다. 이를 **환각 (hallucination)**이라고 합니다.

이 논문은 조수를 다시 훈련시키거나 작업을 이중 확인하기 위해 두 번째 사람을 고용할 필요 없이 이러한 현상을 막기 위한 SIRA라는 새로운 영리한 방법을 소개합니다.

기존 방법의 문제점

과거에는 조수가 거짓말을 하지 못하게 하기 위해 연구자들이 다음과 같은 방법을 시도했습니다:

  1. 조수에게 원본 그림을 보여줍니다.
  2. 그런 다음, 같은 그림의 흐릿하거나 망가진 버전을 보여줍니다.
  3. 두 답변을 비교합니다. 그림이 흐려졌을 때 조수가 이야기를 바꾸면, 아마도 그들이 추측하고 있었을 것입니다.

결함: 이는 누군가에게 그림을 설명하게 한 후, 안개가 낀 안경을 쓴 채 같은 그림을 설명하게 하는 것과 같습니다. "안개가 낀 안경" 버전은 안경 자체가 이미지를 왜곡하기 때문에 공정한 비교가 아닙니다. 이는 번거롭고, 두 번의 시간 (그림을 두 번 따로 보아야 함) 이 걸리며, 왜곡이 새로운 오류를 만들 수 있습니다.

SIRA 의 해결책: "공유 접두어 (Shared Prefix)"

SIRA 는 그림을 조작하는 대신, 조수가 아직 생각 중인 동안 조수의 내부 사고 과정을 조작하는 다른 접근법을 취합니다.

조수의 뇌를 이미지와 질문을 처리하는 여러 스테이션 (층) 이 있는 공장 조립 라인이라고 생각하세요.

  1. 공유 시작: 조수는 그림과 질문을 함께 보며 시작합니다. 그들은 공장의 초기 스테이션에서 장면의 견고한 이해를 구축합니다. 이것이 "공유 접두어"입니다. SIRA 는 두 버전의 조수가 이 초기 이해에 동의하도록 보장합니다.
  2. 갈림길: 초기 이해가 형성된 후, SIRA 는 동일한 뇌 내부에서 두 개의 병렬 트랙으로 프로세스를 분할합니다:
    • 트랙 A (전체 시야): 조수는 문장을 마무리하면서 그림 세부 사항을 계속 봅니다.
    • 트랙 B ( "눈가리개" 시야): 조수는 정확한 동일한 시작점에서 계속하지만, 후기 스테이션에서는 특정 그림 세부 사항에 대해 눈가리개를 합니다. 그들은 이미 쓰기 시작한 문장과 일반적인 지식에만 의존할 수 있습니다.

거짓말을 어떻게 고치는가

이제 SIRA 는 문장을 쓰는 각 단계에서 두 트랙을 비교합니다:

  • 조수가 "나는 를 봅니다"라고 말하고, 트랙 A(개를 보는) 와 트랙 B(눈가리개) 가 모두 높은 확신으로 "개"라고 말하면, SIRA 는 이것이 아마도 일반적인 언어에 기반한 추측일 가능성이 높다는 것을 압니다 (아마도 개가 이야기에서 흔할 수 있음). 눈가리개 버전이 그림 없이도 그것을 말했기 때문에 "개"에 대한 점수를 낮춥니다.
  • 조수가 "나는 보라색 코끼리를 봅니다"라고 말하고, 트랙 A 는 그것을 보기 때문에 "보라색 코끼리"라고 말하지만 트랙 B 는 그것을 볼 수 없기 때문에 "말도 안 돼, 그건 이야기에 없어"라고 말하면, SIRA 는 그림이 이 주장의 유일한 이유라는 것을 압니다. "보라색 코끼리"에 대한 점수를 높입니다.

왜 더 나은가

  • 추가 단계 없음: 그림을 두 번 볼 필요가 없습니다. 내부 사고 과정을 분할함으로써 한 번에 모든 것을 처리합니다.
  • ** messy 왜곡 없음:** 그림을 흐리게 하지 않습니다. 사고 과정의 한 버전에서 시각 입력을 일시적으로 "끄기"만 할 뿐, 나머지 컨텍스트는 완벽하게 정렬된 상태를 유지합니다.
  • 훈련 불필요: 기존 모델에서 즉시 작동합니다. 모델에게 새로운 것을 가르칠 필요가 없습니다.

결과

테스트에서 SIRA 는 사진에 없는 (예: 사진에 없는 "바나나") 물체들을 만들어내는 것을 막으면서도 실제 사물을 정확하게 설명할 수 있도록 했습니다. 이는 모델 자체의 뇌 내부에서 즉시 발생하는 내장형 "현실 점검"과 같아서, 그들이 말하는 것이 그들이 기대하는 것이 아니라 실제로 그들이 보는 것에 의해 뒷받침되는지 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →