← 최신 논문
💻 computer science

YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models

YARD는 얕은 연산을 공유하고 중간 레이어에서 분기하는 Y-아키텍처를 채택하여, 두 번째 순전파의 지연 없이 효과적인 대조 신호를 생성하기 위해 미세한 시각적 토큰을 레지스터 토큰으로 대체함으로써 거대 시각-언어 모델의 환각 현상을 완화하는 학습이 필요 없는 프레임워크이다.

원저자: Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 시각-언어 모델(LVGM)을 매우 재능 있지만 약간은 과신하는 이야기꾼이라고 상상해 보세요. 당신이 이 모델에게 해변 사진을 보여주면, 모델은 그 장면을 묘사하기 시작합니다. 때로는 제대로 맞히기도 하지만("우산과 사람들이 있습니다"), 때로는 없는 사실을 아주 자신 있게 지어내기도 합니다("그리고 보세요, 서핑보드와 강아지도 있어요!"). 이것을 **환각(Hallucination)**이라고 부릅니다.

이 논문은 모델을 다시 학습시키거나 속도를 늦추지 않고도, 이 이야기꾼이 말을 지어내는 것을 막기 위한 새로운 방법인 YARD(Y-Architecture Register Decoding)를 소개합니다.

YARD가 어떻게 작동하는지 쉬운 개념으로 나누어 설명해 드리겠습니다.

1. 기존 방식의 문제점

YARD가 나오기 전, 연구자들은 환각을 해결하기 위해 "대조적 디코딩(Contrastive Decoding)"이라는 기술을 사용했습니다. 이것은 이야기꾼에게 이야기를 두 번 들려달라고 요청하는 것과 같습니다.

  • 버전 A (깨끗한 버전): "실제 사진을 보고 무엇이 보이는지 말해줘."
  • 버전 B (저하된 버전): "사진이 흐릿하거나 조각들이 빠진 것처럼 가정하고, 무엇이 보이는지 말해줘."

컴퓨터는 이 두 가지 이야기를 비교합니다. 만약 버전 B는 서핑보드가 있다고 말하는데 버전 A는 그렇지 않다면, 컴퓨터는 최종 답변에서 "서핑보드"라는 아이디어를 억제해야 한다는 것을 알게 됩니다.

하지만 이전 방식에는 두 가지 큰 결함이 있었습니다.

  • "눈가리개" 방식: 어떤 방식은 버전 B를 위해 시각적 입력을 완전히 제거했습니다. 이는 너무 극단적이었습니다. 모델은 일반적인 지식에 기반해 추측하게 됩니다 (예: "해변에는 보통 서핑보드가 있으니까"). 이는 이 특정 해변에 대한 구체적인 거짓말을 잡아내는 데 도움이 되지 않았습니다.
  • "이중 작업" 방식: 다른 방식은 이미지 픽셀을 손상시켰습니다(노이즈 추가). 이는 컴퓨터가 이미지를 처음부터 두 번 처리해야 했기에 매우 느리고 비용이 많이 들었습니다.

2. YARD의 해결책: "Y" 모양

YARD는 모델의 뇌 안에 Y자형 경로를 구축함으로써 판도를 바꿉니다.

  • 줄기 (공유 경로): "깨끗한" 이야기와 "저하된" 이야기는 함께 시작됩니다. 이들은 처음 몇 개의 레이어를 공유합니다. 이는 책의 첫 단락을 함께 읽는 것과 같습니다. 모델이 처음부터 작업을 두 번 할 필요가 없으므로 시간을 절약할 수 있습니다.
  • 분기점 (중간 레이어): 모델이 생각하는 과정 중 특정 지점에서 경로가 갈라집니다.
    • 왼쪽 가지 (깨끗한 버전): 정상적으로 계속 진행하며, 이미지의 모든 미세한 부분(패치)을 살펴봅니다.
    • 오른쪽 가지 (저하된 버전): 여기서 마법이 일어납니다. 이 가지는 모든 세부 사항을 보는 대신, "레지스터(Register)"를 통해 이미지를 보도록 강제됩니다.

3. "레지스터" 비유

이미지가 고해상도 지도라고 상상해 보세요.

  • 깨끗한 가지는 지도를 보며 모든 거리, 나무, 집을 봅니다.
  • 저하된 가지(YARD 사용)는 "레지스터"를 받습니다. 레지스터는 "이것은 물과 모래가 있는 해변 장면이다"라고 적힌 요약 노트와 같습니다. 하지만 이 노트는 구체적인 세부 사항은 숨깁니다. 사람들이 있다는 것은 알지만, 그들이 어디에 서 있는지, 무엇을 들고 있는지는 볼 수 없습니다.

이것이 왜 영리할까요?
모델이 "서핑보드가 있다"라고 말하려고 한다면, 깨끗한 가지(세부 사항을 보는 쪽)가 지도를 확인하고 "아니, 서핑보드는 안 보여"라고 말합니다. 반면 저하된 가지(일반적인 해변 분위기만 보는 쪽)는 "음, 해변에는 보통 서핑보드가 있으니까 아마 있을 거야"라고 말할 수도 있습니다.

컴퓨터가 이 둘을 비교할 때, "깨끗한 가지는 '아니오'라고 하는데, 저하된 가지는 일반적인 분위기에 기반해 '예'라고 추측하고 있다"는 것을 깨닫습니다. 그러면 YARD는 "서핑보드"라는 추측을 억제합니다. 이를 통해 모델이 실제 사실에 근착하도록 유지하며, "깨끗한" 가지는 증거를 가지고 있고 "저하된" 가지는 모델이 단순히 추측하고 있는 것들을 찾아내는 탐지기 역할을 하게 합니다.

4. 왜 "중간"이 중요한가

이 논문은 모델의 뇌가 단계별로 작동한다는 것을 발견했습니다.

  • 초기 레이어: 사진을 준비하는 단계입니다.
  • 중간 레이어: 텍text와 구체적인 시각적 세부 사항을 연결하기 시작하는 "스위트 스팟(최적의 지점)"입니다.
  • 후기 레이어: 모델이 이미 무엇을 말할지 결정한 상태입니다.

YARD는 경로를 바로 중간에서 나눕니다. 너무 일찍 나누면 모델이 아직 사진을 충분히 보지 못한 상태가 됩니다. 너무 늦게 나누면 모델이 이미 세부 사항을 "기억"해 버려서 저하된 버전에 속지 않을 것입니다. 중간 지점은 레지스터를 도입하여 모델이 실제로 사진을 보고 있는지 아니면 그냥 추측하고 있는지를 테스트하기에 완벽한 타이밍입니다.

5. 결과

이 Y자형 경로와 "레지스터" 기술을 사용함으로써:

  • 더 빠릅니다: 두 경로가 시작 부분을 공유하기 때문에, 모델이 이미지를 처음부터 두 번 처리할 필요가 없습니다.
  • 더 똑똑합니다: 상세한 뷰와 일반적인 뷰 사이의 "공정한 싸움"을 만들어냄으로써(단순히 상세한 뷰 대 맹목적인 추측이 아님), 이전 방식보다 환각을 더 잘 잡아냅니다.
  • 어디서나 작동합니다: 이 논문은 다양한 AI 모델에 YARD를 테스트했으며, 모델을 다시 학습시키지 않고도 일관되게 잘 작동함을 입증했습니다.

요약하자면, YARD는 AI의 뇌 속에 앉아 "정말로 그것이 보이는 건가요, 아니면 그냥 보통 일어나는 일에 기반해 추측하는 건가요?"라고 묻는 팩트 체크 기능과 같습니다. 이는 대화를 늦추지 않으면서도 효율적으로 이 일을 수행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →