ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
이 논문은 시각적 앵커, 온라인 교정 메커니즘 및 선호도 튜닝을 통해 텍스트-이미지 교차 주의 역학을 정렬함으로써 멀티모달 거대 언어 모델의 환각 현상을 완화하는 어텐션 기반 프레임워크인 ADAPT를 소개하며, 이는 일반적인 능력을 보존하면서도 상당한 환각 감소를 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
멀티모달 거대 언어 모델(MLLM)을 사진 한 장을 건네받은 매우 똑똑하고 박학다식한 투어 가이드라고 상상해 보세요. 이 가이드의 임무는 사진을 정확하게 묘사하는 것입니다. 하지만 이 가이드에게는 나쁜 습관이 하나 있습니다. 설명을 하는 동안 점점 딴 데로 눈을 돌린다는 점입니다. 가이드는 실제 사진에 무엇이 있는지보다는, 자신의 일반적인 지식에 기반해 무엇이 들어있을 것이라고 '생각'하는 것에 더 의존하기 시작합니다. 이것을 **환각(Hallucination)**이라고 하며, 예를 들어 사진에는 파란색 자동차만 있는데도 "빨간색 자전거"라고 가짜 디테일을 만들어내는 것을 말합니다.
ADAPT 논문은 왜 이런 현상이 발생하는지 조사하고, 가이드가 사진에 계속 집중할 수 있도록 돕는 세 가지 단계의 해결책을 제시합니다.
문제점: "시선의 표류 (The Drifting Gaze)"
연구진은 모델의 "눈"(내부 교차 주의 집중, cross-attention)이 처음에는 강력하게 작동하지만, 설명이 길어질수록 지치고 혼란스러워진다는 사실을 발견했습니다.
- 초반에는: 모델은 정확히 올바른 지점(예: 사진 속 비행기)을 바라봅니다.
- 후반에는: 시선이 "흐릿해집니다." 모델은 사진의 엉뚱한 구석을 응시하거나, 아예 이미지를 보는 것을 멈추고 방금 자신이 내뱉은 단어들에 기반해 추측하기 시작합니다.
- 결과: 모델은 더 이상 시각적 근거를 확인하지 않기 때문에 무언가를 지어내기 시작합니다.
이것은 마치 시험을 치르는 학생과 같습니다. 처음에는 답을 쓰기 위해 교과서(이미지)를 쳐다봅니다. 하지만 중간쯤 가면 학생은 지쳐서 책을 보는 것을 멈추고, 수업 시간에 기억했던 내용(언어적 사전 지식)을 바탕으로 찍기 시작합니다. 바로 그때부터 틀린 답을 내놓게 됩니다.
해결책: ADAPT
저자들은 이 문제를 해결하기 위해 ADAPT(Attention Dynamics Alignment with Preference Tuning)라는 시스템을 구축했습니다. 그들은 모델의 "시선"을 일정하게 유지하기 위해 세 가지 창의적인 도구를 사용합니다.
1. "황금 닻" (시각적 강화 - Visual Enhance)
모델이 긴 설명을 시작하기 전에, 시스템은 사진을 빠르게 훑어보며 가장 중요하고 부정할 수 없는 사실들을 찾아냅니다.
- 비유: 투어 가이드가 말을 시작하기 전에 형광펜을 받는 상황을 상상해 보세요. 가이드는 사진을 빠르게 스캔하여 주요 피사체(예: "이것은 흰색 비행기이다")를 강조 표시합니다.
- 해결책: 이 강조된 영역은 "황금 닻(Golden Anchor)"이 됩니다. 이는 "무슨 일이 있어도 이것이 비행기라는 점을 기억하라"는 안정적인 참조점이 됩니다. 시스템은 모델이 내용과 상관없이 항상 이미지의 왼쪽만 보는 것과 같은 편향(bias)을 제거하기 위해 이 닻을 정제합니다.
2. "스포트라이트 감독관" (주의 집중 감독 추론 - Attention-Supervised Inference)
모델이 말을 하는 동안, 이 감독관은 실시간으로 모델의 "시선"을 감시합니다.
- 비유: 가이드 옆에 서 있는 엄격한 선생님을 상상해 보세요. 가이드의 눈이 "황금 닻"에서 벗어나거나 빈 공간을 응시할 때마다, 선생님은 가볍게 어깨를 톡톡 칩니다.
- 해결책: 모델의 주의 집중이 흐트러지거나 "초점이 맞지 않게" 되면, 시스템은 즉시 모델의 주의력을 이미지의 관련 부분으로 다시 유도합니다. 이는 모델에게 똑같은 단어를 말하라고 강요하는 것이 아니라, 말을 하기 전에 올바른 시각적 근거를 바라보도록 강제하는 것입니다.
3. "눈가리개 훈련" (시각적 주의 집중 가이드 DPO - Visual Attention Guidance DPO)
이것은 모델이 추측하기보다 사진을 보는 것을 선호하도록 배우는 훈련 단계입니다.
- 비유: 모델은 두 가지 시나리오로 훈련받습니다:
- 시나리오 A (올바른 방식): 모델은 "황금 닻"이 강조된 사진을 보고 올바른 답을 제시합니다.
- 시나리오 B (잘못된 방식): 모델은 빈 화면이나 노이즈가 섞인 화면(눈가리개)을 보고 답을 추측합니다.
- 해결책: 시스템은 모델에게 다음과 같이 가르칩니다: "빈 화면을 보고 있다면 자신감을 가져서는 안 된다. 실제 사진을 보고 있다면 자신감을 가져야 한다." 이를 통해 모델이 단순히 무언가를 지어내는 대신 시각적 근거에 의존하도록 훈련합니다.
결과
연구진이 이 시스템을 다양한 AI 모델에 테스트했을 때 다음과 같은 결과가 나타났습니다:
- 환각 감소: 모델이 가짜 디테일을 만들어내는 경우가 40~60% 줄어들었습니다.
- 지능 유지: 모델은 일반적인 대화 능력이나 이해력을 잃지 않았으며, 단지 이미지의 사실에 더 잘 밀착하게 되었습니다.
- 효율성: 이 시스템은 매우 빠르게 작동하며, 과정에 추가되는 시간이 거의 없습니다.
요약
요약하자면, ADAPT는 AI 모델이 말을 하면서 "주의력이 분산"되고 추측을 시작한다는 점을 깨달았습니다. 이를 해결하기 위해, 시스템은 모델에게 안정적인 참조점(닻)을 주고, 방황하는 시선을 잡아줄 실시간 감독관을 배치하며, 상상보다 눈에 보이는 것을 더 가치 있게 여기도록 하는 특별한 훈련을 제공합니다. 그 결과, 보고 있는 사진에 대해 진실만을 말하는 AI가 탄생했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.