← 최신 논문
💻 computer science

SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification

SAVAA는 토큰 수준의 환각 위험을 추정하고 생성 과정에서 시각적 주의를 적응적으로 증폭하는 인자를 조정함으로써 고정된 증폭 전략의 한계를 극복하는 비학습 프레임워크로, 시각적 근거 엔트로피를 도입하여 대규모 시각-언어 모델의 환각을 완화합니다.

원저자: Jiacheng Zhang, Feng Liu, Chao Du, Tianyu Pang

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiacheng Zhang, Feng Liu, Chao Du, Tianyu Pang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑한 로봇 비서 (Large Vision-Language Model, 즉 LVLM) 가 사진을 보고 그 내용을 당신에게 설명한다고 가정해 봅시다. 때때로 이 로봇은 지나치게 자신감을 가지고 사실을 허구로 만들어 말하기 시작합니다. 예를 들어, 사진에 개가 없는데도 "사진에 개가 있습니다"라고 말할 수 있습니다. 이를 **환각 (hallucination)**이라고 부릅니다.

로봇이 이렇게 하는 이유는 실제 사진에서 그 순간 무엇을 보고 있는지에 비해, 세상이 보통 어떻게 들리는지에 대한 "기억" (언어 사전 확률, language priors) 에 지나치게 의존하기 때문입니다.

구식 방법: "일률적"인 볼륨 조절

최근 연구자들은 로봇의 시각적 주의를 높이는 "볼륨"을 조절함으로써 이 문제를 해결하려 했습니다. 로봇에게 "사진을 보는 것"에 대한 볼륨 조절 노브와 "자신의 생각에 귀 기울이는 것"에 대한 또 다른 노브가 있다고 상상해 보세요.

이전 방법들은 고정된 볼륨 조절 노브를 사용했습니다. 로봇이 작성하는 모든 단어에 대해 "사진을 본다"는 볼륨을 동일한 양만큼 높이기만 했습니다.

  • 문제점: 이는 같은 볼륨 설정으로 속삭임과 큰 소리를 모두 듣으려 하는 것과 같습니다.
    • 때로는 로봇이 거짓말을 멈추기 위해 사진을 더 집중해서 봐야 하지만, 고정된 볼륨은 너무 낮습니다 (과소 증폭).
    • 다른 때는 로봇이 이미 자세히 보고 있는데, 볼륨이 너무 높게 설정되어 너무 집중해서 보다가 존재하지 않는 것을 "보는" 경우가 발생합니다 (과대 증폭).

이 논문은 이를 **"이중 실패 패턴 (Dual Failure Pattern)"**이라고 부릅니다. 고정된 설정은 때로는 너무 약하고 때로는 너무 강하다는 것입니다.

새로운 해결책: SAVAA (지능형 적응형 파일럿)

저자들은 SAVAA(Step-wise Adaptive Visual Attention Amplification, 단계별 적응형 시각적 주의 증폭) 라는 새로운 방법을 제안합니다. 고정된 노브 대신 SAVAA 는 단어마다 실시간으로 조종을 조정하는 지능형 파일럿처럼 작동합니다.

다음은 단계별 작동 원리입니다.

1. "위험 레이더" (시각적 근거 엔트로피, Visual Grounding Entropy)

로봇이 다음 단어를 작성하기 전에, SAVAA 는 로봇이 거짓말을 하려는지 확인하기 위해 "위험 레이더"를 점검합니다. 여기에는 **시각적 근거 엔트로피 (VGE)**라는 특수 도구가 사용됩니다.

  • 작동 원리: 두 가지 질문을 던집니다.
    1. 로봇이 불확실한가? (높은 불확실성 = 위험).
    2. 로봇이 이 단어를 위해 사진을 보고 있는가? (로봇이 자신감은 있지만 사진이 그 단어를 지지하지 않는다면, 이는 큰 위험입니다).
  • 비유: 로봇이 해변을 묘사한다고 상상해 보세요. 만약 "모래"라고 말한다면 사진이 이를 지지하므로 위험은 낮습니다. 하지만 "눈"이라고 말한다면 (사진은 명확히 해변임), 로봇이 "눈"이라는 단어에 대해 매우 자신감을 느끼더라도 위험은 높습니다.

2. "동적 볼륨 조절 노브"

위험 레이더에 기반하여 SAVAA 는 다음 단어에 대한 "사진을 보는" 볼륨을 조정합니다.

  • 높은 위험: 로봇이 위험한 무언가를 말하려 한다면, SAVAA 는 시각적 주의를 극대화합니다. 로봇이 말하기 전에 사진을 집중해서 보도록 강제합니다.
  • 낮은 위험: 로봇이 안전하고 사진이 그 단어를 명확히 지지한다면, SAVAA 는 볼륨을 낮춥니다. 이는 로봇이 "너무 강렬해져" 새로운 세부 사항을 만들어내는 것을 방지합니다.

3. "과거 생각"을 위한 음소거 버튼

때로는 완벽한 시각적 집중을 하더라도 로봇이 여전히 내부의 "이야기하기" 습관에 지나치게 의존합니다. 이를 해결하기 위해 SAVAA 는 텍스트 주의 억제 (Text Attention Suppression) 기능을 추가합니다.

  • 비유: 로봇이 사진을 묘사하려 하지만, 배경에서 이야기가 재생되는 라디오에 계속 산만해지고 있다고 상상해 보세요. SAVAA 는 라디오 (텍스트 입력) 를 부드럽게 음소거하여 로봇이 사진에만 집중하도록 합니다. 이는 로봇이 사진에 있는 것이 아니라 이야기에서 "들리는 대로" 문장을 마무리하는 것을 막아줍니다.

왜 이것이 중요한가

이 논문은 로봇들이 이미지를 묘사해야 하는 다양한 테스트를 사용하여 세 가지 다른 똑똑한 로봇 (LLaVA, Qwen, InternVL) 에서 이를 테스트했습니다.

  • 결과: SAVAA 는 구식 "고정 볼륨" 방법에 비해 허구의 세부 사항 (환각) 을 크게 줄였습니다.
  • 효율성: 로봇을 다시 훈련시키거나 실행 속도를 늦출 필요 없이 모든 작업을 수행합니다. 로봇이 생각하는 동안 주의 조절 노브만 조정하면 됩니다.

요약

구식 방법은 직선 고속도로를 달리든 구불구불한 산길을 달리든 가스 페달을 50% 로 고정해 두는 운전자와 같습니다. 그들은 곡선을 위해 속도를 줄이지 않았거나 언덕을 위해 충분히 가속하지 않아서 사고 (환각) 를 낼 수 있습니다.

SAVAA는 도로, 속도, 조건을 끊임없이 확인하며 모든 커브마다 가스와 브레이크를 완벽하게 조정하는 운전자와 같습니다. 이는 로봇이 본 것을 정확히, 그 이상도 이하도 없이 묘사하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →