Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time
본 논문은 계층별 관련성 전파를 활용하여 키-값 표현을 동적으로 조정하고 텍스트 사전 지식보다 지각 입력에 대한 의존도를 높임으로써 멀티모달 대규모 언어 모델의 환각 현상을 완화하는 학습 없이 추론 시에 작동하는 프레임워크인 LIME 을 제안합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하고 다재다능한 로봇 비서가 있다고 가정해 봅시다. 이 로봇은 사진도 보고, 소리도 듣고, 텍스트도 동시에 읽을 수 있습니다. 이 로봇은 사진이나 녹음 파일을 보고 정확히 무슨 일이 일어나고 있는지 알려주는 탐정 역할을 하도록 설계되었습니다.
하지만 이 로봇은 나쁜 버릇이 하나 있습니다: 스스로에게 거짓말을 합니다.
가끔은 빈 공원의 사진을 보여 주면, 이 로봇은 자신 있게 "개가 공을 주고받는 모습이 보입니다!"라고 말합니다. 또는 침묵을 녹음한 파일을 재생하면, "고양이가 야옹거리는 소리가 들립니다!"라고 강하게 주장합니다. 이를 **환각 (hallucination)**이라고 합니다. 이 로봇은 이야기를 읽고 사물에 대해 말하는 데 너무 익숙해져서, 실제로 존재하는 것을 보는 대신 보통 어떤 일이 일어나는지에 기반하여 추측하기 시작하는 것입니다.
문제: 로봇이 "텍스트에 치중"되어 있음
이 논문의 저자들은 로봇이 왜 이런 행동을 하는지 발견했습니다. 로봇이 결정을 내릴 때, '텍스트 뇌'(단어와 이야기에 대한 지식) 에는 지나치게 귀를 기울이는 반면, '눈'이나 '귀'(실제 이미지나 소리) 에는 거의 귀를 기울이지 않는다는 사실을 발견한 것입니다.
시험을 치르는 학생을 생각해 보세요. 이 학생은 열심히 공부하여 교과서를 통째로 외웠습니다. 하지만 선생님이 사진을 보여주며 "이 사진에 무엇이 있습니까?"라고 물으면, 학생은 사진을 무시하고 교과서에서 떠오르는 첫 번째 것을 적어냅니다. 학생은 증거를 보지 않기 때문에 '환각'을 경험하는 것입니다.
해결책: LIME (학습 추론 시 모달리티 향상)
연구자들은 LIME이라는 해결책을 개발했습니다. 흥미로운 점은 로봇을 다시 가르치거나 뇌 (코드) 를 변경할 필요가 없었다는 것입니다. 대신 로봇이 질문에 답하는 순간에 '부드러운 밀기 (nudge)'를 가해 주었습니다.
다음은 LIME 이 작동하는 방식을 설명하는 간단한 비유입니다:
"스포트라이트" 비유
로봇이 손전등을 들고 어두운 방에 있다고 상상해 보세요.
- LIME 없이: 로봇은 주로 책 더미 (텍스트) 에 손전등을 비춥니다. 방에 있는 실제 사물 (이미지 또는 소리) 은 무시합니다. 그리고 책에 기반하여 방 안에 무엇이 있는지 추측합니다.
- LIME 으로: 연구자들은 로봇이 어디를 보고 있는지 감지하는 스마트 센서를 설치했습니다. 로봇이 이미지를 무시하기 시작하면 LIME 은 손전등 빛을 부드럽게 다시 이미지 쪽으로 밀어 넣습니다. 이는 로봇이 "잠깐, 말하기 전에 이미지를 다시 보자"라고 말하게 만듭니다.
기술적인 작동 방식 (간소화):
로봇은 한 단어씩 답합니다. 다음 단어를 선택하려 할 때마다 LIME 이 개입하여 다음과 같이 묻습니다:
- "이 단어를 결정하는 데 이미지가 얼마나 도움이 되었나요?"
- "텍스트가 얼마나 도움이 되었나요?"
이미지가 충분히 도움이 되지 않았다면, LIME 은 로봇의 내부 기억 (특히 뇌의 '키 (Key)'와 '값 (Value)' 부분) 에 미세하고 일시적인 조정을 가해 이미지의 비중을 더 높입니다. 이는 순식간에 이루어지며, 다음 단어를 위해 다시 초기화됩니다. 마치 코치가 선수가 스윙하기 직전에 "공을 봐!"라고 속삭이는 것과 같습니다.
시도했을 때 어떤 일이 일어났나요?
연구자들은 다양한 작업에서 이를 테스트했습니다:
- 시각: 로봇에게 사진을 보여 주며 "스포츠 공이 있습니까?" 또는 "이 이미지를 설명해 주세요"라고 물었습니다.
- 오디오: 소리를 재생하며 "고양이 소리가 들립니까?"라고 물었습니다.
결과:
- 거짓말 감소: 로봇은 존재하지 않는 사물을 만들어 내는 것을 멈췄습니다. 공이 없다면 "예"라고 추측하는 대신 "아니오"라고 말했습니다.
- 집중력 향상: 로봇이 무언가에 대해 이야기할 때, 실제로 이미지의 올바른 부분이나 소리의 올바른 순간을 보고 있었습니다.
- 재학습 불필요: 로봇을 몇 달 동안 다시 가르칠 필요가 없었습니다. 그들은 로봇이 답하는 동안의 사고 방식을 변경했을 뿐입니다.
트레이드오프
한 가지 단점이 있습니다. LIME 은 로봇이 말하는 모든 단어마다 이 추가적인 '스포트라이트 조정'을 위해 잠시 멈추고 작업을 수행해야 하므로, 답변을 얻는 데 조금 더 시간이 걸립니다. 마치 매우 똑똑한 비서가 문장마다 작업을 두 번 확인하기 때문에 약간 느려진 것과 같습니다. 하지만 속도보다 정확성이 더 중요한 상황에서는 이는 엄청난 승리입니다.
요약
이 논문은 AI 모델이 종종 거짓말을 하는 이유는 그들이 실제로 보고 듣는 것보다 단어에 대한 기억에 지나치게 의존하기 때문임을 보여줍니다. 새로운 방법인 LIME은 AI 가 말하기 직전에 증거 (이미지 또는 소리) 에 주의를 기울이도록 강요하는 실시간 코치처럼 작용하여, AI 를 처음부터 다시 학습시킬 필요 없이 훨씬 더 정직하고 정확한 답변을 이끌어냅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.