MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads
본 논문은 시너지 헤드(synergy heads)에서의 정보 분포 드리프트(information distribution drifts)를 분석하고 출력값을 사실적 근거로 유도하기 위해 동적 보정(dynamic calibration)을 적용함으로써 멀티모달 거대 언어 모델(Multimodal Large Language Models)의 환각 현상을 식별하고 완화하는 새로운 프레임워크인 HEAL을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
멀티모달 거대 언어 모델은 동시에 보고 말할 수 있도록 설계된 강력한 새로운 클래스의 인공지능입니다. 텍스트나 이미지를 개별적으로 처리하는 기존 시스템과 달리, 이 모델들은 사진을 보고 그것을 묘사하거나, 질문에 답하거나, 보이는 것을 바탕으로 이야기를 들려줄 수 있습니다. 이 모델들은 이미지로부터 오는 시각적 데이터와 방대한 양의 텍스트로부터 학습된 언어적 패턴이라는 두 가지 뚜렷한 정보의 흐름을 하나로 엮음으로써 작동합니다. 의료 영상이나 자율 주행과 같이 중대한 분야에서 이 시스템들이 진정으로 유용해지려면 신뢰할 수 있어야 합니다. 그러나 이들은 종로히 '환각(hallucination)'이라고 알려진 문제로 인해 빈번하게 어려움을 겪습니다. 이는 모델이 자신만만하고 그럴듯한 답변을 생성하지만, 시각적 세계에 대해서는 사실과 다르게 말하는 경우를 의미하며, 예를 들어 고양이 사진을 보고 개가 들어있다고 주장하거나, 이미지에 존재하지 않는 세부 사항을 지어내는 것과 같습니다.
오랫동안 연구자들은 이러한 오류가 모델이 실제 사진에는 충분히 주의를 기울이지 않고, 자신의 내부적인 언어 지식에 너무 많은 주의를 기울이기 때문에 발생한다고 믿었습니다. 지배적인 생각은 모델이 답변을 작성함에 따라 이미지로부터 멀어져, 단어만을 바탕으로 기대되는 바에 지나치게 의존하게 된다는 것이었습니다. 이를 해결하기 위해 이전의 시도들은 모델이 이미지에 더 강하게 집중하도록 강제하거나 전체 시스템을 처음부터 다시 학습시키는 데 집중했습니다. 이러한 방법들은 모델을 하나의 '블랙박스'로 취급하여, 왜 오류가 발생하는지에 대한 내부 메커니즘을 이해하지 못한 채 외부에서 모델의 행동을 조정했습니다.
심천 선전 고급기술대학교(Shenzhen University of Advanced Technology)의 연구팀은 이제 이러한 모델의 엔진 내부를 들여다보고 다른 설명을 제시했습니다. 그들은 환각이 단순히 이미지에 대한 주의력이 부족해서 발생하는 것도, 모델이 이미지를 완전히 무시해서 발생하는 것도 아니라고 제안합니다. 대신, 그들은 오류가 모델의 처리 네트워크 내 특정 부분에서 시각 정보와 언어 정보 사이의 내부 균형이 불안정해질 때 발생한다는 것을 발견했습니다. 연구진은 'HEAL(Head-lEvel information disentAnglement and caLibration, 헤드 수준의 정보 분리 및 교정)'이라고 불리는 방법을 개발하여, 실시간으로 이러한 불균형을 식별하고 수정합니다.
그들의 발견의 핵심은 모델이 정보를 처리하는 방식에 있습니다. 이러한 거대 모델 내부에는 '어텐션 헤드(attention heads)'라고 불리는 많은 작은 처리 단위들이 있습니다. 이 헤드들을 문장을 이해하기 위해 함께 협력하는 전문가 팀이라고 생각해 보십시오. 어떤 전문가들은 순수하게 단어에 집중하고, 어떤 이들은 순수하게 이미지에 집중하며, 세 번째 그룹은 이 두 가지를 결합하는 데 집중합니다. 연구진은 이 두 흐름을 결로하는 역할을 하는 그룹, 즉 그들이 '시너지 헤드(synergy heads)'라고 부르는 곳에서 문제가 시작된다는 것을 발견했습니다. 모델이 정상적으로 작동할 때, 이 시너지 헤드들은 시각 정보와 언어 정보가 안정적인 균형을 유지하도록 조절합니다. 그러나 모델이 환각을 일으키기 시작하면 이 균형이 무너집니다. 이 결합 헤드 내부의 정보 분포가 건강한 평형 상태에서 벗어나면서, 모델이 시각적 근거를 놓치게 만드는 것입니다.
결정적으로, 연구진은 환각이 단순히 이미지를 보는 전문가가 너무 적거나 이미지 전문가가 너무 약해서 발생하는 것이라는 아이디어를 배제했습니다. 그들의 분석에 따르면, 모델이 진실을 말하든 거짓을 말하든 시각에 집중하는 헤드의 수는 일정하게 유지됩니다. 문제는 시각적 주의력의 부족이 아니라, 결합 전문가들이 정보의 혼합을 처리하는 방식에서의 이탈입니다. 모델이 올바른 묘사를 생성할 때, 시너지 헤드는 시각적 입력과 언어적 입력을 일정한 비율로 유지합니다. 반면 환각을 일으킬 때는 그 비율이 치우치게 되는데, 이미지가 여전히 존재함에도 불구하고 언어 패턴에 너무 치우쳐 시각적 연결이 약화되는 경우가 많습니다.
이를 해결하기 위해 연구팀은 실시간 조절기 역할을 하는 동적 교정 전략을 만들었습니다. 모델을 재학습시키거나 구조를 변경하는 대신, HEAL은 생성 과정 중에 개입합니다. 이 시스템은 시너지 헤드를 통해 흐르는 정보를 모니터링하고 균형이 무너지기 시작하는 시점을 감지합니다. 드리프트(drift)가 감지되면, 시스템은 교정 계수를 주입하여 시각 정보와 언어 정보가 올바른 평형 상태로 부드럽게 돌아가도록 유도합니다. 이 과정은 연속적이고 적응적입니다. 모델이 언어를 무시하거나 이미지에 과도하게 집중하도록 강요하는 것이 아니라, 시각적 증거가 언어적 맥락에 대해 적절하게 가중치를 갖는 상태로 내부 표현을 다시 조종하는 것입니다.
연구진은 LLaVA와 Qwen의 버전들을 포함한 여러 최첨단 모델들을 대상으로 이 접근 방식을 테스트했습니다. 결과는 다양한 시스템과 작업 전반에 걸쳐 일관되게 나타났습니다. 이 동적 교정을 적용함으로써, 모델들은 유창하고 창의적으로 말하는 능력을 유지하면서도 환각 현상을 현저히 줄였습니다. 모델이 사진에 없는 물체를 얼마나 자주 지어내는지 측정하는 테스트에서, 이 새로운 방법은 단순히 시각적 주의력을 높이려 했던 이전 기술들보다 더 효과적으로 오류를 줄였습니다. 이 연구는 이러한 시스템의 신뢰성을 확보하는 열쇠가 단순히 이미지를 더 열심히 보게 만드는 것이 아니라, 시각과 언어의 내부 결합이 안정적으로 유지되도록 보장하는 데 있음을 시사합니다.
이 연구는 인공지능이 세상을 이해하는 방식에 대한 새로운 관점을 제공합니다. 이는 신뢰성이 단순히 충분한 데이터나 강력한 하드웨어를 갖추는 문제가 아니라, 서로 다른 유형의 정보 사이의 섬세한 내부 균형을 유지하는 문제임을 보여줍니다. 이 균형이 깨지는 구체적인 지점을 식별하고 이를 복구하는 간단한 방법을 제공함으로써, 연구진은 더욱 신뢰할 수 있는 멀티모달 시스템을 향한 길을 열었습니다. 이 방법은 가볍고 모델을 재학습시키는 데 필요한 막대한 계산 자원을 요구하지 않으므로, 보고 말하는 AI의 정확도를 개선하는 데 있어 실용적인 도구가 됩니다. 이번 연구 결과는 미래의 AI 신뢰성 향상이 더 크고 복잡한 모델을 밑바닥부터 구축하는 것이 아니라, 이러한 내부 관계를 미세하게 조정하는 데서 올 수 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.