← 최신 논문
🤖 AI

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

이 논문은 시각적 접지(visual grounding)가 이상적인 조대-세부(coarse-to-fine) 추론 과정에서 벗어날 때 타겟팅된 대조 정렬(contrastive alignment)을 트리거하기 위해 시각적 어텐션 엔트로피(Visual Attention Entropy)와 출력 이미지 상관관계(Output Image Correlation)를 모니터링함으로써 멀티모달 거대 언어 모델의 환각 현상을 완화하는 새로운 방법인 DICA를 제안한다.

원저자: Hao Yang, Jin Wang, Xuejie Zhang

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hao Yang, Jin Wang, Xuejie Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡하고 붐비는 사진 한 장을 통해 미스터리를 풀려고 노력하고 있다고 상상해 보세요. 인간 탐정은 사진 전체를 영원히 멍하니 응시하지 않습니다. 대신, 그들은 장면의 '분위기'를 파악하기 위해 넓게 스캔을 시작한 다음, 빨간 신발, 깨진 창문, 수상한 그림자와 같은 구체적인 단서로 시선을 집중시켜 답을 찾아냅니다. 이것이 우리 뇌가 자연스럽게 작동하는 방식입니다. 즉, 광범위한 개요에서부터 날카롭고 집중된 세부 사항으로 나아가는 여정입니다.

이제 이와 똑같은 일을 할 수 있도록 똑똑한 로봇을 가르친다고 상상해 보세요. 우리는 이미지를 보고 사진에 대해 질문에 답하는 것처럼 이미지에 대해 이야기할 수 있는 '멀티모럴 대규모 언어 모델(MLLM)'을 구축했습니다. 하지만 문제는, 때때로 이 로봇들이 약간 어지러움을 느낀다는 점입니다. 그들은 사진의 엉뚱한 부분을 쳐다보기 시작하거나, 이전에 들었던 정보에 기반해 추측하느라 사진을 보는 것 자체를 멈춰버릴 수도 있습니다. 이런 일이 발생하면 그들은 '환각(hallucination)'을 일으킵니다. 예를 들어, 개를 너무 좋아한다는 이유만으로 고양이 사진 속에 개가 있다고 주장하며 존재하지 않는 사실을 지어내는 식입니다. 과학자들은 이 로봇들이 공상을 떠도는 것을 막아 실세계에서 신뢰할 수 있는 조력자가 되도록 만드는 방법을 연구하고 있습니다.

이 논문은 이 AI 탐정들을 위한 '스팟 체크(spot-check)' 감독관 역할을 할 DICA(Dual-Indicator Guided Contrastive Alignment)라는 영리한 새로운 시스템을 소개합니다. 연구진은 이러한 모델들이 환각을 일으킬 때 보통 두 가지 특정한 실수를 저지른다는 점을 발견했습니다. 첫째, 주의력이 '표류(drift)'할 수 있습니다. 즉, 초점이 신경질적인 다람쥐처럼 이미지 곳곳으로 갑자기 흩어져 중요한 단서를 놓치는 것입니다. 둘째, 시각적 증거를 '과소 활용(underuse)'할 수 있습니다. 이는 모델이 사진을 보는 것을 멈추고 자신의 내부 기억이나 추측에 너무 많이 의존하게 되는 것을 의미합니다.

이러한 실수를 잡아내기 위해 DICA는 로봇이 생각하는 동안 그 뇌를 모니터링하는 두 가지 내부 '게이지(지표)'를 사용합니다. 첫 번째 게이지인 **시각적 주의 엔트로피(Visual Attention Entropy)**는 로봇의 초점이 얼마나 분산되어 있는지를 측정합니다. 만약 이 수치가 급증한다면, 그것은 로봇이 당황하여 사방을 두리번거리고 있다는 뜻입니다. 두 번째 게이지인 **출력-이미지 상관관계(Output-Image Correlation)**는 로봇의 답변이 실제 사진에 얼마나 의존하고 있는지, 아니면 단순히 자신의 텍스트 예측에 의존하고 있는지를 확인합니다. 만약 이 수치가 떨어진다면, 로봇이 사진을 무시하고 이야기를 지어내고 있다는 뜻입니다.

DICA는 이 게이지들이 레드 존(위험 구간)에 진입하는 것을 목격하면, 로봇이 계속해서 추측하도록 내버려 두지 않습니다. 대신 '교정 모드'를 작동시킵니다. 만약 로봇의 초점이 표류하고 있다면, DICA는 현재의 혼란스러운 생각들을 동일한 질문에 대한 '차분한' 버전과 비교하여 올바른 지점으로 다시 유도합니다. 만약 로ло봇이 사진을 무시하고 있다면, DICA는 로봇에게 이전에 찾았던 시각적 단서들을 다시 보라고 강제하며, "이봐, 사진에서 본 걸 기억해! 그걸 사용해!"라고 말하는 것과 같은 역할을 합니다.

저자들은 로봇이 이미지에 관한 질문에 답하거나 이미지를 묘사해야 하는 여러 표준 테스트에서 이 방법을 테스트했습니다. 그 결과, DICA가 모델이 더 많은 정답을 맞히고 더 적은 허위 주장을 하도록 일관되게 도왔다는 것을 발견했습니다. 예를 들어, POPE라는 테스트에서 이 방법은 모델의 정확도를 크게 향상시켜, 실제로 존재하는 물체는 올바르게 식별하고 존재하지 않는 물체는 무시하도록 도왔습니다. 로봇이 묘사 중에 얼마나 자주 물체를 발명하는지를 측정하는 CHAIR라는 또 다른 테스트에서도 DICA는 가짜 물체가 언급되는 횟수를 줄였습니다.

이 논문은 이 접근 방식이 단순히 일반적인 "추측하지 마"라는 규칙을 적용하는 것이 아니라, 왜 실패하는지에 대한 구체적인 진단을 내리기 때문에 특히 효과적이라고 제안합니다. 즉, 주의가 산만한 것인지, 아니면 증거를 무시하고 있는 것인지를 진단한 뒤 필요한 정확한 해결책을 적용하는 것입니다. 비록 이 방법이 사고 과정에 아주 약간의 추가 시간(단어당 약 0.04~0.08초)을 소요하지만, 연구진은 로봇이 자신 있게 거짓을 말하는 것을 방지하는 데 이 작은 비용은 충분히 가치가 있다고 주장합니다. 궁극적으로, 이 연구는 이 두 가지 간단한 지표를 관찰하고 필요할 때만 개입함으로써, 우리가 이 강력한 AI 도구들을 훨씬 더 신뢰할 수 있고 현실에 기반하도록 만들 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →