← 최신 논문
🤖 machine learning

Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models

본 논문은 보조 모델이나 추가 학습 없이 기존 방법들을 능가하는 멀티모달 대규모 언어 모델을 위한 플러그 앤 플레이 객체 할루시네이션 탐지기인 인스트럭션 렌즈 스코어 (InsLen) 를 소개하며, 이는 인스트럭션 토큰 임베딩을 활용합니다.

원저자: Runhe Lai, Xinhua Lu, Yanqi Wu, Jinlun Ye, Weijiang Yu, Ruixuan Wang

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Runhe Lai, Xinhua Lu, Yanqi Wu, Jinlun Ye, Weijiang Yu, Ruixuan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇 도우미 (멀티모달 대규모 언어 모델) 가 있다고 상상해 보세요. 이 로봇은 사진을 보고 상세하게 설명할 수 있습니다. 당신이 "무엇이 보이나요?"라고 묻자 로봇이 말하기 시작합니다. 하지만 때때로 이 로봇은 너무 상상력이 풍부해지기도 합니다. 예를 들어, 스키를 타는 사람들이 있는 눈 덮인 산의 사진을 보고 자신 있게 "스키어 위에 빨간색 가방이 보입니다"라고 말하는데, 사실 사진에는 가방이 하나도 없습니다. 이를 **객체 환각 (Object Hallucination)**이라고 합니다.

이 논문은 이러한 거짓말을 잡아내기 위한 새로운 도구인 **지시 렌즈 점수 (Instruction Lens Score, InsLen)**를 소개합니다. 간단한 비유를 들어 작동 원리를 설명해 보겠습니다.

문제: "노이즈가 있는 카메라" 대 "똑똑한 안내자"

로봇의 시각 시스템을 때로는 나쁜 조명이나 반사에 혼란을 겪는 카메라로 생각해보세요. 카메라는 가방처럼 보이는 그림자를 보고 로봇의 뇌에 "야, 가방이 있어!"라고 말할 수 있습니다.

보통 다른 방법들은 로봇의 답변을 확인하기 위해 카메라의 원시 데이터 (시각 임베딩) 를 살펴봅니다. 하지만 카메라가 혼란스러우면 이 확인 과정은 실패합니다.

저자들은 놀라운 사실을 발견했습니다. 로봇의 지시 (Instructions) (즉, "이 이미지를 설명해 주세요"와 같이 당신이 입력한 텍스트) 는 똑똑한 안내자처럼 작용한다는 것입니다. 카메라에 노이즈가 있더라도, 이 똑똑한 안내자는 노이즈를 걸러내는 방법이 있습니다. 로봇이 당신의 지시를 읽을 때, 암묵적으로 사진에 실제로 무엇이 있는지 "알고" 있으며, 혼란스러운 카메라에서 오는 가짜 "가방" 신호를 무시할 수 있습니다.

해결책: "지시 렌즈 (Instruction Lens)"

연구자들은 스마트 안내자의 생각에 초점을 맞춘 확대경 역할을 하는 InsLen이라는 탐지기를 개발했습니다. 카메라의 것이 아니라요.

이들은 이를 두 가지 주요 검사로 나누어 설명합니다.

1. "현실 확인 (Reality Check)" (보정된 로컬 점수)

  • 비유: 탐정 (카메라) 이 가방처럼 보이는 단서를 발견했다고 가정해 보세요. 하지만 현명한 판사 (지시) 는 같은 단서를 보며 "그건 가방이 아닌 것 같아. 그냥 그림자야"라고 말합니다.
  • 작동 원리: 이 방법은 로봇이 가방을 보는 것에 대해 가진 "신뢰도"를 취합니다. 카메라는 가방에 대해 흥분하지만, "똑똑한 안내자 (지시)"는 매우 회의적이며 이에 대한 확률을 매우 낮게 부여한다면, 시스템은 신뢰도를 **보정 (낮추는)**해야 한다는 것을 알게 됩니다. 이는 효과적으로 "카메라는 거짓말을 하고 있어. 안내자가 더 잘 알아"라고 말하는 것과 같습니다.

2. "맥락 확인 (Context Check)" (맥락 일관성 점수)

  • 비유: 군중 속에서 사람을 식별하려고 한다고 상상해 보세요.
    • 로컬 확인: 당신은 얼굴처럼 보이는 흐릿한 픽셀 덩어리를 봅니다.
    • 맥락 확인: 당신은 "똑똑한 안내자"에게 "이 사람이 전체 장면의 이야기와 어울리나요?"라고 묻습니다. 장면이 스키 슬로프라면, 안내자는 스키어와 눈이 있어야 하지만 하늘에 떠 있는 "가방"은 없어야 한다는 것을 압니다.
  • 작동 원리: 이 방법은 "똑똑한 안내자"가 전체 장면을 어떻게 이해하는지 살펴봅니다. 로봇이 본다고 주장하는 객체 (예: "가방") 가 안내자가 전달하는 전체 이야기와 부합하는지 확인합니다. 만약 안내자의 이야기가 가방의 존재를 지지하지 않는다면, 시스템은 이를 환각으로 표시합니다.

왜 이것이 더 나은가요?

대부분의 이전 방법들은 로봇을 고치기 위해 더 무거운 장비를 추가하거나 (예: 작업을 확인하기 위해 두 번째 초고가의 AI 에게 요청) 로봇이 완벽하도록 훈련시키는 방식 (이는 영원히 걸립니다) 을 사용했습니다.

InsLen 은 다음과 같은 이유로 다릅니다:

  • "플러그 앤 플레이 (Plug-and-Play)"입니다: 로봇을 다시 훈련시키거나 새로운 비싼 도구를 추가할 필요가 없습니다. 로봇이 자신의 작업을 확인하기 위해 로봇의 내부 "똑똑한 안내자" 생각만 사용하면 됩니다.
  • 빠릅니다: 로봇의 사고 과정에 거의 추가 시간이 들지 않습니다.
  • 정확합니다: 테스트에서 이 방법은 다른 어떤 방법보다 더 많은 거짓말을 잡아냈습니다. 심지어 로봇이 실제 객체와 가짜 객체가 매우 비슷하게 보이는 까다로운 사진 (예: 숟가락과 칼) 을 볼 때조차 그랬습니다.

요약

이 논문은 로봇의 **눈 (카메라)**뿐만 아니라 **지시 (똑똑한 안내자)**에 귀 기울임으로써 가짜 객체를 효과적으로 걸러낼 수 있다고 주장합니다. **지시 렌즈 점수 (Instruction Lens Score)**는 카메라의 신뢰도를 보정하는 "현실 확인"과 객체가 이야기와 부합하는지 확인하는 "맥락 확인"을 결합하여 AI 이미지 설명을 위한 매우 신뢰할 수 있는 거짓말 탐지기를 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →