← 최신 논문
💻 computer science

Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

본 논문은 비전-언어 모델에서 시각적 근거와 환각 경로를 식별하고 특징화하기 위한 이중 경로 회로 분석을 제시하며, 환각 경로를 표적 억제함으로써 정확도를 유지하면서 객체 환각을 최대 76%까지 감소시킬 수 있음을 입증합니다.

원저자: Jiaxin Liu, Ding Zhong, Yue Wang, Zhidong Yang, Zhaolu Kang, Guangyuan Dong, Qishi Zhan, Pengcheng Fang, Aofan Liu

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiaxin Liu, Ding Zhong, Yue Wang, Zhidong Yang, Zhaolu Kang, Guangyuan Dong, Qishi Zhan, Pengcheng Fang, Aofan Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 아주 똑똑한 로봇 비서가 사진을 보고 자신이 본 것을 설명한다고 가정해 봅시다. 때로는 이 로봇이 매우 훌륭하게 작동합니다. 하지만 다른 때는 지나치게 자신감을 가지고 실제로 존재하지 않는 것들을 묘사하기 시작합니다. 예를 들어, 사진이 조용한 교외의 거리일 뿐인데 "집 위로 황금 독수리가 날아다니는 것이 보입니다"라고 말하는 식입니다. 이를 **환각 (hallucination)**이라고 부릅니다.

오랫동안 과학자들은 이러한 로봇들을 "블랙박스"처럼 취급했습니다. 로봇이 실수를 하는 것은 볼 수 있었지만, 로봇의 두뇌 내부에서 그 실수가 , 어떻게 발생했는지는 알 수 없었습니다. 그들은 로봇의 훈련 방법이나 말하는 방식을 변경하여 이를 해결하려 했지만, 이러한 해결책들은 종종 우연에 의존하거나 다양한 유형의 로봇에는 잘 작동하지 않았습니다.

이 논문인 **"객체 환각의 이중 경로 회로 (Dual-Pathway Circuits of Object Hallucination)"**는 로봇을 분해하여 실제 배선을 살펴보는 것과 같습니다. 연구자들은 로봇이 자신이 보는 것에 대해 거짓말을 하게 만드는 특정 전기 회로를 찾아내고자 했습니다.

다음은 그들이 발견한 내용을 쉽게 설명한 이야기입니다:

1. 두 개의 트랙 시스템 (이중 경로)

연구자들은 이러한 시맨틱 - 언어 모델 내부에 무작위적인 배선만 있는 것이 아니라, 정보가 이동하는 두 가지 뚜렷한 "고속도로" 또는 경로가 있음을 발견했습니다.

  • 진실 고속도로 (시각적 근거 경로): 이 신경군들은 사진을 보고 "이봐, 여기 독수리는 없어. 그냥 집일 뿐이야"라고 말합니다. 이 경로는 로봇이 진실을 말하도록 돕습니다.
  • 거짓말 고속도로 (환각 경로): 이 다른 신경군들은 흥분하여 실제로 존재하지 않는데도 "독수리야! 내가 독수리를 봤어!"라고 말합니다. 이 경로는 오류를 유발합니다.

재미있는 점은 이 동일한 두 트랙 시스템을 완전히 다른 다섯 가지 유형의 로봇 두뇌 (다른 아키텍처) 에서 발견했다는 것입니다. 포드든 페라리든 모든 자동차가 부품이 약간 다르게 보일지라도 엔진과 변속기를 가지고 있는 것과 같습니다. 이는 이러한 로봇들이 환각을 학습하는 방식이 특정 설계의 단순한 특징이 아니라, 훈련의 근본적인 부분임을 시사합니다.

2. "극성 반전" (고정된 스위치)

연구자들은 **활성화 패칭 (Activation Patching)**이라는 기법을 사용하여 교묘한 작업을 수행했습니다. 로봇이 올바르게 작동하는 비디오를 가지고 있다고 상상해 보세요. 그런 다음 실수를 하는 비디오를 가져옵니다. 그 후 오류를 수정할 수 있는지 확인하기 위해 "올바른" 비디오의 특정 배선을 "실수" 비디오로 교체합니다.

그들은 진실 고속도로에서 이상한 행동을 발견했습니다.

  • 로봇이 정확할 때, 진실 고속도로의 배선은 활성화되어 "아니, 독수리가 없어!"라고 말합니다 (양성 신호).
  • 로봇이 환각을 일으킬 때, 그 동일한 배선들이 부호를 반전시킵니다! 그들은 "그래, 독수리가 있어!"라고 말하기 시작합니다 (음성 신호).

이는 안전을 위해 보통 "정지 (Red)"라고 말하는 신호등과 같습니다. 하지만 로봇이 환각을 일으킬 때, 그 동일한 신호등이 "진행 (Green)"으로 바뀌어 로봇이 벽으로 운전하도록 지시합니다. 연구자들은 로봇이 단순히 시각적 증거를 "놓치고" 있는 것이 아니라, 진실을 찾기 위해 고안된 회로를 오히려 자신의 거짓말을 지지하는 데 실제로 오용하고 있음을 깨달았습니다.

3. "중복 백업" 문제

그들은 또한 진실 고속도로가 중복적임을 발견했습니다. 이는 같은 일을 수행하는 여러 개의 백업 배선이 있다는 것을 의미합니다. 하나의 배선을 잘라내도 다른 배선들이 그 역할을 대신합니다. 이는 안정성에는 좋지만, 단순히 한 부분을 조정하여 로봇을 고치기 어렵게 만듭니다.

그러나 거짓말 고속도로는 다릅니다. 이는 특정하고 집중된 배선 그룹과 같아서, 이들이 활성화되면 로봇을 잘못된 답변으로 밀어붙입니다.

4. 해결책: "거짓말 팀"의 볼륨 줄이기

문제를 이해했음을 증명하기 위해 연구자들은 "외과적"인 해결책을 시도했습니다. 로봇 전체를 재훈련하는 대신, 거짓말 고속도로의 특정 배선들의 볼륨을 줄이는 (출력을 축소하는) 것만으로도 충분했습니다.

  • 결과: 그들은 로봇의 환각을 최대 **76%**까지 줄였습니다 (거의 거짓말을 근절). 이는 진실성을 말하는 능력에 거의 영향을 주지 않았습니다.
  • 주의점: 그들은 로봇을 단일 "방향" (예: 일반적인 "거짓말 하지 마" 명령) 으로 밀어붙여 해결하려 했지만, 그렇게 잘 작동하지 않았습니다. 이는 "거짓말 고속도로"가 단일한 간단한 스위치가 아니라, 서로 다른 방식으로 작동하는 복잡한 배선 그룹임을 증명했습니다. 단순히 일반적인 버튼을 누르는 것이 아니라, 특정 그룹의 볼륨을 줄여야 합니다.

5. 이 해결책은 어디에서나 작동할까요?

연구자들은 이 "거짓말 고속도로"가 모든 종류의 거짓말에 대해 동일한지 테스트했습니다.

  • 객체 존재: "독수리가 있나요?" (예/아니오). 해결책이 매우 잘 작동했습니다.
  • 관계: "독수리가 집 위에 있나요?" 이 부분에서도 해결책이 잘 작동했습니다.
  • 속성: "독수리가 황금색인가요?" 해결책은 작동하지 않았습니다.

이는 로봇이 존재하지 않는 것들이 존재한다고 말하는 데는 특정 "환각 회로"가 있지만, 세부 사항(예: 색상) 을 설명하는 것은 완전히 다른 종류의 문제일 수 있음을 보여줍니다.

요약

간단히 말해, 이 논문은 자동차 엔진에 오작동을 일으키는 특정 "떨림" 회로가 있다는 것을 발견한 정비사와 같습니다. 그들은 다음을 발견했습니다.

  1. 모든 이러한 똑똑한 로봇 두뇌에는 동일한 "진실"과 "거짓말" 회로가 있습니다.
  2. "진실" 회로가 때로는 "거짓말"을 지지하기 위해 납치됩니다.
  3. 단순히 "거짓말" 회로의 볼륨을 줄임으로써, 로봇이 자신이 보지 않는 것을 만들어내지 않도록 할 수 있으며, 전체 엔진을 다시 구축할 필요는 없습니다.

이것은 이러한 모델들이 어떻게 실패하는지에 대한 명확한 지도를 제공하며, 이는 진정한 신뢰할 수 있는 로봇을 구축하기 위한 첫걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →