← 최신 논문
🤖 machine learning

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

본 논문은 비전-언어 모델을 해석하기 위해 트랜스코더를 활용한 기능 중심 프레임워크를 제시하며, 이 접근법이 희소 오토인코더보다 더 안정적인 시각적 그라운딩을 제공하고 기계적 그래프 분석을 통해 환각을 예측할 수 있음을 입증합니다.

원저자: Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

비전-언어 모델 (VLM) 을 매우 재능 있지만 다소 신비로운 번역가로 상상해 보세요. 이 번역가는 그림을 보고 그 그림에 대한 이야기를 씁니다. 우리는 그것이 잘 작동한다는 것은 알지만, 어떤 이미지 부분을 바탕으로 어떤 단어를 선택하는지 그 결정 과정은 잘 모릅니다. 마치 마술사가 모자에서 토끼를 꺼내는 것을 보는 것과 같습니다. 우리는 결과를 보지만, 모자 안의 트릭은 블랙박스입니다.

이 논문은 그 모자를 열고 트릭을 설명하려 합니다. 여기서는 간단한 비유를 사용하여 그들이 무엇을 했는지 요약해 보겠습니다.

1. 문제: "정지된 사진" 대 "영화"

이러한 모델을 이해하기 위한 이전 방법들은 번역가의 뇌를 한 순간에 찍은 정지된 사진과 같았습니다. 그들은 "희소 자동 인코더 (Sparse Autoencoders, SAEs)"라는 도구를 사용하여 특정 계층에서 모델이 무엇을 "생각"하고 있는지 살펴보았습니다.

저자들은 번역가가 가만히 앉아 있는 것이 아니라 끊임없이 작업을 수행하고 있기 때문에 이는 결함이 있다고 주장합니다. 시각적 입력을 받아 적극적으로 텍스트로 변환하는 과정입니다. 정지된 사진은 그 행동을 놓칩니다.

해결책: 그들은 **트랜스코더 (Transcoder)**라는 새로운 도구를 사용했습니다.

  • 비유: SAE 가 차고에 주차된 자동차의 사진이라면, 트랜스코더는 엔진이 작동하는 영상이었습니다. 그것은 자동차의 부품만 보는 것이 아니라, 엔진이 어떻게 연료를 변화시켜 운동으로 바꾸는지 지켜봅니다. 즉, 데이터가 어떻게 보이는지 (상태) 가 아니라 수행 중인 작업 (기능) 에 초점을 맞춥니다.

2. 실험: "시각적 그라운딩 (Visual Grounding)" 찾기

연구자들은 이 새로운 "엔진 영상" 도구가 모델이 이미지와 특정 단어를 어떻게 연결하는지 더 잘 설명할 수 있는지 확인하고 싶었습니다.

  • 테스트: 그들은 모델에게 이미지를 설명하도록 요청했습니다. 그런 다음, 그들의 도구를 사용하여 특정 단어 (예: "개") 에 대해 이미지의 어떤 부분이 가장 중요한지 추측했습니다.
  • "Ablation" (지우기 테스트): 그들의 추측이 맞는지 확인하기 위해, 그들은 디지털 지우개로 중요하다고 생각한 이미지의 특정 부분을 제거 (ablated) 했습니다.
    • 결과: 트랜스코더가 식별한 부분을 지우자, 모델은 매우 혼란스러워졌고 "개"라는 단어를 올바르게 쓰지 못했습니다. 반면, 이전 SAE 방법이 식별한 부분을 지우자 모델은 거의 알아차리지 못했습니다.
    • 비유: 케이크가 초콜릿 맛이 나게 만드는 재료가 무엇인지 추측하는 것과 같습니다. 트랜스코더가 지목한 재료를 제거하면 케이크는 더 이상 초콜릿 맛이 나지 않습니다. 반면, 이전 방법이 지목한 재료를 제거하면 케이크는 여전히 맛이 좋습니다. 트랜스코더는 진짜 초콜릿을 찾아낸 것입니다.

3. "거짓 그라운딩" 확인

트랜스코더가 단순히 무작위로 추측하거나 혼란을 겪지 않도록 하기 위해, 그들은 "거짓 시각적 그라운딩 (False Visual Grounding)"이라는 트릭 테스트를 실행했습니다.

  • 설정: 그들은 모델에게 수학 문제 ("20 + 30 은 무엇인가?") 나 일반 상식 질문 ("프랑스의 수도는 무엇인가?") 을 물었지만, 무작위로 고양이 사진을 보여주었습니다. 정답은 고양이와 전혀 관련이 없습니다.
  • 결과: 트랜스코더는 고양이 사진을 올바르게 무시했습니다. 그것은 고양이를 정답과 연결하려 하지 않았습니다. 반면, 이전 방법들은 때때로 존재하지 않는 연결을 강제로 만들려고 했습니다.
  • 교훈: 트랜스코더는 사진이 단순히 산만하게 만드는 요소일 뿐 정답과 관련이 없다는 것을 알아낼 만큼 똑똑합니다.

4. "환각 (Hallucination)" 탐정

마지막으로 연구자들은 모델이 "환각"을 일으킬 때, 즉 이미지에 없는 사실을 확신 있게 만들어낼 때를 살펴보았습니다.

  • 수사: 그들은 모델의 내부 사고 과정을 지도나 회로 기판처럼 취급했습니다. 그들은 이미지에서 최종 단어까지 정보가 이동한 경로를 추적했습니다.
  • 발견: 그들은 모델이 진실을 말할 때 "지도"는 한 가지 모양을 하고, 거짓말 (환각) 을 할 때는 다른 모양을 한다는 것을 발견했습니다.
    • 차이점: 환각은 더 짧고, 더 붐비며, 더 집중된 경로를 통해 이동하는 것처럼 보였습니다. 마치 진정은 많은 랜드마크를 확인하는 긴 경치를 따라가는 길인 반면, 거짓말은 주변 환경을 무시하고 터널을 통과하는 지름길인 것과 같습니다.
  • 예측: 그들은 이러한 지도의 모양만 보는 간단한 "거짓말 탐지기 (로지스틱 분류기)"를 만들었습니다. 텍스트를 읽거나 이미지를 보지 않고도, 이 탐지기는 모델이 환각을 일으켰는지 약 68% 의 정확도로 추측할 수 있었습니다 (이는 무작위 추측보다 훨씬 더 나은 수치입니다).

요약

간단히 말해, 이 논문은 다음과 같이 말합니다:

  1. 스냅샷을 보지 말고 영화를 보십시오. 모델이 기억에 무엇을 담고 있는지 보는 것보다, "트랜스코더"를 사용하여 모델이 정보를 어떻게 처리하는지 보는 것이 더 좋습니다.
  2. 올바른 연결을 찾습니다. 이 방법은 실제로 쓰이는 단어에 대해 이미지의 어떤 부분이 중요한지를 정확하게 식별합니다.
  3. 거짓말은 다른 모양을 가집니다. 출력물을 읽지 않더라도 모델이 내부적으로 답변을 계산한 "배선"의 모양만 봐도 모델이 거짓말을 하고 있는지 알 수 있습니다.

저자들은 이 "기능 중심" 접근 방식이 이러한 AI 모델이 실제로 어떻게 작동하는지에 대해 더 명확하고 신뢰할 수 있는 지도를 제공한다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →