Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models
이 논문은 멀티모달 거대 언어 모델이 거친 수준의 시각적 증거를 성공적으로 인코딩하지만, 언어적 사전 지식 대비 그 의존도를 안정적으로 제어하는 데 어려움을 겪는다는 점을 밝히며, 이러한 한계는 지도 미세 조정과 활성화 스티어링을 통해 완화될 수 있음을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거의 모든 책을 읽고 수백만 시간의 영화를 본, 아주 똑똑한 로봇과 대화하고 있다고 상상해 보세요. 이 로봇은 '멀티모달 거대 언语言 모델(MLLM)'입니다. 마치 자신의 학습 데이터인 '사전 지식'으로부터 세상의 모든 것을 알고 있는 천재 사서와 같습니다. 하지만 이 로봇에게는 눈도 있습니다. 로봇은 사진을 보고 자신이 아는 것과 결합할 수 있습니다. 과학자들이 던져온 큰 질문은 이것입니다. 만약 로봇이 자신이 아는 것과 모순되는 사진(예를 들어 다리가 다섯 개 달린 말의 사진)을 본다면, 로봇이 실패하는 이유가 추가된 다리를 '보지 못해서'일까요, 아니면 다리를 '보았지만' 무시하기로 결정했기 때문일까요? 이 논문은 이 미스터리를 파헤치며, 로봇의 뇌를 탐정 소설처럼 다루어 어디에서 문제가 발생하는지, 즉 '감각'(보는 것)의 문제인지 아니면 '의사결정'(본 것을 사용하는 것)의 문제인지를 밝혀냅니다.
리 쟈앙(Jiaang Li)과 동료들이 이끄는 연구진은 영리한 두 단계의 조사를 통해 이 퍼즐을 풀고자 했습니다. 첫째, 연구진은 로봇이 실제로 사진 속의 이상한 부분을 '보고' 있는지 알고 싶었습니다. 이를 테스트하기 위해, 그들은 단순히 로봇에게 질문을 던지는 대신, 로봇의 내부 뇌 신호로부터 사진을 재구성해 보았습니다. 그 결과, 로봇이 틀린 답을 냈을 때조차도, 이상한 사진(예: 다리가 다섯 개 달린 말)의 '설계도'는 로봇의 최종적인 생각 속에 여전히 명확하게 남아 있음을 발견했습니다. 그것은 마치 로봇의 눈은 완벽하게 작동하고 있지만, 뇌가 눈을 감기로 선택한 것과 같았습니다. 이는 로봇이 세부 사항을 보지 못해 눈이 먼 것이라는 가설을 배제했습니다.
다음으로, 팀은 로봇이 자신의 눈을 믿는 것과 자신의 기억을 믿는 것 사이를 얼마나 잘 전환할 수 있는지 테스트하기 위해 'WhatIfVis'라는 새로운 게임을 만들었습니다. 그들은 자연의 법칙을 깨뜨리는 사진(예: 빨간색 수박)을 로봇에게 보여주고, 두 가지 방식으로 답하도록 요청했습니다: "사진만 보고 답하라" 또는 "사진은 무시하고 아는 것을 사용하라." 연구 결과, 추가적인 훈련 없이는 로봇이 기복이 심하다는 것을 발견했습니다. 어떤 때는 사진을 무시하고 교과서적인 답(예: 수박이 빨갛더라도 초록색이라고 말함)을 내놓았습니다. 또 어떤 때는 사진에 너무 꽂힌 나머지, 사진을 무시하라는 지시를 따르지 못했습니다. 로봇이 고장 난 것이 아니라, 언제 보고 언제 생각할지를 결정하는 신뢰할 수 있는 '스위치'가 없었던 것입니다.
하지만 좋은 소식은 연구진이 그 스위치를 찾아냈다는 점입니다. 단 한 종류의 까다로운 사진만으로 '지도 미세 조정(Supervised Fine-Tuning)'이라는 약간의 연습을 시킴으로써, 연구진은 로봇에게 주의력을 조절하는 법을 가르쳤습니다. 훨씬 더 나아가, 그들은 로봇의 뇌 안에 있는 특정 '노브(knob, 조절 손잡이)'—즉, 하나의 수학적 방향—을 발견했습니다. 이 노브를 통해 구두 지시 없이도 로토의 집중력을 켜거나 끌 수 있었습니다. 이 노브를 돌렸을 때, 로봇은 사진을 보든 무시하든 규칙을 따르는 데 훨씬 더 능숙해졌습니다.
또한, 이 연구는 로봇이 사진과 문장을 어떻게 다르게 처리하는지 비교했습니다. 연구진은 로봇이 자연의 법칙을 깨는 문장을 따르는 것이 사진을 따르는 것보다 훨씬 쉽다는 것을 발견했습니다. 이는 로봇이 보는 것보다 듣는 것에 훨씬 더 능숙하다는 뜻입니다. 이 격차는 로봇이 더 똑똑해지고 커질수록 더 벌어졌는데, 이는 모델이 성장할수록 자신이 보는 것을 무시하려는 고집이 더 세질 수 있음을 시사합니다.
결론적으로, 이 논문은 우리가 공부하는 크고 명백한 것들(색상, 크기, 동물의 다리 개수 등)에 대해, 이 AI 모델들이 실패하는 이유는 볼 줄 몰라서가 아니라고 제안합니다. 그들은 자신의 눈을 믿을지 아니면 기억을 믿을지를 결정하는 일관된 방법을 배우지 못했기 때문에 실패하는 것입니다. 하지만 연구진이 이 행동을 제어할 수 있는 특정 '노브'를 찾아냈다는 것은, 미래에 우리가 이 디지털 뇌를 더 유연하고 신뢰할 수 있게 만들어, 세상이 교과서와 다르게 보일 때도 잘 대처하도록 가르칠 수 있음을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.