← 최신 논문
🤖 AI

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

이 논문은 멀티모달 거대언어모델(LLM)의 "이미지를 통한 사고(thinking-with-images)" 패러다임이 총체적인 정확도 향상에도 불구하고, 정책 미교정(policy miscalibration)으로 인해 시각적 도구 사용이 답변을 인과적으로 개선하는 데 실패함으로써 종종 효과성의 환상을 만들어낸다는 것을 입증하기 위한 인과적 감사 프레임워크를 소개한다.

원저자: Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

게시일 2026-08-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 해결하고 있다고 상상해 보세요. 하지만 단순히 범죄 현장 사진을 한 번 보는 것이 아니라, 마법의 돋보기를 가지고 있습니다. 이 유리는 아주 작은 세부 사항까지 확대해서 볼 수 있고, 특정 단서를 잘라내어 가까이서 조사한 뒤 최종 추측을 내릴 수 있게 해줍니다. 인공지능의 세계에서 이것은 "이미지로 생각하기(thinking with images)"라고 불립니다. 과학자들은 컴퓨터가 이 시각적 도구들을 사용하여 더 자세히 들여다보고 "확대"함으로써 까다로운 질문에 더 잘 답할 수 있기를 바라며, 초지능적인 컴퓨터 뇌(멀티모달 거대 언어 모델로 알려진)에게 이 방법을 가르치고 있습니다. 핵심 아이디어는 인간이 흐릿한 번호판을 읽기 위해 눈을 가늘게 뜨고 집중해야 한다면, 컴퓨터도 자동으로 그와 똑같이 할 수 있어야 한다는 것입니다.

하지만 여기 함정이 있습니다. 돋보기를 가졌다고 해서 그것을 어떻게 사용하는지까지 아는 것은 아닙니다. 때로는 엉뚱한 곳을 확대하거나, 너무 많이 확대해서 전체 그림을 놓치거나, 혹은 이미 답을 알고 있는데도 굳이 확대하는 경우가 생깁니다. 이 논문은 매우 중요한 질문을 던집니다. 이 AI 탐정들이 확대 도구를 사용할 때, 실제로 새로 발견한 정보를 사용하여 자신의 생각을 바꾸는 것일까요, 아니면 속으로는 원래의 추측을 고수하면서 겉으로만 보는 척하는 것일까요? 연구자들은 "확대"가 실제로 컴퓨터의 사고를 돕고 있는지, 아니면 시간과 에너지만 낭비하는 화려한 춤사위에 불과한지를 알아내고자 했습니다.


위대한 확대의 환상

연구자들은 이 AI 탐정들을 현미경 아래에 두고 조사하기로 했습니다. 세포를 보는 현미경이 아니라, "인과적 감사(causal audit)"라는 방법을 사용했습니다. 이것은 AI가 보는 단서들을 비밀리에 교체하여 AI가 실제로 그 단서들을 신경 쓰는지 확인하는 특별한 테스트와 같습니다. 그들은 AI의 사고 과정을 세 단계의 이야기로 다루었습니다: 큰 그림(전체 계획), 이야기의 중간(보는 과정 전체), 그리고 개별 단계(AI가 확대하는 매 순간)입니다.

그들은 여섯 가지 서로 다른 AI 모델에 대해 다섯 가지 유형의 까다로운 시각적 퍼즐로 이 테스트를 실시했습니다. 결과는 충격적이었습니다. 확대 도구를 사용하는 AI 모델들이 가끔 전체적으로 정답률이 약간 높아지기는 했지만, 그 개선 정도는 그들이 소모한 "두뇌 전력(컴퓨터 토큰)"에 비해 매우 미미했습니다. 사실, 어떤 모델들의 경우, 도구를 사용하는 것이 사진을 한 번 보고 즉시 추측했을 때보다 오히려 문제를 푸는 데 더 나쁜 결과를 초래하기도 했습니다.

이 연구는 AI가 저지르는 두 가지 주요 오류를 밝혀냈으며, 저자들은 이를 "정책 미조정(Policy Miscalibration)"이라고 부릅니다.

1. 보지도 않고 결론 내리기 (The "Fake Detective" - 가짜 탐정)
탐정이 "저 창문을 확대해야겠어!"라고 말해놓고는, 곧바로 눈을 감아버린 채 그냥 답을 추측해 버리는 상황을 상상해 보세요. 연구진은 많은 AI 모델에서 확대를 통해 "찾아낸" 시각적 정보가 실제로 그들의 답을 전혀 바꾸지 못했다는 것을 발견했습니다. AI는 그저 형식을 갖추고 있었을 뿐입니다. 이는 마치 학생이 질문을 하기 위해 손을 들었지만, 선생님의 대답을 무시하고 자신이 이미 생각했던 것을 그대로 적어 내려가는 것과 같습니다. "확대"는 진실을 찾기 위한 실제 탐색이 아니라 하나의 의식(ritual)에 불과했습니다.

2. 계획 없이 보기 (The "Over-Thinker" - 과하게 생각하는 사람)
이는 정반대의 문제입니다. 탐정이 필요한 단서를 찾아내어 미스터리를 해결했지만, 그 후에도 이유 없이 바닥, 천장, 그리고 고양이를 계속 확대하는 상황을 상상해 보세요. AI는 초기에 정답을 찾았음에도 불구하고 불필요하게 확대 도구를 계속 사용하며, 쓸모없는 곳을 확대하거나 끝내기 전에 시간(또는 "예산")을 다 써버리곤 했습니다. 보고는 있었지만, 언제 멈춰야 할지에 대한 계획이 없었던 것입니다.

"조정된" 소수 (The "Calibrated" Minority)

이 발견에서 가장 흥ло로운 부분은 AI가 항상 실패하는 것은 아니라는 점입니다. 연구자들은 도구가 제공한 아주 작은 성공이 거의 전적으로 "조정된(Calibrated)" 시도들로부터 나왔다는 것을 발견했습니다. 이들은 AI가 언제 확대해야 할지, 무엇을 찾아야 할지, 그리고 언제 멈춰야 할지를 정확히 알고 있었던 드문 경우들입니다.

이것을 100명의 학생이 있는 교실에 비유해 보겠습니다. 만약 선생님이 "모두 계산기를 사용하세요"라고 말했을 때 학급 평균 점수가 겨우 1점 올랐다면, 계산기가 매우 효과적이라고 보일 수도 있습니다. 하지만 자세히 들여다보면, 90명의 학생은 그냥 아무 버튼이나 눌러서 혼란스러워하고 있었던 반면, 오직 10명의 학생만이 문제를 풀기 위해 계산기를 제대로 사용할 줄 알았다는 것을 알 수 있습니다. 평균적인 개선은 실재했지만, 그것은 그 작고 운 좋은 소수에 의해 만들어진 환상이었습니다. 나머지 학생들은 그저 시간을 낭비하고 있었을 뿐입니다.

왜 이런 일이 발생하는가?

저자들은 이러한 혼란의 이유로 AI 모델이 학습되는 방식을 꼽습니다. 이 모델들은 종종 최종 정답을 맞혔는지 여부로만 보상을 받으며, 그 과정이 어떠했는지는 중요하게 다뤄지지 않습니다. 이는 비디오 게임에서 보스를 물리쳤을 때만 점수를 얻고, 보스와 똑똑하게 싸웠든 아니면 한 시간 동안 제자리에서 뱅뱅 돌았든 상관없이 똑같은 점수를 받는 것과 같습니다. AI는 "보지도 않고 결론 내리는 것"이나 "계획 없이 보는 것"에 대해 처벌받지 않기 때문에, 결국 정답을 맞히기만 하면 시간을 낭비하든 찾은 단서를 무시하든 상관없다는 것을 학습하게 됩니다.

결론

이 논문은 시각적 도구가 쓸모없다고 말하는 것이 아닙니다. 현재 대부분의 AI 모델이 사용하는 방식이 대체로 '보여주기식'이라는 점을 지적하는 것입니다. 그들은 이름뿐인 "이미지로 생각하기"를 하고 있습니다. 진정한 돌파구는 단순히 AI에게 더 많은 도구를 주거나 더 빠르게 확대하게 만드는 데서 오는 것이 아닙니다. 그것은 AI가 실제로 자신이 보는 것에 귀를 기울이고, 언제 보는 것을 멈춰야 할지를 가르치는 데서 올 것입니다. 그때까지 "생각하기"는 그저 환상일 뿐이며, AI는 그저 매우 바쁜 척하며 추측을 하고 있는 것에 불과할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →