← 최신 논문
🤖 AI

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

이 논문은 1,200개의 샘플로 구성된 벤치마크와 시각적 사고 과정(Visual Action-of-Thought) 프로토콜을 포함하는 통합 평가 프레임워크인 See2Think를 소개하며, 멀티모달 모델이 중간 시각적 상태에 대한 행동 의존성을 보이지만, 이들의 추론 정확도는 렌더링 충실도에 의해 크게 제한되며 모델과 환경에 따라 현저하게 차이가 난다는 점을 밝힌다.

원저자: Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang

게시일 2026-07-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 까다로운 퍼즐을 풀려고 노력 중이라고 상상해 보세요. 하지만 단순히 그림을 보는 것에 그치지 않고, 연필을 들어 선을 긋고, 단서를 동그라미 치고, 종이 위에 자신의 생각을 스케치할 수 있는 권한이 주어집니다. 이것이 바로 **멀티모달 거대 언해 모델(Multimodal Large Language Models)**의 세계입니다. 이들은 텍 án를 읽을 수 있을 뿐만 아니라 이미지를 "볼" 수도 있는 매우 똑똑한 컴퓨터 프로그램입니다. 한동안 이 모델들은 **연쇄 사고(Chain-of-Thought)**라고 불리는 기술을 통해 자신의 단계를 글로 써 내려가며 "소리 내어 생각하는" 능력을 발전시켜 왔습니다. 하지만 3D 공간이나 복잡한 기하학을 포함한 많은 퍼즐은 글자만으로는 해결하기 어렵습니다. 인간은 사고를 돕기 위해 자연스럽게 도표를 그리는데, 이에 과학자들은 의문을 품었습니다. 이 AI 모델들이 실제로 중간 단계의 그림이나 스케치를 사용하여 문제를 해결할 수 있는 것일까, 아니면 그저 흉내만 내는 것일까?

이것이 연구자들이 던지는 핵심 질문입니다. 만약 AI가 "여기에 선을 그려서 이 문제를 풀어야겠다"라고 말한다면, 실제로 그 새로운 그림을 사용하여 답을 찾아낼까요? 아니면 그 그림을 무시하고 그냥 답을 추측해 버릴까요? 이는 마치 학생이 수학 문제를 풀 때 실제로 연습장에 풀이 과정을 적고 있는지, 아니면 그저 낙서를 휘갈기며 최종 답이 마법처럼 나오기를 바라고 있는지를 묻는 것과 같습니다. 모델이 스스로 만든 시각적 도구를 실제로 사용하지 않는다면, 우리는 그들을 더 똑똑하게 만들기 위해 기능을 구축하는 데 시간을 낭비하고 있는 것일지도 모릅잡니다.

여기 AI의 추론 과정을 탐정처럼 조사하는 새로운 연구인 See2Think가 등장했습니다. 연구진은 2D 기하학, 화학 구조식부터 3D 로봇 장면, 현실 세계의 물리 문제에 이르기까지 1,200개의 다양한 퍼즐을 포함하는 거대한 테스트 환경인 See2ThinkBench를 구축했습니다. 그들은 모델에게 단순히 정답을 요구하는 대신, **시각적 사고 행동(Visual Action-of-Thought, VAoT)**이라는 특별한 프로토콜을 설정했습니다. 이것은 AI가 차례를 지켜 게임을 하는 것과 같습니다. 먼저 생각하고, 무엇을 "그릴지"(예: 특정 각도를 강조하거나 이미지의 일부를 크롭하는 것) 결정하면, 별도의 도구가 실제로 그것을 그리고, 그 후 AI는 그 새로운 그림을 보고 추론을 이어가야 합니다.

연구팀은 이 게임을 어떻게 다루는지 확인하기 위해 네 가지 강력한 AI 모델을 테스트했습니다. 그 결과, "하나의 정답(one size fits all)"은 없다는 사실을 발견했습니다. 때로는 (그림 없이) 말로만 생각하는 것이 가장 효과적이었고, 어떤 경우에는 실제로 그림을 보는 것이 도움이 되기도 했습니다. 하지만 반전이 있었습니다. 모델들은 무엇을 그릴지 결정하는 것(적절한 단서를 선택하는 것)에는 놀라울 정도로 뛰어났지만, 그 그림을 올바르게 사용하는 데는 자주 실패했습니다. 실제로 연구 결과, 가장 큰 병목 현상은 적절한 행동을 선택하는 것이 아니라, 그 그림 자체가 얼마나 "충실한가(faithfulness)"—즉, 도구가 AI가 요청한 대로 실제로 그렸는가—에 있었습니다.

가장 흥ся로운 발견은 연구진이 모델에게 부린 "속임수"에서 나왔습니다. 그들은 의도적으로 모델에게 "오염된" 그림들—AI가 요청한 것과 비슷해 보이지만 실제로는 틀렸거나 오해의 소지가 있는 그림들—을 주었습니다. 이런 상황이 발생했을 때, 특히 3D 장면에서 정확도가 10퍼센트 포인트 이상 떨어지며 모델의 성능이 크게 하락했습니다. 이는 모델들이 비록 망가졌을지라도, 자신이 보는 시각적 상태에 진심으로 의존하고 있었다는 것을 증명합니다. 그러나 이 연구는 모델이 그림에 의존한다고 해서 그 그림이 반드시 정답을 찾는 데 도움이 된다는 뜻은 아니라는 점도 시사합니다. 때때로 모델들은 시각적 피드백에 너무 의존한 나머지, 나쁜 그림 때문에 혼란을 느껴 실패하기도 했습니다. 이는 "사용하는 것"과 "이득을 얻는 것"이 매우 다른 문제임을 보여줍니다.

요약하자면, 이 논문은 AI 모델들이 시각적 추론이라는 개념에는 익숙해지고 있지만, 여전히 자신의 스케치를 실행하고 신뢰하는 복잡한 현실 앞에서는 고군분투하고 있음을 밝혀냈습니다. 그들은 어떤 부분의 도표를 봐야 할지는 정확히 알지만, 막상 직접 만든 새 스케치를 읽으려고 하면 길을 잃는 학생들과 같습니다. 연구진은 결론적으로 우리가 단순히 최종 결과만을 볼 것이 아니라, 과정 전체를 진단해야 한다고 주장합니다. 즉, 그림이 관련이 있는지, 올바르게 그려졌는지, 그리고 모델이 그것을 사용하여 실제로 생각했는지를 확인해야 한다는 것입니다. 이러한 병목 현상을 해결하지 못한다면, "이미지를 통한 사고"는 여전히 진정한 초능력이 아닌 일종의 퍼포먼스에 불과할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →