← 최신 논문
🤖 AI

Thinking with Visual Grounding

이 논문은 시각-언어 모델이 자연어 추론과 명시적인 시각적 접지(visual grounding)를 교차하여 수행하는 "시각적으로 접지된 사고(visually grounded thinking)"라는 프레임워크를 소개하며, 이는 확장 가능한 합성 파이프라인과 접지 인식 강화 학습을 통해 훈련되었을 때 수량 계산 및 공간 추론 작업에서 성능을 크게 향상시켜 더 작은 모델이 훨씬 더 큰 모델들과 경쟁할 수 있게 한다.

원저자: Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수학 시험을 치르고 있다고 상상해 보세요. 하지만 문제는 숫자가 아니라 그림에 관한 질문들입니다. 당신에게는 똑똑한 비서(AI)가 한 명 있는데, 이 비서는 소리 내어 혼잣말을 하며 이 그림 퍼즐들을 풀려고 노력합니다.

문제점: "유령" 추론
현재 이러한 AI 비서들은 말을 아주 잘합니다. "입구 근처에 빨간 자동차가 보이니, 정답은 A입니다"라고 말할 수 있죠. 하지만 여기에는 함정이 있습니다. 그들은 단지 빨간 자동차가 '보인다'고 말할 뿐입니다. 실제로 사진 속의 빨간 자동차를 가리키지는 못한다는 것이죠. 이는 마치 정답은 맞혔지만 풀이 과정을 보여주지는 못하는 학생과 같습니다. 만약 당신이 "그게 왜 빨간 자동차인지 어떻게 알죠?"라고 묻는다면, AI는 "그냥 알아요"라고 답하거나 그냥 때려 맞히고 있는 것일지도 모릅니다. AI가 증거를 가리키도록 강제되지 않았기 때문에, AI가 실제로 사진을 보고 있는 것인지 아니면 그냥 지어내고 있는 것인지 판단하기 어렵습니다.

해결책: "시각적 접지(Visual Grounding)"
이 논문의 저자인 장준카이(Junkai Zhang)와 그의 팀은 **"시각적으로 접지된 사고(Visually Grounded Thinking)"**라는 새로운 방식의 AI 사고법을 고안해 냈습니다.

이렇게 생각해보세요:

  • 기존 방식: AI가 "탁자 위에 검은색 노트북이 있습니다"라고 말합니다. (단순한 텍스트입니다.)
  • 새로운 방식: AI가 "탁자 위에 검은색 노트북 <화면의 정확한 지점을 가리킴>이 있습니다"라고 말합니다.

AI가 어떤 물체(예: "갈색 의자"나 "파란 컵")를 언급할 때마다, AI는 이미지 속의 그 특정 물체를 나타내는 디지털 핀(점)을 떨어뜨리거나 상자를 그려야 합니다. 이는 마치 AI가 레이저 포인터를 들고 "내가 지금 생각하고 있는 것은 바로 여기 있는 이것입니다"라고 말하는 것과 같습니다.

그들은 AI를 어떻게 가르쳤는가
AI에게 정확하게 가리키는 법을 가르치는 것은 어렵습니다. 왜냐하면 단순히 "정확하게 하라"고 요청할 수는 없기 때문입니다. 그래서 연구진은 학습 예시를 만들기 위해 특별한 공장(데이터 파이프라인)을 구축했습니다:

  1. 탐정: 매우 똑똑한 AI를 사용하여 그림 퍼즐을 풀고 그 단계를 기록하게 했습니다.
  2. 형광펜: 연구진은 SAM3(매우 정밀한 디지털 형광펜이라고 생각하세요)라는 도구를 사용하여, 탐정이 언급한 물체의 정확한 형태를 자동으로 찾아냈습니다.
  3. 선생님: 이 정확한 형태들을 "점"이나 "상자"로 변환하여 완벽한 정답지를 만들었습니다.
  4. 보상 시스템: 연구진은 게임 같은 시스템을 사용하여 AI를 훈련시켰습니다. 만약 AI가 정답을 맞히면서 동시에 정확한 위치를 가리켰다면 높은 점수를 받았습니다. 만약 정답은 맞혔지만 엉뚱한 곳을 가리켰거나 아예 가리키지 않았다면 더 낮은 점수를 받았습니다. 이는 AI가 "생각하는 것"과 "가리키는 것"이 반드시 함께 일어나야 한다는 것을 배우도록 강제했습니다.

테스트 결과는 어떠했는가?
연구진은 이 새로운 "가리키는" AI를 두 가지 유형의 과업에 대해 테스트했습니다:

  1. 개수 세기: "이 사진에 도넛이 몇 개 있습니까?"
    • 결과: AI는 이 작업에서 훨씬 더 나아졌습니다. 각 도넛에 점을 찍어 가리키는 것은 비슷한 물체들 사이에서 혼동을 일으키지 않고 정확하게 개수를 세는 데 도움이 되었습니다.
  2. 공간 추론: "어떤 물체가 남자의 왼쪽에서 가장 멀리 있습니까?"
    • 결과: 이것은 큰 놀라움이었습니다. 가리키는 법을 배운 작은 AI 모델(40억 개의 '뇌세포')이 가리키는 법을 배우지 않은 거대한 AI 모델(270억 개의 '뇌세포')만큼, 혹은 때로는 그보다 더 뛰어난 성능을 보였습니다.

핵심 요약
이 논문은 AI 모델이 자신의 생각을 실제 이미지와 연결하도록 강제될 때—마치 자신이 사용한 숫자에 동그라미를 쳐서 풀이 과정을 보여줘야 하는 학생처럼—더 똑똑해진다는 것을 보여줍니다.

  • 개수 세기를 위해서는: 물체에 점을 찍는 것만으로도 충분합니다.
  • 복잡한 공간 퍼즐을 위해서는: 물체 주위에 상자를 그리는 것이 AI가 크기와 모양을 이해하는 데 도움을 주지만, 단순히 점을 찍는 것만으로도 놀라울 정도로 잘 작동합니다.

요약하자면, 이 논문은 자신이 생각하고 있는 것을 가리킬 수 있을 때 사고가 더 나아진다는 것을 증명합니다. 이는 "마법 같은 추측"을 "검증 가능한 증거"로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →