← 최신 논문
🤖 AI

Mull-Tokens: Modality-Agnostic Latent Thinking

본 논문은 텍스트 및 이미지 모달리티 간 자유형 중간 추론을 가능하게 하여 취약한 도구 호출이나 비용이 많이 드는 이미지 생성에 의존하지 않고도 복잡한 공간 및 퍼즐 해결 작업에서 성능을 크게 향상시키는 모달리티 무관 잠재 토큰 프레임워크인 Mull-Tokens 를 소개합니다.

원저자: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 논문 "Mult-Tokens: Modality-Agnostic Latent Thinking"을 쉬운 언어와 창의적인 비유로 설명한 내용입니다.

핵심 문제: 한 차원에서의 사고

복잡한 3 차원 퍼즐, 예를 들어 루빅스 큐브나 퍼즐을 풀려고 한다고 상상해 보세요. 만약 단어만 사용하여 이를 해결하려 한다면, "빨간 조각을 왼쪽으로 옮긴 다음 파란 조각을 회전시켜라"라고 말할 수 있습니다. 하지만 단어는 이 작업에 느리고 둔합니다. 단어는 모양, 깊이, 혹은 공간에서 조각들이 어떻게 맞물리는지를 쉽게 설명할 수 없습니다.

현재의 AI 모델은 말하기 (텍스트) 와 보기 (이미지) 에 뛰어나지만, 공간, 시간, 혹은 사물의 움직임에 대해 추론하려 할 때는 종종 막힙니다.

  • 옛날 방식 (텍스트만): AI 는 단어로 퍼즐을 설명하려 합니다. 이는 세부 사항에 빠지고 실수를 범하게 만듭니다.
  • "너무 많은" 방식 (이미지 + 텍스트): 일부 연구자들은 AI 가 자신의 생각을 "그리도록" 만들려고 시도했습니다. 하지만 이는 요리사에게 요리를 멈추고, 레시피를 적고, 요리의 그림을 그리고, 또 다른 레시피를 쓴 뒤, 마지막으로 음식을 서빙하라고 요구하는 것과 같습니다. 이는 비싸고 느리며, AI 는 종종 어떤 그림이 어떤 문장에 해당하는지 혼란을 겪습니다.

해결책: "Mult-Token"(마법의 낙서판)

저자들은 Mult-Tokens라는 더 간단하고 지능적인 도구를 제안합니다.

AI 의 뇌를 주방이라고 상상해 보세요.

  • 텍스트 토큰은 요리사의 구두 지시와 같습니다.
  • 이미지 토큰은 요리사가 메모장에 실제로 그림을 그리는 것과 같습니다.
  • Mult-Tokens마법의 보이지 않는 낙서판과 같습니다.

AI 가 어려운 문제 (예: 공간 퍼즐) 에 직면했을 때, 긴 문단으로 외치거나 완전한 그림을 그리는 대신, 이 보이지 않는 낙서판에 글을 쓰며 잠시 멈춥니다.

왜 이것이 마법일까요?

  1. 모달리티 중립적입니다: 이는 "생각의 형태가 무엇인지에 상관없다"는 것을 fancy 한 용어로 표현한 것입니다. 이 낙서판은 회전하는 큐브의 정신적 이미지나 경로의 상징적 지도를 모두 담을 수 있습니다. 반드시 단어일 필요도, 완전한 그림일 필요도 없습니다. 그것은 순수한 "사고 데이터"일 뿐입니다.
  2. 압축적입니다: 일반적인 텍스트 기반 설명은 200 단어가 필요할 수 있습니다. 완전한 이미지는 수백 개의 픽셀을 필요로 합니다. Mult-Token 접근 방식은 단 20~40 개의 토큰만으로 문제를 해결합니다. 이는 수학 문제를 설명하기 위해 10 페이지의 에세이를 쓰는 것과 냅킨에 핵심 공식을 적어내는 것의 차이와 같습니다.

훈련 방법: 3 단계 체육관 루틴

연구자들은 AI 에게 단순히 낙서판을 주기만 한 것이 아니라, 그것을 사용하는 법을 가르쳤습니다. 그들은 3 단계 훈련 과정을 사용했습니다.

  1. 워밍업 (사고의 언어 학습):
    먼저, 연구자들은 퍼즐을 풀고 있는 사람들의 예시들을 AI 에게 보여주었습니다. 때로는 그림이 포함된 해결책이었고, 때로는 문장이었습니다. 그들은 Mult-Tokens 가 이러한 단계들을 모방하도록 가르쳤습니다.

    • 비유: 이는 학생이 선생님이 수학 문제를 풀고 있는 것을 보는 것과 같습니다. 때로는 선생님이 숫자를 쓰는 것을 보고, 때로는 그래프를 그리는 것을 봅니다. 학생은 "낙서판"이 둘 다 담을 수 있음을 배웁니다.
  2. 자유 형식 연습 (놓아주기):
    다음으로, 연구자들은 AI 에게 문제를 어떻게 풀지 보여주지 않았습니다. 그들은 최종 답안만 보여주었습니다. AI 에게는 이렇게 말했습니다. "여기 퍼즐이 있습니다. 낙서판을 사용하여 풀어보되, 무엇을 적어야 할지는 알려주지 않겠습니다. 단지 정답을 맞추세요."

    • 비유: 선생님은 힌트를 주지 않고 "이것을 풀어라"라고만 말합니다. 학생은 선생님을 단순히 모방하는 것이 아니라, 자신에게 가장 잘 작동하는 방식으로 낙서판을 사용하는 법을 배웁니다.
  3. 강화 (좋은 사고에 대한 보상):
    마지막으로, 그들은 GRPO(강화 학습) 라는 기법을 사용했습니다. AI 가 낙서판을 사용하여 정답을 맞히면 "금색 별"을 받았습니다. 만약 생각 없이 추측했다면 아무것도 받지 못했습니다. 이는 AI 가 단순히 추측하는 대신 실제로 낙서판을 사용하여 추론하도록 장려했습니다.

결과: 더 빠르고 더 똑똑함

이 논문은 퍼즐, 3 차원 공간 추론, 비디오 분석과 관련된 네 가지 어려운 벤치마크에서 이 새로운 방법을 테스트했습니다.

  • 승리: Mult-Tokens 를 가진 AI 는 기존 최상위 방법들보다 평균 3% 더 좋은 성과를 거두었습니다. 가장 어려운 퍼즐 테스트에서는 16% 개선되었습니다.
  • 속도: 수백 개의 단어나 이미지 대신 약 20 개의 "사고 토큰"만 사용하기 때문에 실행이 훨씬 빠르고 비용 효율적입니다.
  • 유연성: AI 는 낙서판을 언제 사용할지 결정하는 법을 배웠습니다. 일부 쉬운 질문에서는 낙서판을 건너뛰었고, 어려운 공간 퍼즐에서는 이를 적극적으로 활용했습니다.

결론

이 논문은 AI 가 깊이 사고하기 위해 "말"하거나 "그리"도록 강요할 필요가 없다고 주장합니다. 대신, 우리는 AI 에게 모달리티 중립적 잠재 공간을 제공할 수 있습니다. 이는 완전한 문장이나 그림을 생성하는 오버헤드 없이 이미지와 개념을 자유롭게 혼합할 수 있는 사적이고 내부적인 "사고 공간"입니다.

이는 인간에게 3 차원 객체를 시각화하되, 이를 소리 내어 설명할 필요 없이 침묵하는 내부 독백을 주는 것과 같습니다. 그 결과, 공간 퍼즐에 더 능숙하고, 더 빠르며, 더 효율적인 AI 가 탄생합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →