← 최신 논문
🤖 AI

TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens

TTE-Flash 는 계산 비용이 많이 드는 명시적 사고 연쇄 추론을 학습 가능한 잠재적"생각 토큰"으로 대체하여 일정한 추론 비용으로 고성능이며 해석 가능한 다중 모달 임베딩을 생성하는 방법을 도입함으로써, 벤치마크에서 명시적 사고 연쇄 추론 기반 모델보다 우수한 성능을 보이면서도 증가된 토큰 수로부터 확장 가능한 이점을 입증합니다.

원저자: Jianpeng Cheng, Xian Wu, Jiangfan Zhang, Wentao Bao, Chaitanya Ahuja, Shlok Kumar Mishra, Hanchao Yu, Yang Gao, Fan Xia, Qi Guo, Shaodan Zhai, Xiangjun Fan, Jun Xiao

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jianpeng Cheng, Xian Wu, Jiangfan Zhang, Wentao Bao, Chaitanya Ahuja, Shlok Kumar Mishra, Hanchao Yu, Yang Gao, Fan Xia, Qi Guo, Shaodan Zhai, Xiangjun Fan, Jun Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 재능이 풍부한 조수 (AI 모델) 가 있다고 가정해 봅시다. 이 조수의 일은 사진, 비디오 또는 문서를 보고 나중에 유사한 항목을 찾을 수 있도록 설명하는 것입니다. 이를 '임베딩 (embedding)' 생성이라고 합니다.

과거에는 이 조수가 복잡한 장면을 이해하는 데 정말 능숙하도록 하기 위해 연구자들이 먼저 소리를 내어 생각하도록 가르쳤습니다. 최종 설명을 제공하기 전에 조수는 (수사관이 단서를 적어내듯) 긴 단계별 추론 메모를 작성했습니다. 이는 매우 효과적이었지만 느렸습니다. 마치 요리사가 양파를 실제로 다지기 전에 양파를 다지는지에 대해 5 페이지 분량의 에세이를 쓰도록 요구하는 것과 같았습니다. 질문을 할 때마다 요리사는 에세이를 작성해야 했으므로 많은 시간과 에너지가 소모되었습니다.

TTE-Flash는 느린 '에세이 작성' 단계 없이 동일한 고품질 결과를 얻을 수 있는 새로운 방법입니다. 간단한 비유를 들어 작동 방식을 설명해 보겠습니다.

1. '침묵의 생각' 대 '소리 내어 쓴 에세이'

조수가 긴 가시적 추론 메모를 작성하게 하는 대신, TTE-Flash 는 조수가 침묵의 생각을 하도록 가르칩니다.

  • 구식 방식 (명시적 CoT): 조수는 자신의 추론을 설명하는 긴 문단 텍스트를 작성합니다. 이는 정확하지만 느립니다.
  • 신규 방식 (TTE-Flash): 조수는 몇 개의 '숨겨진 생각 토큰 (hidden thought tokens)'을 생성합니다. 이 생각들은 즉시 텍스트로 볼 수 없습니다. 이들은 추론에 대한 비밀스럽고 압축된 요약과 같습니다.
  • 마법 같은 점: 생각이 침묵 상태라 하더라도, 모델은 훈련되어 만약 원한다면 나중에 그 침묵의 생각을 다시 풀어서 완전한 추론 에세이로 복원할 수 있습니다. 하지만 올바른 답을 찾는 실제 작업에서는 모델이 침묵의 생각만 사용하므로 속도가 매우 빠릅니다.

2. '레지스터 (Register)' 대 '루프 (Loop)'

이 논문은 이러한 침묵의 생각을 처리하는 두 가지 방식을 비교합니다.

  • 루프 (느림): 조수가 스스로에게 메모를 전달하고, 그것을 읽은 후 새로운 메모를 작성하여 다시 전달하는 과정을 생각 과정을 끝낼 때까지 8 번 반복한다고 상상해 보세요. 이는 정확하지만 한 단계씩 진행되므로 시간이 걸립니다.
  • 레지스터 (빠름): 조수가 모든 생각을 한 번에 한눈에 작성할 수 있는 특별한 '생각 패드 (Register)'를 가지고 있다고 상상해 보세요. 다음 생각을 시작하기 전에 하나의 생각이 끝날 때까지 기다릴 필요가 없습니다.
  • 결과: 저자들은 '레지스터' 방식을 사용하면 '루프' 방식보다 70 배 더 빠르면서도 거의 똑똑함을 유지한다는 사실을 발견했습니다. 이는 한 단어씩 손으로 편지를 쓰는 것과 키보드로 즉시 모두 타이핑하는 것의 차이와 같습니다.

3. 두 가지 다른 모자: 생각하기 대 답변하기

연구자들은 '생각하기'와 '답변하기'가 두 가지 다른 기술임을 깨달았습니다.

  • 만약 조수가 생각과 최종 답변을 모두 위해 동일한 뇌 부위를 사용하도록 강요하면 혼란을 겪어 두 가지 업무 모두를 poorly 수행하게 됩니다.
  • 해결책: 그들은 모델에 두 개의 별도의 '모자 (또는 전문화된 부분)'를 부여했습니다. 하나는 침묵의 생각 (Think 토큰) 에 전념하고, 다른 하나는 최종 답변 (Embed 토큰) 에 전념합니다. 이러한 분리 덕분에 모델은 두 가지 작업 모두에서 훨씬 더 능숙해집니다.

4. '예산' 실험

팀은 모델이 얼마나 많은 '침묵의 생각'이 필요한지도 테스트했습니다.

  • 간단한 작업 (고양이 식별 등) 은 몇 가지 생각만 필요했습니다.
  • 어려운 작업 (복잡한 비디오 줄거리 파악 등) 은 정답을 얻기 위해 훨씬 더 많은 생각이 필요했습니다.
  • 그들은 심지어 모델이 자신의 예산을 선택할 수 있도록 파일럿 연구를 시도하기도 했습니다. 질문이 쉬우면 더 적은 생각을 사용하고, 어렵다면 더 많은 생각을 사용하는 방식이었습니다. 이를 통해 모델은 작업의 난이도에 따라 생각의 힘을 현명하게 '사용'하는 법을 학습했다는 것이 입증되었습니다.

결론

TTE-Flash는 AI 가 똑똑해지기 위해 스스로와 '대화'할 필요가 없다는 것을 증명했기 때문에 획기적인 발전입니다. 숨겨진 토큰을 사용하여 AI 가 '침묵으로 생각'하게 할 수 있습니다. 이로 인해 AI 는 다음과 같은 특징을 갖게 됩니다:

  1. 훨씬 더 빠름 (70 배 속도 향상).
  2. 똑같거나 더 똑똑함 (실제로 일부 테스트에서는 느리고 말하는 버전보다 더 좋은 성과를 보였습니다).
  3. 해석 가능함 (우리는 여전히 그 침묵의 생각을 엿볼 수 있으며, 이를 다시 텍스트나 심지어 이미지로 변환하여 모델이 무엇을 '생각'했는지 확인할 수 있습니다).

요약하자면, 이는 천재 학생에게 종이 위에 모든 단계를 하나씩 쓰게 하는 대신 머릿속으로 즉시 암산을 하도록 가르치는 것과 같습니다. 물론 필요할 때 그들이 수학 문제를 올바르게 풀었음을 증명할 수 있게 하죠.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →