← 최신 논문
💻 computer science

Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

이 논문은 경량 디트랜스포머를 활용하여 독립적이고 자기 일관성을 갖춘 시각 토큰을 생성함으로써 기존 잠재 시각 추론 방법의 한계인 '정보 획득 붕괴'를 극복하는 새로운 프레임워크인 SCOLAR을 소개하며, 이를 통해 훨씬 더 긴 추론 체인을 가능하게 하고 실제 세계 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 퍼즐, 예를 들어 기하학적 도형이 포함된 수학 문제를 풀려고 한다고 상상해 보세요. 도형의 그림이 있고, 답을 찾기 위해 그것에 대해 '생각'해야 합니다.

인공지능 (AI) 세계에는 '생각의 사슬 (Chain of Thought)'이라는 인기 있는 개념이 있습니다. 이는 AI 가 답변하기 전에 생각의 단계를 적어놓을 수 있도록 메모지를 주는 것과 같습니다. 텍스트 기반 AI 의 경우, 더 많은 단계를 작성할수록 일반적으로 더 나은 답변이 나옵니다. 마치 "그것에 대해 더 많이 생각할수록 더 똑똑해진다"라고 말하는 것과 같습니다.

연구자들은 이 같은 아이디어를 시각 - 언어 모델(이미지를 인식하는 AI) 에 적용해 보았습니다. 그들은 AI 가 답변하기 전에 이미지와 관련된 '잠재적 사고 (latent thoughts)'—보이지 않는 내부 메모—를 적어내려 하기를 원했습니다. 만약 AI 가 이러한 보이지 않는 메모의 목록을 길게 작성한다면 시각적 퍼즐을 푸는 데 더 똑똑해질 것이라고 가정했습니다.

놀라운 문제: '속삭이는 사슬' 효과
연구자들은 기이하고 반직관적인 사실을 발견했습니다. 이러한 AI 모델들이 이미지에 대해 목록의 보이지 않는 메모를 작성하려고 할 때, 실제로는 더 멍청해졌습니다.

'전화 게임 (또는 속삭임)' 게임을 상상해 보세요.

  • 옛날 방식: AI 는 메모 #1 을 씁니다. 그런 다음 메모 #1 을 읽어서 메모 #2 를 씁니다. 그 다음 메모 #2 를 읽어서 메모 #3 을 씁니다.
  • 결과: AI 가 메모 #50 에 도달할 때쯤이면, 원래 이미지의 세부 사항들은 왜곡되고 잊혀집니다. 마치 전화 게임에서 첫 번째 사람이 "고양이는 파란색이다"라고 속삭이면, 50 번째 사람이 "고양이는 블루베리다"라고 말하는 것과 같습니다. 정보가 붕괴됩니다. 사슬이 길어질수록 AI 는 실제로 무엇을 보고 있는지 더 많이 잊어버립니다.

이 논문은 이를 **"정보 획득 붕괴 (Information Gain Collapse)"**라고 부릅니다. AI 는 이미지에 대한 새로운 것을 배우는 것을 멈추고 혼란스럽고 흐릿한 아이디어들을 반복해서 되풀이하기만 합니다.

해결책: SCOLAR(스냅샷 접근법)
Chenfeng Wang 과 팀이 이끄는 연구자들은 이를 해결하기 위해 SCOLAR이라는 새로운 시스템을 구축했습니다.

AI 가 긴 사슬 속에서 스스로에게 메모를 속삭이는 대신, SCOLAR 은 **"detransformer"**라는 특수 도구를 사용합니다. 이 도구를 초고속 카메라를 가진 사진사로 생각하세요.

  1. 옛날 방식 (자기회귀): AI 는 이미지를 보고 메모를 쓰고, 메모를 보고 또 다른 메모를 쓰고, 그 메모를 보고... 그리고 천천히 이미지를 잃어버립니다.
  2. SCOLAR 방식 (한 번 촬영): AI 는 이미지와 질문을 봅니다. 잠시 멈춥니다. 그런 다음 'detransformer'가 즉시 이미지 전체에 대한 고품질의 정신적 스냅샷 전체 세트를 한 번에 찍습니다.

간단한 용어로 작동 방식:

  • 독립성: SCOLAR 이 생성하는 모든 단일 '사고 토큰 (메모)'은 원래 선명한 이미지에 직접 고정됩니다. 이전 메모에 의존하여 존재하지 않습니다. 메모 #100 은 메모 #1 과 마찬가지로 원래 사진과 똑같이 선명하고 연결되어 있습니다.
  • 감쇠 없음: 전체 맥락에서 한 번의 '촬영'으로 모두 생성되기 때문에 정보가 사라지지 않습니다. AI 가 1,000 개의 메모 사슬을 가질 수 있으며, 그중 하나 하나마다 시각적 퍼즐의 선명한 조각을 여전히 보유하고 있습니다.

훈련: AI 에게 '시각적으로 생각'하도록 가르치기
이를 작동시키기 위해 팀은 AI 를 세 단계로 가르쳤습니다:

  1. 보는 법 배우기: 그들은 detransformer 가 AI 의 내부 사고를 명확한 시각적 특징으로 변환하는 법을 가르쳤습니다 (사진의 언어를 배우는 번역가와 같습니다).
  2. 언제 멈출지 배우기: 그들은 AI 에게 이러한 추가적인 시각적 메모를 언제 취해야 하는지 인식하도록 가르쳤습니다. "이 삼각형을 더 자세히 봐야 한다"라고 말하고 스냅샷 도구를 트리거하는 법을 배웁니다.
  3. 강화: 그들은 보상 시스템 (비디오 게임 점수와 같은) 을 사용하여 AI 가 실제로 문제를 해결하는 데 도움이 될 때만 이러한 시각적 메모를 사용하도록 장려하고, 필요하지 않을 때는 무시하도록 했습니다.

결과
이 논문은 SCOLAR 이 엄청난 성공이라고 주장합니다:

  • 확장성: 다른 방법들은 약 10 개의 메모 이후에 실패하는 반면, SCOLAR 은 30 배 더 많은(최대 1,000 개) 메모를 처리할 수 있으며, 사슬이 길어질수록 실제로 더 좋아집니다.
  • 성능: 복잡한 다이어그램이나 실제 세계의 장면을 이해하는 것과 같은 실제 세계 추론 테스트에서 다른 오픈소스 모델들을 압도적인 차이로 능가했습니다.
  • 거인들 이기기: 한 가지 특정 테스트 (V*Bench) 에서 SCOLAR(70 억 개 파라미터 모델) 은 **83.77%**를 기록하여 유명한 폐쇄형 소스 모델인 GPT-4o(67.50% 기록) 를 능가했습니다.

한 줄 요약
이 논문은 긴 속삭임 사슬을 통해 AI 가 이미지를 '생각'하게 하려는 시도는 메시지가 사라지기 때문에 작동하지 않는다고 주장합니다. 대신 SCOLAR 은 AI 에게 자신의 사고에 대한 새롭고 고품질의 사진 더미를 한 번에 제공합니다. 이를 통해 AI 는 원래 이미지를 잊어버리는 일 없이 원하는 만큼 깊고 오랫동안 생각할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →