← 최신 논문
🤖 machine learning

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

이 논문은 지도 미세 조정(supervised fine-tuning) 시 더 나은 잠재 타겟 표현을 위해 전용 스캐폴딩 인코더를 도입하고, 효과적인 탐색을 가능하게 하도록 강화 학습 샘플러를 위한 평균과 분산을 모두 학습시킴으로써 멀티모달 추론을 최적화하는 "Scaffolding Minds"라는 방법을 제안하며, 이를 통해 다양한 시각적 추론 작업에서 기존 베이스라인들을 크게 능가한다.

원저자: Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능는 오랫동안 인간처럼 세상을 보는 데 어려움을 겪어 왔습니다. 컴퓨터가 사진을 볼 때 사물을 식별할 수는 있지만, 사물 간의 관계를 이해하거나 복잡한 시각적 퍼즐을 통해 추론하는 데는 자주 실패합니다. 수년간 연구자들은 기계에게 소리 내어 "생각"하도록 가르쳐, 답을 내놓기 전에 텍스트로 단계별 설명을 쓰게 함으로써 이 문제를 해결하려 노력해 왔습니다. 이 방식은 도움이 되긴 하지만, 기계가 풍부하고 상세한 시각적 정보를 서투른 단어로 번역하게 만들어 그 과정에서 중요한 뉘앙스를 놓치게 만드는 경우가 많습니다. 더 새로운 접근 방식은 기계가 자신의 생각을 내부의 숨겨진 언어, 즉 컴퓨터의 두뇌 속에만 존재하는 연속적인 데이터 스트림으로 유지하게 함으로써 이 문제를 해결하려고 시도합니다. '잠재적 추론(latent reasoning)'이라고 알려진 이 방법은 모델이 문장으로 설명할 필요 없이 시각적 세부 사항을 유지할 수 있게 해줍니다. 그러나 이 진보된 기술조차 한계에 부딪혔습니다. 기계가 생성하는 내부 사고는 종종 특정 문제에 맞게 설계되지 않은 일반적이고 미리 만들어진 도구들에 기반하며, 기계는 최선의 해결책을 찾기 위해 다양한 사고 방식을 탐색하는 데 어려움을 겪습니다.

Google DeepMind와 캘리포니아 대학교 샌디에이고 캠퍼스의 연구진은 이러한 장애물을 극복하기 위해 '스캐폴딩 마인즈(Scaffolding Minds)'라는 새로운 프레임워크를 개발했습니다. 이들의 연구는 내부 추론 시스템이 일반적으로 실패하는 두 가지 특정 단계에 초점을 맞춥니다. 첫 번째로, 초기 학습 단계에서 기계는 보통 수백만 개의 일반적인 이미지(고양이, 자동차, 풍경 등)를 인식하도록 훈련된 표준적인 기성 비전 인코더(vision encoder)의 출력을 모방하도록 배웁니다. 문제는 이 일반적인 도구가 기계가 해결하려는 특정 추론 작업에 최적화되어 있지 않다는 점입니다. 이 도구는 불필요한 시각적 세부 사항은 보존하면서 정작 퍼즐을 푸는 데 필요한 결정적인 증거는 놓칠 수 있습니다. 두 번째로, 기계가 시행착오를 통해 스스로를 개선하려고 할 때, 기존 방식들은 종-종 기계가 단 하나의 사고 경로에 엄격하게 묶여 있거나 텍스트 답변만을 수정할 수 있도록 강제하여, 내부적인 시각적 추론은 변경되지 않은 채로 남겨둡니다. 이는 기계가 문제를 해결하기 위한 더 나은 새로운 방식을 발견하는 것을 방해합니다.

이를 해결하기 위해 연구진은 기계의 내부 사고를 위한 맞춤형 가이드 역할을 하는 두 부분의 시스템을 도입했습니다. 첫 번째 단계에서 그들은 일반적인 도구에 의존하는 대신, 전용 '스캐폴딩 인코더(scaffolding encoder)'를 훈련시켰습니다. 이것을 일반적인 사전을 단순히 복사하는 것이 아니라, 특정 작업에 가장 도움이 되는 내부 메모가 무엇인지 정확히 배우는 전문 튜터라고 생각하면 됩니다. 이 튜터는 훈련 중에만 제공되는 시각적 보조 도구인 '헬퍼 이미지(helper image)'를 받아, 추론 과제에 완벽하게 조율된 최적화된 내부 토큰 세트로 변환합니다. 기계가 스스로 이러한 최적화된 메모를 생성하는 법을 배우고 나면, 튜터는 제거되며 기계는 도움 없이 작업할 준비를 마칩니다.

두 번째 단계에서 연구진은 기계의 내부 사고를 지배하는 경직된 규칙을 유연한 학습 기반 샘플러(learning-based sampler)로 교체했습니다. 기계가 하나의 정해진 궤도를 따라가도록 강제하는 대신, 이 새로운 방법은 기계가 연습 중에 자신의 내부 사고의 다양한 변형을 샘플링할 수 있게 해줍니다. 기계는 사고의 '평균(mean)'과 '분산(variance)'을 조정하는 법을 배우며, 효과적으로 더 넓은 범위의 가능성을 탐색하여 어떤 내부 경로가 정답으로 이어지는지 확인합니다. 이러한 탐색은 보상에 의해 유도되며, 기계가 단순히 처음 찾은 경로에 안주하는 것이 아니라 가장 효과적인 추론 궤적을 찾도록 장려합니다.

이 접근 방식의 결과는 캐릭터가 격자 위의 얼음과 구멍을 통과해 목표에 도달해야 하는 공간 계획 게임인 '프로즌 레이크(FrozenLake)'를 포함한 일련의 도전적인 시각적 추론 과제들을 통해 테스트되었습니다. 표준 8x8 격자에서 새로운 방법은 이전의 가장 강력한 시도들에 비해 기계의 정확도를 9.5% 향상시켰습니다. 격자가 32x32로 확장되어 난이도가 높아질수록 그 우위는 더욱 커졌으며, 새로운 시스템은 기존의 최선 방법들보다 19% 더 높은 성능을 보였습니다. 연구진은 또한 미세한 관찰과 비교가 필요한 9가지 다른 시각적 추론 벤치마크에서도 시스템을 테스트했습니다. 이 모든 테스트에서 이 방법은 일관되게 성능을 개선하여 평균 정확도를 5.2% 높였습니다.

이 연구는 추론 과정 중에 새로운 이미지를 생성하는 것 자체가 성공을 위해 필수적이라는 생각을 명시적으로 배제했습니다. 중간 단계의 그림을 그려서 기계를 돕고자 하는 다른 방법들은 종종 높은 계산 비용과 느린 속도로 어려움을 겪습니다. 스캐폴딩 마인즈 방식은 추가 이미지를 전혀 생성하지 않고도 우수한 결과를 얻었으며, 이는 시각적 데이터의 내부적, 숨겨진 표현을 최적화하는 것이 가시적인 중간 단계를 만드는 것보다 더 효과적임을 입증했습니다. 연구진은 두 가지 개선 사항, 즉 내부 메모를 위한 맞춤형 튜터와 그 메모의 유연한 탐색이 함께 사용될 때 가장 잘 작동한다는 것을 발견했습니다. 맞춤형 튜터 없이는 유연한 탐색이 그 잠재력에 도달할 수 없었고, 탐색 없이는 맞춤형 튜터가 최선의 경로를 정교화할 수 없었습니다.

이 연구는 기계가 목표로 하는 내부 타겟의 품질이 그곳에 도달하기 위해 사용하는 방법만큼이나 중요하다는 것을 시사합니다. 기계에게 자신만의 최적화된 내부 메모를 생성하도록 가르치고, 그런 다음 그 메모의 다양한 변형을 탐색할 수 있게 함으로써, 연구진은 기계가 복잡한 시각적 문제를 더 정밀하고 신뢰성 있게 추론할 수 있는 시스템을 만들어냈습니다. 이러한 결과는 미래의 시각적 추론의 발전이 기계를 더 많이 "보게" 하거나 더 잘 "말하게" 하는 것보다, 기계의 숨겨진 내부 사고를 당면한 과제에 완벽하게 부합하는 방식으로 구조화하는 방법을 가르치는 것에 달려 있을 수 있음을 나타냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →