← 최신 논문
🤖 AI

Test-Time Deep Thinking to Explore Implicit Rules

본 논문은 복잡한 텍스트 기반 신체화 작업에서 숨겨진 암묵적 규칙을 추론하고 지능형 에이전트의 성능을 크게 향상시키기 위해 새로운 안정적 강화 학습 파이프라인을 통해 훈련된 전용 7B 'Exp-Thinker' 모델을 활용하는 TTExplore 프레임워크를 소개합니다.

원저자: Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao, Yesai Wu, Qinyu Luo, Haotian Chen, Yankai Lin, Zhiyuan Liu, Maosong Sun

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wentong Chen, Xin Cong, Zhong Zhang, Yaxi Lu, Siyuan Zhao, Yesai Wu, Qinyu Luo, Haotian Chen, Yankai Lin, Zhiyuan Liu, Maosong Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"테스트 시간 딥 싱킹을 통한 암묵적 규칙 탐색"이라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 풀어보겠습니다.

문제: 낯선 집의 "눈먼" 로봇

당신이 한 번도 가본 적이 없는 집을 청소하러 매우 똑똑한 로봇을 고용했다고 상상해 보세요. 당신은 로봇에게 간단한 지시를 내립니다: "깨끗한 접시를 조리대 위에 올려놓아."

로봇은 접시를 잡으려 하지만 아무 일도 일어나지 않습니다. 다시 시도해 봅니다. 여전히 아무 일도 일어나지 않습니다. 로봇은 좌절하며 다른 각도로 시도해 보지만 여전히 실패합니다. 로봇은 기니피그가 바퀴를 도는 것처럼 같은 실수를 반복하다가 결국 포기합니다.

왜 이런 일이 일어날까요?
로봇은 움직이는 방법과 물건을 잡는 방법 (일반적인 지식) 을 알고 있습니다. 하지만 이 특정 집의 숨겨진 규칙은 모릅니다.

  • 규칙이 *"물건을 만지기 전에 반드시 그 물체의 정면 앞에 서 있어야 한다"*일지도 모릅니다.
  • 규칙이 *"한 번에 한 가지 물건만 들 수 있다"*일지도 모릅니다.
  • 규칙이 *"전등을 켜기 전에는 꽃병을 램프 아래에 놓을 수 없다"*일지도 모릅니다.

이러한 규칙들은 벽에 적혀 있지 않습니다. 로봇은 무언가를 시도하고 그 결과를 관찰함으로써 이를 알아내야 합니다. 현재의 AI 에이전트는 이에 서툴러서, 실패하는 '이유'를 모른 채 시행착오의 고리에 갇히게 됩니다.

해결책: "생각하는 자"와 "행동하는 자"

이 논문의 저자들은 TTExplore(Test-Time Exploration)라는 새로운 시스템을 제안합니다. 그들은 AI 를 두 사람이 협력하는 팀처럼 두 가지 명확한 역할로 나눕니다:

  1. 행동하는 자 (The Actor): 이는 "손"입니다. 실제로 움직이고 물건을 집어 들고 작업을 시도하는 부분입니다. 이는 자신이 보는 것에 기반해 빠르게 행동합니다.
  2. 생각하는 자 (The Thinker): 이는 "뇌"이거나 "탐정"입니다. 이는 움직이지 않습니다. 대신 행동하는 자를 관찰합니다. 행동하는 자가 실패하거나 갇히기 시작하면, 생각하는 자가 개입합니다.

생각하는 자가 작동하는 방식:
생각하는 자는 발생한 과거의 기록을 살펴봅니다: "접시를 잡으려 했지만 컴퓨터가 '아무 일도 일어나지 않았다'고 말했다. 다시 시도했지만 결과는 같았다. 잠깐... 내가 조리대 뒤에 서 있었구나. 아마 규칙은 그 앞에 서야 한다는 것일까?"

그런 다음 생각하는 자는 메모 (깊은 생각) 를 작성하고 행동하는 자에게 말합니다: "멈춰! 먼저 조리대 앞에 서 보아라." 이는 행동하는 자가 고리에서 벗어나 문제를 해결하는 데 도움을 줍니다.

어려운 부분: 생각하는 자를 가르치는 일

당신은 "그냥 생각하는 자를 더 똑똑하게 만들면 되지!"라고 생각할지도 모릅니다. 하지만 함정이 있습니다. 어떻게 컴퓨터를 훌륭한 탐정으로 가르칠 수 있을까요?

학교에서는 시험 끝에 성적을 받습니다. 하지만 이 AI 세계에서는 "성적"(성공 또는 실패) 이 길고 messy 한 여정의 끝에서만 나옵니다. 만약 생각하는 자가 중간에 훌륭한 추측을 했지만, 행동하는 자가 나중에 실수를 하면 전체가 실패하게 됩니다. 생각하는 자가 실제로 도움이 되었는지 아닌지 알기 어렵습니다. 이는 공을 모두 떨어뜨린 후에야 "잘했어" 또는 "나빠"라고 말하며 누군가에게 공 던지기를 가르치는 것처럼 훈련을 매우 불안정하게 만듭니다.

논문의 해결책: "원 샷 (One Shot)" 전략
이를 해결하기 위해 연구자들은 특별한 훈련 방법을 고안했습니다:

  • 핵심 순간에 집중: 긴 작업 동안 생각하는 자가 여러 번 말하도록 하는 대신, 시도당 한 번만 말하도록 강제합니다.
  • 보상: 그 단일 시도의 결과를 살펴봅니다. 생각하는 자의 조언이 행동하는 자가 목표에 더 가까워지는 데 도움이 되었다면, 생각하는 자는 "엄지척"을 받습니다. 도움이 되지 않았다면 "엄지내림"을 받습니다.
  • 결과: 이로 인해 훈련이 훨씬 안정적이 됩니다. 연구자들은 이 방법을 사용하여 Exp-Thinker라고 부르는 전용 70 억 파라미터 모델을 훈련시켰습니다.

결과: 더 똑똑한 팀

연구자들은 이 시스템을 다섯 가지 다른 "텍스트 기반 비디오 게임"(명령어를 입력해 물체를 움직이는 시뮬레이션 환경) 에서 테스트했습니다.

  • 전: 생각하는 자가 없으면 AI 에이전트들 (심지어 크고 똑똑한 에이전트들조차) 고리에 갇혀 자주 실패했습니다.
  • 후: Exp-Thinker를 추가했을 때, 에이전트들은 숨겨진 규칙을 파악하는 데 훨씬 능숙해졌습니다.
    • 평균적으로 성공률은 14~19 포인트 급증했습니다.
    • 에이전트들은 같은 실수를 반복하지 않게 되었습니다.
    • 그들은 벽에 머리를 박는 대신 새로운 아이디어를 탐색하기 시작했습니다.

결론

이 논문은 AI 에게 새로운 환경의 숨겨진 규칙을 훨씬 빠르게 학습할 수 있게 해주는 "탐정" 역할을 부여하여 실패하는 이유를 분석하기 위해 멈추게 함으로써, AI 가 더 빠르게 학습할 수 있음을 보여줍니다.

무작정 시도하는 대신, 이제 AI 는 *"잠깐, 여기서 실제로 무슨 일이 일어나고 있는지 생각해 보자"*라고 말하며 행동을 안내하는 파트너를 갖게 되었습니다. 이 간단한 변화는 혼란스러운 로봇을 훨씬 더 유능한 탐험가로 변모시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →