← 최신 논문
🤖 AI

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

본 논문은 잠재적 예측 능력을 먼저 주입하고, 형식 유도형 감독을 통해 이를 구조화하며, 최종적으로 선견 지식 조건부 강화 학습을 통해 보정 과정을 정교화함으로써, 반응형 에이전트의 한계를 극복하고 근거 있고 장기적인 의사결정을 달성하기 위해 LLM 에이전트 내에 미래 인지적 계획 능력을 내재화하는 통합된 3단계 훈련 패러다임을 제안한다.

원저자: Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

게시일 2026-06-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 인터넷에서 특정 사실을 찾아내거나 까다로운 수학 문제를 푸는 것과 같은 복잡한 퍼즐을 해결하는 법을 가르치고 있다고 상상해 보세요.

현재 대부분의 로봇은 **반응형 운전자(reactive driver)**처럼 작동합니다. 교통 신호가 빨간불로 바뀌는 것을 보고 브레이크를 밟는 식입니다. 질문을 받으면 즉시 답변을 타이핑합니다. 빠르기는 하지만, "앞을 내다보며 생각"하지는 못합니다. 만약 길을 잘못 들면, 이미 충돌할 때까지 자신이 실수했다는 사실을 깨닫지 못하는 경우가 많습니다.

이 논문의 연구자들은 이 로봇들에게 인간 운전자처럼 행동하는 법을 가르치고자 했습니다. 인간은 단순히 반응만 하지 않습니다. 우리는 "정신적 시뮬레이션(mental simulation)"을 수행합니다. 핸들을 돌리기 전에 스스로에게 묻습니다. "여기서 왼쪽으로 돌면 저 트럭과 부딪힐까? 직진하면 교통 체증에 갇히게 될까?" 우리는 실제로 움직이기 전에 머릿속에서 다양한 경로를 시험해 봅니다.

연구자들은 현재의 AI 에이전트들이 이러한 "정신적 시뮬레이션" 또는 **내부 세계 모델(internal world model)**이 부족하다고 주장합니다. 그들은 자신의 행동이 가져올 미래의 결과를 진정으로 상상할 수 없습니다.

문제점: "될 때까지 하는 척하기(Fake It Till You Make It)"의 함정

연구자들은 먼저 간단한 해결책을 시도했습니다. AI에게 "답변하기 전에 다음에 어떤 일이 일어날 것 같은지에 대한 계획을 작성하라"고 단순히 말하는 것이었습니다.

그들은 **"포맷-역량 간극(Format-Capability Gap)"**이라고 부르는 문제를 발견했습니다.

이것은 마치 학생에게 영화 시나리오를 쓰는 법을 가르치는 것과 같습니다. 만약 당신이 학생에게 "영웅, 악당, 그리고 반전이 있는 시나리오를 써라"라고 말한다면, 학생은 종이 위에는 완벽해 보이는 시나리오를 써낼 수도 있습니다. 하지만 만약 당신이 실제로 그 장면을 연기해 보라고 요청한다면, 학생은 캐릭터가 어떻게 움직이고 말해야 하는지 진정으로 이해하지 못했기 때문에 비틀거릴 수 있습니다. 그들은 계획의 포맷을 흉내 낼 뿐, 미래를 예측하는 실제 역량을 갖춘 것이 아닙니다.

AI의 경우, 계획처럼 보이지만 엉터리 내용(환각 현상)으로 가득 찬 "계획"을 쓰기 시작했습니다. "X를 검색한 다음, Y를 찾겠다"라고 말하지만, 실제로 X를 검색하는 것이 Y로 이어질지 알지 못하는 상태였습니다. 그것은 단지 추측하고 있었을 뿐입니다.

해결책: 3단계 훈련 캠프

이를 해결하기 위해 연구자들은 AI에게 어떻게 미래를 "앞서 생각"하고 그 생각을 행동으로 옮길지 가르치는 특별한 3단계 훈련 프로그램을 만들었습니다. 그들은 이를 **세계 모델 에이전트 훈련(World Model Agentic Training)**이라고 부릅니다.

1단계: "정신적 체육관" (세계 모델 에이전트 중간 훈련)

AI가 계획에 대해 말하기 전에, 먼저 계획을 가질 수 있어야 합니다.

  • 비유: 조종사가 비행 시뮬레이터에서 훈련받는 것을 상상해 보세요. 그들은 단순히 매뉴얼을 읽는 것이 아니라, 스틱을 너무 세게 당기거나 폭풍 속으로 비행할 때 어떤 일이 발생하는지 확인하며 수천 시간 동안 가상 비행기를 조종합니다.
  • 연구진이 한 일: 그들은 AI에게 미래가 이미 알려져 있는 방대한 양의 데이터를 입력했습니다. AI가 현재 상황을 보고, 실제 세상에서 다음에 어떤 일이 일어났는지에 대한 요약과 함께 확신도(예: "이 검색이 답을 찾을 확률은 85%이다")를 작성하도록 강제했습니다.
  • 결과: AI는 단순히 추측하는 것을 멈추고, 원인과 결과에 대한 실제적인 내부 이해를 구축하기 시작했습니다. AI는 과업의 "물리학"을 배운 것입니다.

2단계: "시나리오 작가" (포맷 유도 SFT)

이제 AI는 미래를 예측하는 능력을 갖추었으므로, 이를 어떻게 보여줄지 배워야 합니다.

  • 비유: 조종사는 이제 비행하는 법을 알지만, 항공 관제사가 이해할 수 있도록 올바른 형식으로 비행 계획을 제출하는 법을 배워야 합니다.
  • 연구진이 한 일: 그들은 AI에게 따라야 할 특정 구조를 가르쳤습니다. 행동을 취하기 전에, AI는 "여기에 나의 예측 경로가 있고, 내가 찾고자 하는 키워드는 이것이며, 나의 확신도는 이 정도이다"라고 말하는 "세계 모델 블록(World Model Block)"을 출력해야 합니다.
  • 결과: AI는 자신의 내부 생각을 명확하게 언어화하고, 자신의 "상상"과 "행동"을 분리하는 법을 배웠습니다.

3단계: "스톱워치를 든 코치" (예측 조건부 강화 학습)

마지막으로, AI의 예측이 정직하고 유용한지 확인해야 했습니다.

  • 비유: 조종사를 지켜보는 코치를 상상해 보세요. 만약 조종사가 "허리케인 속에서도 착륙할 자신이 100% 있다"라고 말했는데 추락했다면, 코치는 벌점을 줍니다. 만약 조종사가 "50% 정도 확신하지만 시도해 보겠다"라고 말하고 안전하게 착륙했다면, 보상을 줍니다.
  • 연구진이 한 일: 그들은 두 가지를 확인하는 보상 시스템을 사용했습니다.
    1. 접지성(Grounding): AI가 예측한 것들이 실제로 일어났는가? (예를 들어, 특정 이름을 찾겠다고 예측했다면 실제로 찾았는가?)
    2. 교정(Calibration): AI의 확신도가 정확했는가? (예를 들어, "90% 확신한다"라고 말했는데 틀렸다면 벌점을 받았고, "50% 확신한다"라고 말했는데 맞았다면 보상을 받았습니다.)
  • 결과: AI는 불확실할 때는 겸손해지고, 확신이 있을 때는 자신감을 갖도록 학습되었습니다. AI는 터무니없는 추측을 멈추었습니다.

결과: 더 똑똑하고 안전한 에이전트

연구진은 이 새로운 훈련 방법을 두 가지 유형의 과업에 대해 테스트했습니다:

  1. 검색: 여러 조각의 정보를 찾아내야 하는 복잡한 질문에 대한 답을 찾는 것.
  2. 수학: 어려운 수학 문제를 푸는 것.

결과는 명확했습니다:

  • 이 3단계 방식으로 훈련된 AI는 표준 방식으로 훈련된 AI보다 이러한 문제를 해결하는 데 훨씬 뛰어났습니다.
  • 특히 다단계 추론(많은 단계가 필요한 과업)에서 뛰어난 성능을 보였습니다. 과정 중간에 길을 잃지 않았습니다.
  • 가장 중요한 점은, AI의 확신도 점수가 신뢰할 수 있게 되었다는 것입니다. AI가 "90% 확신한다"라고 말하면 대개 맞았습니다. "10%만 확신한다"라고 말하면 대개 어려움을 겪고 있거나 실수를 하기 직전이었습니다.

요약

이 논문은 단순히 AI에게 "앞을 내로다 보라"고 말한다고 해서 그것이 작동하는 것이 아님을 보여줍니다. 먼저 미래를 시뮬레이션하는 방법을 가르치고(1단계), 그다음 그 생각을 기록하는 방법을 가르치며(2단계), 마지막으로 자신이 얼마나 확신하는지에 대해 정직해지도록 훈련시켜야 합니다(3단계). 이렇게 함으로써, 그들은 단순히 세상에 반응하는 것이 아니라 인간처럼 실제로 미래를 계획하는 AI 에이전트를 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →