← 최신 논문
🤖 AI

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

이 논문은 파운데이션 모델 에이전트의 sim-to-real 격차를 정형화하기 위해 통합된 마르코프 결정 과정(MDP) 프레임워크를 제안하며, 신뢰할 수 있는 실세계 배포를 위해 관측, 행동, 전이 및 보상의 불일치를 해소하고자 고전적 로보틱스 솔루션과 표준화된 벤치마크의 적용을 옹호한다.

원저자: Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 사람들의 일상적인 업무를 돕기 위해 천재적이고 초지능적인 로봇 비서를 훈련시키고 있다고 상상해 보십시오. 당신은 모든 것이 예상대로 작동하는 완벽하고 깨끗한 실험실에서 이 로봇을 가르칩니다. 실험실의 불은 항상 켜져 있고, 도구들은 항상 같은 자리에 있으며, 로봇에게 말을 거는 사람들은 항상 완벽하고 표준적인 영어를 사용합니다.

이 실험실에서 로봇은 천재입니다. 모든 테스트에서 100점을 받습니다.

하지만 당신은 이 로봇을 실제 세상으로 보냅니다. 갑자기 상황이 잘못되기 시작합니다. 사람들은 철자가 틀리거나 오타를 섞어 말하고, 로봇이 필요한 도구들은 때때로 느리거나 고장 나 있으며, 환경의 "규칙"은 엉망진창입니다. 실험실에서는 천재였던 로봇은 그럼에도 불구하고 처참하게 실패하기 시작합니다.

이 논문은 AI 커뮤니티가 현재 큰 실수를 저지르고 있다고 주장합니다. 우리는 이 로봇이 실제 세상에서 겪는 실패를 완전히 새롭고 신비로운 문제로 취급하고 있습니다. 저자들은 "바퀴를 다시 발명하는 일을 멈추라!"고 말합니다. 그들은 물리적 로봇을 만드는 엔지니어들이 이미 수십 년 동안 정확히 이와 동일한 문제를 해결해 왔다는 점을 지적합니다. 그들은 이를 "심투리얼 갭(Sim-to-Real Gap)"(시뮬레이션과 현실 사이의 간극)이라고 부릅니다.

이 논문은 이 간극을 이해하기 위한 단순하고 통일된 방법으로, **마르코프 결정 과정(MDP)**이라는 고전적인 프레임워크를 사용할 것을 제안합니다. MDP를 에이전트가 세상과 상호작용하는 방식에 대한 네 가지 부분의 체크리스트라고 생각하십시오. 저자들은 로봇이 이 네 가지 영역 중 하나(또는 모두)에서 불일치가 발생하기 때문에 실패한다고 말합니다.

1. 관측 (Observation: 로봇이 보고 듣는 것)

  • 실험실: 로봇은 명확하고 완벽한 영어 지시를 듣습니다.
  • 실제 세상: 사람들은 오타를 입력하거나, 속어를 사용하거나, 다른 언어(예: 힌디어 또는 이그보어)로 말합니다.
  • 비유: 요리사에게 채소가 완벽하게 밝은 초록색일 때만 채소를 썰도록 훈련시켰다고 상상해 보십시오. 실제 세상에서 채소는 약간 노란색이거나 흙이 묻어 있을 수 있습니다. 요리사는 채소가 여전히 채소임에도 불구하고, 모양이 "옳지 않다"는 이유로 썰기를 거부합니다.
  • 논문의 예시: 저자들은 만약 사용자가 중국어로 질문하면, 로봇이 의도는 완벽하게 이해할 수 있지만 값을 채울 때는 중국어 문자를 사용하려고 시도할 수 있음을 보여줍니다. 해당 양식의 컴퓨터 시스템은 영어 숫자만을 받아들입니다. 로봇은 똑똑하지만, "관측"을 "실행" 언어로 번역하는 데 실패한 것입니다.

2. 행동 (Action: 로봇이 하는 것)

  • 실험실: 로봇은 깔끔하고 짧은 목록에서 도구를 선택합니다. 모든 도구는 고유한 이름을 가지며 즉각적으로 작동합니다.
  • 실제 세상: 수천 개의 도구가 있으며, 이름이 매우 유사하여 혼동을 주는 경우가 많습니다. 어떤 도구들은 로딩이 느리거나, "방해 요소(distractors)"(진짜처럼 보이지만 고장 난 가짜 도구)가 존재하기도 합니다.
  • 비유: 실험실에서 로봇은 명확하게 라벨이 붙은 단 하나의 "드라이버"를 받습니다. 실제 세상에서 로봇은 50개의 드라이버가 들어 있는 공구함을 건네받는데, 그중 49개는 똑같이 생겼지만 사실은 플라스틱 소품이고 진짜 드라이버는 맨 밑바닥에 파묻혀 있습니다. 로봇은 혼란에 빠져 소품을 집어 듭니다.

3. 전이 (Transition: 로봇이 행동한 후에 일어나는 일)

  • 실험실: 로봇이 버튼을 클릭하면 결과가 즉시 완벽하게 나타납니다.
  • 실제 세상: 인터넷이 느립니다. 도구가 타임아웃되거나, 충돌하거나, 부분적인 답변만을 줄 수 있습니다.
  • 비유: 실험실에서 당신이 피자를 주문하면 테이블에 즉시 나타납니다. 실제 세상에서는 피자 가게가 문을 닫았거나, 배달원이 길을 잃었거나, 피자가 식은 채로 도착할 수 있습니다. 성공을 당연하게 기대하도록 훈련받은 로봇은 피자가 나타나지 않을 때 어떻게 해야 할지 몰라 당황하며, 다시 시도하는 대신 그저 패닉에 빠집니다.

4. 보상 (Reward: 로봇을 판단하는 기준)

  • 실험실: 정답을 맞히면 금색 별을 줍니다(정확도).
  • 실제 세상: 정답을 맞히는 것만으로는 충분하지 않습니다. 그것이 10초 걸렸습니까, 아니면 10분이 걸렸습니까? 비용이 0.01달러였습니까, 아니면 10달러였습니까?
  • 비유: 실험실에서는 로봇이 수학 문제를 풀었는지 여부만 중요합니다. 실제 세상에서는 문제를 푸는 데 수백만 달러짜리 슈퍼컴퓨터를 사용했는지, 혹은 푸는 데 1년이 걸렸는지도 중요합니다. 로봇은 "정답"을 맞혔을지 모르지만, 너무 비싸거나 너무 느리기 때문에 무용지물일 수 있습니다.

해결책: 새로운 훈련 체계

논문은 이러한 문제들을 별개의 이상한 문제로 취급하는 것을 멈추자고 제안합니다. 대신, 물리적 로봇 엔지니어들이 사용하는 것과 같은 "훈련 드릴"을 사용해야 합니다.

  • 무작위화(Randomization): 로봇을 완벽한 실험실에서만 훈련시키지 마십시오. 불이 깜빡거리고, 도구가 느리며, 지시에 오타가 있는 어수선한 실험실에서도 훈련시키십시오.
  • 스트레스 테스트(Stress Tests): 다양한 언어로 말하거나, 가짜 도구를 도입하거나, 인터넷 중단을 시뮬레이션함으로써 로봇을 고의로 고장 내려는 벤치마크를 만드십시오.
  • 통합된 어휘(Unified Vocabulary): AI 커뮤니티가 이러한 실패에 대해 이야기할 수 있는 동일한 언어를 제공하여, 우리가 더 나은, 더 신뢰할 수 있는 에이전트를 함께 구축할 수 있도록 하십시오.

요약하자면: 이 논문은 파운데이션 모델 에이전트(고급 챗봇과 같은)가 실제 세상에서 실패하는 이유가 그들이 "새롭거나" "마법 같은" 존재여서가 아니라, 물리적 로봇들이 수년 동안 겪어온 것과 동일한 문제들을 겪고 있기 때문이라고 주장합니다. 이 오래되고 검증된 해결책들을 새로운 AI 에이전트의 세계에 적용함으로써, 우리는 실험실을 떠나 예측 불가능하고 복잡한 우리의 삶 속으로 들어갔을 때 실제로 신뢰할 수 있는 시스템을 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →