← 최신 논문
💻 computer science

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

본 논문은 모호한 인간의 지시와 장면 그래프를 PDDL 하위 목표로 변환하기 위해 새로운 강화 학습 알고리즘(TGPO)을 통해 훈련된 LLM을 활용하여, 로봇이 넓은 환경에서 복잡한 가사 작업을 수행하기 위한 최적의 계획을 생성할 수 있도록 하는 확장 가능한 장기 계획 프레임워크인 AHAT를 제안한다.

원저자: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 지저분한 방을 청소하는 법을 가르치려 한다고 상상해 보세요. 당신은 "양말을 집어 들고, 두 걸음 걷고, 몸을 굽혀라"와 같은 단계별 매뉴얼을 주고 싶지 않을 것입니다. 그것은 너무 지루하고 취약합니다. 만약 양말이 움직이기라도 하면 로봇은 혼란에 빠질 테니까요. 대신, 당신은 그저 "이 방을 깔끔하게 해줘"라고 말하고, 로봇이 나머지를 스스로 알아서 해결하게 만들고 싶을 것입니다. 이것이 바로 **로보틱스(robotics)**의 성배입니다. 즉, 모호한 인간의 바람을 완벽하고 물리적인 실행 계획으로 바꾸는 것입니다.

이를 위해 과학자들은 흔-히 두 가지 서로 다른 도구를 사용합니다. 첫 번째는 **대규모 언어 모델(LLM)**로, 이는 세상에 대한 수백만 가지 사실을 알고 있는 매우 똑똑하고 박식한 사서와 같지만, 때때로 이야기를 지어내거나 물리 법칙을 잊어버리기도 합니다. 두 번째는 **기호적 플래너(Symbolic Planner)**로, 이는 규칙을 완벽하게 따르는 엄격하고 타협 없는 수학 선생님과 같지만, "깔끔하게"가 무엇인지 모르거나 인간과 대화하는 법을 모릅니다. 큰 과제는 이 수다스러운 사서와 엄격한 수학 선생님이, 사서 때문에 로봇이 루프에 빠지거나 수학 선생님이 지시가 너무 모호하다는 이유로 시작을 거부하지 않도록 협력하게 만드는 것입니다.

이것이 바로 TGPO(Trace-Guided Policy Optimization, 추적 유도 정책 최 optimization)라는 새로운 논문에서 다루는 문제입니다. 연구진은 로봇이 어떻게 크고 모호한 인간의 명령을 로봇이 실제로 따를 수 있는 작고 검증 가능한 단계들로 분해하는지 가르치려 노력하고 있습니다. 그들은 단순히 똑똑한 AI에게 "그냥 해봐"라고 요청하는 것이 종종 서류상으로는 좋아 보이지만 실제 세계에서는 실패하는 계획을 만든다는 것을 발견했습니다. 대신, 그들은 AI가 자신의 사고 과정인 '트레이스(trace)'를 생성하도록 학습시키고, 실수를 할 때마다 조력자로부터 교정을 받고, 다시 시도하게 하는 영리한 훈련 방법을 개발했습니다. 이는 학생에게 단순히 결과 점수만 주는 것이 아니라, 숙제를 하는 동안 옆에서 과정을 함께하며 논리적 오류를 고쳐주고, 제대로 할 때까지 연습하게 하는 것과 같습니다. 그 결과, 이 시스템은 이전 방식들에 비해 특히 지시가 모호할 때, 긴 호흡의 복잡한 작업(예: 집 전체를 파티 준비 상태로 만들기)을 계획하는 데 훨씬 더 뛰어난 성능을 보였습니다.

문제점: 부러져 버리는 "마법 지팡이"

당신에게 로봇 집사가 있다고 상상해 보세요. 당신은 "축제를 열 예정이니 집을 치워줘"라고 말합니다. 인간은 이를 즉시 이해합니다. 쓰레기를 줍고, 테이블을 닦고, 어쩌면 장식을 배치해야 한다는 것을 알죠. 하지만 로봇에게 이것은 악몽입니다. 만약 표준 AI에게 그냥 "계획을 세워봐"라고 요청한다면, 그것은 환각(hallucination)을 일으킬 수 있습니다. 소파가 너무 무겁더라도 "소파를 주방으로 옮겨라"라고 하거나, "바닥을 청소하기 위해 가스레인지를 켜라"와 같이 끔찍한 아이디어를 낼 수도 있습니다.

논문에 따르면, 현재의 AI 모델들은 문장에서 다음에 올 단어를 예측하는 데는 뛰어나지만, 그들의 계획이 *실행 가능한지(feasible)*를 보장하는 데는 서툽니다. 그들은 초기에 작은 실수들을 저지르는데—예를 들어 테이블을 옮기기 전에 컵을 먼저 치우는 것을 잊는 식입니다—이 실수들은 카드 집처럼 쌓여 결국 전체 계획을 무너뜨립니다. 반면에 전통적인 로봇 플래너들은 매우 안전합니다. 불가능한 일은 하지 않죠. 하지만 그들은 매우 멍청하기도 합니다. 그들은 당신이 매우 구체적인 코드(PDDL이라 불리는)로 무엇을 해야 할지 정확히 알려주어야 하며, "파티를 위해 정리해라"라는 뉘앙스를 이해할 수 없습니다.

해결책: TGPO ( "추적 유도형" 코치)

저자들은 **TGPO(Trace-Guided Policy Optimization)**라고 불리는 새로운 로봇 훈련 방식을 제안합니다. TGPO를 단순히 추측하는 로봇이 아니라, 매우 엄격하면서도 도움이 되는 코치와 함께 배우는 학생이라고 생각해보세요.

훈련 방식은 다음과 같은 간단한 비유로 설명할 수 있습니다:

  1. 학생 (AI 정책): 로봇의 두뇌는 당신의 명령("파티를 위해 정리해줘")을 일련의 하위 목표들로 분해하려고 시도합니다. 예를 들어 "1. 쓰레기 줍기. 2. 설거지하기. 3. 진공청소기 돌리기"라고 말할 수 있습니다.
  2. 코치 (검증기): 엄격한 검사자가 이 목록을 살펴봅니다. 코치는 묻습니다. "잠깐, 싱크대에 음식물이 가득 차 있는데 설거지를 할 수 있어? 진공청소기를 돌리기 전에 의자를 옮기는 걸 잊지는 않았니?"
  3. "트레이스" 교정: 만약 학생의 계획이 틀렸다면, 코치는 단순히 "실패"라고 말하는 대신, 사고 과정(trace)을 살펴보고 특정 실수를 수정합니다. 코치는 "먼저 싱크대를 비우는 것을 잊었구나. 여기 수정된 단계들이 있다"라고 말할 수 있습니다.
  4. 연습 루프: 로봇은 이 수정된 목록을 가져가서 이를 바탕으로 나머지 계획을 생성하려고 시도합니다. 로봇은 단순히 최종적인 "합격/불합격" 성적표를 통해서가 아니라, 교정을 통해 학습합니다.

이는 오늘날 대부분의 AI가 훈련되는 방식과는 다릅니다. 보통은 AI에게 무언가를 시키고, 실패하면 그냥 "잘못했어"라고 말하고 다시 시도합니다. 이는 수학 시험을 보고 나서 어디가 틀렸는지 보여주는 빨간 펜 표시 없이 그냥 "낙제"를 받는 것과 같습니다. TGPO는 시험을 치르는 동안 빨간 펜의 도움을 받아, 제출하기 전에 논리를 수정할 수 있게 해주는 것과 같습니다.

결과: 로봇이 더 똑똑해지다

연구진은 이 새로운 방법을 단순한 "수건 가져와"부터, 가구를 옮기고 청소하고 특정 순서대로 정리해야 하는 매우 복잡한 "축제를 위해 집을 준비해"와 같은 작업까지 매우 다양한 작업에 테스트했습니다.

그들은 이 새로운 방식의 로봇을 두 가지 다른 유형의 플래너와 비교했습니다:

  • "프롬프팅(Prompting)" 로봇: 이들은 단순히 계획을 쓰도록 요청받은 AI 모델들입니다. 논문에 따르면, 작업이 더 어렵고 추상적으로 변할수록 이 로봇들은 처참하게 실패했습니다. 이들은 복잡함에 혼란을 느껴 불가능한 행동을 제안하곤 했습니다.
  • "표준 학습(Standard Learning)" 로봇: 이들은 표준 강화 학습(시행착오 방식)으로 훈련된 로봇들입니다. 프롬프팅 로봇보다는 나았지만, 지시가 모호하거나 작업이 매우 길어지면 여전히 어려움을 겪었습니다.

결과:
TGPO 로봇이 명확한 승자였습니다.

  • 쉬운 작업에서, 약 **88%**의 성공률을 보였습니다.
  • 복잡한 작업(긴 행동 체인)에서, **77%**의 성공률을 보였습니다.
  • 추상적인 작업(로봇이 "정리하기"의 의미를 추측해야 하는 작업)에서, **70%**의 성공률을 보였습니다.

반면, 가장 뛰어났던 "프롬프팅" 로봇은 동일한 추상적 작업에서 약 **22%**의 성공률만을 기록했습니다. 논문은 TGPO의 핵심이 자신의 사고 과정(trace)을 실시간으로 수정하는 능력에 있다고 시사합니다. 이 로봇은 단순히 추측하는 것이 아니라, 추론하고, 확인하고, 수정하고, 그 후에 행동합니다.

이것이 왜 중요한가

이 논문은 로봇에게 "검증 가능한 하위 목표"(작고 확인할 수 있는 단계들)를 생성하도록 가르치고, 사고 트레이스를 수정하는 시스템을 사용함으로써, 우리가 실세계에서 로봇을 훨씬 더 신뢰할 수 있게 만들 수 있음을 보여줍니다. 저자들은 환경이 지저분하거나 지시가 모호하더라도 이 방식이 작동한다는 점을 언급합니다.

하지만 저자들은 이것이 아직 모든 로봇 문제를 해결하는 마법 같은 해결책은 아니라는 점을 분명히 합니다. 이 시스템은 여전히 미리 정의된 세계의 지도(씬 그래프, scene graph)와 로봇이 알고 있는 규칙에 의존합니다. 카메라를 보는 것만으로 밑바닥부터 세상을 배우는 것이 아니라, 계획을 세우기 위해 구조화된 지도가 필요합니다. 그러나 인간의 말을 안전하고 실행 가능한 로봇 행동으로 바꾸는 특정한 작업에 있어서, TGPO는 큰 진전을 보여주며, 적절한 방식의 "코칭"이 있다면 AI가 스스로 할 때보다 훨씬 더 잘 계획할 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →