← 최신 논문
🤖 AI

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

이 논문은 체화된 에이전트가 실행 정지(execution stalls)를 감지했을 때 전략을 적응적으로 전환하여 장기 과업의 성공률과 효율성을 높일 수 있도록, 다중 모드 계획 정책(multimodal planning policies)의 다양한 아카이브를 발견하고 유지하는 품질-다양성(Quality-Diversity) 최적화 프레임워크를 제안한다.

원저자: Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 거대하고 지저ка로운 집 안을 탐색하며 특정 물건을 찾아 친구에게 가져다주는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 어떻게 주변을 살피고, 다음 행동을 결정하며, 팔을 움직일지에 대한 일련의 지침, 즉 레시피를 제공합니다. 이것이 바로 **체화된 AI(Embodied AI)**의 세계입니다. 이곳에서 컴퓨터 프로그램은 단순히 생각만 하는 것이 아니라 물리적 또는 시뮬레이션된 환경 속에서 실제로 행동합니다. 보통 우리는 대규모 언어 모델(LLM)—방대한 양의 텍스트로 학습된 매우 똑똑한 컴퓨터 뇌—에 의존하여 로봇의 두뇌 역할을 맡깁니다. 이 모델들은 자신이 보고 읽은 것을 바탕으로 다음에 무엇을 할지 결정하는 데 탁월합니다. 하지만 문제가 하나 있습니다. 만약 로봇이 루프(loop)에 빠져서, 예를 들어 이미 열려 있는 문을 계속 열려고 하거나 제자리에서 뱅뱅 도는 것과 같은 상황이 발생하면, 로봇은 다른 결과를 기대하며 똑같은 행동을 계속 반복하곤 합니다. 이는 마치 길을 잃은 사람이 아는 방법이 그것뿐이라서 계속 같은 방향으로 걷는 것과 같습니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 이 디지털 탐험가들이 현재의 전략이 작동하지 않는다는 것을 깨닫고, 완전히 다른 방식으로 생각하도록 가르칠 수 있을까?

"품질-다양성 최적화를 통한 멀티모달 체화된 에이전트의 다양한 계획 정책 발견(Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization)"이라는 제목의 이 논문은 바로 그 문제를 다룹니다. 저자들인 난징 정보기술대학교 연구팀은 해결책이 로봇의 단 하나의 '최선'의 계획을 더 똑똑하게 만드는 것이 아니라고 제안합니다. 대신, 그들은 로봇에게 선택할 수 있는 다양한 전략이 담긴 배낭을 주는 방식을 제안합니다. 그들은 품질-다양성(Quality-Diversity, QD) 최적화라는 방법을 사용하는데, 이는 단순히 하나의 완벽한 행동을 찾는 것이 아니라, 많은 다양한 유형의 성공적인 행동들을 찾아내는 보물찾기와 같습니다.

이 시스템이 어떻게 작동하는지 재미있는 비유를 통해 설명하겠습니다. 로봇이 물건을 배달하기 위해 산맥을 넘으려는 등산객이라고 상상해 보세요. 대부분의 로봇은 단 하나의 등산 스타일, 즉 "항상 오르막길을 걷고 가장 가파른 경로를 찾는다"라는 스타일로 훈련됩니다. 만약 등산객이 절벽이나 늪지에 부딪히면, 그들은 계속 절벽을 오르려 하거나 늪을 헤치려 하며 시간을 허비하고 에너지를 낭비하게 됩니다. 이 논문은 하나의 스타일 대신, **등산 스타일의 라이브러리(도서관)**를 만드는 것을 제 제안합니다. 어떤 등산객은 모든 구석을 확인하는 "탐험가"일 수도 있고, 다른 이는 목표를 향해 돌진하는 "직진 러너"일 수도 있으며, 또 다른 이는 매 걸음을 신중히 테스트하는 "조심스러운 등반가"일 수도 있습니다.

연구진은 이 라이브러리를 만들고 사용하는 2단계 시스템을 구축했습니다:

  1. 오프라인 단계 (라이브러리 생성): 로봇이 실제 임무를 수행하기 전, 컴퓨터는 수천 번의 시뮬레이션을 실행합니다. 컴퓨터는 로봇이 생각하는 방식에 대한 기본적인 "레시피"를 가져와서, 마치 케이크 레시피의 재료를 바꾸는 미친 과학자처럼 그 구성 요소들을 섞고 조합하기 시작합니다. 어떤 레시피는 로봇을 매우 수다스럽고 신중하게 만들고(높은 "상호작용 강도"), 어떤 레시피는 매우 집중력 있고 빠르게 만듭니다(높한 "목표 지향성"). 컴퓨터는 이 레시피들을 ThreeDWorld라는 3D 환경(시뮬레이션 세계)에서 테스트합니다. 컴퓨터는 단 하나의 최고의 레시피만을 유지하는 것이 아니라, 모든 서로 다른 스타일에 적합한 최고의 레시피를 유지합니다. 만약 "신중한" 스타일이 특정 상황에서 잘 작동한다면, 그것은 라이브러리의 특별한 슬롯에 저장됩니다. 만약 "빠른" 스타일이 다른 상황에서 잘 작동한다면, 그것 역시 저장됩니다. 이를 통해 다양한 전략의 아카이브(기록 보관소)가 만들어지며, 각 전략에는 그 특징이 태그로 붙습니다.

  2. 온라인 단계 (실제 임무): 이제 로봇이 실제 과업을 수행하러 갑니다. 로봇은 라이브러리에서 하나의 전략을 골라 움직이기 시작합니다. 이 시스템에는 내장된 "정체 감지기(stall detector)"가 있습니다. 마치 코치가 로봇을 지켜보고 있는 것과 같습니다. 만약 로봇이 목표에 가까워지지 못한 채 10단계 동안 똑같은 행동을 반복한다면(예: 원을 그리며 걷기), 코치는 "멈춰! 그 전략은 효과가 없어!"라고 외칩니다. 시스템은 로봇이 계속 실패하게 두는 대신, 마지막 안전했던 순간(체크포인트)으로 돌아가는 되감기 버튼을 누릅니다. 그런 다음 라이브러리를 살펴보고, 방금 실패했던 것과는 완전히 다른 전략을 선택합니다. 만약 로봇이 너무 신중했다면, 시스템은 "직진 러너" 스타일로 전환할 수 있습니다. 이를 통해 로봇은 루프에서 벗어나 즉시 새로운 접근 방식을 시도할 수 있습니다.

이 접근 방식의 결과는 꽤 유망했습니다. 로봇이 시뮬레이션된 집 안에서 물건을 운반해야 하는 테스트에서, 연구팀은 이 "라이브러리" 방식이 단 하나의 고정된 스타일을 사용하거나 ReAct 또는 Tree-of-Thoughts와 같은 다른 일반적인 방법들을 사용하는 로봇보다 훨씬 더 낫다는 것을 발견했습니다. 구체적으로, "음식(Food)" 과업(음식 아이템 이동)에서 이들의 방법은 표준 베이스라인의 33% 성공률에 비해 **51%**의 성공률을 기록했습니다. "물건(Stuff)" 과업(일반 물체 이동)에서는 베이스라인의 24% 대비 **43%**의 성공률을 달ian했습니다. 더욱 인상적인 점은, 일부 고급 방법들보다 더 적은 "토큰"(컴퓨터가 얼마나 많이 "생각"하고 대화했는지를 나타내는 척도)을 사용하면서도 이를 달성했다는 것입니다.

연구진은 이 아이디어를 다른 종류의 과업에도 테스트했습니다: 로봇이 집 안을 걸어 다니라는 음성 지시를 따라가는 시각적 내비게이션 게임입니다. 비록 로봇이 물건을 운반하는 것이 아니라 단순히 걷는 것이었지만, 동일한 "라이브러리" 기술이 더 자주 성공하는 데 도움을 주었습니다(성공률이 **35.2%**에서 **37.3%**로 향상됨). 이는 다양한 전략을 보유하는 것이 로봇이 막혔을 때 회복하는 데 도움이 되는 일반적인 방법임을 시사합니다.

저자들은 자신들이 로봇의 지능 문제를 영원히 "해결"한 것은 아니라는 점을 분명히 합니다. 대신, 그들의 실험은 다양한 사전 제작된 전략을 보유하는 것이 실제 세계의 무질서하고 예측 불가능한 과업을 다루는 강력한 방법임을 시사한다고 말합니다. 그들은 현재 로봇의 가장 큰 약점은 충분히 똑똑하게 생각하지 못해서가 아니라, 현재의 계획이 작동하지 않을 때 자신의 생각을 바꾸기를 너무나 고집스럽게 거부한다는 것이라고 주장합니다. 로봇에게 다양한 행동 방식이 담긴 "도구 상자"를 제공함으로써, 로봇은 즉각적으로 적응하여 잠재적인 실패를 성공적인 배달로 바꿀 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →