← 최신 논문
💻 computer science

M3^3P-R1: Reinforcement Learning for Large Language Model Guided Multi-Modal Motion Planning via MIP Code Generation

이 논문은 복잡한 다중 모드 모션 플래닝 과업을 해결 가능한 변수, 제약 조건, 그리고 목적 함수로 분해함으로써 이를 강건하게 해결하기 위해 대규모 언어 모델을 실행 가능한 혼합 정수 계획법(MIP) 코드를 생성하도록 미세 조정하는 강화 학습 프레임워크인 M3^3P-R1을 제안한다.

원저자: Xingpeng Sun, Zherong Pan, Kai Cheng, Xindi Tang, Syed Talha Bukhari, Aniket Bera

게시일 2026-09-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xingpeng Sun, Zherong Pan, Kai Cheng, Xindi Tang, Syed Talha Bukhari, Aniket Bera

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 단순한 명령과 세상을 움직이는 복잡한 현실 사이의 간극을 메우는 데 오랫동안 어려움을 겪어왔습니다. 인간이 기계에게 "저 컵을 집어 들어"라고 요청할 때, 그 요청은 매우 간단해 보이지만 로봇에게는 무한한 변수가 얽힌 퍼즐입니다. 기계는 물체에 가까워지기 위해 다리를 어떻게 움직일지, 테이블에 부딪히지 않고 팔을 어떻게 구부릴지, 그리고 물체를 떨어뜨리지 않고 잡기 위해 손가락을 정확히 어디에 배치할지를 결정해야 합니다. 이러한 결정은 두 가지 서로 다른 언어로 이루어집니다. 즉, "여기로 가고, 그다음 이것을 해라"와 같은 이산적이고 단계적인 논리와, "공간 속을 부드럽게 이동하라"와 같은 연속적이고 유동적인 물리 법칙의 언어입니다. 수십 년 동안 엔지니어들은 이 두 언어를 동시에 구사할 수 있는 시스템을 구축하려 노력해 왔지만, 이 문제들을 동시에 해결하는 데 필요한 수학적 계산은 컴퓨터가 실시간으로 처리하기에는 너무 무겁거나, 새로운 상황에 적응하기에는 너무 경직되어 있는 경우가 많았습니다.

퍼듀 대학교의 연구진은 모든 가능한 시나리오에 대해 인간이 복잡한 수학적 규칙을 작성할 필요가 없도록 우회하는 다른 접근 방식을 취했습니다. 대신, 그들은 인간의 대화를 이해하는 데 탁월한 인공지능의 한 종류인 대규모 언어 모델(LLM)이 자연어 명령을 엄격한 수학적 계획으로 직접 변환하는 번역가 역할을 하도록 가르쳤습니다. 그들은 이 시스템을 M3P-R1이라고 부릅니다. AI가 단순히 답을 추측하거나 경로를 묘사하게 하는 대신, 이 시스템은 AI가 특수화된 수학적 솔버(solver)를 위한 지침 세트로서 실행 가능한 컴퓨터 코드를 작성하도록 강제합니다. 그러면 이 솔버는 로봇이 근육 하나 움직이기 전에 그 계획이 실제로 가능한지 확인하기 위해 물리 법칙 및 기하학적 법칙에 따라 계획을 검증합니다.

연구진은 단일 로봇 팔이 물체에 닿는 것부터 여러 대의 드론이 장애물을 피하며 대형을 유지하며 비행하는 것까지, 모든 범위를 아우르는 방대한 연습 문제 라이브러리를 만드는 것으로 시작했습니다. 그들은 AI가 복잡한 과업을 인간 엔지니어처럼 작고 관리 가능한 조각들로 분해하도록 가르쳤지만, 결정적인 차이점이 있었습니다. 바로 AI가 게임의 규칙을 정의하는 코드를 직접 작성해야 한다는 점입니다. 만약 과업이 건물을 돌아 드론을 비행시킨 후 움직이는 플랫폼에 착륙하는 것이라면, AI는 드론이 안전 구역 내에 머물고 적절한 시간에 플랫폼과 만날 수 있도록 하는 구체적인 수학적 제약 조건을 생성해야 했습니다. 이 시스템은 컴퓨터 자체가 교사 역할을 하는 방식으로 훈련되었습니다. AI가 코드를 작성할 때마다 수학적 솔버가 이를 실행해 보았고, 만약 코드가 깨졌거나 계획이 불가능하다면 시스템은 다시 시도하라는 명확한 신호를 받았습니다. 수천 번의 시도를 거치며, AI는 단순히 로봇 공학의 언어를 말하는 법뿐만 아니라 로봇을 움직이게 만드는 정밀한 수학적 구조를 구축하는 법을 배웠습니다.

훈련 결과는 놀라웠습니다. 다양한 과업에 대해 테스트했을 때, 로봇이 걷거나 드론이 비행하는 것과 같은 단일 모드 문제의 경우 약 92%의 성공률을 보였습니다. 로봇이 걷고 나서 물체를 잡거나, 두 대의 드론이 경로를 협력해야 하는 등 과업이 더 복잡해졌을 때도 성공률은 약 81%로 높게 유지되었습니다. 이는 훈련 데이터를 바탕으로 최선의 경로를 단순히 추측하는 방식에 의존했던 기존 방식들이 복잡한 과업에서 절반도 안 되는 성공률을 보였던 것과 비교하면 상당한 개선입니다. 연구진은 이러한 결과가 컴퓨터 시뮬레이션뿐만 아니라 실제 하드웨어로 계획을 전달함으로써 검증되었습니다. 그들은 물리적인 로봇 팔과 실제 드론에 시스템을 테스트했으며, 여기서 87.5%의 성공률을 달ol 성했습니다. 발생한 몇 안 되는 실패는 대부분 깨끗한 디지털 세계의 시뮬레이션과, 물체의 형태를 인식하는 로봇의 센서가 가진 미세한 부정확함과 같은 복잡한 현실 세계 사이의 차이 때문이었습니다.

이 연구가 차별화되는 점은 현실 세계의 불확실성을 다루는 방식에 있습니다. 기존 시스템은 종-종 특정 상황에 대한 규칙을 미리 프로그래밍하거나, 충돌이나 막다른 길로 이어질 수 있는 "시도하고 확인하는(try and see)" 방식을 사용했습니다. 하지만 이 새로운 방법은 AI가 행동하기 전에 전체 문제를 수학적으로 먼저 생각하도록 강제하여, 계획이 시작부터 끝까지 유효함을 보장합니다. 연구진은 AI가 단순히 특정 정답을 암기하는 것이 아니라, 훈련 중에 보았던 단순한 구성 요소들을 결합하여 이러한 계획을 만들어낸다는 것을 발견했습니다. 덕분에 AI는 드론에 부착된 로봇 팔과 같이 이전에 본 적 없는 새로운 조합의 과업도 높은 신뢰도로 처리할 수 있었습니다. 이 연구는 인공지능을 검증 가능한 수학적 도구에 기반하게 함으로써, 우리가 단순한 명령-응답 상호작용을 넘어, 예측 불가능한 물리적 세계의 도전 과제들을 헤쳐 나가면서도 인간 전문가와 같은 정밀도로 복잡한 다단계 지시를 이해하고 실행할 수 있는 미래로 나아갈 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →