← 최신 논문
💻 computer science

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

이 논문은 시연으로부터 시공간적 제약 조건을 추출하기 위해 진화 탐색을 통합하고, 이를 진화적 PDDL 플래너 및 제약 실행 루프와 결래하여 LLM 기반 로봇이 개방형 환경에서 공식적인 보증을 갖춘 안전하고 실행 가능한 계획을 생성할 수 있도록 하는 뉴로-심볼릭 프레임워크인 EvoPlan을 소개한다.

원저자: Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

게시일 2026-07-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 로봇에게 복잡한 세상을 항해하는 법을 가르치려 한다고 상상해 보십시오. 예를 들어 공장의 배송 로봇이나 도시의 자율주행 자동차 같은 경우입니다. 당신에게는 이를 돕기 위한 두 가지 주요 도구가 있지만, 둘 다 중대한 결함이 있습니다.

  1. "창의적인 작가" (AI/LLM): 이 스마트한 AI는 당신의 지시("카페테리아로 가줘")를 읽고 영리한 계획을 세울 수 있습니다. 문맥을 이해하고 실수를 바로잡는 데 탁quent합니다. 문제점: 약간 무모합니다. 그럴듯해 보이지만 물리적으로 불가능한 계획을 내놓거나, 규칙에 대해 제대로 "생각"하지 못해 실수로 빨간불에 지나칠 수도 있습니다.
  2. "엄격한 회계사" (고전적 플래너): 이 시스템은 경직된 규칙 기반 시스템입니다. 오직 완벽하고 수학적인 세계 묘사가 주어졌을 때만 작동합니다. 문제점: 자연어를 이해하거나 스스로의 실수를 바로잡는 데 매우 서툽니다. 세상이 조금만 변해도 시스템은 멈춰버립니다.

EvoPlan은 이 두 세계의 장점을 결합한 새로운 프레임워크입니다. 이 시스템은 "창의적인 작가"를 사용하여 계획을 구상하고, "엄격한 회계사"를 사용하여 그 계획이 안전하고 실행 가능한지 확인합니다. 작동 방식은 다음과 같이 세 가지 간단한 단계로 나뉩니다.

1. "그림자 코치" (규칙 학습하기)

로봇이 움직이기 전, 시스템은 도로 혹은 공장 바닥의 "불문율"을 배워야 합니다.

  • 문제: 연구자들은 오직 좋은 행동(안전하게 운전하거나 예의 바르게 걷는 전문가의 영상)의 영상만을 가지고 있습니다. 로봇에게 무엇을 하지 말아야 하는지 보여줄 나쁜 행동의 영상은 없습니다.
  • 해결책: 시스템은 창의적인 글쓰기 코치처럼 행동합니다. 좋은 주행 영상을 가져온 뒤 AI에게 묻습니다: "만약 운전자가 속도를 높였다면? 만약 빨간불에 지나갔다면?" 이처럼 "나쁜" 시나리오(반사실적 상황)를 만들어 대조를 이룹니다.
  • 결과: "좋은" 영상과 발명된 "나쁜" 영상을 비교함으로써, 시스템은 하나의 보편적인 규칙집(STL 제약 조건)을 학습합니다. 이것은 로봇의 귀에 속삭이는 "그림자 코치"와 같습니다: "절대 X보다 빠르게 달리지 마라," 또는 "항상 사람으로부터 Y 미터 거리를 유지하라." 이 규칙집은 로봇의 모든 움직임에 적용됩니다.

2. "진화적 편집자" (계획 구축하기)

이제 로봇은 A 지점에서 B 지점까지 가는 계획을 세워야 합니다.

  • 과정: "창의적인 작가"(AI)가 계획 초안을 제안합니다. 하지만 시스템은 이를 그냥 받아들이는 대신 엄격한 편집 과정을 거칩니다.
  • 루프:
    1. AI가 계획 초안을 작성합니다.
    2. "검증기"(회계사)가 이를 검사합니다. 만약 계획이 잘못되었다면(예: "존재하지 않는 문을 열 수 없습니다"), 검증기는 특정 오류를 표시합니다.
    3. AI는 그 오류를 읽고, 그 특정 부분만을 수정하여 다시 시도합니다.
    4. 이 과정은 작가가 이야기가 완벽해질 때까지 다듬는 것처럼 반복됩니다.
  • 마법: 시스템은 이미 검증된 계획의 "좋은 부분"은 그대로 유지하고, 고장 난 부분만을 다시 작성합니다. 시간이 흐름에 따라 계획은 점점 더 길어지고 신뢰할 수 있게 되며, 마침내 완전히 유효한 상태가 됩니다.

3. "안전 문지기" (실시간 실행)

마지막으로, 로봇이 움직이기 시작합니다. 여기서 "그림자 코치"와 "안전 문지기"가 역할을 수행합니다.

  • 체크: 로봇은 계획을 맹목적으로 실행하지 않습니다. 로봇이 한 걸음을 내딛거나 바퀴를 돌리기 전에, 시스템은 해당 움직임을 1단계에서 학습한 규칙집과 대조합니다.
  • 안전망:
    • 시나리오 A: 로봇이 왼쪽으로 회전하려고 합니다. 문지기가 확인합니다: "거기에 보행자가 있는가? 속도가 안전한가?" 예. 로봇이 움직입니다.
    • 시나리오 B: 로봇이 왼쪽으로 회전하려고 합니다. 문지기가 확인합니다: "잠깐, 보행자가 너무 가깝다!" 아니오. 로봇은 즉시 멈춥니다.
  • 재계획: 문지기가 "아니오"라고 답하더라도 로봇은 충돌하지 않습니다. 로봇은 이미 수행한 안전한 단계들을 고정하고, 현재 위치를 업데이트한 뒤, "진화적 편집자"에게 남은 여정에 대한 새로운 계획을 써달라고 요청합니다.

이것이 중요한 이유

논문은 이 시스템이 AI 단독 혹은 규칙 단독 사용보다 더 효과적임을 보여줍니다.

  • 운전에서: 주행 데이터로 테스트했을 때, 시스템은 드라이버 AI를 재학습시키지 않고도 충돌과 신호 위반을 크게 줄였습니다. 단순히 "가드레일"을 추가하여 잘못된 움직임을 차단한 것입니다.
  • 내비게이션에서: 복잡한 오픈 월드 퍼즐(예: 집 안에서 물건 찾기)에서 테스트했을 때, 시스템은 명령에 사용된 단어가 로봇의 어휘와 완벽히 일치하지 않더라도 다른 AI 플래너들보다 더 많은 과제를 해결했습니다.

요약하자면: EvoPlan은 창의적이고 유연하게 행동하기 위해 AI를 사용하되, 위험한 행동을 하지 않도록 (데이터로부터 학습된) "안전 헬멧"과 (코드로 체크되는) "규칙집"을 반드시 착용하게 하는 로봇 계획 시스템입니다. 이는 마치 천재적이지만 충동적인 운전자가 매우 엄격하고 똑똑한 부조종사의 안내를 끊임없이 받는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →