← 최신 논문
💻 computer science

Learning Communication-Conditioned Generative Policies for Decentralized Multi-Agent Collision Avoidance

본 논문은 중앙 집중식 계획 없이도 시뮬레이션과 실세계 시나리오 모두에서 전문가 수준의 성능과 강건한 일반화 성능을 달ermo하기 위해, 특권 있는 오프라인 데이터를 통해 학습된 플로우 매칭 정책(flow-matching policies)을 사용하여 학습된 잠재 의도 교환을 통한 다중 에이전트 충돌 회피를 가능하게 하는 분산형, 통신 조건부 생성 프레임워크를 제안한다.

원저자: Prajwal Koirala, Mark Campbell

게시일 2026-09-16
📖 5 분 읽기🧠 심층 분석

원저자: Prajwal Koirala, Mark Campbell

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기계와 사람이 함께 움직이는 혼잡한 공간—분주한 창고 바닥이든, 도시의 거리든, 혹은 하늘 위든—에서 안전은 단순하지만 어려운 진실에 달려 있습니다. 즉, 모든 움직이는 물체는 다른 물체가 다음에 무엇을 할지 추측해야 한다는 것입니다. 수십 년 동안 엔지니어들은 자동차의 교통 법규처럼 로봇이 어떻게 반응해야 하는지에 대한 엄격한 규칙을 작성하여 이 문제를 해결하려 노력해 왔습니다. 이러한 규칙은 모두가 동일한 대본을 따르고 환경이 예측 가능할 때는 잘 작동합니다. 하지만 현실 세계에서 군중은 무질서하며, 로봇은 종종 주변의 모든 것을 보지 못할 수도 있습니다. 벽에 가로막히거나, 센서가 빠르게 움직이는 동료를 포착하지 못할 수도 있습니다. 로봇이 전체 그림을 볼 수 없을 때, 로봇은 자신의 제한된 시야에 의존해야 하며, 중앙 컴퓨터가 모두에게 지시를 내리지 않고는 충돌을 피하기 어렵게 만듭니다. 중앙의 통제 없이 많은 독립적인 기계들이 안전하게 함께 움직이도록 만드는 이 과제는 로봇 공학의 근본적인 문제입니다.

코넬 대학교의 연구팀은 이러한 군중 속을 항해하는 법을 배우는 새로운 방법을 개발했습니다. 엄격한 규칙을 프로그래밍하는 대신, 그들은 로봇 그룹이 경험을 통해 학습하도록 가르쳤는데, 구체적으로는 모든 것을 볼 수 있는 '특권적인(privileged)' 전문가를 관찰하는 방식입니다. 핵심적인 혁신은 로봇들이 서로 대화하는 법을 배웠다는 점인데, 이는 말이나 표준 무선 신호를 사용하는 것이 아닙니다. 대신, 그들은 의도를 요약하는 보이지 않는 추상적인 메시지를 교환하는 법을 배웠습니다. 이러한 숨겨진 메시지를 로로컬(local) 시야와 결합함으로써, 로봇들은 다른 이들이 어떻게 움직일지 예측하고 충돌을 피하기 위해 자신의 경로를 조정하는 법을 배웠습니다. 그 결과, 각 로봇이 스스로 행동하면서도, 설령 연결이 끊기거나 노이즈가 발생하더라도 집단과 조화를 이루며 움직이는 시스템이 탄생했습니다.

연구진은 네 대의 로봇이 있는 디지털 훈련장을 만드는 것으로 시작했습니다. 그들은 시뮬레이션 내의 모든 로봇의 정확한 위치와 속도에 접근할 수 있는 강력한 컴퓨터 프로그램을 사용하여 이 공간을 완벽하게 항해하게 했습니다. 이 '전문가'는 모든 에이전트의 미래를 알고 있었기에 충돌하지 않았습니다. 연구진은 그다음 이 새로운, 더 단순한 로봇들에게 이 전문가의 행동으로부터 배우라고 요청했습니다. 하지만 여기에는 함정이 있었습니다. 새로운 로봇들은 세상을 전체적으로 볼 수 없었습니다. 그들은 어둡거나 혼잡한 방 안에서처럼, 오직 자신의 위치와 가장 가까운 이웃의 정보만을 볼 수 있었습니다. 이 간극을 메우기 위해 연구진은 로봇들이 서로 짧고 압축된 신호를 보낼 수 있는 방법을 제공했습니다. 이 신호들은 미리 프로그래밍된 것이 아니라, 로봇들이 충돌을 피하기 위해 어떤 정보를 공유하는 것이 유용한지를 스스로 찾아내야 했습니다.

학습 과정은 이해와 행동이라는 두 단계의 춤처럼 작동했습니다. 첫째, 로봇들은 자신의 로컬 관측치를 자신의 '의도(intent)', 즉 본질적으로 다음에 무엇을 할 계획인지에 대한 아주 작은 메시지로 압축하는 법을 배웠습니다. 그런 다음 이 메시지들을 주변 로봇들과 공유했습니다. 둘째, 각 로봇은 받은 메시지를 자신의 로컬 시야와 결합하여 짧은 이동 계획을 생성했습니다. 로봇은 단 하나의 회전이나 속도를 결정하는 대신, 향후 몇 초간의 움직임 시퀀스를 상상했습니다. 그러고 나서 그 시퀀스 중 첫 번째 움직임을 실행하고, 즉시 새로운 정보에 기반하여 다음 몇 초간의 계획을 다시 세우기 시작했습니다. 이 연속적인 순환 덕분에 로봇들은 군중의 변화에 즉각적으로 반응하며 유연성을 유지할 수 있었습니다.

이 접근 방식이 특히 영리한 점은 로봇들이 소통하는 법을 배운 방식에 있습니다. 연구진은 로봇들에게 무엇을 말해야 할지 알려주지 않았습니다. 대신, 로봇들은 충돌을 피하기 위해 자신들의 미래 경로에 대한 특정한 종류의 숨겨진 정보를 공유해야 한다는 것을 발견했습니다. 또한, 이 시스템은 로봇들이 메시지 없이도 순수하게 자신의 로컬 관측치만으로 작동할 수 있도록 설계되었습니다. 이 설계 덕분에 통신 링크가 끊어지더라도 로봇들은 멈추거나 충돌하지 않고, 단순히 독립적으로 행동하며 자신들이 세운 계획에 의존하게 됩니다. 연구진은 이 시스템이 매우 견고하다는 것을 발견했습니다. 로봇들이 서로 대화하는 능력을 최대 75%의 시간 동안 상실하도록 시뮬레이션했음에도 불구하고, 그들은 여로 충돌 없이 목표에 도달했습니다. 로봇들은 방금 전까지 세워두었던 계획에 의지하여 움직임을 부드럽고 안전하게 유지했습니다.

연구팀은 네 대, 여섯 대, 여덟 대의 로봇 그룹을 대상으로 시뮬레이션 테스트를 진행했습니다. 놀랍게도, 그들은 오직 네 대의 그룹에 대해서만 시스템을 훈련시켰음에도 불구하고, 추가 훈련 없이 로봇을 더 많이 투입했을 때도 동일하게 잘 작동했습니다. 이는 로봇들이 특정 네 명의 에이전트를 위한 패턴을 암기한 것이 아니라, 군중 항해의 일반적인 원리를 배웠음을 시사합니다. 시뮬레이션에서 로봇들은 네 명의 에이전트가 있는 협력적 시나리오에서 거의 97%의 성공률을 달ol 달성했으며, 그룹 규모가 두 배로 늘어나도 높은 성공률을 유지했습니다. 또한 일부 로봇이 이기적으로 설정되어 다른 이들을 무시하도록 프로그램된 경우에도 잘 작동하여, 시스템이 협력적 행동과 비협력적 행동이 섞인 상황을 처리할 수 있음을 보여주었습니다.

이것이 단순한 컴퓨터상의 트릭이 아님을 증명하기 위해, 연구진은 디지털 세계에서 완전히 훈련된 소프트웨어를 실제 실험실의 네 대의 작은 물리적 로봇에 설치했습니다. 그들은 코드를 수정하거나 실세계에 맞춰 재훈련하지 않았습니다. 고유의 센서와 프로세서를 갖춘 물리적 로봇들은 좁은 공간에서 서로의 경로를 가로지르며 위치를 바꾸어야 했습니다. 실제 세상의 노이즈와 불완전함에도 불구하고, 로봇들은 서로를 피하며 목적지에 도달하는 데 성공했습니다. 이러한 '제로샷 전이(zero-shot transfer)', 즉 시뮬레이션 훈련 직후 실세계에서 즉시 작동하는 능력은 중요한 진전입니다. 이는 로봇들이 단순히 디지털 환경의 세부 사항을 외운 것이 아니라, 안전한 상호작용의 근본적인 논리를 진정으로 학습했음을 입증합니다.

이 연구는 또한 이 학습 방법의 독특한 특징인 '조정 수준의 제어 능력'을 밝혀냈습니다. 로봇들은 자신의 관측치와 타인의 메시지를 혼합하여 움직임을 생성하도록 학습되었기 때문에, 연구진은 로봇들이 그룹의 신호에 얼마나 많은 비중을 둘지 조절할 수 있었습니다. 간단한 다이얼을 돌림으로써, 로봇들이 서로를 무시하고 완전히 독립적으로 행동하게 하거나, 서로를 정교하게 헤치며 나아가는 고도로 조화된 방식으로 움직이게 할 수 있었습니다. 이러한 유연성은 조용한 방에서 로봇이 자유롭게 움직이는 상황부터, 지속적인 통신이 필수적인 혼란스러운 군중 속 상황까지 다양한 상황에 적응할 수 있음을 시사합니다.

연구진은 이 접근 방식이 자율 시스템에 새로운 길을 제시한다고 주장합니다. 전통적인 방식은 복잡하고 손으로 직접 쓴 규칙에 의존하거나 교통을 관리하는 중앙 컴퓨터를 필요로 하는 경우가 많으며, 이는 취약하고 느릴 수 있습니다. 예측 시퀀스를 생성하고 학습된 추상적 신호를 통해 소통하는 생성 모델을 사용함으로써, 로봇들은 새 떼나 물고 떼처럼 행동하게 됩니다. 여기서 복잡한 집단 행동은 단순한 국소적 상호작용으로부터 나타납니다. 이 연구는 기계가 공유된 언어나 중앙 집중식 두뇌 없이도 서로의 의도를 이해하는 법을 배울 수 있음을 보여주며, 우리가 공유하는 공간에서 더 안전하고 효율적인 로봇 함대를 운용할 수 있는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →