← 최신 논문
💻 computer science

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

이 논문은 대규모 언어 모델을 활용하여 객체를 병합하거나 제거함으로써 작업별 장면 추상화를 자동으로 생성하고 동적으로 업데이트하는 플러그 앤 플레이 프레임워크인 LENS를 소개하며, 이를 통해 매우 복잡한 로봇 조작 환경에서 다양한 계획 및 제어 방법의 성능을 크게 향상시킵니다.

원저자: Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

게시일 2026-07-23
📖 5 분 읽기🧠 심층 분석

원저자: Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 어질러진 침실을 정리하려고 노력하는 모습을 상상해 보세요. 우리에게 어질러진 방은 그저 옷, 책, 장난감이 쌓여 있는 더미일 뿐입니다. 하지만 로봇의 뇌에게 그것은 공포스러운 수학적 폭발입니다. 모든 개별 물체는 잠재적인 장애물이자, 로봇이 부딪힐 수 있는 것, 혹은 로ks가 실수로 넘어뜨릴 수 있는 물건입니다. 로봇은 움직이는 방법을 알아내기 위해 모든 물체가 다른 모든 물체와 어떻게 상호작용하는지를 계산해야 합니다. 물건이 너무 많으면 수학적 계산이 너무 거대해져서, 마치 컴퓨터가 너무 큰 파일을 열려고 할 때처럼 로봇은 얼어붙어 버립니다. 이것이 바로 "클러터 문제(clutter problem)"이며, 로봇이 깨끗하고 텅 빈 실험실에서는 훌륭하게 작동하지만, 우리의 실제 지저분한 집에서는 도움을 주는 데 서툰 주요 이유입니다. 과학자들은 로봇에게 잡동사니를 무시하도록 가르치기 위해 노력해 왔지만, 대개 이는 특정 사물을 무시하도록 인간이 직접 프로그래밍해야 하며, 이는 상황이 변할 때 제대로 작동하지 않습니다.

여기 LENS(LLM-guided Environment Simplification, LLM 유도 환경 단순화)라는 새로운 아이디어가 있습니다. LENS를 로봇을 위한 아주 똑똑하고 마법 같은 안경이라고 생각해 보세요. 로봇이 이 난잡한 장면 전체에 대한 수학 문제를 풀려고 노력하는 대신, 이 안경을 쓰면 강력한 "두뇌"(거대 언어 모델)를 사용하여 장면을 보고 "이 특정 작업에 실제로 중요한 것이 무엇인가?"라고 묻습니다. 만약 로봇이 빨간 컵을 집어야 한다면, 이 안경은 "구석에 있는 빨래 더미는 무시하고, 책 세 권이 쌓인 것은 하나의 덩어리로 취급하라"고 말해줄 수 있습니다. 실시간으로 세상을 단순화함으로써, 로봇은 패닉에 빠지는 것을 멈추고 작업을 시작할 수 있습니다. 이 논문은 이 "스마트 안경" 접근 방식을 사용함으로써, 로봇이 기존의 전통적인 수학 기반 계획 방식이나 비디오를 보고 배우는 최신 AI를 사용하는 경우 모두에서 이전보다 훨씬 더 지저러진 방을 처리할 수 있음을 보여줍니다.

로봇의 악몽: 생각할 것이 너무 많음

엄청나게 많은 숙제가 쌓여 있을 때, 그 산 전체를 바라보느라 집중하기 어려운 경험을 해본 적이 있나요? 로봇도 똑같이 느낍니다. 로봇이 어질러진 방에서 물체를 움직이려 할 때, 로봇은 방 안에 있는 모든 것을 생각해야 합니다. 저 의자가 길을 막을까요? 저 장난감이 굴러갈까요? 만약 물체가 50개 있다면, 로봇은 충돌하지 않기 위해 수백만 번의 계산을 수행해야 합니다.

오랫동안 연구자들은 매우 깨끗하고 정리된 방에서만 작동하는 로봇을 만드는 방식으로 이 문제를 해결하려 했습니다. 하지만 그것은 현실이 아닙니다. 현실은 지저분합니다. 로봇이 지저러진 방에 놓이면 혼란에 빠집니다. 로봇의 "시야"는 복잡해지고, "두뇌"는 과부하가 걸립니다. 로봇은 작업과 관련도 없는 장난감을 움직이려 하거나, 수학이 너무 어려워 얼어붙어 버릴 수도 있습니다. 문제는 로봇이 멍청해서가 아니라, 한 번에 너무 많은 일을 하려고 하기 때문입니다.

해결책: 마법의 필터

이 논문의 저자인 펜실베이니아 대학교의 에일린 리오(Aileen Liao)와 그녀의 팀은 LENS라는 영리한 해결책을 고안했습니다. 로봇을 더 똑똑하게 만드는 대신, 그들은 로봇을 위한 세상을 더 작게 만들기로 결정했습니다.

당신이 비디오 게임을 하고 있는데, 화면에 캐릭터와 아이템이 너무 많아서 목표를 볼 수 없다고 상상해 보세요. 당신은 중요하지 않은 것들을 흐릿하게 만드는 필터를 씌웁니다. 갑자기 경로가 명확하게 보입니다. LENS는 로봇에게 정확히 그 역할을 합니다. 시각-언어 모델(Vision-Language Model)이라는 특수한 종류의 AI를 사용하여 장면을 살펴보고 무엇을 남기고 무엇을 버릴지 결정합니다.

LENS는 장면을 단순화하기 위해 두 가지 주요 작업을 수행합니다:

  1. 가지치기 (버리기): 만약 어떤 물체가 멀리 떨어져 있거나 작업과 아무런 관련이 없다면, LENS는 로봇에게 그것이 존재하지 않는 것처럼 행동하라고 지시합니다. 예를 들어, 로로봇이 초록색 블록을 옮겨야 한다면, LENS는 "구석에 있는 파란 공은 무시하라"고 말할 수 있습니다.
  2. 병합 (하나로 합치기): 때때로 책 더미처럼 물체들이 붙어 있는 경우가 있습니다. LENS는 각 책을 별개의 문제로 다루는 대신, 책들을 로봇의 마음속에서 하나로 붙여 하나의 커다란 물체로 취급합니다. 이렇게 하면 수학적 계산이 훨씬 쉬워집니다.

작동 방식: "시도, 실패, 수정" 루프

정말 멋진 부분은 이겁니다. LENS는 단 한 번의 필터링이 아닙니다. 그것은 루프(순환)입니다. 로봇은 단순화된 뷰를 가지고 작업을 시도합니다. 만약 실패한다면(예를 들어, 책 더 더미를 옮기려다 책들이 흩어져 버린 경우), 로봇은 "이봐, 그건 안 됐어!"라는 메시지를 "마법의 두뇌"로 보냅니다. 그러면 두뇌는 장면을 다시 살펴보고, 자신이 실수를 했다는 것(아마도 버려야 할 것을 버리지 못했거나, 합쳐야 할 것을 합치지 못한 것)을 깨닫고 필터를 업데이트합니다. 이것은 마치 사람이 퍼즐을 풀다가 조각이 잘못된 위치에 있다는 것을 깨닫고 다시 시도하는 것과 같습니다.

연구진은 이를 세 가지 방식으로 테스트했습니다:

  • 계획 (Planning): 논리를 사용하여 단계를 결정하는 고전적인 계획 시스템과 함께 사용했습니다.
  • 제어 (Control): 로봇의 근육을 실시간으로 제어하는 시스템과 함께 사용했습니다.
  • 학습 (Learning): 비디오를 통해 학습하는 현대적인 AI(시각-언어-행동 모델)와 함께 사용했습니다.

연구 결과

결과는 매우 인상적이었습니다. 실험에서 LENS를 가진 로봇들은 LENS가 없는 로봇들보다 지저러진 방을 훨씬 더 잘 처리했습니다.

  • 속도: 방 안의 물체 수가 증가할 때, LENS가 없는 로봇들은 점점 느려졌습니다. 물체가 7개일 때, LEND가 없는 로봇들은 무엇을 할지 결정하는 데 4,000초(한 시간 이상!)가 걸렸습니다. 반면 LENS를 가진 로봇들은 물체의 수와 상관없이 약 40초에서 135초 사이의 빠른 속도를 유지했습니다.
  • 성공률: 지저러진 방에서 LENS가 없는 로봇들은 자주 완전히 실패했습니다. LENS를 사용하면 훨씬 더 자주 성공했습니다. 예를 들어, 로봇이 초록색 그릇을 빨간 접시로 옮겨야 하는 테스트에서, LENS가 없는 로봇은 길을 가로막는 다른 그릇들 때문에 혼란을 겪었습니다. LENS를 가진 로봇은 나머지 그릇들을 무시하고 작업을 완수했습니다.
  • 실제 로봇: 연구진은 컴퓨터 시뮬레이션뿐만 아니라 실제 물리적인 로봇에서도 이를 테스트했습니다. 로봇들은 복잡한 물체들 사이로 물체를 밀고 지나가거나 봉제 인형을 집어 올리는 등, 방해 요소들을 성공적으로 무시하며 작업을 수행했습니다.

이것이 왜 중요한가

이 논문은 우리가 현실 세계를 다루기 위해 반드시 더 "똑똑한" 로봇을 만들 필요는 없다는 점을 시사합니다. 대신, 우리는 로봇에게 사물을 더 잘 무시하는 법을 가르칠 수 있습니다. 로봇에게 수행 중인 작업에 따라 세상을 동적으로 단순화하는 방법을 알려줌으로써, 우리는 로봇을 우리의 지저러진 집에서 훨씬 더 유용하게 만들 수 있습니다. 이것은 마치 훌륭한 선생님이 학생에게 교과서 전체를 통째로 암기하게 하는 대신, 수업의 가장 중요한 부분에 집중할 수 있도록 도와주는 것과 같습니다.

저자들은 이것이 아직 완벽한 해결책은 아니라고 신중하게 밝히고 있습니다. 때때로 로봇은 여전히 실수를 하며, "마법의 두뇌"는 필터를 제대로 설정하기 위해 몇 번의 시도가 더 필요할 수도 있습니다. 하지만 이것은 거대한 진전입니다. 시각 및 언어 이해 능력과 장면을 단순화하는 능력을 결합함으로써, 우리는 실험실에서 작동하는 로봇과 우리의 일상생활에서 실제로 도움을 줄 수 있는 로봇 사이의 간극을 메울 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →