← 최신 논문
⚡ electrical engineering

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

이 논문은 사전 학습된 시각-언어 모델을 활용하여 자연어를 접지된 바운딩 박스 목표로 변환함으로써, 특정 작업에 대한 학습 없이도 실제 로봇에서 73.3%의 성공률로 제로샷 오픈 보캐블러리 테이블탑 조작을 가능하게 하는 신경-기호적 계획 프레임워크인 GRASP를 소개한다.

원저자: Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

게시일 2026-06-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 테이블 위에 놓인 로봇 팔을 가지고 있고, 특정 물건을 집어서 특정 장소에 가져다 놓으려고 한다고 상상해 보세요. 보통 로봇을 프로그래밍하는 것은 강아지에게 복잡한 기술을 가르치는 것과 같습니다. 수천 번 동안 정확히 무엇을 해야 하는지 보여주거나, "왼쪽으로 5인치, 위로 2인치 이동"과 같이 매우 경직되고 지루한 명령을 내려야 합니다. 만약 당신이 "빨간 물건들을 맨 위 선반에 놓아줘"와 같이 새로운 말을 하면, 로봇은 그 정확한 명령을 본 적이 없기 때문에 종종 혼란에 빠집니다.

이 논문은 GRASP(Grounded Reasoning and Symbolic Planning)라고 불리는 새로운 시스템을 소개합니다. 이 시스템은 로봇을 위한 스마트한 번역기이자 GPS 역할을 합니다. 이를 통해 로로봇은 새로운 작업마다 다시 학습할 필요 없이 자연어를 이해하고 어떻게 움직여야 할지 스스로 파악할 수 있습니다.

작동 방식은 다음과 같이 간단한 단계로 나뉩니다.

1. "번역기" (두뇌)

당신이 로봇에게 "파란색 물체들을 모두 맨 위 선반에 놓아줘"라고 말하면, 시스템은 단순히 단어를 듣는 것이 아니라 그것을 하나의 지도로 번역합니다.

  • 비유: 사람이 관광객에게 길을 알려주는 것을 생각해 보세요. "좌표 X, Y로 가세요"라고 말하는 대신, "파란색 건물을 찾아서 위층으로 가세요"라고 말하는 것과 같습니다.
  • GRASP의 방식: 이 시스템은 강력한 AI(대규모 언형 모델, LLM)를 사용하여 당신의 문장을 "목표" 목록으로 변환합니다. "파란색 물체"가 무엇인지 파악하고, "맨 위 선반"을 화면상의 특정 영역으로 정의합니다. 즉, 수행해야 할 일에 대한 디지털 체크리스트를 만드는 것입니다.

2. "눈" (시각)

목표를 알게 된 후, 로봇은 물체를 찾아야 합니다.

  • 비유: 지저한 방 안에서 열쇠를 찾는 상황을 상상해 보세요. 당신은 모든 물건을 무작위로 훑어보는 것이 아니라, 열쇠의 모양과 색깔을 보고 찾습니다.
  • GRASP의 방식: 이 시스템은 이미 수천 가지 사물을 인식하도록 훈련된 특화된 "눈"(GroundingDINO라는 컴퓨터 비전 모델)을 사용합니다. 테이블을 스캔하여 당신의 설명과 일치하는 물체 주변에 보이지 않는 상자를 그립니다 (예: 파란색 병 주변에 상자를 그림).

3. "스티어링 휠" (제어)

이 부분이 가장 독특한 부분입니다. 로봇은 물체를 잡기 위해 복잡한 경로를 암기하는 대신, 단순하고 연속적인 피드백 루프를 사용합니다.

  • 비유: "더 높이, 더 낮게(Hot and Cold)" 게임을 하거나 움직이는 목표물을 카메라로 조준하는 것을 생각해 보세요. 당신은 목표를 맞히기 위해 한 번에 정확한 수학적 계산을 하지 않습니다. 대신, 목표가 어디 있는지 보고, 조금 더 가까이 이동하고, 다시 보고, 조금 더 이동합니다. 당신이 목표 바로 위에 올 때까지 계속해서 조정합니다.
  • GRSA의 방식: 로봇은 화면상에 나타난 물체 주변의 "상자"를 관찰합니다. 만약 상자가 시야의 중심에서 왼쪽에 있다면, 로봇은 팔을 약간 왼쪽으로 움직입니다. 만약 상자가 너무 작다면(물체가 멀리 있다는 의미), 로봇은 더 가까이 다가갑니다. 로봇은 물체가 자신의 "그리퍼(집게)" 정중앙에 올 때까지 이 과정을 반복하며 끊임없이 경로를 수정합니다.

왜 특별한가요?

대부분의 고급 로봇 시스템은 새로운 작업을 배우기 위해 수년 동안의 훈련(수천 번의 연습 시도)이 필요한 헤비급 운동선수와 같습니다. 또한 실행 속도가 느리고 비용이 많이 듭니다.

GRASP는 가볍고 적응력이 뛰어난 등산객과 같습니다.

  • 학습 불필요: 이 시스템은 특정 작업을 위해 따로 연습할 필요가 없습니다. 만약 당신이 "자홍색 마커"나 "연두색 가위"를 집으라고 요청한다면, 이미 훈련된 "눈"과 "번역기"를 사용하여 즉석에서 문제를 해결합니다.
  • 강력한 내구성: 위치를 계속 확인하기 때문에("Hot and Cold" 루프), 물체가 약간 움직이거나 카메라 각도가 완벽하지 않더라도 이를 처리할 수 있습니다. 단순히 추측하고 운에 맡기는 것이 아니라, 실시간으로 스스로를 수정합니다.

결과

연구진은 쉬운 작업(큰 블록 집기)부터 어려운 작업(드라이버 같은 작고 까다로운 물건 집기)까지 다양한 난이도로 이 시스템을 테스트했습니다.

  • 성공률: 로봇은 전체적으로 약 73%의 확률로 올바른 물체를 잡는 데 성공했습니다.
  • 실패 원인: 주로 "눈"이 물체를 명확하게 보지 못했을 때(예: 너무 멀리 있거나 조명이 나쁠 때) 문제가 발생했으며, 이는 로봇의 "두뇌"가 잘못된 지시를 내렸기 때문이 아니었습니다.

요약

GRASP는 당신이 인간처럼 로봇에게 말을 걸 수 있게 해주는 시스템이며, 로봇은 AI 번역연속적인 시각적 교정을 결합하여 물체를 잡는 법을 스스로 알아냅니다. 이 시스템은 무거운 훈련이나 경직된 프로그래밍의 필요성을 건너뛰어, 테이블 위의 물건을 분류하는 것과 같은 일상적인 작업에서 훨씬 더 유연한 도구가 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →