← 최신 논문
🤖 AI

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS 는 대비적 표현을 활용하여 오프라인 궤적에서 내재적 목표-수행 가능성 인식을 학습하도록 사전 훈련을 목표 조건부 강화 학습으로 재구성하는 비전-언어-행동 기반 모델로, 이를 통해 전통적인 행동 복제보다 장기적, 접촉이 풍부한, 그리고 제로샷 작업에서 로봇 성능을 획기적으로 향상시킵니다.

원저자: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

게시일 2026-05-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 집안일을 가르친다고 상상해 보세요. 대부분의 현재 로봇은 모방을 통해 학습합니다. 인간이 어떤 작업 (예: 컵을 집어 올리기) 을 수행하는 영상을 보고, 그들이 보는 정확한 움직임을 복사하려 합니다. 이는 학생이 춤 동작을 외워서 암기하는 것과 같습니다. 음악이 바뀌거나 조명이 꺼지거나, 무용수가 다른 위치로 이동하면, 학생은 혼란을 느껴 춤을 멈춥니다. 그들은 어떻게 움직여야 하는지는 알지만, 왜 움직이는지, 혹은 어디로 가고 있는지는 진정으로 이해하지 못합니다.

이 논문은 PRTS(Primitive Reasoning and Tasking System, 원시 추론 및 작업 시스템) 라는 새로운 유형의 로봇 두뇌를 소개합니다. 이는 단순히 움직임을 복사하는 대신, 목표진행 상황을 이해하도록 학습합니다.

간단한 비유를 사용하여 작동 방식을 다음과 같이 설명합니다:

1. 문제: "기억만 하는 로봇"

현재의 로봇은 대본을 외운 배우와 같습니다. 대본에 "빨간 컵을 집어 올리라"고 쓰여 있으면, 그들은 그렇게 합니다. 하지만 "파란 컵을 집어 올리라"고 요청하면 (파란 컵을 본 적이 있더라도) 또는 컵이 이상한 곳에 있으면, 그들은 종종 실패합니다. 그들은 방향감이 부족합니다. 목표에 가까워지고 있는지, 아니면 멀어지고 있는지 알지 못합니다.

2. 해결책: "나침반" (대비 강화 학습)

PRTS 는 로봇의 두뇌에 "나침반"을 추가합니다. 이는 대비 강화 학습(Contrastive Reinforcement Learning) 이라는 기술을 사용합니다.

  • 비유: 캠프파이어 (목표) 를 찾으려 어두운 숲속에 있다고 상상해 보세요.
    • 구형 로봇: 그들은 지난번에 걸어온 경로만 기억합니다. 나무들이 움직이면 길을 잃습니다.
    • PRTS: 그들은 "이걸로 한 걸음 내디디면, 불꽃에 가까워지는가?"라고 묻는 법을 배웁니다. 매 단계마다 "잘했다!"라고 알려주는 지도나 교사가 필요하지 않습니다. 대신, 두 가지를 비교하며 학습합니다:
      1. "이 행동을 하면, 목표 방향으로 가고 있는 것처럼 보이는가?" (예/좋음).
      2. "이 다른 행동을 하면, 다른 목표 방향으로 가고 있는 것처럼 보이는가?" (아니요/나쁨).

이를 수백만 번 반복함으로써 로봇은 언어로 주어진 특정 목표에 도달할 확률에 따라 모든 행동에 점수를 매기는 내부 지도를 구축합니다.

3. 마법 같은 트릭: 두 가지를 동시에 수행

보통 로봇에게 "목표를 이해하는 법"을 가르치고 "팔을 움직이는 법"을 가르치는 것은 별도의 수업입니다. 먼저 두뇌를 가르치고, 그 다음 근육을 가르칩니다. 이는 느리고 비용이 많이 듭니다.

PRTS 는 한 번의 수업에서 동시에 두 가지를 학습하기 때문에 영리합니다.

  • 비유: 학생이 한 장의 종이에 에세이 (행동) 를 쓰고 동시에 수학 문제 (목표) 를 풀어야 하는 시험을 치른다고 상상해 보세요.
  • PRTS 는 로봇의 입력부에 두 개의 작고 보이지 않는 "스티커 메모"를 추가함으로써 이를 수행합니다. 한 메모는 행동을 추적하고, 다른 하나는 목표를 추적합니다.
  • 로봇의 두뇌는 전체 장면을 처리하고 행동을 작성하면서 동시에 "수학 문제"를 확인합니다 (이 행동이 목표를 향해 가고 있는가?). 속도를 늦추지 않습니다. 이 방식은 매우 효율적이어서 이전의 더 단순한 방법과 거의 동일한 컴퓨터 성능 비용으로 작동합니다.

4. 결과: "생각할 수 있는" 로봇

저자들은 시뮬레이션과 실제 로봇 (두 팔과 한 팔) 에서 PRTS 를 테스트했습니다. 다음과 같은 결과가 나왔습니다:

  • "장기적" 테스트: "차 만들기" (물 끓이기, 컵 가져오기, 차 넣기 등) 와 같은 긴 작업 연쇄를 수행하라고 요청했을 때, PRTS 는 중간에 길을 잃지 않았습니다. 여전히 길을 잘 가고 있는지 확인하기 위해 "나침반"을 계속 확인했습니다.
  • "새로운 지시" 테스트: 훈련된 빨간 블록 대신 "파란 블록을 집어 올리라"고 로봇에게 말하면, 그들은 즉시 알아냅니다. 그들은 단순히 "X 위치의 물체를 잡는다"는 것을 외운 것이 아니라, "'파란'이라는 단어와 일치하는 물체를 잡는다"는 것을 이해했습니다.
  • "인간 방해" 테스트: 이것이 가장 인상적인 부분입니다. 로봇이 테이블 위에 블록을 놓으려 할 때, 인간이 블록을 낚아채 다른 곳에 다시 놓는다고 상상해 보세요.
    • 구형 로봇: 그들은 혼란을 느껴, 블록이 있었던 곳에 놓으려 하거나 그냥 멈춥니다.
    • PRTS: 그들은 즉시 "아, 목표는 여전히 '블록을 테이블 위에 놓는 것'이지만, 블록이 움직였구나. 다시 가서 가져와야겠다"라고 깨닫습니다. 그들은 인간처럼 회복하여 작업을 완료합니다.

요약

PRTS 는 단순히 "복사"하는 것을 멈추고 "추론"하기 시작하는 로봇 두뇌입니다. "이 단계가 내가 하라고 요청된 일에 가까워지게 하는가?"라고 끊임없이 묻는 방식으로 목표 (단어) 와 행동을 연결하는 법을 배웁니다.

이러한 "방향감"을 방대한 양의 데이터를 통해 처음부터 학습하기 때문에, 이전의 로봇들보다 새로운 상황, 긴 작업, 그리고 실수를 처리하는 데 훨씬 능숙해집니다. 이는 로봇을 무심한 모방자에서 목표 지향적인 조력자로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →