← 최신 논문
💻 computer science

DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors

본 논문은 물리 AI 를 위한 효율적이고 파인튜닝이 필요 없는 비동기 실행을 가능하게 하기 위해 이산 확산 정책의 네이티브 언마스킹 능력을 활용하는 DiscreteRTC 라는 프레임워크를 제안하며, 이는 기존 흐름 기반 접근법과 비교하여 훨씬 높은 성공률과 더 낮은 추론 비용을 달성합니다.

원저자: Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 논문 "DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors"를 쉬운 언어와 일상적인 비유로 설명한 내용입니다.

큰 문제: "생각하기 vs 행동하기" 딜레마

컴퓨터와 테니스 경기를 하는 것처럼 빠른 템포의 비디오 게임을 한다고 상상해 보세요.

  • 로봇의 임무: 로봇은 공을 쳐야 합니다.
  • 문제: 로봇의 뇌 (AI) 는 완벽한 스윙을 계산하는 데 잠시 시간이 걸립니다. 로봇이 "생각"하는 동안 공은 계속 날아갑니다.
  • 옛 방식 (동기식): 로봇은 멈추고, 생각하며, 계산한 뒤 그리고 나서 스윙합니다. 스윙할 때가 되면 공은 이미 지나간 뒤입니다. 이는 역동적인 작업에 치명적입니다.
  • 더 나은 방식 (비동기식): 로봇은 이미 움직이고 있는 동안 생각해야 합니다. 마지막 생각에 기반하여 계속 스윙하면서도 다음 스윙을 계산해야 합니다.

현재 해결책: "실시간 청킹 (Real-Time Chunking, RTC)"

이를 해결하기 위해 엔지니어들은 **실시간 청킹 (RTC)**이라는 방법을 사용합니다.

  • 비유: 로봇이 한 번에 10 단어씩 조각으로 이야기를 쓴다고 상상해 보세요.
    1. 1~10 단어를 씁니다.
    2. 1120 단어를 쓰는 동안 110 단어를 실행하기 시작합니다.
    3. 결함: 로봇이 첫 번째 조각에서 두 번째 조각으로 전환할 때, 전환이 거칠 수 있습니다. 마치 작가가 문장 중간에 갑자기 필체를 바꾸는 것과 같습니다. 로봇은 새로운 계획이 이전 계획과 완벽하게 일치하지 않기 때문에 팔을 갑자기 뒤틀 수 있습니다.

이 거침을 해결하기 위해 현재 가장 좋은 방법 ( Flow-Matching 사용) 은 전환 구간을 "덮어 그리는" 시도를 합니다. 이미 쓴 단어를 고정하고 나머지 문장을 매끄럽게 만들기 위해 "인페인팅 (inpainting, 채우기)"을 시도합니다.

  • 단점: 이 "인페인팅"은 화가가 여전히 물감을 섞는 도중 그림을 고치라고 요청하는 것과 같습니다. AI 가 이전과 새로운 것을 어떻게 혼합할지 알려주는 특수하고 복잡한 가이드 (휴리스틱) 가 필요합니다. 이는 느리고, 추가 학습이 필요하며, 종종 어색하게 느껴집니다.

새로운 해결책: DiscreteRTC

저자들은 DiscreteRTC라는 새로운 방식을 제안합니다. 로봇의 "뇌" (정책) 를 **이산 확산 정책 (Discrete Diffusion Policy)**으로 교체합니다.

비유: "빈칸 채우기" 게임
로봇이 처음부터 이야기를 쓰는 것이 아니라, "빈칸 채우기" 게임 (매드 립스나 십자말풀이와 유사) 을 한다고 상상해 보세요.

  • 작동 원리: 로봇은 일부 단어가 가려진 (마스킹된) 문장을 보고 누락된 단어가 무엇인지 추측하도록 훈련받습니다.
  • 마법: 로봇이 이미 누락된 단어를 추측하는 데 능숙하기 때문에, 전환을 "인페인팅"하기 위한 특별한 기술을 배울 필요가 없습니다. 로봇은 태어날 때부터 해오던 대로 하면 됩니다.

논문에 따르면 이 새로운 방법이 게임 체인저인 이유는 다음과 같습니다.

1. 추가 학습 불필요 (파인튜닝 프리)

  • 옛 방식: 이미 훈련된 로봇에게 "전환 기술"이라는 특별한 기술을 가르쳐야 했으며, 이는 어렵고 위험했습니다.
  • 새 방식: 로봇은 이미 빈칸 채우기를 하도록 훈련되어 있습니다. 청크를 전환할 때 전환을 새로운 "빈칸 채우기" 퍼즐로 취급할 뿐입니다. 별도의 학습 없이 바로 완벽하게 작동합니다.

2. 자연스러운 안내 (복잡한 규칙 불필요)

  • 옛 방식: 엔지니어들은 AI 에게 이전과 새로운 행동을 어떻게 혼합할지 알려주기 위해 복잡하고 수동적인 규칙 (휴리스틱) 을 작성해야 했습니다. 마치 운전자에게 운전하는 법을 매뉴얼로 알려주는 것이지, 운전하게 내버려 두는 것이 아니었습니다.
  • 새 방식: 로봇은 전환을 자연스럽게 처리하는 법을 알고 있습니다. 새로운 청크의 앞부분 단어를 이미 파악했다면, 거기서 멈추고 다음 생각을 기다리기만 하면 됩니다. "마스킹 해제된" 단어들이 매뉴얼 없이도 다음 단계를 자연스럽게 안내합니다.

3. 빠르고 저렴함 (추론 비용 절감)

  • 옛 방식: "덮어 그리기" 방식은 로봇이 원래 계획을 계산하는 것 더하기 수정 작업을 두 배로 해야 하므로 느렸습니다.
  • 새 방식: 로봇은 아직 파악하지 못한 단어만 "마스킹 해제 (공개)"하면 되므로, 이미 완료한 작업을 건너뜁니다. 마치 책을 읽을 때 페이지를 넘길 때마다 전체 책을 다시 읽는 것이 아니라, 아직 보지 않은 페이지만 읽는 것과 같습니다.
    • 결과: 기존 방법보다 약 30% 빠릅니다 (계산량 0.7 배).

결과: 실제로 작동할까요?

저자들은 두 가지 방법으로 이를 테스트했습니다.

  1. 시뮬레이션 세계 (Kinetix): 움직이는 표적이 있는 디지털 놀이터.
    • 결과: 새로운 방식은 기존 방식보다 작업을 더 자주 해결했고, 지연을 훨씬 잘 처리했습니다.
  2. 실제 로봇 (실제 세계): 움직이는 물체를 집어 움직이는 플랫폼에 올려놓으려는 물리적 로봇 팔.
    • 결과: 기존 방식은 가장 어려운 움직이는 작업에서 완전히 실패했습니다 (성공률 0%). 반면 새로운 방식은 **95~100%**의 성공률을 보였습니다.
    • 속도: 새로운 방식은 실시간 실행에서도 더 빨랐습니다.

한 문장으로 요약

DiscreteRTC는 로봇이 움직이는 동안 생각할 수 있는 새로운 방식으로, 행동 계획을 "빈칸 채우기" 게임처럼 취급하여 기존에 어색했던 방식에 비해 자연스럽게 더 매끄럽고 빠르며 추가 학습이 전혀 필요하지 않게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →