← 최신 논문
🤖 machine learning

DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation

DISC 프레임워크는 지시사항으로부터 직접 작업별 정책 매개변수를 생성하는 하이퍼네트워크를 사용하여 언어 기반 조작에서 관찰 누출을 제거함으로써 언어 그라운딩과 시각 상태 처리를 구조적으로 분리하고, 얽힌 베이스라인 및 대규모 사전 학습 모델에 비해 우수한 성능과 일반화를 달성합니다.

원저자: Hanxiang Ren, Pei Zhou, Xunzhe Zhou, Yanchao Yang

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hanxiang Ren, Pei Zhou, Xunzhe Zhou, Yanchao Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

DISC: 정책 생성을 통한 상태 조건 제어와 명령어 분리에 대한 설명을 간단한 언어와 창의적인 비유로 풀어보겠습니다.

큰 문제: "속임수"를 쓰는 로봇

로봇에게 요리하는 법을 가르친다고 상상해 보세요. 로봇에게 두 가지 정보를 제공합니다:

  1. 레시피 (명령어): "프라이팬을 가스레인지 위에 올려라."
  2. 시각 (관측): 가스레인지, 프라이팬, 접시가 있는 부엌을 보여주는 카메라 영상.

대부분의 현재 로봇들은 "뇌"가 레시피와 카메라 영상을 동시에 처리하여, 이를 거대한 데이터의 국물처럼 섞어버립니다. 이 논문은 이를 **"작업 - 상태 얽힘 (Task-State Entanglement)"**이라고 부릅니다.

속임수 코드:
로봇이 훈련 데이터에서 가스레인지와 프라이팬을 함께 보는 경우가 너무 많기 때문에, 로봇은 지름길을 배우게 됩니다. 로봇은 레시피를 읽는 것을 멈추고 그냥 그림만 봅니다.

  • 상황: "프라이팬을 가스레인지 위에 올려라"라고 말하면, 로봇은 그림에서 가스레인지와 프라이팬을 보므로 그곳에 프라이팬을 올려놓습니다.
  • 함정: 이제 "프라이팬을 접시 위에 올려라"라고 말하면, 로봇은 여전히 그림에서 가스레인지와 프라이팬을 봅니다. 로봇은 말을 무시하고 그림에만 반응하도록 학습했기 때문에, 여전히 프라이팬을 가스레인지 위에 올리려 하거나 혼란을 겪을 수 있습니다. 왜냐하면 로봇은 실제로 당신의 구체적인 명령어를 듣는 법을 배운 적이 없기 때문입니다. 로봇은 언어에 기반한 것이 아니라 시각적 장면에서 답을 "유출"해낸 것입니다.

해결책: DISC ("맞춤 정장" 제작자)

저자들은 로봇의 뇌를 만드는 새로운 방식을 제안하는데, 이를 DISC라고 부릅니다. 레시피와 시야를 섞는 대신, 완전히 분리합니다.

DISC 를 일괄 생산 유니폼이 아닌 맞춤 정장 재봉사로 생각하세요.

  1. 재봉사 (하이퍼네트워크): 이는 오직 당신의 목소리 (명령어) 만 듣는 특수한 AI 입니다. 이 AI 는 부엌을 보지 않습니다. 오직 "프라이팬을 가스레인지 위에 올려라"라는 말을 듣고, 그 정확한 작업을 위해 새로고 고유한 뇌를 직조하는 것만이 임무입니다.
  2. 정장 (생성된 정책): 재봉사가 직조를 마치면, 당신에게 맞춤 뇌 (수학적 가중치 집합) 를 건네줍니다. 이 뇌는 이제 "가스레인지 작업용 뇌"라는 것을 내재적으로 알고 있도록 "하드웨어적으로 연결"된 상태입니다.
  3. 착용자 (로봇): 로봇은 이 맞춤 뇌를 착용합니다. 이제 로봇은 부엌 (시야) 을 보고 행동합니다. 결정적으로, 로봇은 더 이상 당신의 목소리를 들을 수 없습니다. 로봇은 받은 맞춤 뇌에 기반하여만 행동할 수 있습니다.

이것이 속임수를 막는 이유:
로봇의 뇌가 당신의 말로부터 완전히 만들어졌기 때문에, 로봇은 당신을 듣는 것 외에는 다른 선택지가 없습니다. 로봇은 그림을 보고 무엇을 해야 할지 추측할 수 없습니다. 그림이 뇌와 직접 대화할 수 없기 때문입니다. 로봇이 무엇을 해야 하는지 아는 유일한 방법은 당신의 말이 로봇의 뇌를 만들었기 때문입니다.

"맞춤 뇌"를 만드는 방법 (2 단계 프로세스)

단어 한 문장만으로 뇌 전체를 새로 만드는 것은 어렵습니다. 컴퓨터에게 "이 문장을 위한 뇌를 만들어라"라고만 요청하면, 엉망으로 깨진 뇌를 만들 수도 있습니다.

DISC 는 2 단계 구축으로 이를 해결합니다:

  1. 초안 (가중치 초기화): 재봉사가 단어에 기반하여 대략적인 정장을 빠르게 스케치합니다. 이는 올바른 모양에 가깝습니다 (예: 청소 작업이 아닌 요리 작업임을 앎). 하지만 단추 위치가 잘못될 수 있습니다.
  2. 재봉 (반복적 정제): 이것이 이 논문의 기발한 트릭입니다. 재봉사는 단순히 추측하지 않습니다. 대신 정장을 어떻게 고치는지에 대한 "정신적 시뮬레이션"을 사용합니다. 그들은 초안을 보고 무엇이 잘못되었는지 상상한 뒤, 작고 정밀한 조정을 가합니다. 이를 매우 빠르게 반복하여 정장이 완벽하게 맞을 때까지 진행합니다.
    • 참고: 그들은 실제 훈련의 느리고 무거운 수학을 수행하지 않고도 이를 수행합니다. 그들은 많은 예시를 관찰하여 정장을 고치는 법을 배웠기 때문에, 머릿속에서 즉시 수행할 수 있습니다.

실험에서 무슨 일이 일어났나요?

저자들은 컴퓨터 시뮬레이션 내의 로봇과 실제 로봇 팔에서 이를 테스트했습니다.

  • "시각적 함정" 테스트: 로봇이 빨간 사과를 들고 특정 그릇 (작은 회색, 큰 빨간색, 또는 밝은 회색) 에 넣어야 하는 까다로운 테스트를 만들었습니다. 시각적 장면은 매번 동일했지만, 말만 바뀌었습니다.
    • 구형 로봇: 혼란을 겪었습니다. 사과와 그릇들을 보았지만, 시각적 지름길에 의존했기 때문에 사과를 잘못된 그릇에 넣거나 멈추는 경우가 많았습니다.
    • DISC: 거의 매번 올바르게 수행했습니다. 그 뇌가 "빨간 사과 -> 작은 회색 그릇"을 위해 특별히 만들어졌기 때문에, 시각적 혼란을 무시하고 명령어를 따랐습니다.
  • 학습 속도: 새로운 작업에 대한 몇 가지 예시 (1 회 또는 3 회 시도) 만 주어졌을 때, DISC 는 구형 로봇보다 훨씬 빠르게 학습했습니다. 이는 그 "재봉사"가 이미 작업의 일반적인 모양을 알고 있었기 때문에 처음부터 배우는 대신 정장을 약간만 수정하면 되었기 때문입니다.
  • 복잡성: 작업이 복잡해질수록 (예: "가스레인지 켜고, 그 위에 프라이팬 올려라"), DISC 는 다른 로봇들보다 더 잘 수행했습니다. "속임수"를 쓰는 로봇들은 긴 작업에서 위치를 잃어 크게 실패한 반면, DISC 는 궤도를 유지했습니다.

요약

이 논문은 현재 로봇들이 자신이 보는 것에 기반한 추측을 너무 잘하기 때문에, 구체적인 명령어를 따르는 데는 부족하다고 주장합니다.

DISC는 아키텍처를 변경함으로써 이를 수정합니다:

  • 구식 방식: 말과 그림을 섞음 \rightarrow 로봇은 말을 무시하고 그림에서 추측하도록 학습함.
  • DISC 방식: 말을 사용하여 맞춤 뇌를 구축 \rightarrow 로봇은 그 뇌를 사용하여 그림을 봄.

로봇이 명령어만으로 "작업 특화 뇌"를 스스로 구축하도록 강제함으로써, 로봇이 단순히 장면의 반응이 아니라 실제로 당신이 시킨 일을 이해하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →