← 최신 논문
💻 computer science

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

본 논문은 추가적인 데이터 수집 없이도 시각-언어-행동 모델의 지시 이행 능력을 크게 향착시키기 위해, 시각-언어 모델을 활용하여 로봇 데이터셋을 증강할 반사실적 레이블을 생성하는 방법론인 CAST를 제안한다.

원저자: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 집 안을 돌아다니거나 물건을 집는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 로봇이 복도를 따라 걷다가 오른쪽으로 도는 영상을 보여줍니다. 그리고 로봇에게 "이것이 '직진하라'는 것이 어떤 모습인지 알려주는 거야"라고 말합니다.

문제는 로봇이 조금 게으른 학생이라는 점입니다. 로봇은 영상 속에서 복도가 보일 때마다 로봇이 오른쪽으로 도는 것을 발견합니다. 그래서 로봇은 지름길을 학습해 버립니다. "복도가 보이면, 오른쪽으로 돈다." 로봇은 당신의 구체적인 지시(예: "파란 테이블에서 왼쪽으로 돌아")를 듣는 것을 멈춥니다. 왜냐하면 복도 사진이 자신에게 필요한 모든 것을 알려준다고 생각하기 때문입니다. 이 논문의 기술적 용어로는 이를 "사후 확률 붕괴(posterior collapse)"라고 부릅니다. 즉, 로봇이 당신의 목소리를 무시하고 보이는 것에 근거해 추측해 버리는 현상입니다.

CAST 솔루션: "만약에?" 게임

UC 버클리와 프린스턴 연구진은 이를 해결하기 위한 영리한 트릭을 고안해 냈습니다. 그들은 이를 CAST(Counterfactual Labels Improve Instruction Following, 반사실적 레이블을 통한 지시 이행 개선)라고 부릅니다.

CAST를 로봇을 위한 창의적 글쓰기 코치라고 생각해 보세요. 코치는 로봇에게 실제로 취했던 단 하나의 경로만을 보여주는 대신, 로봇에게 "만약에?" 게임을 하도록 요청합니다.

작동 방식은 다음과 같습니다:

  1. 원래 장면: 로봇이 복도를 따라 걷고 있는 영상이 있습니다.
  2. "만약에?" 질문: 연구진은 매우 똑똑한 AI(시각-언어 모델)를 사용하여 그 동일한 복도를 보게 한 뒤 묻습니다. "이봐, 여기서 로봇이 할 수 있었던 다른 행동은 무엇이었을까?"
    • 원래: "직진하라."
    • 반사실적 상황 (만 if): "주황색 테이블에서 오른쪽으로 돌아라" 또는 "왼쪽 벽을 따라 이동하라."
  3. 경로 발명: AI는 단순히 문장만 만들어내는 것이 아니라, 그 새로운 문장에 어울리는 가짜 영상 경로도 함께 만들어냅니다. AI는 "좋아, 만약 로봇이 주황색 테이블에서 오른쪽으로 돌았다면, 다음 몇 초 동안의 모습은 어떻게 보였을까?"라고 상상합니다.
  4. 새로운 레슨: 이제 로봇은 정확히 같은 복도에 대해 두 가지 레슨을 받게 됩니다.
    • 레슨 A: "직진하라" (실제 영상).
    • 레슨 B: "주황색 테이블에서 오른쪽으로 돌아라" (만들어진 영상).

이것이 모든 것을 어떻게 바꾸는가

이 트릭을 사용하기 전, 로봇은 복도를 보고 "이건 알지! 오른쪽으로 돌면 돼!"라고 생각했습니다. 로봇은 당신의 말을 들을 필요가 없었습니다.

CAST 트릭을 적용한 후, 로봇은 같은 복도를 보면서도 이렇게 깨닫습니다. "잠깐, 어떤 때는 직진하기도 하고, 어떤 때는 주황색 테이블에서 오른쪽으로 돌기도 하네. 사진만으로는 무엇을 해야 할지 알 수 없어. 나는 어떤 경로를 택할지 알기 위해 반드시 당신의 구체적인 말을 들어야 해."

결과

연구진은 이 실험을 두 가지 유형의 로봇을 대상으로 테스트했습니다:

  • 내비게이션 로봇: 실내외를 돌아다니는 로봇.
  • 매니퓰레이션(조작) 로봇: 브로콜리나 숟가락 같은 물건을 집는 로봇 팔.

연구진은 새로운 실제 영상을 수집할 필요 없이, 이 "만약에?" 데이터를 사용하는 것만으로도 로봇이 지시를 따르는 능력이 훨씬 좋아졌다는 것을 발견했습니다.

  • 내비게이션 작업에서, 이 트릭 없이 훈련된 로봇에 비해 성공률이 두 배 높아졌습니다.
  • 매니퓰레이션 작업(주변에 방해되는 물체가 있는 상황에서 물건을 집는 작업 등)에서는 27% 개선되었습니다.

핵론

CAST는 로봇에게 "평행 우주"의 도서관을 제공하는 것과 같습니다. 동일한 장면이 지시에 따라 얼마나 다양한 결과를 낳을 수 있는지 보여줌으로써, 로봇이 추측하는 것을 멈추고 경청하게 만듭니다. 이는 로봇을 단순히 "보고 추측하는" 존재에서 진정으로 "듣고 행동하는" 존재로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →