← 최신 논문
🤖 AI

SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models

이 논문은 추가적인 학습이나 검증기 없이도 기존의 테스트 단계 스케일링 방법들을 능가하며, 시각적 인지와 행동 실행 모두를 동적으로 적응시키기 위해 자기 불확실성(self-uncertainty)을 활용하여 시각-언어-행동 모델을 위한 학습이 필요 없는 단일 패스 추론 전략인 SCALE을 소개한다.

원저자: Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

게시일 2026-06-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 저녁 식사 요리를 가르치고 있다고 상상해 보세요. 당신은 로봇에게 레시피(언어 지시)를 주고 주방의 모습(시각적 입력)을 보여줍니다. 로봇은 다음 행동을 결정해야 합니다: 칼을 잡을지, 양파를 썰지, 아니면 가스레인지를 켤지 말입니다.

현재의 로봇 두뇌(이를 **시각-언어-행동 모델(Vision-Language-Action models)**이라 부릅니다)는 똑똑하지만, 한 가지 결함이 있습니다. 바로 너무 경직되어 있다는 점입니다. 일단 결정을 내리면, 설령 혼란스러운 상황이라도 그것을 고수합니다. 만약 로봇이 토마토처럼 보이는 빨간 피망을 보고, 실수로 잘못된 것을 집어 요리를 망치게 되더라도, 로봇은 "나는 내가 무엇을 하고 있는지 정확히 알고 있다"라고 자신 있게 주장하며 계속 밀고 나갑니다.

이 논문은 SCALE(Self-uncertainty Conditioned Adaptive Looking and Execution)이라는 새로운 방법을 소개합니다. SCALE은 로봇에게 언제 대담하게 행동하고 언제 신중해야 하는지를 알려주는 '직감' 측정기를 달아주는 것과 같습니다.

SCALE의 작동 원리는 다음과 같습니다. 이해하기 쉽게 몇 가지 개념으로 나누었습니다.

1. 문제점: "자신만만한 바보"

오늘날 대부분의 로봇은 시험을 치르는 학생처럼 행동합니다. 답을 찍어놓고는, 중간에 자신이 틀렸다는 것을 깨닫더라도 답을 바꾸기를 거부하는 학생 말입니다.

  • 고정된 시각 (Fixed Vision): 그들은 항상 동일한 "집중도"로 세상을 바라봅니다. 만약 주의를 분산시키는 물체(디스트랙터)에 정신이 팔리면, 정작 필요한 재료를 놓칠 수 있습니다.
  • 고정된 행동 (Fixed Action): 그들은 즉시 가장 가능성 높은 단 하나의 행동을 선택합니다. 확신이 없는 상태에서도 일단 하나를 골라 운에 맡깁니다.

2. 해결책: "자기 불확실성" 측정기

SCALE은 로봇에게 행동하기 전 아주 간단한 질문을 던집니다: "지금 나는 얼마나 확신하고 있는가?"

이 방식은 로봇의 작업을 확인하기 위해 인간 선생님이나 두 번째 로봇을 필요로 하지 않습니다. 로봇은 자신의 내부 수학적 수치(로그/logits)를 살펴보고 스스로의 확신도를 측정합니다.

  • 높은 확신 (낮은 불확실성): 로봇은 저 빨간 것이 토마토라고 확신합니다. 레이저 빔처럼 초점을 좁혀 빠르고 직접적으로 행동합니다.
  • 낮은 확신 (높은 불확실성): 로봇은 두 개의 빨간 물체를 보고 어느 것이 토마토인지 확신하지 못합니다. 대신, "잠깐, 나 지금 혼란스러워"라고 말합니다.

3. 마법 같은 기술: 적응형 관찰과 행동 (Adaptive Looking and Acting)

로봇이 혼란을 느낀다는 것을 깨달으면, SCALE은 두 가지 변화를 동시에 실행합니다.

  • 적응형 관찰 (렌즈 넓히기): 로봇이 안경을 쓰고 있다고 상상해 보세요. 확신이 있을 때, 안경은 특정 작업에 집중하기 위해 "줌 인(Zoom In)" 모드로 설정됩니다. 하지만 혼란스러울 때, 안경은 자동으로 "광각(Wide Angle)" 모드로 전환됩니다. 이는 로봇이 전체 장면을 다시 훑어보게 하여, 이전에 놓쳤을지도 모를 단서(예: 다른 빨간 물체가 실제로 피망인지 확인하는 것)를 찾도록 강제합니다.
  • 적응형 행동 (더 많은 옵션 시도하기): 확신이 있을 때는 최선의 움직임을 선택합니다. 하지만 혼-란스러울 때는 그렇게 경직되지 않습니다. 단 하나의 움직임만을 고르는 대신, 여러 가지 가능성을 "샘플링(sampling)"합니다(예: 물체를 잡기 위해 약간 다른 각도로 시도해 보는 것 등). 이를 통해 어떤 방식이 적절한지 파악합니다.

4. 왜 특별한가? ("원 패스(One-Pass)"의 장점)

로봇을 더 똑똑하게 만드는 다른 방법들은 보통 다음과 같은 것을 요구합니다:

  • 새로운 선생님 학습: 로봇의 작업을 검사할 별도의 AI를 훈련시켜야 합니다.
  • 테스트 반복 수행: 로봇은 최선의 선택을 하기 위해 머릿속으로 작업을 10번 정도 반복해서 시뮬레이션해야 하며, 이는 속도가 느립니다.

SCALE은 다릅니다. SCALE은 마치 운전자가 보조 운전자를 필요로 하거나 두 번 길을 갈 필요 없이, 스스로 속도를 줄이고 주변을 살펴야 할 때를 본능적으로 아는 것과 같습니다.

  • 추가 학습 불필요: 로봇의 기존 두뇌를 그대로 활용합니다.
  • 재고할 필요 없음: 단 한 번의 과정(one "forward pass")으로 결정을 내립니다.
  • 실시간 작동: 계산을 반복하느라 시간을 낭비하지 않기 때문에 실제 로봇에 적용할 만큼 충분히 빠릅니다.

결과

테스트 결과, SCALE을 사용하는 로봇은 다음과 같은 까다로운 상황을 훨씬 더 잘 처리했습니다:

  • 다른 물체와 비슷하게 생긴 물체를 집어 올릴 때.
  • 장애물에 부딪히지 않고 이동할 때.
  • 초반의 작은 실수가 전체를 망칠 수 있는 길고 복잡한 과업을 수행할 때.

요약하자면: SCALE은 로봇에게 자신의 "직감"에 귀를 기울이는 법을 가르칩니다. 확신이 있을 때는 빠르고 집중력 있게 행동하고, 확신이 없을 때는 속도를 늦추고 더 주의 깊게 살피며 다양한 접근 방식을 시도합니다. 이를 통해 추가적인 학습이나 느린 반복 테스트 없이도 로봇을 더 안전하고, 똑똑하며, 신뢰할 수 있게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →