← 최신 논문
⚡ electrical engineering

Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control

이 논문은 월드 액션 모델(World Action Models)의 활성화 공간 내에 존재하는 저차원 선형 분리 가능성을 활용하여 분포 변화에 대한 강건성을 향상시키기 위해 기계론적 해석 가능성과 최적 제어를 결합한 WA-LQR이라는 훈련이 필요 없는 스티어링 방법을 제안한다.

원저자: Jihoon Hong, Julian Skifstad, Qiyue Dai, Alice Chan, Glen Chou

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jihoon Hong, Julian Skifstad, Qiyue Dai, Alice Chan, Glen Chou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 저녁 식사 요리를 가르치고 있다고 상상해 보세요. 단순히 레시피를 단계별로 따르게 하는 것이 아니라, 로봇이 주방 그 자체를 이해하기를 원합니다. 스토브가 뜨거워지면 물이 끓고, 숟가락을 떨어뜨리면 챙그랑 소리가 난다는 것을 알기를 바라는 것이죠. 이것이 바로 '월드 액션 모델(World Action Models, WAMs)'의 꿈입니다. 이들은 단순히 다음 행동을 결정하는 것을 넘어, 자신의 행동에 따라 세상이 어떻게 변할지를 시뮬레이션하며 미래를 예측하는 고도의 AI 두뇌입니다. 마치 로봇의 머릿속에서 비디오 게임 엔진이 돌아가는 것과 같습니다.

하지만 문제가 있습니다. 이 로봇들은 믿기지 않을 정도로 똑똑하지만, 동시에 놀라울 정도로 취약합니다. 주방의 조명을 바꾸거나, 카메라를 약간 움직이거나, 영상 피드에 약간의 정적 노이즈를 추가하기만 해도 로봇은 당황하여 수프를 쏟아버릴 수 있습니다. 이는 조용한 책상에서는 수학 문제를 완벽하게 풀지만, 근처에서 파리가 윙윙거리기만 해도 얼어붙어 버리는 천재 학생과 같습니다. 과학자들은 난잡한 주방의 사례를 수천 개씩 다시 학습시켜 로봇을 고치려 노력해 왔지만, 이는 시간이 너무 오래 걸리고 막대한 비용이 듭니다. 큰 질문은 이것입니다. "우리가 '리셋' 버튼을 누르고 처음부터 다시 시작하지 않고도, 로봇이 작동하는 도중에 즉석에서 행동을 수정할 수 있을까?"

"기계론적 해석 가능성과 최적 제어를 통한 월드 액션 모델의 강건성 유도(Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control)"라는 제목의 이 논문은 로봇의 궤도를 바로잡기 위해 로봇의 두뇌 속을 파고듭니다. 저자들은 로봇의 내부 사고(이를 '활성화'라고 부릅니다)를 하나의 지도처럼 다룹니다. 그들은 질문합니다. "이 지도 위에 '올바르게 행동하는 것'과 '노이즈 섞인 카메라 때문에 패닉에 빠지는 것'을 구분하는 단순하고 곧은 선이 존재하는가?" 그들은 일부 로봇 모델의 경우, 그렇다, 즉 명확한 선이 존재한다는 것을 발견했습니다. 다른 모델들의 경우, 지도는 엉망으로 뒤엉킨 상태였습니다.

이 선명한 선을 가진 로봇들을 고치기 위해, 저자들은 WA-LQR이라는 새로운 기술을 발명했습니다. 이것을 로봇 두의 아주 똑똑한 자동 조종 장치라고 생각하세요. 로봇의 생각을 단순히 한 방향으로 밀어붙이는 대신(이는 너무 과하거나 부족할 수 있습니다), WA-LQR은 도로를 벗어나려는 자동차를 바로잡는 숙련된 운전자처럼 행동합니다. 이 장치는 로봇이 현재 어떤 생각을 하고 있는지 끊임없이 확인하고, 평온함을 유지하기 위해 '어디를 생각해야 하는지'와 비교하며, 로봇이 경로를 이탈하지 않도록 작고 정밀한 조정을 수행합니다.

결과는 유망하지만 특정적입니다. 저자들이 두 종류의 로봇 두뇌(Cosmos-Policy 및 DiT4DiT)에 대해 테스트했을 때, 이 자동 조령 장치는 놀라운 효과를 보였습니다. 카메라가 흔들리거나, 그리퍼의 위치가 잘못되었거나, 영상에 정적 노이즈가 가득한 상황에서도 로봇이 임무를 완수하도록 도왔습니다. 어떤 경우에는 성공률을 최대 41%까지 높였습니다. 하지만 세 번째 유형의 로봇 두뇌(LingBot-VA)에 적용했을 때는 "지도"가 너무 복잡하여 직선을 찾을 수 없었고, 자동 조종 장치도 별다른 도움을 주지 못했습니다. 이는 이 기술로 모든 로봇을 고칠 수는 없지만, 적절한 내부 구조를 갖춘 로봇의 경우에는 재학습 없이도 훨씬 더 견고하고 신뢰할 수 있게 만들 수 있음을 시사합니다. 이는 어떤 자동차는 단순히 더 좋은 핸들이 필요한 것이고, 어떤 자동차는 완전히 새로운 엔진이 필요한 것이라는 사실을 깨닫는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →