← 최신 논문
🤖 AI

IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training

IMPACT는 교차 주의 집중(cross-attention)을 사용하여 내부 상호작용 지도를 생성함으로써 디노이징 감독의 가중치를 재설정하여, 외부 표현 없이도 물리적 타당성과 시각적 품질을 향상시키고 표준 MSE 학습에서 동적 객체의 감독 부족 문제를 해결하는 상호작용 인지형 월드 모델을 훈련하기 위한 확장 가능한 프레임워크이다.

원저자: Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen

게시일 2026-09-02
📖 5 분 읽기🧠 심층 분석

원저자: Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 팔이 컵을 집어 올리는 영상을 보고 다음에 정확히 어떤 일이 일어날지 예측할 수 있는 컴퓨터를 상상해 보십시오. 이 컴퓨터는 컵이 들리고, 탁자는 가만히 있으며, 세라믹에 빛이 반사될 것임을 알고 있습니다. '월드 모델(world model)'이라고 알려진 이러한 종류의 인공지능은 미래를 상상하는 데 점점 더 능숙해지고 있습니다. 이들은 방대한 양의 비디오 데이터를 통해 사물이 어떻게 움직이고 시간이 흐름에 따라 세상이 어떻게 변하는지를 학습합니다. 이러한 시스템은 전자 제품을 조립하거나 가사 노동을 돕는 것과 같은 복잡한 과업을 수행하도록 로봇을 가르치는 데 매우 중요한데, 왜냐하면 기계가 실제 물체에 손을 대기 전에 가상 공간에서 연습하고 계획할 수 있게 해주기 때문입니다. 그러나 이러한 모델은 장면의 일반적인 흐름을 예측하는 데는 뛰어나지만, 접촉이 일어나는 구체적인 순간에는 종종 어려움을 겪습니다. 로봇 손이 도구를 잡거나 사람의 손가락이 버튼을 누를 때, 현재의 기술은 자주 흐릿하거나 물리적으로 불가능하거나 일관성이 없는 결과를 만들어냅니다. 물체가 손 안으로 녹아 들어가거나, 동작이 그 동작을 유발한 원인으로부터 분리된 것처럼 보이기도 합니다.

연구자들은 컴퓨터에 깊이 정보의 상세한 지도나 물체가 따라야 할 정밀한 경로와 같은 추가 정보를 제공하여 이를 해결하려고 노력해 왔습니다. 이 방법은 도움이 되기는 하지만, 비용이 많이 들고 시간이 오래 걸리는 준비 과정이 필요하며 시스템이 학습할 수 있는 데이터의 양을 제한하기도 합니다. 칭화대학교와 중국과학기술대학교를 포함한 여러 기관의 연구진이 발표한 새로운 연구는 다른 해결책을 제시합니다. 그들은 문제가 데이터의 부족이 아니라, 컴퓨터가 데이터를 통해 배우는 방식에 있다는 것을 발견했습니다. 이들은 주의를 집중시키는 학습 과정을 변경함으로써, 추가적인 외부 데이터 없이도 시스템의 속도를 늦추지 않으면서 물리적 상호작용을 현저히 개선하는 IMPACT라는 방법을 만들어냈습니다.

연구진이 식별한 핵심 문제는 컴퓨터가 학습하는 방식에서의 일종의 불균형입니다. 이러한 월드 모델을 훈련할 때, 시스템은 보통 비디오의 다음 프레임을 예측하도록 요청받으며 자신이 저지르는 모든 실수에 대해 벌점을 받습니다. 그러나 전형적인 비디오에서 대부분의 이미지는 변화가 거의 없는 벽, 탁자, 바닥과 같은 정적인 배경입니다. 이러한 정적인 영역은 픽셀의 대다수를 차지하기 때문에, 컴퓨터는 단순히 그 양이 많다는 이유만으로 배경을 정확하게 맞추는 데 대부분의 노력을 쏟게 됩니다. 그리퍼가 블록을 만지거나 손이 도구를 잡는 것과 같이 동작이 일어나는 작고 결정적인 영역은 너무 작아서 노이즈 속에 묻혀버립니다. 컴퓨터는 이 영역들이 차지하는 공간이 매우 적기 때문에 이를 중요하지 않은 것으로 간주하고 사실상 무시합니다. 이는 비디오가 전체적으로는 매끄럽고 일관되게 보이지만, 구체적인 상호작용은 물리적으로 틀리거나 시각적으로 지저분해지는 상황을 초래합니다.

이를 해결하기 위해 연구진은 컴퓨터가 실제로 동작이 일어나고 있는 부분에 더 많은 주의를 기울이도록 가르치는 방법을 개발했습니다. 그들은 컴퓨터가 이미 어디를 보아야 할지에 대한 내장된 힌트를 가지고 있다는 점을 깨달았습니다. 시스템이 "파란색 그릇을 집어라"와 같은 명령을 받으면, '교차 주의(cross-attention)'라는 메커니즘을 사용하여 "파란색 그릇"이라는 단어를 비디오의 시각적 부분과 연결합니다. 이는 컴퓨터가 그릇이 어디에 있다고 생각하는지를 보여주는 정신적 지도를 생성합니다. 연구진은 이 기존의 지도를 출발점으로 사용했습니다. 그런 다음 컴퓨터에게 해당 특정 영역을 살펴보고, 그곳에서 일어날 일을 예측하는 것이 얼마나 어려웠는지 확인하도록 요청했습니다. 만약 컴퓨터가 그릇의 움직임을 예측하는 데 어려움을 겪었다면, 그 영역은 중요하며 더 많은 집중이 필요하다는 것을 의미했습니다.

IMPACT라고 명명된 이 시스템은 여러 가능한 영역을 샘플링하고, 컴퓨터가 예측하기 어렵다고 판단한 정도에 따라 각 영역에 가중치를 부여함으로써 이 과정을 한 단계 더 발전시킵니다. 그런 다음 상호작용 구역을 강조하는 특별한 가이드, 즉 지도를 생성합니다. 훈련 과정 중에 컴퓨터는 이 강조된 영역에서 발생하는 실수를 수정하는 데 우선순위를 두도록 지시받으며, 이는 사실상 "잠시 벽은 무시하고 손과 물체에 집중하라"고 말하는 것과 같습니다. 결정적으로, 이 가이드는 훈련 과정 중 컴퓨터 자체의 내부 신호로부터 완전히 생성됩니다. 이는 외부 도구나 수동 라벨링, 또는 어디서 동작이 일어나는지 알려주는 추가 센서를 필요로 하지 않습니다. 덕분에 이 방법은 높은 확장성을 가지며, 막대한 양의 데이터와 함께 작업할 때 발생하는 과도한 비용 없이도 작동할 수 있습니다.

연구진은 이 새로운 방법을 두 가지 매우 다른 유형의 과업, 즉 테이블 위의 물체를 조작하는 로봇 팔과 1인칭 시점에서 숙련된 동작을 수행하는 사람의 손을 대상으로 테스트했습니다. 두 경우 모두 표준 비디오 생성 기술을 사용하여 모델을 훈련하되, 학습 과정에 IMPACT 방식을 적용했습니다. 결과는 일관되었고 유의미했습니다. IMPACT로 훈련된 모델은 상호작용이 훨씬 더 현실적인 비디오를 생성했습니다. 로봇 그리퍼가 블록을 닫았을 때, 블록은 단단함을 유지하며 올바르게 움직였습니다. 사람의 손이 컵을 집었을 때, 손가락은 자연스럽게 컵을 감싸 쥐었으며 컵은 적절한 무게감과 움직임으로 반응했습니다. 시각적 품질 또한 극적으로 향상되어, 표준적인 균등 접근 방식으로 훈련된 모델에 비해 왜곡이 적고 물리적으로 더 타당한 움직임을 보여주었습니다.

로봇 팔 테스트에서 이 새로운 방법은 특히 로봇이 명령을 얼마나 잘 따르는지와 물체의 물리학을 얼마나 정확하게 시뮬레이션하는지에 있어 전체적인 품질 점수를 눈에 띄게 높였습니다. 사람의 손 과업에서는 시각적 충실도 측면에서 개선 효과가 더욱 두드러졌습니다. IMPACT로 훈련된 모델은 훨씬 더 선명하고 일관된 이미지를 생성했으며, 손과 물체가 인간의 눈에 자연스럽게 보일 정도로 상호작용했습니다. 연구진은 이 접근 방식이 다양한 유형의 컴퓨터 아키텍처와 제어 신호 전반에서 잘 작동한다는 것을 발견했으며, 이는 해결책이 견고하고 적응력이 높음을 시사합니다. 단순히 무엇이 가장 중요한지에 따라 학습 과정을 재가중하는 것만으로도, 그들은 밑바닥의 AI 구조를 바꾸지 않고도 더 높은 수준의 물리적 사실성을 끌어낼 수 있었습니다.

이 연구는 인공지능의 더 나은 상호작용을 위한 열쇠가 더 복잡한 데이터를 추가하거나 외부 제약을 가하는 것이 아니라, 시스템이 이미 가지고 있는 데이터로부터 배우는 방식을 정교하게 다듬는 데 있다는 것을 보여줍니다. 연구진은 주의가 할당되는 방식의 불일치를 식별하고 이를 수정함으로써, 모델이 물리적 상호작용의 어렵고 희소한 세부 사항을 숙달하도록 유도할 수 있음을 보여주었습니다. 이 방법은 실제로 새로운 비디오를 생성할 때 시스템의 변경을 요구하지 않으므로, 순수하게 훈련 단계에 대한 개선입니다. 월드 모델이 더 복잡한 로봇 과업과 시뮬레이션을 지원하기 위해 계속 진화함에 따라, IMPACT와 같은 기술은 확장 가능한 경로를 제공하여, 모델이 상상하는 미래가 단순히 시각적으로 매끄러운 것을 넘어 물리적으로도 진실되도록 보장할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →