← 최신 논문
🤖 machine learning

Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control

이 논문은 문맥 표현 용량과 헤드 중복성을 기반으로 강화 학습 과정에서 어텐션 헤드를 동적으로 성장시키고 가지치기하는 런타임 증분형 트랜스포머 메커니즘을 소개하며, 이를 통해 관찰 불가능한 마찰 메모리를 가진 로봇 매니퓰레이터의 장기 적응 제어에서 발생하는 치명적 실패를 제거하고 비용이 많이 드는 오프라인 하이퍼파라미터 튜닝의 필요성을 없앤다.

원저자: Giansalvo Cirrincione, Adriano Fagiolini

게시일 2026-09-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Giansalvo Cirrincione, Adriano Fagiolini

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

자동차를 조립하거나 섬세한 재료를 다루는 공장의 로봇 팔처럼 정밀하게 움직이는 로봇들은, 얼마만큼의 힘을 가해야 하는지 알기 위해 복잡한 수학에 의존합니다. 수십 년 동안 엔지니어들은 관절을 원하는 지점으로 이동시키기 위해 필요한 정확한 밀거나 당기는 힘을 계산하는 '계산 토크 제어(computed-torque control)'라는 방법을 사용해 왔습니다. 이 방식은 로봇의 움직임이 예측 가능할 때는 잘 작동하지만, 현실 세계의 기계들은 '마찰'이라는 숨겨진 문제에 직면합니다. 어떤 마찰은 단순하고 일정하지만, '스트라이벡 마찰(Stribeck friction)'로 알려진 스틱-슬립(sticky-slip) 현상과 같은 다른 유형의 마찰은 시간에 따라 변하는 숨겨진 내부 상태에 의존합니다. 로봇의 센서는 이 숨겨진 상태를 직접 볼 수 없기 때문에, 시스템은 현재 위치만으로는 자신의 미래 행동을 예측하는 능력을 상실하게 됩니다. 이를 해결하기 위해 연구자들은 인공지능, 구체적으로는 컴퓨터 프로그램이 시행착오를 통해 학습하는 '강화 학습(reinforcement learning)'이라는 유형의 학습에 주목했습니다. 그러나 이러한 프로그램들은 대개 '어텐션 메커니즘(attention mechanism)'이라 불리는 특정 구조적 특징을 사용하는데, 이는 마치 스포트라이트처럼 AI가 최근의 이력 중 서로 다른 부분에 집중할 수 있게 해줍니다. 이 스포트라이트, 즉 '헤드(head)'의 개수는 보통 훈련이 시작되기 전에 결정되며, 길고 비용이 많이 드는 탐색 과정을 거쳐 선택됩니다. 만약 선택된 헤드 수가 너무 적으면 로봇은 학습에 실패하고, 너무 많으면 시스템이 비효율적이 됩니다.

이 연구의 연구진들은 학습 중에 스스로 생각을 바꿀 수 있는 시스템을 만듦으로써 이러한 경직성을 해결하고자 했습니다. 그들은 헤드의 개수를 미리 결정하지 않는 새로운 제어기를 개발했습니다. 대신, 이 제어기는 학습 과정 중에 자신의 성능을 관찰하며, 작업의 복잡함에 압도된다고 느낄 때 새로운 헤드를 추가하거나, 어떤 헤드가 아무런 역할을 하지 못하고 있다는 것을 깨달을 때 이를 제거합니다. 이 과정은 학습 과정을 중단하지 않고 실시간으로 이루어집니다. 시스템은 결정을 내리기 위해 두 가지 단순한 신호를 사용합니다. 첫째, 로봇의 이력으로부터 얼마나 많은 새로운 정보가 들어오는지 측정합니다. 만약 정보가 현재의 헤드 수로 처리하기에 너무 복잡하면 시스템은 새로운 헤드를 하나 키웁니다. 둘째, 각 헤드가 최종 결정에 얼마나 기여하는지 확인합니다. 만약 어떤 헤드가 거의 일을 하지 않는다면, 시스템은 이를 조용히 제거합니다. 결정적으로, 연구진은 헤드를 추가하거나 제거할 때 로봇의 행동에 갑작스러운 도약이나 오류가 발생하지 않도록 시스템을 설계했습니다. 새로운 헤드가 추가될 때는 영향력이 0에서 시작하여 로봇의 움직임이 매끄럽게 유지되도록 합니다. 헤드가 제거될 때도 그 변화가 매우 미미하여 학습을 방해하지 않습니다.

연구팀은 다양한 수준의 마찰 기억(단기 기억부터 장기 지연까지)에 직면한 시뮬레이션된 2관절 로봇 팔을 대상으로 이 접근 방식을 테스트했습니다. 고정된 수의 헤드를 사용하는 이전 실험에서는 가장 어려운 장기 기억 시나리오에서 시스템이 완전히 실패하여, 로봇이 제어력을 잃거나 싣고 있는 무게를 무시하는 현상이 자주 발생했습니다. 새로운 런타임 조절 가능 시스템을 사용했을 때는, 기존 방식이 실패했던 어려운 경우를 포함하여 모든 테스트에서 로봇이 성공했습니다. 연구진은 시스템이 작업에 내재된 특정한 '자연스러운' 헤드 수를 발견한 것이 아니라, 주요 캠페인의 모든 실행에서 최대 헤드 수 제한치에 도달했으며, 사용되지 않는 헤드를 제거하기 위한 프룬(prune) 트리거는 한 번도 작동하지 않았다는 것을 발견했습니다. 흥amente하게도, 이 이점은 시스템의 최종 크기에서 온 것이 아니라, 그것이 성장하는 방식에서 왔습니다. 헤드를 점진적으로 추가하는 과정은 마치 훈련 커리큘럼처럼 작용하여, 로봇이 복잡한 과제에 한꺼번에 던져지는 대신 단계별로 학습할 수 있도록 도왔습니다. 이는 구조를 거대하게 미리 구축해 놓는 것보다 학습 중에 아키텍처를 적응시키는 능력이 더 중요하다는 것을 시사합니다. 결과적으로, 이는 로봇이 움직이기 전 적절한 설정을 찾기 위한 비용이 많이 드는 시행착오 탐색 과정을 없애주며, 현실 세계의 무질서하고 예측 불가능한 마찰을 다루는 법을 가르치는 더 견고하고 효율적인 방법을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →