← 최신 논문
🤖 machine learning

A Compositional Paradigm for Foundation Models: Towards Smarter Robotic Agents

이 논문은 파운데이션 모델의 한계를 극복하여 더욱 유연하고 효율적이며 스마트한 로봇 에이전트 개발을 가능하게 하기 위해, 지속 학습(Continual Learning)과 구성성(Compositionality) 원리를 파운데이션 모델에 통합할 것을 제안한다.

원저자: Luigi Quarantiello, Elia Piccoli, Jack Bell, Malio Li, Giacomo Carfì, Eric Nuertey Coleman, Gerlando Gramaglia, Lanpei Li, Mauro Madeddu, Irene Testa, Vincenzo Lomonaco

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luigi Quarantiello, Elia Piccoli, Jack Bell, Malio Li, Giacomo Carfì, Eric Nuertey Coleman, Gerlando Gramaglia, Lanpei Li, Mauro Madeddu, Irene Testa, Vincenzo Lomonaco

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 토스트 만들기부터 물 새는 수도꼭지 고치기까지 모든 것을 가르치려고 한다고 상상해 보세요. 오랫동안 이를 수행하는 가장 좋은 방법은 로봇을 위한 '슈퍼 브레인'을 만드는 것이었습니다. 즉, 테라바이트 단위의 데이터로 학습된 거대하고 모든 것을 알고 있는 모델을 만드는 것이죠. 이것은 도서관의 모든 책을 읽고 인터넷의 모든 영상을 본 천재를 고용하는 것과 같습니다. 이러한 '파운데이션 모델(Foundation Models)'은 믿기지 않을 정도로 똑똑합니다. 인간처럼 대화하고, 사진을 인식하며, 심지어 로봇 팔을 제어할 수도 있습니다. 하지만 여기에는 함정이 있습니다. 이들은 마치 거대하고 무거운 배낭과 같습니다. 일단 이 배낭을 메고 나면 바꾸기가 매우 어렵습니다. 만약 로봇이 특정 종류의 병을 여는 것과 같은 완전히 새로운 기술을 배워야 한다면, 당신은 종종 그 거대한 배낭을 통째로 벗어 던지고, 천재를 처음부터 다시 훈련시킨 뒤에야 다시 멜 수 있습니다. 이는 시간이 너무 오래 걸리고, 전기도 엄청나게 사용하며, 만약 로봇이 병 여는 법을 배우는 동안 토스트 만드는 법을 잊어버린다면 그것은 '파괴적 망각(catastrophic forgetting)'이라는 문제가 됩니다.

이를 해결하기 위해 과학자들은 두 가지 서로 다른 아이디어인 **지속 학습(Continual Learning)**과 **구성성(Compositionality)**을 살펴보고 있습니다. 지속 학습은 공부를 멈추지 않는 학생과 같습니다. 그들은 기존의 지식을 잊지 않으면서 새로운 지식을 계속해서 뇌에 추가합니다. 구성성은 레고 블록으로 만드는 것과 같습니다. 하나의 거대하고 단일한 플라스틱 덩어리 대신, 작고 특화된 여러 개의 블록을 가지고 있는 것입니다. 당신은 이 블록들을 다양한 방식으로 끼워 맞춰 성, 자동차, 또는 우주선을 만들 수 있습니다. 만약 우주선을 잠수함으로 바꾸고 싶다면, 전체를 녹여서 새로 만드는 대신 몇 개의 블크만 교체하면 됩니다. 큰 질문은 이것입니다. 우리가 이 레고 같은 빌딩 블록을 사용하여 오늘날의 거대한 배낭 모델보다 더 똑똑하고, 빠르고, 업데이트하기 쉬운 로봇을 만들 수 있을까요?

"파운데이션 모델을 위한 구성적 패러다임: 더 스마트한 로봇 에이전트를 향하여(A Compositional Paradigm for Foundation Models: Towards Smarter Robotic Agents)"라는 제목의 이 논문은 그 답이 '예'라고 주장합니다. 저자들은 단순히 AI 모델을 점점 더 크게 만드는 것만으로는 한계에 부딪히고 있다고 주장합니다. 그들은 하나의 거대하고 경직된 모델을 훈련시키는 대신, 작고 특화된 부분들을 결합하는 시스템을 구축해야 한다고 제안합니다. 그들은 이 아이디어를 이미지 인식과 로봇 팔 제구라는 두 가지 매우 다른 세계에서 테스트했습니다.

먼저, 그들은 이미지 분류를 살펴보았습니다. 컴퓨터에게 새, 자동차, 꽃 등 다양한 종류의 사진을 차례대로 보여준다고 상상해 보세요. 새로운 종류의 사진이 나타날 때마다 전체 컴퓨터 비전 시스템을 다시 훈련시키는 대신, 저자들은 '레고' 방식을 사용했습니다. 그들은 각 새로운 작업에 대해 작은 별도의 모듈(LoRA 어댑터라고 불림)을 훈련시켰습니다. 그런 다음, 이 모듈들을 서로 끼워 맞추는 스마트한 병합 과정을 사용했습니다. 그들은 이 방식이 훨씬 더 정확할 뿐만 아니라 훈련 속도도 훨씬 빠르다는 것을 발견했습니다. 50개의 작업이 포함된 데이터셋에 대한 테스트에서, 그들의 '레고' 방식은 55.17%의 정확도에 도달하여, 47.56%나 36.02%에 그친 다른 방식들을 앞질렀습니다. 더욱 놀라운 점은, 이들의 방식이 단 170.61초 만에 훈련을 마친 반면, 경쟁 모델들은 300초 이상이 걸렸다는 것입니다.

다음으로, 그들은 이 아이디를 실제 로봇의 세계로 가져갔습니다. 그들은 로봇이 슈퍼컴퓨터 없이도 사물을 조작하는 법을 배울 수 있는지 알고 싶었습니다. 그들은 로봇의 기존 뇌를 미세 조정할 수 있는 작은 '사전 훈련된 어댑터'를 사용하는 시스템을 구축하여, 로봇이 실시간으로 새로운 상황에 적응할 수 있도록 했습니다. 결과는 놀라웠습니다. 로봇 조작 작업에서, 이들의 경량화된 방식은 0.91의 성공률(91%의 성공률을 의미)을 달ável 했으며 단계당 0.60의 보상을 얻었습니다. 반면, OpenVLA나 InstructRL 같이 훨씬 더 복잡하고 유명한 모델들은 성공률 0.0을 기록하며 완전히 실패했습니다. 무거운 모델들이 훈련에 40~92시간이 걸리는 동안, 저자들의 방식은 단 14시간 만에 임무를 완수했습니다.

논문은 결론적으로, 로봇이 복잡하고 변화무쌍한 현실 세계를 다룰 수 있는 스마트한 에이전트가 되기 위해서는, 정적인 거인이 되는 것을 멈추고 유연한 기술의 집합체가 되어야 한다고 말합니다. 이 작고 효율적인 부분들을 결합함으로써, 우리는 기존의 방식이 따라올 수 없는 수준의 유연성을 가지고, 이전의 것을 잊지 않으면서도 새로운 것을 배우고, 훨씬 적은 에너지와 시간을 사용하는 에이전트를 만들 수 있습니다. 이는 단 하나의 변경 불가능한 슈퍼 브레인을 만드는 것에서, 함께 협력하고 즉각적으로 적응하며 문제를 해결할 수 있는 전문가 팀을 조립하는 것으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →