Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interactio
이 논문은 강력한 일반 지능과 특화된 체화된 상호작용 능력을 성공적으로 결합하기 위해 다단계 사후 학습 파이프라인을 활용하여, 더 큰 모델들을 체화된 벤치마크에서 능가하는 동시에 더 간결한 응답으로 대등한 일반 추론 성능을 유지하는 8B 파라미터 규모의 온디바이스 로봇 브레인인 Athena-Brain-8B를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 단순히 "만약 ~라면, ~하라"는 엄격한 명령 목록을 따르는 투박한 기계가 아니라, 어질러진 방을 이해하고, 계획을 세우고, 작업하는 동안 당신과 대화할 수 있는 영리한 동료가 되는 세상을 상상해 보십시오. 이것이 바로 "체화된 지능(embodied intelligence)"의 꿈입니다. 즉, 로봇에게 현실 세계에서 생각하고 행동할 수 있는 뇌를 부여하는 것입니다. 오랫동안 과학자들은 까다로운 선택에 직면해 있었습니다. 모든 것을 알고 있지만 너무 느리고 무거워서 로봇에 담기에는 부적합한 거대하고 초지능적인 뇌를 사용할 것인가, 아니면 빠르게 움직일 수는 있지만 복잡한 지시를 이해하기에는 너무 멍청한 아주 작은 뇌를 사용할 것인가 하는 문제였습니다. 이는 마치 책이 가득한 도서관에서 페이지 하나를 찾는 데 한 시간이 걸리는 상황과, 손에 들어올 만큼 작지만 몇 줄의 메모만 적혀 있는 주머니 속 수첩 사이에서 하나를 골라야 하는 것과 같았습니다. 핵심 질문은 이것이었습니다. 기기에 들어갈 만큼 작으면서도, 인간처럼 추론할 만큼 똑똑하고, 실시간 대화를 따라갈 수 있을 만큼 빠른 로봇의 뇌를 만들 수 있을 것인가?
여기, 이 퍼즐을 풀기 위해 XPENG 로보틱스가 개발한 새로운 "로봇 뇌"인 Athena-Brain-8B가 있습니다. 이것을 거대한 클라우드 서버에 의존하는 대신 로봇 자체의 컴퓨터에서 살아가도록 설계된 특수한 80억 파라미터 언어 모델(텍лан을 이해하고 생성하는 일종의 AI)이라고 생각하십시오. 연구진은 단순히 거대한 모델을 축소한 것이 아니라, 특별한 훈련 레시피를 사용하여 처음부터 새롭게 구축했습니다. 그들은 똑똑한 기초 모델에서 시작하여, 효율적으로 추론하도록 가르쳤고, 그 후 "체화된(embodied)" 기술—가상의 박물관이나 슈퍼마켓을 탐색하고, 물건을 집어 올리고, 단계별로 문제를 해결하는 법—을 익히도록 집중 훈련을 시켰습니다. 그 결과는 어떠했을까요? 이 모델은 훨씬 더 크고 느린 모델만큼이나 복잡한 추론 과제를 처리할 수 있으면서도, 훨씬 적은 단어를 사용하여 훨씬 더 빠르게 수행합니다. 이는 똑똑한 로봇을 갖기 위해 슈퍼컴퓨터가 필요한 것이 아니라, 작은 뇌가 정말 열심히, 그리고 정말 빠르게 작동하도록 만드는 올바른 종류의 훈련이 필요하다는 것을 증명합니다.
문제점: "너무 큰" vs "너무 작은" 로봇 뇌
당신이 로봇 집사를 만들고 싶다고 가정해 봅시다. 당신에게는 그 뇌를 위한 두 가지 옵션이 있습니다. 옵션 A는 거대한 슈퍼컴퓨터 뇌입니다. 그것은 믿을 수 없을 정도로 똑똑하며, 인터넷의 모든 것을 알고 있고, 복잡한 수학 문제를 풀 수 있습니다. 하지만 너무 무겁고 느려서 벽에 플러그를 꽂아야 하며, "내 열쇠 어디 있어?"와 같은 간단한 질문에 답하는 데도 오랜 시간이 걸립니다. 옵션 B는 아주 작고 가벼운 뇌입니다. 빠르고 로봇의 머리에 딱 맞지만, 그리 똑똑하지는 않습니다. 만약 당신이 붐비는 상점을 통과하는 경로를 계획하거나, 물이 새는 수도꼭지를 어떻게 고칠지 묻는다면 당황할 수도 있습니다.
오랫동안 과학자들은 둘 중 하나를 선택해야 한다고 생각했습니다. 움직일 수 없는 똑똑한 로봇을 만들거나, 생각할 수 없는 빠른 로봇을 만들거나 말입니다. 하지만 Athena-Brain-8B를 만든 팀은 이렇게 물었습니다. 만약 우리가 작은 뇌가 똑똑하면서도 빠르게 움직이도록 가르칠 수 있다면 어떨까?
해결책: 4단계 훈련 캠프
연구진은 단순히 추측한 것이 아니라, 로봇의 뇌를 위한 4단계 부트 캠프와 같은 구체적인 훈련 파이프라인을 구축했습니다.
1단계: 일반 지식 기반 (General SFT)
먼저, 그들은 표준적이고 똑똑한 언어 모델(기초 모델)을 가져와 엄청난 양의 숙제를 주었습니다. 이것은 단순히 사실을 암기하는 것이 아니라, 지시를 따르고, 수학 문제를 풀고, 코드를 작성하고, 세상을 이해하는 법을 배우는 과정이었습니다. 이것을 로봇을 일반 과목에 대한 탄탄한 교육을 받기 위해 일반 학교에 보내는 것으로 생각하십시오.
2단계: 간결해지는 법 배우기 (General Reinforcement Learning)
여기서 흥ет미로운 점이 나옵니다. 연구진은 똑똑한 로봇들이 말이 너무 많다는 것을 깨달았습니다. 만약 당신이 로봇에게 열쇠를 찾으라고 했는데, 로봇이 "찾았다"라고 말하기 전에 500단어의 생각을 겉으로 내뱉는다면, 그것은 실제 로봇에게 너무 느린 일입니다. 그래서 그들은 강화 학습(Reinforcement Learning)이라는 기술을 사용했습니다. 정답뿐만 아니라, 가장 짧은 정답을 냈을 때도 금메달을 주는 선생님을 상상해 보십시오. 로봇은 문제를 올바르게 해결하면서도 더 적은 단어를 사용했을 때 보상을 받았습니다. 이를 통해 뇌는 불필요한 내용을 걷어내고 핵심에 바로 접근하는 효율성을 배웠습니다.
3단계: "현실 세계" 시뮬레이션 (Embodied Expert Training)
이제 뇌는 똑똑하고 효율적이 되었지만, 실제로 무언가를 해본 적은 없었습니다. "박물관"이 무엇인지는 알았지만, 그 안을 어떻게 걸어 다녀야 하는지는 몰랐습니다. 연구진은 두 가지 가상 세계인 박물간과 슈퍼마켓을 만들었습니다.
- 박물관에서 로봇은 방문객을 공룡 화석까지 안내해야 했습니다. 표지판을 읽고, 어느 방향으로 돌지 결정하고, 제 위치에 있는지 확인해야 했습니다.
- 슈퍼마켓에서 로봇은 우유 한 병을 찾아 카트에 담고 계산을 마쳐야 했습니다.
로봇은 단순히 이 과업들에 대해 읽기만 한 것이 아니라, 반복해서 연습했습니다. 로봇은 물건을 집으려다 실패하면 포기하는 것이 아니라, 다른 각도로 다시 시도해야 한다는 것을 배웠습니다. 경로를 계획하고, 실수를 처리하며, 계속 나아가는 법을 배웠습니다. 이것을 "체화된(embodied)" 훈련이라고 부르는데, 이는 로봇이 물리적 환경(비록 시뮬레이션된 환경일지라도)과 상호작용하는 법을 배우기 때문입니다.
4단계: 뇌 결합 (Model Merge)
이 모든 훈련을 마친 후, 연구진은 서로 다른 여러 버전의 뇌를 갖게 되었습니다. 일반 지식에 뛰어난 뇌, 간결함에 뛰어난 뇌, 그리고 박물관과 슈퍼마켓을 항해하는 데 뛰어난 뇌가 그것입니다. 연구진은 이 중 하나를 고르는 대신, 특별한 수학적 기법을 사용하여 이들을 하나의 '슈퍼 뇌'로 "병합(merge)"했습니다. 이것은 학자, 속독가, 그리고 탐험가의 가장 좋은 특성들을 가져와서, 이 세 가지를 모두 완벽하게 수행할 수 있는 한 사람으로 결합하는 것과 같습니다.
결과: 작지만 강하다
결과는 인상적이었습니다. Athena-Brain-8B를 테스트했을 때, 연구진은 이 모델이 훨씬 더 크고 느린 모델들만큼이나 일반적인 추론 과제(수학 및 논리 등)를 잘 처리할 수 있다는 것을 발견했습니다. 하지만 진짜 마법은 속도와 효율성에 있었습니다.
- 말을 적게 합니다: 길게 생각하며 말을 늘어놓는 다른 똑똑한 모델들과 비교했을 때, Athena-Brain-8B는 현저히 짧은 응답을 생성했습니다. 시간을 낭비하며 횡설수설하지 않고, 곧바로 행동으로 옮겼습니다.
- 더 잘 행동합니다: 가상의 박물관과 슈퍼마켓에서 Athena-Brain-8B는 다른 작은 로봇들보다 과업을 훨씬 더 잘 수행했습니다. 실제로 이 모델은 훨씬 더 크고 강력한 일부 거대하고 비싼 모델들조차 능가할 정도로 뛰어난 성과를 보였습니다.
- 효율적입니다: 연구진은 모델이 작업을 완료하기 위해 사용하는 "토큰(단어 덩어리)"의 수를 측정했습니다. Athena-Brain-8B는 가장 높은 점수를 얻으면서도 가장 적은 토큰을 사용했습니다. 이는 이 모델이 단순히 똑똑할 뿐만 아니라 에너지 효율적이라는 것을 의미하며, 배터리로 구동되는 로봇에게는 매우 중요한 요소입니다.
이것이 왜 중요한가
이 논문은 똑똑한 로봇을 갖기 위해 반드시 거대하고 클라우드에 의존하는 뇌를 구축할 필요는 없다는 점을 시사합니다. 콤팩트한 모델이 효율적으로 작동하도록 훈련하고, 현실적이고 상호작용이 가능한 환경에서 연습하게 함으로써, 우리는 기기 자체에 탑재될 수 있는 "로봇 뇌"를 만들 수 있습니다. 이는 로봇이 더 빠르고, 더 즉각적으로 반응하며, 인터넷 연결이 느리거나 없는 곳에서도 작업할 수 있음을 의미합니다.
연구진은 80억 개의 파라미터를 가진 작은 모델이 범용성(많은 분야에서 똑똑함)과 전문성(움직임과 행동에 능숙함)을 동시에 학습할 수 있다는 것을 보여주었습니다. 그들은 단순히 대화할 수 있는 로봇을 만든 것이 아니라, 무언가를 수행하고, 다음에 무엇을 할지 생각하며, 그것을 빠르게 해낼 수 있는 로봇을 만들었습니다. 비록 이 로봇들을 실제 세상으로 가져오기 위해 해결해야 할 과제들(더 복잡한 물리적 물체를 다루는 법 등)이 남아 있지만, 이 연구는 온디바이스(on-device) 로봇으로 가는 길이 우리가 생각했던 것보다 더 명확하다는 것을 보여줍니다. 로봇 공학의 미래는 더 큰 뇌를 만드는 것이 아니라, 작은 뇌가 믿을 수 없을 정도로 효율적으로 작동하도록 가르치는 데 있을지도 모릅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.