← 최신 논문
🤖 AI

RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection

이 논문은 사전 학습된 MLLM의 지식 주입을 강화하기 위해 참조 지원 토큰에 증류 가중치를 동적으로 재할당하고 희소 앵커 교정(sparse anchored corrections)을 적용함으로써, 모델의 기존 행동 유지력을 효과적으로 보존하면서도 주입된 지식의 정확도를 탁월하게 달성하는 롤아웃 조건부 온라인 증류 프레임워크인 RoCo-ACE를 소개한다.

원저자: Yan Hong, Wei Li, Kedong Xiu, Jun Lan, Shuheng Zhou, Zhongcai Lyu, Huijia Zhu, Weiqiang Wang, Jianfu Zhang

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yan Hong, Wei Li, Kedong Xiu, Jun Lan, Shuheng Zhou, Zhongcai Lyu, Huijia Zhu, Weiqiang Wang, Jianfu Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거의 모든 도서관의 책을 읽고 수백만 장의 사진을 본 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 로봇은 대화하고, 퍼즐을 풀고, 보이는 것을 묘사하는 데 매우 능숙합니다. 하지만 함정이 하나 있습니다. 세상은 매일 변한다는 점입니다. 새로운 영화가 개봉하고, 새로운 과학적 발견이 일어나며, 유명인들이 새로운 일을 합니다. 만약 당신이 이 로로봇 친구에게 이러한 최신 사실들을 알려주고 싶다면, 로봇을 가르쳐야 합니다. 하지만 거대한 로봇을 가르치는 것은 까다로운 일입니다. 단순히 로봇에게 새로운 사실을 암기하도록 강요하면, 로봇은 고양이를 그리거나 안전 질문에 답하는 것과 같은 기존의 기술들을 잊어버릴 수도 있습니다. 이는 마치 체스 그랜드마스터에게 새로운 오프닝 수를 가르치려다가, 그 과정에서 게임을 플레이하는 방법 자체를 잊게 만드는 것과 같습니다. 이 논문은 바로 그 문제를 다룹니다. 즉, 어떻게 하면 로봇의 기존의 믿음직한 기술들을 망가뜨리지 않으면서, 새롭고 구체적인 사실들을 로봇의 뇌 속에 슬쩍 집어넣을 수 있는가에 대한 문제입니다.

Ant Group 및 여러 대학과 협력하여 연구를 진행한 연구진은 이러한 로봇들을 가르치는 기존 방식들이 다소 서툴다는 점을 깨달았습니다. 한 가지 방법은 로봇에게 교과서를 단어 하나하나 그대로 베끼도록 강요하는 것과 같습니다. 이 방식은 사실을 배우기는 하지만, 로봇이 지루한 기계처럼 변하고 자신의 개성을 잃게 만듭니다. 또 다른 방법은 매우 조심스럽게 뇌의 아주 작은 부분만을 수정하려고 노력하지만, 종종 핵심을 놓쳐 새로운 사실을 절반만 배우게 되는 경우가 많습니다. Yan Hong과 Jun Lan이 이끄는 팀은 RoCo-ACE라는 영리한 새로운 전략을 고안해 냈습니다. 이것을 "스마트 형광펜" 시스템이라고 생각해 보세요. 로봇에게 교과서 전체를 암기하게 하는 대신, 로봇이 먼저 질문에 답해 보도록 하는 것입니다. 그런 다음, 로봇의 답변을 선생님의 "정답"과 비교합니다.

여기 마법 같은 기술이 있습니다. 시스템은 로봇의 답변을 보고 이렇게 묻습니다. "선생님의 도움이 이 특정 단어를 더 가능성 있게 만들었는가?" 만약 로봇이 올바른 사실(예: 특정 날짜나 이름)을 맞혔고, 선생님의 존재가 그 추측을 더욱 강력하게 만들었다면, 시스템은 그 단어에 하이파이브를 해주며 로봇에게 그것을 잘 기억하라고 말합니다. 하지만 로봇이 그저 일반적인 단어(예: "에펠탑" 대신 "큰 건물")를 사용하고 있다면, 시스템은 이를 무시합니다. 이것이 RoCo 부분입니다. 그다음은 ACE 부분입니다. 때때로 로봇은 새로운 사실을 완전히 놓치기도 합니다. ACE 시스템은 "이봐, 박물관 이름을 잊었잖아! 딱 그 부분만 고쳐보자"라고 말하며 부드럽게 넛지를 주는 역할을 합니다. 이 두 가지를 결합함으로써, 로봇은 자연스럽게 대화하는 능력이나 안전을 유지하는 능력을 잃지 않으면서도 새로운 사실들을 정확하게 배울 수 있습니다.

연구팀은 이를 연예인 소식부터 과학적 사실에 이르기까지 세 가지 다른 유형의 지식 업데이트에 대해 테스트했습니다. 그들은 RoCo-ACE가 다른 방법들에 비해 새로운 사실을 가르치는 데 가장 뛰어났다는 것을 발견했습니다. 한 테스트에서, 이 방식은 로봇의 지식 정확도를 27.6까지 끌어올렸습니다(표준적인 "교과서 베끼기" 방식의 20.1과 비교했을 때). 결정적으로, 다른 방법들이 로봇의 일반적인 성능 점수를 무려 31.8까지 떨어뜨리며 기존 기술을 망가뜨린 반면, RoCo-ACE는 로봇의 일반적인 기술을 시작 지점과 거의 동일한 수준인 약 56.5로 유지했습니다. 이 논문은 이 접근 방식이 훨씬 더 나은 균형을 제공한다고 제안합니다. 즉, 로봇이 자신이 누구인지 잊어버리지 않으면서도 매일 새로운 것을 배울 수 있는, 더 나은 학습의 균형을 얻을 수 있다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →