← 최신 논문
🤖 AI

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

본 논문은 텍스트 지문을 제거하고 태스크 범위를 확장함으로써 현재 멀티모달 지속적 인스트럭션 튜닝의 전문가 라우팅(expert routing)이 가진 한계를 드러내는 도전적인 34개 태스크 벤치마크인 FLEX를 소개하는 동시에, 라우팅 정확도와 전반적인 성능을 크게 향상시키는 원칙적인 클래스 점진적 학습(class-incremental learning) 프레임워크를 제안한다.

원저자: Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 한 로봇에게 여러 가지 다양한 기술을 하나씩 차례대로 가르치는 마스터가 되도록 가르치고 있다고 상상해 보세요. 먼저, 고양이와 강아지를 인식하는 법을 가르칩니다. 그다음에는 수학 문제를 푸는 법을 가르칩니다. 그다음에는 의료 X-레이를 판독하는 법을 가르칩니다. 이것을 **연속 학습(Continual Learning)**이라고 부릅니다. 까다로운 점은, 로봇이 새로운 기술을 배울 때 종종 이전의 것들을 잊어버리거나, 당신이 질문을 던졌을 때 어떤 기술을 사용해야 할지 혼란스러워한다는 것입니다.

이를 해결하기 위해 과학자들은 로봇에게 전문화된 조력자들의 "도구 상자", 즉 **LoRA 전문가(LoRA experts)**를 제공합니다. 이 전문가들을 거대한 주방에 있는 서로 다른 요리사들이라고 생각해 보세요. 어떤 요리사는 베이킹에 능숙하고, 다른 요리사는 그릴 요리에 능숙하며, 또 다른 요리사는 초밥을 만드는 데 뛰어납니다. 당신이 음식을 주문하면, 당신의 주문을 보고 적절한 요리사에게 전달할 똑똑한 웨이터인 **라우터(Router)**가 필요합니다. 만약 웨이터가 초밥 주문을 그릴 요리사에게 보낸다면, 그 식사는 엉망이 될 것입니다. 이 분야의 핵심 질문은 이것입니다. "우리 웨이터가 수십 명의 요리사가 생기고 주문서들이 매우 비슷해질 때, 정확히 어떤 요리사를 골라야 할지 알 수 있을 만큼 더 똑똑해질 수 있을까?"


문제점: 웨이터가 지름길에 의존하고 있다 (단, 메뉴가 너무 쉬운 덕분에)

난징 대학교의 연구진은 이 "웨이터"(라우터)들이 실제로 얼마나 일을 잘하고 있는지 조사하기로 했습니다. 그들은 로봇을 훈련시키는 데 사용되는 표준 테스트들을 살펴보았고, 무언가 수상한 점을 발견했습니다. 웨이터들이 완벽한 점수를 받고 있었지만, 사실은 지름길에 의 Relying(의존)하고 있었다는 것입니다.

기존의 테스트들에서는 "메뉴"(로봇에게 주어지는 지시문)에 명백한 단서들이 있었습니다. 예를 들어, 수학 문제는 항상 "합계를 계산하시오"라는 문구로 시작할 수 있고, 이미지 묘사는 항상 "이미지를 설명하시오"라는 문구로 시작할 수 있습니다. 웨이터는 이미지를 보거나 수학을 이해할 필요가 없었습니다. 그저 어떤 요리사를 선택할지 알기 위해 지시문의 앞 몇 단어만 읽으면 그만이었던 것입니다. 연구진은 이러한 단서들을 **"텍extual fingerprint(텍스트 지문)"**라고 부릅니다.

기존의 테스트들은 작업의 수가 적었고(요리사가 6~10명 정도), 메뉴가 너무나 명백했기 때문에 라우팅 문제가 "포화(saturated)" 상태였습니다. 이는 마치 손님이 겨우 세 테이블뿐인 작은 식당의 웨이터와 같아서, 고객의 이름을 배우기도 전에 테이블 번호를 외워버린 것과 같습니다. 연구진은 로봇이 오랜 시간 동안 수백 가지의 기술을 배울 수 있게 하려면, 메뉴가 서로 비슷하게 보여서 웨이터가 실제로 내용을 이해하도록 만드는 훨씬 더 어려운 테스트가 필요하다는 것을 깨달았습니다.

해결책: 새로운, 더 강력한 레스토랑 (FLEX)

이 문제를 해결하기 위해 연구팀은 FLEX(Fingerprint-reduced Long-horizon Expert eXamination)라는 새로운 벤치마크를 만들었습니다.

FLEX를 단 몇 명의 요리사가 아닌, 34명의 서로 다른 요리사(태스크)가 있는 거대하고 혼란스러운 레스토랑이라고 상상해 보세요. 이 레스토랑에서는 모든 요리사가 정확히 동일한 메뉴 템플릿을 사용합니다. 수학 문제를 주문하든, 의료 진단을 주문하든, 혹은 노을 지는 풍경에 대한 설명을 주문하든, 지시문의 형태는 동일합니다. 어떤 요리사를 선택할지 알 수 있는 유일한 방법은 실제로 사진을 보고 맥락을 이해하는 것뿐입니다.

연구진은 또한 "지름길"이 되는 단서들을 제거했습니다. 화학 문제에 대한 지시문이 미술사 문제와 다르게 보이지 않도록 만들었습니다. 이를 통해 라우팅 시스템이 지름길에 의존하는 것을 멈추고, 실제 태스크가 무엇인지 파악하는 어려운 작업을 수행하도록 강제했습니다.

핵심 아이디어: 웨이터는 결국 분류기(Classifier)이다

여기서 연구진이 도입한 영리한 반전이 있습니다. 연구진은 웨이터(라우터)의 역할이 사실 **클래스 증분 학습(Class-Incremental Learning, CIL)**이라는 고전적인 머신러닝 문제와 동일하다는 것을 깨달았습니다.

CIL에서는 컴퓨터에게 새로운 카테고리(예: "고양이", 그다음 "강아지", 그다음 "새")를 이전의 것을 잊지 않고 인식하도록 가르칩니다. 연구진은 적절한 LoRA 전문가를 선택하는 것이 적절한 카테고리를 선택하는 것과 정확히 같다는 것을 보여주었습니다.

  • 태스크 1 (수학) = 클래스 1
  • 태스크 2 (미술) = 클래스 2
  • 태스크 34 (의료) = 클래스 34

이 관점을 통해, 그들은 이미 CIL을 위해 발명된 강력한 "웨이터 훈련" 기법들을 빌려올 수 있었습니다. 그들은 네 가지 서로 다른 방법(HC, HC-SOINN, RanPAC, DDAS)을 가져와 기존 로봇의 라우팅 시스템에 적용했습니다.

결과: 훨씬 더 똑똑해진 웨이터

이 새로운 "플러그인" 웨이터들을 까다로운 FLEX 레스토랑에서 테스트했을 때, 결과는 인상적이었습니다.

  • 더 나은 정확도: 새로운 라우터들은 기존의 것보다 최대 16.3 퍼센트 포인트 더 자주 올바른 요리사를 식별해 냈습니다.
  • 더 나은 성능: 로봇의 전반적인 성능(MacroScore)이 최대 4.6 포인트 향상되었습니다.
  • 격차 해소: 새로운 라우터들은 현재의 성능과 "완벽한" 성능(로봇이 항상 올바른 요리사를 아는 상태) 사이의 격차를 28%에서 50% 사이로 메울 수 있었습니다.

하지만 연구진은 모든 로봇이 동일하게 혜택을 받는 것은 아니라는 점도 발견했습니다. 일부 기존 시스템(예: HiDe-LLaVA)은 웨이터가 완벽하더라도 최종 결과물(식사)을 크게 개선할 수 없도록 설계되어 있었습니다. 이는 문제가 웨이터가 아니라 요리사가 요리하는 방식에 있었기 때문입니다. 그러나 웨이터에 크게 의존하는 시스템(예: DISCO 및 SAME)의 경우, 개선 효과는 엄청났습니다.

이것이 중요한 이유

이 논문은 로봇이 장기간 진정으로 연속 학습을 하기 위해서는, 단순히 명백한 단서가 있는 쉬운 테스트를 제공해서는 안 된다는 점을 시사합니다. 우리는 로봇이 라벨을 읽는 것이 아니라, 태스크를 실제로 이해해야 하는 환경을 구축해야 합니다. "누구를 불러야 하는가?"라는 문제를 "이것은 어떤 카테고리인가?"라는 문제로 바라봄으로써, 우리는 기존의 강력한 도구들을 사용하여 우리의 AI를 훨씬 더 신뢰할 수 있게 만들 수 있습니다.

연구진은 단순히 제안만 한 것이 아닙니다. 그들은 새로운 테스트(FLEX)를 구축했고, 기존의 테스트들이 너무 쉬웠음을 증명했으며, 새로운 라우팅 방법을 교체하는 것이 효과가 있다는 것을 보여주었습니다. 그들은 모든 것을 해결했다고 주장하는 것이 아닙니다. 완벽함과의 격차는 여전히 존재합니다. 하지만 그들은 멀티모달 AI가 혼란에 빠지지 않고 실제로 계속 학습할 수 있도록 만드는 명확하고 원칙적인 경로를 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →