← 최신 논문
🤖 machine learning

Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts

본 논문은 300 개 이상의 매우 긴 작업 시퀀스를 효과적으로 처리하기 위한 이중 수준 라우팅 혼합 전문가 메커니즘을 활용하는 확장 가능한 지속적 학습 프레임워크인 CaRE 를 제안하며, 동시에 평가를 위한 까다로운 OmniBenchmark-1K 데이터셋을 소개합니다.

원저자: Meng Lou, Yunxiang Fu, Yizhou Yu

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Meng Lou, Yunxiang Fu, Yizhou Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 한 번에 하나의 새로운 카테고리씩 수천 가지의 다른 사물을 인식하도록 가르친다고 상상해 보세요. 문제는 새로운 것 (예: "코기") 을 가르칠수록 이전에 배운 것 (예: "햄버거") 을 잊어버리는 경향이 있다는 것입니다. 이를 "재앙적 망각 (catastrophic forgetting)"이라고 합니다.

이 논문은 이러한 문제를 해결하기 위해 CaRE(Continual Learner with efficient Bi-Level Routing Mixture-of-Experts, 효율적인 2 단계 라우팅 혼합 전문가를 갖춘 지속 학습자) 라는 새로운 시스템을 소개합니다. 작동 원리를 간단히 설명하면 다음과 같습니다:

1. 문제: "일률적 해결책"의 함정

대부분의 기존 AI 시스템은 이미 가진 동일한 "뇌"를 조정하여 새로운 작업을 학습하려 합니다. 개에 대해 가르치면, 고양이를 인식하는 규칙이 실수로 덮어써질 수 있습니다.

  • 논문의 통찰: AI 에게 모든 작업에 동일한 "뇌"를 사용하도록 강요하는 대신, CaRE 는 AI 에게 방대한 전문 도구 라이브러리를 제공합니다. 새로운 작업이 들어오면 AI 는 단순히 학습하는 것을 넘어, 라이브러리에서 올바른 도구를 선택하는 방법을 학습합니다.

2. 해결책: "스마트 사서" 시스템 (BR-MoE)

CaRE 는 Bi-Level Routing Mixture-of-Experts(BR-MoE, 2 단계 라우팅 혼합 전문가) 라는 메커니즘을 사용합니다. AI 의 뇌를 수많은 전문 "전문가"(미니 뇌) 가 들어 있는 거대한 도서관으로 생각해보세요.

  • 1 단계: 수석 사서 (라우터 선택)
    새로운 이미지 (예: 코기 사진) 가 들어오면 시스템은 단순히 추측하지 않습니다. 대신 일련의 "수석 사서"(Class Perceptrons라고 함) 에게 이미지를 보고 "이것이 당신의 특정 섹션에 속한다고 얼마나 확신하십니까?"라고 묻습니다.

    • "개 사서"가 매우 확신한다면 (불확실성이 낮음), 선택됩니다.
    • "자동차 사서"가 혼란스러워한다면 (불확실성이 높음), 무시됩니다.
    • 비법: 시스템은 단순히 하나만이 아니라 가장 관련 있어 보이는 상위 몇몇 사서들을 선택합니다. 이를 통해 AI 는 주된 개념에 집중하면서도 관련 개념 (예: 다른 동물들) 을 고려하게 됩니다.
  • 2 단계: 전문 전문가 (동적 전문가 라우팅)
    상위 사서들이 선택되면, 그들은 각각 자신의 전문 전문가(작고 효율적인 어댑터) 팀을 소집합니다.

    • 각 전문가는 과거 작업에 특화되어 훈련된 미니 뇌입니다 (예: 한 전문가는 개에 대해, 다른 전문가는 새에 대해 모두 알고 있습니다).
    • 사서들은 현재 이미지에 가장 도움이 되는 상위 몇몇 전문가들을 활성화합니다.
    • "공유 전문가": 또한 지금까지 배운 모든 것에 대해 조금씩 알고 있는 "슈퍼 전문가" 한 명도 있습니다. 이는 AI 가 일반적인 지식을 잃지 않도록 보장합니다.

3. "모든 레이어"의 이점

일반적으로 AI 시스템은 매우 마지막 단계에서만 결정을 내립니다. CaRE 는 다릅니다. 이 "사서 + 전문가" 시스템이 뇌의 단일 레이어마다 내장되어 있습니다.

  • 비유: 공장의 조립 라인을 상상해 보세요. 일반 공장에서는 최종 관리자가 제품에 대해 무엇을 할지 결정합니다. 반면 CaRE 에서는 라인 위의 모든 작업자 (모든 레이어) 가 그 순간 바로 어떤 특정 도구를 사용할지 결정하는 자신만의 미니 사서를 가지고 있습니다. 이를 통해 AI 는 사물에 대해 매우 세밀하고 정확한 그림을 단계별로 구축할 수 있습니다.

4. 새로운 도전: "OmniBenchmark-1K"

이것이 작동함을 증명하기 위해 저자들은 기존 테스트들이 너무 쉽다는 점을 깨달았습니다. 대부분의 테스트는 20 가지 작업 (예: 20 가지 유형의 동물 학습) 만 포함했습니다.

  • 그들은 OmniBenchmark-1K라는 새롭고 매우 어려운 테스트를 만들었습니다.
  • 이 데이터셋은 1,000 개의 서로 다른 클래스(카테고리) 와 거의 20 만 개의 이미지를 포함합니다.
  • 그들은 CaRE 를 100 개, 200 개, 그리고 심지어 301 개의 작업을 연속으로 가르치며 테스트했습니다.
  • 결과: 다른 AI 시스템들은 작업 수가 늘어남에 따라 실패하고 무언가를 잊기 시작했지만, CaRE 는 계속 더 좋아졌습니다. 작업 목록이 엄청나게 길었을 때도 CaRE 는 다른 모든 방법보다 훨씬 큰 차이로 우위를 점했습니다.

요약

CaRE 는 단순히 사실을 암기하는 학생이 아니라, 올바른 상황에 맞는 올바른 기억을 어떻게 회상할지 배우는 학생과 같습니다.

  1. 가장 관련 있는 "기억 방"(1 단계 라우팅) 을 찾기 위해 자신의 확신을 확인합니다.
  2. 문제를 해결하기 위해 해당 방에서 특정 "도구"(2 단계 라우팅) 를 꺼냅니다.
  3. 마지막 단계가 아닌 사고 과정의 모든 단계에서 이를 수행합니다.

이를 통해 CaRE 는 이전 것들을 잊지 않고 수백 가지의 새로운 것을 학습할 수 있으며, 이는 이 규모에서 성공적으로 입증된 바 없는 다른 어떤 시스템도 이루지 못한 업적입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →