← 최신 논문
🤖 machine learning

CRAFT: Forgetting-Aware Intervention-Based Adaptation for Continual Learning

CRAFT 은 작업 라우팅, KL 발산 기반 미세 조정, 그리고 개입 병합이라는 통합된 3 단계 프로세스를 통해 은닉 표현에 대한 저랭크 개입을 학습함으로써 대규모 언어 모델의 파국적 망각을 완화하고, 여러 벤치마크에서 강력한 LoRA 기반 접근법들을 능가하는 continual learning 프레임워크입니다.

원저자: Md Anwar Hossen, Fatema Siddika, Juan Pablo Munoz, Tanya Roosta, Ali Jannesari

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Md Anwar Hossen, Fatema Siddika, Juan Pablo Munoz, Tanya Roosta, Ali Jannesari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 역사, 과학, 요리 등에 대해 많은 지식을 가진 천재적이고 고도로 훈련된 사서 (대형 언어 모델) 를 상상해 보세요. 당신은 이 사서에게 매일 새로운 기술을 가르치고 싶습니다: 오늘은 코딩, 내일은 법률 문서 요약, 그 다음 날은 시 쓰기입니다.

전통적인 교육 방식의 문제는 새로운 것을 배우기 위해 사서가 자신의 뇌를 다시 써야 한다는 점입니다. 새로운 기술을 배울 때마다 실수로 이전 기억들을 지우거나 혼란스럽게 만들어 버립니다. 이를 "파괴적 망각 (catastrophic forgetting)"이라고 합니다. 만약 코딩을 배우면 시 쓰는 법을 잊을 수 있습니다.

CRAFT는 이 문제를 뇌를 다시 쓰지 않고 해결하는 새로운 교육 방식입니다. 간단한 비유를 통해 작동 원리를 설명하겠습니다:

1. 뇌를 다시 쓰는 대신 "부착식 메모"

사서의 영구 기억 (모델의 가중치) 을 변경하도록 강요하는 대신, CRAFT 는 사서에게 부착식 메모 (sticky notes) 한 묶음 (개입) 을 제공합니다.

  • 뇌: 사서의 원래 지식은 고정되어 변하지 않습니다. 절대 변경되지 않습니다.
  • 부착식 메모: 새로운 작업이 들어오면 CRAFT 는 작은 저랭크 (low-rank) "지시사항"을 메모에 적어 사서의 현재 사고 과정에 붙입니다.
  • 결과: 사서는 메모를 이용해 새로운 작업을 완벽하게 수행할 수 있지만, 원래 뇌는 그대로 유지됩니다. 뇌 자체가 건드리지 않았기 때문에 이전 기억이 지워지지 않습니다.

2. "스마트 분류기" (라우팅)

각각의 작업마다 무작위로 부착식 메모를 주는 것은 혼란스러울 뿐입니다. CRAFT 는 이러한 메모들을 정리하기 위해 스마트 분류기를 사용합니다.

  • 워밍업: 새로운 작업이 도착하면 (예: "회의 요약"), CRAFT 는 잠시 시도해 보고 어떤 "분위기"나 출력을 생성하는지 확인합니다.
  • 매칭: 이 분위기를 이미 보유한 부착식 메모 그룹들과 비교합니다.
    • 만약 새로운 작업이 "금융 뉴스"와 유사하다면, 기존 "금융" 부착식 메모 그룹과 묶입니다.
    • 만약 "파이썬 코드 작성"처럼 완전히 다르다면, 새로운 그룹을 만듭니다.
  • 추가 뇌 없음: 핵심적으로, 이 분류기 자체는 새로운 것을 배울 필요가 없습니다. 출력만 보고 "아, 이건 A 그룹 같네" 또는 "이건 새롭네, B 그룹을 만들자"라고 말할 뿐입니다.

3. "수호자" (망각 제어)

이것이 가장 교묘한 부분입니다. 사서가 부착식 메모를 이용해 새로운 작업을 배울 때, 새로운 메모가 같은 그룹의 기존 메모들을 실수로 망가뜨릴 위험이 있습니다.

  • 앵커: CRAFT 는 새로운 작업이 도착하기 전 그룹이 무엇을 알고 있었는지의 "스냅샷"을 찍습니다. 이것이 앵커입니다.
  • 안전 점검: 사서가 새로운 작업을 배우는 동안, CRAFT 는 지속적으로 확인합니다: "그룹이 과거에 알고 있던 것에서 너무 멀어지고 있지는 않나요?"
  • KL 신호: 이는 **KL 발산 (KL Divergence)**이라는 수학적 측정치를 사용하여 새로운 행동과 이전 행동 사이의 거리를 측정합니다 (이를 "이동계 (Drift Meter)"라고 생각하세요).
    • 이동이 작으면 새로운 메모를 유지해도 안전합니다.
    • 이동이 크다면 (즉, 새로운 작업이 너무 달라 기존 것들을 망가뜨릴 경우), 시스템은 학습을 중단하거나 작업을 새로운 그룹으로 이동시킵니다.
  • 병합: 작업이 안전하게 학습되면, 새로운 메모는 그룹의 공유 더미에 다시 병합되어 그룹의 지식을 업데이트하면서도 기존 내용은 깨뜨리지 않습니다.

왜 이것이 더 나은가요?

  • 효율성: 유사한 작업 간에 메모를 공유하기 때문에 다른 방법들보다 훨씬 적은 수의 "부착식 메모" (파라미터) 를 사용합니다.
  • 망각 없음: 원래 뇌는 고정되어 있고 메모들은 신중하게 관리되기 때문에, 사서는 오늘 배우는 동안 어제 배운 모든 것을 기억합니다.
  • 간단함: 무엇을 할지 결정하기 위해 복잡한 "게이팅" 시스템이 필요하지 않습니다. 출력만 보고 자연스럽게 정리합니다.

결론

CRAFT 는 지속적 학습을 "뇌를 다시 쓰는 것"이 아니라 부착식 메모 도서관을 정리하는 것으로 다룹니다. 뇌를 고정시키고 새로운 메모가 기존 메모를 망가뜨리지 않도록 보장하는 단일 "이동계"를 사용함으로써, 대형 언어 모델이 자신이 누구인지 잊지 않고 영원히 학습할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →