← 최신 논문
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

본 논문은 기존 파라미터 업데이트 방식에 비해 LLM 이 텍스트 피드백을 더 효율적으로 학습하고, 더 높은 성능을 달성하며, 더 큰 가소성을 유지하면서도 파국적 망각을 크게 줄일 수 있도록 고정된 모델 파라미터("느린" 가중치) 와 최적화된 컨텍스트("빠른" 가중치) 를 결합하는 프레임워크인 Fast-Slow Training(FST) 을 소개한다.

원저자: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수학 문제, 코딩 챌린지, 사실 확인 퍼즐과 같은 복잡한 퍼즐을 푸는 방법을 천재적이지만 융통성 없는 학생 (대형 언어 모델) 에게 가르친다고 상상해 보세요.

전통적으로, 이 학생이 더 나아지기를 원할 때 우리는 그들의 뇌를 다시 쓰는 것 (모델의 내부 매개변수 업데이트) 으로 새로운 규칙을 암기하도록 강요합니다. 이는 스펀지를 새로운 물에 담갔다가 다시 짜내는 것과 같습니다. 문제는 짜낸 후, 이전 물 (그들의 원래 일반 지식) 이 새어 나간다는 것입니다. 그들은 가르쳐 준 특정 퍼즐에 매우 능숙해지지만, 좋은 일반적 사고자가 되는 법을 잊어버리고 다음 퍼즐을 배우는 데 어려움을 겪습니다. 이를 '파괴적 망각 (catastrophic forgetting)'이라고 합니다.

반면, 각 특정 퍼즐에 대해 학생에게 요약 노트 (프롬프트) 를 줄 수도 있습니다. 이는 저렴하고 빠르지만, 학생은 여전히 원래의 두뇌 능력을 의존해야 합니다. 퍼즐이 너무 어렵다면 요약 노트만으로는 만점을 받기에 충분하지 않습니다.

"빠르고 느린" 해결책
이 논문은 빠른-느린 학습 (Fast-Slow Training, FST) 이라는 새로운 학습 방법을 소개합니다. 이는 학생의 학습 과정을 두 트랙 시스템처럼 취급함으로써 양쪽 세계의 장점을 결합합니다:

  1. 느린 트랙 (뇌): 이는 모델의 영구 가중치입니다. 장기 기억처럼 느리게 학습합니다. 이는 학생의 핵심 추론 능력과 일반 지식을 온전하게 유지하는 데 중점을 둡니다.
  2. 빠른 트랙 (요약 노트): 이는 "맥락" 또는 프롬프트입니다. 임시 스티커 메모처럼 매우 빠르게 학습합니다. 이는 학생의 뇌를 영구적으로 변경하지 않고 현재 작업의 구체적이고 까다로운 세부 사항을 흡수합니다.

작동 원리 (비유)
당신이 새로운 어려운 요리를 배우는 요리사 (AI) 를 훈련한다고 상상해 보세요.

  • 옛 방법 (느린 학습만): 요리사의 전체 요리 철학을 다시 쓰는 방식으로 레시피를 암기하도록 강요합니다. 그들은 이 한 가지 요리에는 뛰어나게 되지만, 다른 요리를 만드는 법을 잊어버리고 나중에 약간 다른 버전을 요리하라고 요청하면 적응하지 못합니다.
  • FST 방법: 요리사의 기본 기술 (느린 트랙) 을 그대로 유지합니다. 대신 그들에게 동적이고 진화하는 레시피 카드 (빠른 트랙) 를 줍니다.
    • 요리사가 요리를 시도하다 실수를 할 때마다, "코치" (시스템) 는 오류를 살펴보고 즉시 레시피 카드에 구체적인 팁 (예: "3 단계가 될 때까지 소금을 넣지 마세요") 을 추가합니다.
    • 요리사는 이 업데이트된 카드를 사용하여 다시 시도합니다.
    • 요리사가 이러한 카드를 사용하여 요리를 마스터한 후에야 우리는 그들의 기본 요리 스타일 (느린 트랙) 에 미세하고 신중한 조정을 가합니다.

왜 이것이 더 나은지 (결과)
이 논문은 이 접근 방식이 세 가지 주요 방식으로 승리한다고 주장합니다:

  1. 더 빠르고 저렴함: "레시피 카드" (빠른 트랙) 가 새로운 정보를 즉시 흡수할 수 있기 때문에 시스템이 작업을 훨씬 빠르게 학습합니다. 논문은 동일한 성능 수준에 도달하는 데 기존 방법보다 최대 3 배 적은 시도가 필요하다고 말합니다.
  2. 잊지 않음: 요리사의 기본 뇌 (느린 트랙) 가 끊임없이 다시 쓰이지 않기 때문에, 그들은 일반 요리 기술을 잃지 않습니다. 논문은 모델이 원래의 똑똑한 자아에 훨씬 더 가깝게 유지되어 "일반적 추론자"가 되는 법을 잊지 않는다고 보여줍니다.
  3. 다음 도전에 대비함: 요리사의 뇌가 첫 번째 요리에 과도하게 특화되지 않았기 때문에, 그들은 이전 것을 "잊어버릴" 필요 없이 즉시 새로운 요리를 배우기 시작할 수 있습니다. 논문은 학습 중간에 작업을 전환하여 이를 테스트했는데, FST 모델은 매끄럽게 적응한 반면 기존 모델은 완전히 멈췄습니다.

비밀 재료: 요리사 팀
이 논문은 또한 교묘한 트릭을 언급합니다. 단 하나의 레시피 카드만 사용하는 대신, 서로 다른 레시피 카드들의 팀 (프롬프트 군집) 을 유지합니다. 어떤 카드는 수학에 뛰어나고, 다른 카드는 코딩에 뛰어납니다. 시스템은 이를 혼합하여 "느린 트랙"이 문제를 해결하는 다양한 방식을 볼 수 있게 함으로써 혼란 없이 더 잘 학습하도록 돕습니다.

요약하자면
이 논문은 AI 모델이 모든 새로운 작업을 암기하도록 뇌를 다시 쓰는 것을 강요해서는 안 된다고 주장합니다. 대신, 그들이 일반 지능 (느린) 을 유지하면서 특정 작업을 처리할 수 있는 초고속이고 적응력 있는 일련의 지시사항 (빠른) 을 제공해야 합니다. 이는 그들을 더 똑똑하게 만들고, 학습 속도를 높이며, 이전 것을 잊지 않고 새로운 것을 배우는 능력을 향상시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →