← 최신 논문
🤖 machine learning

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

이 논문은 강화학습에서 도메인 중립적 기술 벡터를 선형적으로 주입함으로써 지식 통합과 에이전트 도구 사용을 위한 효율적이고 효과적인 지속적 적응을 가능하게 하여 대형 언어 모델의 적응에 있어 지도 미세조정의 한계를 해결하는 매개변수 기술 전이 (PaST) 라는 프레임워크를 제안합니다.

원저자: Pingzhi Tang, Yiding Wang, Muhan Zhang

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pingzhi Tang, Yiding Wang, Muhan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"지식만으로는 부족하다: 지속적 적응을 위한 RL 기술 주입"이라는 논문을 쉬운 언어와 창의적인 비유로 설명합니다.

큰 문제: "똑똑하지만 무지한" 학생

상상해 보세요. 도서관의 거의 모든 책을 특정 날짜까지 읽은 천재 학생 (대형 언어 모델, 또는 LLM) 이 있습니다. 이 학생은 이미 알고 있는 내용을 바탕으로 질문에 답하는 데 매우 뛰어납니다.

하지만 세상은 계속 변합니다. 매일 새로운 사실들이 등장합니다 (어제 통과된 새로운 법률이나 오늘 아침 출시된 새로운 앱처럼).

  • 옛날 방식 (SFT): 학생에게 이 새로운 사실들을 가르치기 위해 보통은 새로운 텍스트를 암시하게 합니다. 시험 전날 새로운 교과서를 억지로 외우게 하는 것과 같습니다. 그들은 사실을 완벽하게 읊어낼 수 있지만, 시험이 그 사실들을 까다로운 상황에서 사용하라고 요구하면 종종 얼어붙거나, 잘못 추측하거나, 사실을 지어냅니다 (할루시네이션). 그들은 지식은 있지만, 그것을 적용할 기술이 부족합니다.
  • 비싼 방식 (RL): 그들이 어떻게 생각하고 문제를 해결하는지 가르치기 위해 보통 강화 학습 (RL) 을 사용합니다. 이는 학생이 문제를 반복해서 풀도록 하는 개인 코치를 고용하고, 정답을 맞출 때 보상을 주는 것과 같습니다. 이는 매우 효과적이지만, 엄청난 시간과 비용이 듭니다. 세상에 나오는 모든 새로운 사실마다 코치를 고용할 수는 없습니다.

발견: 두 가지 다른 유형의 뇌 변화

베이징 대학의 연구자들은 이 두 가지 과정에서 학생의 뇌가 어떻게 변하는지에 대해 흥미로운 사실을 발견했습니다.

그들은 학생이 사실을 암기할 때 (SFT) 와 추론 기술을 학습할 때 (RL), 변화가 뇌의 완전히 다른 부분에서 일어난다는 것을 발견했습니다.

  • 비유: 학생의 뇌를 거대한 도서관이라고 상상해 보세요.
    • SFT는 선반에 새로운 책을 추가하는 것과 같습니다. 이는 도서관의 내용을 변경합니다.
    • RL은 사서가 책을 어떻게 찾고, 상호 참조하며, 이를 이용해 퍼즐을 푸는지 훈련하는 것입니다. 이는 도서관의 조직과 논리를 변경합니다.
    • 핵심 통찰: 이 두 가지 변화는 서로 방해하지 않습니다. 그들은 "직교"하며, 즉 서로 겹치지 않는 별도의 공간에서 일어납니다. 사서의 논리를 망가뜨리지 않고 새로운 책을 추가할 수 있고, 선반의 책을 변경하지 않고 사서를 훈련시킬 수 있습니다.

해결책: PaST (매개변수 기술 전이)

이 두 가지 변화가 분리되어 있기 때문에, 연구자들은 PaST라는 교묘한 단축키를 고안해냈습니다.

작동 방식:

  1. "기술 벡터" 추출: 모든 새로운 주제마다 학생을 다시 훈련시키는 대신, 비싼 "코치" 방법 (RL) 으로 이미 한 주제 (예: 영화) 에 대해 훈련된 모델을 가져옵니다. 그런 다음 이 "똑똑한" 모델과 사실만 암기한 "멍청한" 버전을 비교합니다. 이 둘 사이의 차이가 "기술 벡터"입니다.
    • 비유: 이 기술 벡터를 보편적인 "방법" 매뉴얼이나 근육 기억 칩이라고 생각하세요. 이는 특정 사실에 묶이지 않고 "문제를 해결하는 방법"의 순수한 논리를 담고 있습니다.
  2. 기술 주입: 새로운 주제 (예: 새로운 법률 문서) 가 등장하면, 먼저 학생에게 새로운 사실을 빠르게 가르칩니다 (경량 SFT). 그런 다음 단순히 "기술 벡터"를 학생의 뇌에 붙입니다.
    • 비유: 이는 학생에게 새로운 교과서 (사실) 를 주고, 영화 훈련에서 배운 "문제 해결 칩" (기술) 을 즉시 꽂아주는 것과 같습니다. 이제 학생은 새로운 사실을 알고 있을 뿐만 아니라, 새로운 코치가 필요 없이 그 사실을 정확히 어떻게 사용할지 알게 됩니다.

이것이 중요한 이유

이 논문은 세 가지 다른 도전 과제에서 이를 테스트했습니다:

  1. 독해 (SQuAD): 모델은 지문을 암기하고 텍스트를 다시 보지 않고 질문에 답해야 했습니다. PaST 는 단순히 암기하는 것보다 모델이 정답을 찾는 능력을 훨씬 더 향상시켰습니다.
  2. 긴 문서 (LooGLE): 텍스트가 거대할 때 (예: 2 만 단어 문서), 표준 방법들은 길을 잃었습니다. PaST 는 모델이 집중하고 올바른 정보를 찾도록 도와주었습니다.
  3. 도구 사용 (ToolBench): 모델은 API 를 사용해야 했습니다 (예: 인스타그램 게시물 다운로드). 인스타그램 계정이 비공개일 때, 일반적인 모델은 새로운 가짜 도구를 사용하겠다고 추측하기만 했습니다. PaST 모델은 계정이 비공개임을 인지하고 추측을 멈추며 정답을 제시했습니다: "계정이 비공개라서 이를 수행할 수 없습니다."

결론

이 논문은 지식과 기술은 별개의 것임을 증명합니다. 새로운 정보를 줄 때마다 모델의 "생각" 능력을 재훈련하기 위해 거액을 쓸 필요가 없습니다. 대신, "생각" 기술을 한 번 학습한 후 이를 휴대 가능한 도구로 추출하여 어떤 새로운 상황에도 연결할 수 있습니다. 이는 AI 가 현실 세계에 적응하는 속도를 훨씬 더 빠르고, 저렴하며, 똑똑하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →