← 최신 논문
🤖 AI

Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents

이 논문은 가중치가 고정된 AI 에이전트가 정적 모델을 배포 피드백을 검색 가능한 자연어 규칙으로 증류하는 외부 메모리 시스템과 결합함으로써, 모델 재학습 없이도 이전에 해결 불가능했던 과제들을 해결할 수 있게 하여 상당한 지속 학습 개선을 달성할 수 있음을 입증한다.

원저자: Valentin Tablan, Scott Taylor, Kristoffer Bernhem

게시일 2026-07-27
📖 5 분 읽기🧠 심층 분석

원저자: Valentin Tablan, Scott Taylor, Kristoffer Bernhem

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 퍼즐을 풀려고 할 때마다 타이머가 멈추는 순간 규칙을 잊어버리는 세상을 상상해 보십시오. 만약 오늘 까다로운 수학 문제를 풀었다 하더라도, 내일은 그 문제가 정확히 똑같더라도 처음부터 다시 시작해야 합니다. 이것이 현재 많은 인공지능(AI) 에이전트들이 처한 현실입니다. 이들은 출시될 때 고정되어 버리는 '동결된(frozen)' 뇌를 가진 강력한 모델들로 구축되었습니다. 이들은 뇌의 배선을 바꾸는 것이 비용이 많이 들고, 위험하며, 느리기 때문에 실시간으로 자신의 실수를 통해 배울 수 없습니다. 하지만 현실 세계에서 이 에이전트들은 끊임없이 피드백을 받습니다. 고객은 "그렇게 하니 잘 되네요!"라고 말할 수도 있고, 인간은 실수를 바로잡으며 "이렇게 하는 게 정답이에요"라고 말할 수도 있습니다. 과학자들이 던지는 큰 질문은 이것입니다. "우리가 이 동결된 뇌를 가진 에이전트들에게, 뇌를 실제로 바꾸지 않고도 자신의 과거 경험이 담긴 '치트 시트(요약 노트)'를 읽는 것만으로 더 똑똑해지는 법을 가르칠 수 있을까?"

"Learning on the Job"이라는 제목의 이 논문은 영리한 우회 방법을 탐구합니다. 연구진은 AI의 뇌를 재배선하려고 노력하는 대신, 에이전트에게 외부적인 노트—즉, 메모리 시스템—를 주었습니다. 에이전트는 과업을 마칠 때 결과를 확인하고(성공했는가 실패했는가?), 이 내용을 짧은 자연어 규칙으로 작성하여 이 노트에 적습니다. 예를 들어, "고객이 환불을 요청하면, 먼저 날짜를 확인하라"와 같이 적는 것입니다. 나중에 에이전트가 유사한 상황에 직면했을 때, 자신의 노트를 확인하고 행동합니다. 이 연구는 AI가 복잡한 규칙을 탐색하며 고객을 도와야 하는 뱅킹 시뮬레이션에서 테스트되었습니다. 연구 결과, 단순히 자신의 노트를 읽는 것만으로도 에이전트들은 업무 능력이 크게 향상되었습니다. 단지 "승/패" 신호만으로 학습한 에이전트는 성공률이 1.6배 향했고, 상세한 교정 내용을 통해 학습한 에이전트는 2.6배 향상되었습니다. 더 멋진 점은, 한 유형의 AI가 작성한 노트가 완전히 다른 유형의 AI에게도 유용했다는 것입니다. 이는 이 "경험"이 도서관의 책처럼 공유될 수 있음을 증명합니다.

문제점: AI 건망증

오늘날 가장 진보된 AI 에이전트들을 매우 유능하지만 매우 건망증이 심한 인턴이라고 생각해보십시오. 당신은 그들을 고용하고, 그들에게 참조할 방대한 정책 서적(이 연구에서는 약 700개의 문서)을 주고 고객을 돕게 합니다. 만약 그들이 어려운 문제를 해결한다면 아주 좋습니다! 하지만 대화가 끝나는 순간, 그들의 단기 기억은 깨끗이 지워집니다. 만약 그 까다로운 고객이 내일 다시 전화를 한다면, 에이전트는 어제 무슨 일이 있었는지 전혀 알지 못합니다. 다시 제로(0)에서 시작해야 합니다.

이러한 건망증의 원인은 구조적(architectural)입니다. 이 에이전트들은 "동결된 가중치(frozen weights)"를 가진 모델 위에서 구동됩니다. 모델의 뇌를 찰흙으로 만든 거대하고 정교한 조각상이라고 상상해 보십시오. 일단 조각상이 구워지고 딱딱하게 굳으면(배포되면), 전체를 다시 녹여서 처음부터 시작하지 않고서는 새로운 찰흙을 덧붙이거나 깎아낼 수 없습니다. 그것을 녹이는 것은 위험하며(기존에 알고 있던 모든 것을 잊어버릴 수 있음), 비용이 많이 듭니다. 그래서 현실 세계에서 이 에이전트들은 동결된 상태로 유지됩니다. 그들은 업무 첫날만큼이나 마지막 날에도 동일한 능력을 갖추고 있습니다.

해결책: 외부 노트

연구진은 질문했습니다. "만약 에이전트가 배우기 위해 뇌를 바꿀 필요가 없다면 어떨까? 그저 노트만 있으면 된다면?"

연구진은 동결된 AI와 Spark라고 불리는 시스템을 결មាន했습니다. Spark를 에이전트가 메모를 쓰고 읽을 수 있는 공유된 마법 같은 도서관이라고 생각하십시오. 에이전트는 과업을 마칠 때 경험을 그냥 버리지 않습니다. 대신, 일어난 일을 되돌아보고 도서관에 "규칙"을 작성합니다.

  • "경험(Experience)" 모드: 에이전트는 단순한 엄지 척 또는 엄지 아래로(1비트의 판결)를 받습니다. 스스로 교훈을 찾아내야 합니다. "X를 시도했는데 실패했다. 다음에는 X를 피해야겠다."
  • "지시(Instruction)" 모드: 에이전트는 엄지 아래로 신호와 함께 정답을 받습니다. "X를 시도했는데 실패했다. 올바른 방법은 Y이다."

에이전트는 이러한 교훈을 "고객이 송금을 요청할 때는 항상 일일 한도를 먼저 확인하라"와 같은 간단한 자연어 규칙으로 작성합니다. 이 규칙들은 Spark 라이브러리에 저장됩니다. 다음에 에이전트가 고객을 마주할 때, 행동하기 전에 라이브러리에서 관련 규칙을 검색합니다.

실험: 기억에 거는 도박

이를 테스트하기 위해 팀은 τ-bench라는 까다로운 뱅킹 벤치마크를 사용했습니다. AI가 은행원 역할을 수행하는 비디오 게임을 상상해 보십시오. "고객"은 다른 AI들에 의해 시뮬레이션되며, 이들은 숨겨진 목표와 까다로운 요청을 가지고 있습니다. 에이전트는 방대한 정책 문서 더미를 검색하여 은행의 규칙을 파악해야 합니다. 이는 어렵습니다. 최고의 AI 모델들도 첫 시도에서 이러한 과업의 약 25%만을 해결합니다.

연구진은 두 가지 서로 다른 AI 모델로 실험을 진행했습니다:

  1. Mistral Large: 기업들이 자체 서버에서 실행할 수 있는 강력한 오픈 소스 모델입니다.
  2. Claude Sonnet 5: 최첨단 프런티어 모델입니다.

그들은 각 모델에 대해 세 가지 시나리오를 테스트했습니다:

  1. 베이스라인(The Baseline): 에이전트는 정책 라이브러리는 가지고 있지만 메모리는 없습니다. 시도 사이마다 모든 것을 잊어버립니다.
  2. 경험(Experience): 에이전트는 라이브러리와 메모리 노트를 가지고 있지만, 단순한 "승/패" 신호로부터만 학습합니다.
  3. 지시(Instruction): 에이전트는 라이브러리와 메모리 노트를 가지고 있으며, "승/패" 신호와 더불어 실패 후의 정답으로부터 학습합니다.

결과: 제로에서 히어로로

결과는 놀라웠습니다. 메모리 노트를 사용한 에이전트들은 훨씬 더 나은 성과를 냈으며, 동결된 뇌의 뉴런 하나도 바꾸지 않고 이를 해냈습니다.

  • 교정의 힘: Mistral Large 모델의 경우, "지시" 그룹(교정으로부터 학습하는 그룹)은 베이스라인과 비교했을 때 첫 시도에서 2.6배 더 많은 과업을 해결했습니다. 그들은 베이스라인 에이전트가 아무리 반복해도 결코 해결하지 못했던 84개 중 22개의 과업을 해결해 냈습니다.
  • 경험의 힘: 단순한 "승/패" 신호로부터 배우는 것만으로도 도움이 되었습니다. "경험" 그룹은 베이스라인보다 1.6배 향상되었습니다.
  • 학습 곡선: 초반에는 모든 에이전트가 똑같이 형편없었는데, 이는 노트가 비어 있었기 때문입니다. 하지만 시도가 계속됨에 따라, 노트를 가진 에이전트들은 점점 더 똑똑해졌습니다. 베이스라인 에이전트는 평탄한 상태를 유지한 반면, 학습하는 에이전트들은 매 시도마다 더 높이 올라갔습니다.
  • 교차 모델의 마법: 연구진은 매우 멋진 일을 했습니다. Mistral Large가 구축한 노트를 가져다가 Claude Sonnet 5가 읽을 수 있게 했고(그 반대도 마찬가지), 그 반대로도 했습니다. 서로 다른 모델이었음에도 불구하고, 그 노트들은 유용했습니다! Claude의 노트를 읽었을 때 Mistral 모델의 성공률이 크게 향상되었습니다. 이는 노트에 저장된 지식이 단순히 "Mistral의 스타일"이 아니라, 어떤 에이전트도 사용할 수 있는 일반적이고 유용한 지식임을 입증합니다.

이것이 왜 중요한가

이 논문은 AI를 재학습시키는 거대한 비용과 위험 없이도 AI를 더 똑똑하게 만드는 새로운 방법을 제시합니다. AI의 뇌를 녹이고 재형성하려 하는 대신, 우리는 그저 더 나은 기억 방법을 제공할 수 있습니다.

이 연구는 또한 몇 가지 아이디어를 검증했습니다. 예를 들어, 연구진은 에이전트들이 단순히 답을 "캐싱(저장)"하고 있는 것인지(특정 퍼즐의 정답을 암기하는 것인지) 확인했습니다. 그들은 그렇지 않다는 것을 발견했습니다. 에이전트들은 특정 정답을 외우는 것이 아니라, 새로운 변형의 문제를 해결하는 데 도움이 되는 규칙(예: "날짜를 확인하라")을 학습하고 있었습니다. 또한, 이러한 학습이 이미 잘하고 있는 일들을 못하게 만들지 않는다는 것도 보여주었습니다. 그들은 새로운 기술을 얻으면서도 기존의 기술을 유지했습니다.

요약하자면, 이 연구는 동결된 AI 에이전트들에게 매일 받는 피드백이—그것이 단순한 "잘했어"이든 상세한 교정이든—그들이 배운 것을 적어둘 장소만 있다면 평생 학습자로 변모하기에 충분하다는 것을 보여줍니다. 이는 한 에이전트의 경험을 공유된 조직적 자산으로 바꾸어 놓으며, 한 번에 하나의 노트를 통해 전체 시스템을 더 똑똑하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →