Personalizing Large Language Model Agents with Small Policy Models
이 논문은 베이지안 컨텍스추얼 톰슨 샘플링을 통해 스칼라 피드백으로부터 사용자 특유의 실행 선호도를 학습함으로써, 비용이 많이 드는 미세 조정 없이도 고정된 대규모 언어 모델 에이전트의 온라인 개인화를 가능하게 하는 경량화된 인수 분해 정책 레이어인 FABLE을 소개한다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 거의 모든 것을 알고 있는 초지능형 로봇과 대화하고 있다고 상상해 보세요. 이 로봇은 읽고, 쓰고, 웹 브라우저나 계산기 같은 도구도 사용할 수 있는 거대한 도서관과 같습니다. 하지만 여기에는 함정이 있습니다. 이 로봇은 "얼어붙어(frozen)" 있습니다. 로봇이 너무 크거나, 비용이 너무 많이 들거나, 혹은 회사가 코드 수정을 허용하지 않아서 당신은 로봇의 뇌를 다시 쓰거나 성격을 바꿀 수 없습니다. 그렇다면 어떻게 이 거대하고 변경 불가능한 로봇을 당신만의 개인 비서처럼 만들 수 있을까요?
이것이 바로 대규모 언어 모델(LLM) 에이전트의 퍼즐입니다. 이들은 단순히 채팅만 하는 것이 아니라, 항공권을 검색하거나 달력을 확인하는 것과 같은 행동을 취하는 AI 시스템입니다. 문제는 이 로봇이 똑똑하긴 하지만, 당신의 구체적인 스타일은 모른다는 점입니다. 예를 들어, 어떤 사람은 긴 설명을 싫어하고 빠른 답변을 원하는 반면, 당신의 친구는 상세한 단계별 가이드를 좋아할 수도 있습니다. 보통 이를 해결하려면 로봇을 "파인 튜닝(fine-tuning)"해야 하는데, 이는 마치 코끼리에게 새로운 춤 동작을 가르치기 위해 코끼리 전체를 재훈련시키는 것과 같습니다. 매우 무겁고, 비용이 많이 들며, 종종 불가능한 일입니다.
당신이 읽게 될 논문은 이 문제를 다음과 같이 해결합니다: 우리는 얼어붙은 로봇의 뇌를 바꾸지 않고도 우리에게 적응하도록 가르칠 수 있을까? 저자들은 영리한 묘책을 제안합니다. 로봇을 바꾸는 대신, 로봇 외부에 서 있는 작고 가벼운 "코치"를 만드는 것입니다. 이 코치는 로봇이 무엇을 하는지 지켜보고, 당신의 피드백(예: 엄지 척 또는 엄지 아래로)을 들으며, 로봇이 당신이 선호하는 선택을 하도록 유도하는 법을 배웁니다. 이는 거대하고 움직일 수 없는 조각상에게 새로운 근육을 새겨 넣는 대신, 당신을 바라보도록 머리의 각도를 조절하라고 말하는 개인 트레이너와 같습니다.
문제점: 말을 듣지 않는 로봇
당신이 여행사 로봇에게 여행 계획을 세워달라고 요청한다고 가정해 봅시다.
- 사용자 A는 이렇게 말합니다: "내 과거 여행 기록을 확인하고, 현재 가격을 찾아보고, 무엇인가 예약하기 전에 나에게 물어봐 줘."
- 사용자 B는 이렇게 말합니다: "내 기록은 보지 말고, 그냥 질문 없이 즉시 가장 저렴한 항공편을 찾아줘."
로봇이 얼어붙어 있다면, 이러한 차이점을 쉽게 학습할 수 없습니다. 로봇은 그냥 추측할 뿐입니다. 만약 당신이 "질문하는 건 싫어"라고 말한다면, 프롬프트에 적어 넣을 수는 있겠지만, 로봇은 나중에 그것을 잊거나 무시할 수도 있습니다. 만약 로봇 전체를 재훈련시키려 한다면 엄청난 돈이 들 것입니다. 이 논문은 기존 방식들이 로봇을 바꾸려고 시도하거나(너무 어려움), 단순히 규칙 목록을 제공하거나(너무 경직됨) 한다고 주장합니다. 그들은 당신의 반응으로부터 실시간으로 학습하지 못합니다.
해결책: FABLE, 작은 코치
저자들은 FABLE(Factorized Adaptive Bandit Layer for Execution)을 소개합니다. FABLE를 당신과 거대한 얼어붙은 로봇 사이에 위치한 스마트하고 작은 소프트웨어 계층이라고 생각하세요. 이것은 로봇의 뇌를 건드리지 않습니다. 단지 로봇이 당신을 위해 어떻게 행동해야 하는지를 결정할 뿐입니다.
FABLE가 어떻게 작동하는지 몇 가지 재미있는 비유를 통해 설명하겠습니다.
요소별 메뉴 (분해하기):
로봇이 무엇을 할지 결정할 때, 실제로 세 가지 별개의 선택을 동시에 내립니다:- 메모리: 사용자의 과거 대화를 살펴볼 것인가?
- 도구: 검색 엔진을 사용할 것인가, 아니면 그냥 추측할 것인가?
- 스타일: 직접적일 것인가, 수다스러울 것인가, 아니면 확인 질문을 할 것인가?
"평면적인(flat)" 접근 방식은 이 선택들의 모든 조합(예: "메모리 + 검색 + 수다스러움"은 하나이고, "메모리 + 검색 안 함 + 직접적임"은 또 다른 것)을 한꺼번에 배우려고 할 것입니다. 그것은 마치 1,000가지 재료가 들어간 레스토랑의 모든 메뉴 아이템을 외우려는 것과 같습니다. FABLE는 더 똑똑합니다. 그것은 메뉴를 분해합니다. 당신이 검색이나 도구를 사용하는지와 상관없이 일반적으로 "수다스러운" 스타일을 싫어한다는 것을 배웁니다. 그것은 당신의 선호도를 구성하는 재료들을 따로 학습하며, 이를 통해 훨씬 빠르게 학습합니다.
잔차 점수 (더해지는 맛):
얼어붙은 로봇은 이미 고유의 "기본" 행동 방식을 가지고 있습니다. 아마도 매우 예의 바르고 상세하게 행동하는 것이 기본일 수 있습니다. FABLE는 그 예의 바름을 다시 배우려고 하지 않습니다. 대신, F 是否 로봇을 당신의 것으로 만드는 잔차(residual), 즉 추가적인 부분만을 학습합니다. 만약 로봇이 자연적으로 80% 정도 예의 바르다면, FABLE는 당신이 10% 정도 덜 예의 바르기를 원한다는 것을 배웁니다. 이는 미리 만들어진 수프를 다시 만드는 것이 아니라, 당신이 좋아하는 특정한 소금 한 꼬집을 추가하는 것과 같습니다.안전 필터 (문지기):
때로는 특정 행동을 할 수 없을 때가 있습니다. 예를 들어, 당신이 은행 계좌에 접근할 권한이 없거나 도구가 고장 났을 수 있습니다. FABLE에는 선택을 하기 전에 규칙을 확인하는 "문지기"가 있습니다. 문지기는 "좋아, 오늘은 은행 도구를 사용할 수 없으니, 우리가 할 수 있는 목록 중에서 골라보자"라고 말합니다. 이는 로봇이 학습하는 동안에도 규칙을 어기려고 시도하지 않도록 보장합니다.베이지안 코치 (엄지 위/아래로부터의 학습):
FABLE는 **베이지안 톰슨 샘플링(Bayesian Thompson Sampling)**을 사용합니다. 코치가 당신이 무엇을 좋아하는지에 대한 짐작(hunch)을 가지고 있다고 상상해 보세요. 코치는 하나의 선택을 시도합니다. 당신은 작은 신호(-1에서 1 사이의 점수와 같은 스칼라 피드백)를 줍니다. 코치는 자신의 짐작을 업데이트합니다.- 만약 당신이 "간결한" 스타일을 좋아했다면, 코치는 당신이 간결한 스타일을 좋아한다는 확신을 조금 더 갖게 됩니다.
- 만약 당신이 "웹 검색" 도구를 싫어했다면, 코치는 그것을 피하는 법을 배웁니다.
결정적으로, FABLE는 선택지를 분해했기(Factorized) 때문에, 당신이 "웹 검색"을 싫어한다는 것을 배우면, 단지 그 한 번의 상황뿐만 아니라 다른 맥락에서도 당신이 웹 검색을 싫어할 것이라는 점을 이해하는 데 도움이 됩니다.
이 논문이 발견한 것
저자들은 항공사, 소매, 통신, 뱅킹의 네 가지 서로 다른 세계를 시뮬레이션하는 tau2-bench라는 벤치마크에서 FABLE를 테스트했습니다. 또한 수학 문제와 쇼핑 작업에 대해서도 테스트했습니다.
결과는 다음과 같습니다 (결과에서 직접 가져온 내용입니다):
- 선호도에 효과적임: FABLE는 사용자가 원하는 것을 맞추는 데 가장 뛰어났습니다. 테스트에서 FABLE는 표준적인 얼어붙은 로봇에 비해 "개인화된 보상"(사용자가 상호작용을 얼마나 좋아했는지)을 +0.077만큼 개선했습니다. 또한 특정 "상세도(verbosity)" 선호도(예: 간결함 vs 상세함)를 맞추는 데 훨씬 더 나아졌으며, 정렬(alignment) 성능을 +0.281 향상시켰습니다.
- 만능 과제 해결사는 아님: 중요한 부분은 이것입니다: FABLE는 실제 과제의 성공률을 유의미하게 높이지 못했습니다. 로봇이 개인화되었다고 해서 항공권을 더 잘 예약하거나 수학 문제를 더 잘 풀게 된 것은 아닙니다. 실제로 과제 성공률의 차이는 너무 작아서 저자들은 이를 "미결정(unresolved)" 상태(숫자가 너무 비슷해서 결론을 내리기 어려움)라고 말합니다.
- "온보딩"의 효과: 논문은 코치에게 사용자에 대한 초기 정보(이를 "온보딩"이라 함)를 약간 제공하는 것이 큰 도움이 된다는 것을 발견했습니다. 이 단계를 건너뛰면 코치가 학습하는 데 더 오래 걸리고 성능도 떨어졌습니다.
- "하나의 크기로 모두에게 적용"은 없음: 이 논문은 이 방법이 로봇을 모든 면에서 더 낫게 만든다는 생각을 명시적으로 부정합니다. 이 방법은 로봇이 당신의 스타일에 더 잘 맞도록 만들지만, 그것이 원래 하던 핵심 업무를 더 똑똑하게 만드는 것은 아닙니다.
결론
FABLE는 거대하고 변경 불가능한 AI 로봇이 마치 당신만을 위해 만들어진 것처럼 느껴지게 만드는 영리하고 가벼운 방법입니다. 이것은 로봇의 뇌를 전혀 건드리지 않고도 당신의 구체적인 취향(예를 들어, 얼마나 수다스럽기를 원하는지 또는 어떤 도구를 좋아하는지)을 학습함으로써 가능합니다.
하지만 이 논문은 그 한계에 대해서도 매우 솔직합니다. 이 방법은 로봇이 당신의 스타일에 맞춰 춤을 추도록 가르쳐주는 훌륭한 코치가 될 수는 있지만, 로봇이 이미 달리기 선수였다면 달리기를 가르쳐줄 수는 없듯이, 로봇이 이미 잘하지 못하는 문제를 해결하는 천재가 되게 만들 수는 없다는 점을 시사합니다. 요약하자면, FABLE는 얼어붙은 로봇에게 당신의 음악에 맞춰 춤추는 법을 가르쳐주는 완벽한 코치이지만, 로봇이 이미 달리기 선수였다고 해서 마라톤을 뛰는 법을 가르쳐주지는 못합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.