Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents
이 논문은 Google의 Gemini LLM 에이전트를 활용하여 이중 루프 워크플로우를 통해 최적화된 모델 아키텍처와 보상 함수를 자율적으로 생성, 검증 및 배포하는 자기 진화형 추천 시스템을 소개하며, YouTube의 실제 운영 환경에서 전통적인 수동 엔지니어링에 비해 우수한 개발 속도와 성능을 성공적으로 입증하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 가장 좋아하는 동영상 앱가 단순히 다음에 무엇을 보고 싶어 할지 추측하는 것을 넘어, 매일 스스로 더 나은 추측을 하는 법을 학습하는 세상을 상상해 보세요. 이것이 바로 인공지능의 한 분야인 **강화 학습(Reinforcement Learning)**의 영역입니다. 강화 학습에서 컴퓨터 프로그램은 호기심 많은 탐험가처럼 행동합니다. 프로그램은 다양한 행동(예: 고양이 영상을 보여주거나 요리 튜토리얼을 보여주는 것)을 시도하고, 그 결과(사용자가 그것을 봤는지, 좋아했는지)를 관찰하며, 좋은 선택에 대해 '보상'을 받습니다. 목표는 시간이 지남에 따라 그 보상을 극대화하는 것입니다. 하지만 여기서 까다로운 점은, 이 보상을 어떻게 줄 것인지 결정하는 것이 매우 어렵다는 것입니다. 이는 마치 개에게 공 가져오기를 가르치는 것과 같은데, 당신은 개의 언어를 말할 수 없고, 개는 몇 주가 지나서야 자신이 행복했다는 것을 알려주는 것과 같습니다. 전통적으로 인간은 규칙을 미세하게 조정하고, 개(또는 사용자)가 진정으로 무엇을 원하는지 추측하며, 코드를 수동으로 다시 작성하는 데 수년을 소비해야 했습니다. 이 논문은 대담한 질문을 던집니다. 만약 우리가 인간이 매 단계마다 손을 잡아줄 필요 없이, 스스로 이 미세 조정과 실험, 그리고 코드 재작성을 수행할 수 있는 시스템을 구축할 수 있다면 어떨까요?
구글의 연구진들은 **자기 진화형 추천 시스템(Self-Evolving Recommendation System)**이라 불리는 해결책을 제안합니다. 이것을 기계가 단순히 제품을 만드는 것을 넘어, 공장이 돌아가는 동안 공장 바닥을 재설계하고, 새로운 도구를 발명하며, 새로운 작업 지침서를 써 내려가는 디지털 공장이라고 생각해 보세요. 이 시스템의 핵심에는 **LLM 에이전트(LLM Agents)**가 있습니다. 이들은 이야기를 쓰거나 당신과 대화할 수 있는 것과 같은 종류의 거대 언어 모델(Large Language Models)로 구동되는 특화된 컴퓨터 프로그램입니다. 이 에이전트들은 절대 잠들지 않는 초스마트하고 지치지 않는 머신러닝 엔지니어 팀처럼 행동합니다. 이들은 단순히 몇 개의 숫자를 조정하는 것에 그치지 않고, 코드를 읽고, 시스템이 작동해야 하는 방식에 대한 기발한 새로운 아이디어를 내놓으며, 그 아이디어를 테스트하기 위한 코드를 작성하고, 그 결과를 확인합니다.
이 시스템은 매우 다른 속도를 가진 두 명의 주자가 참여하는 릴레이 경주처럼 작동합니다. 첫 번째 주자는 오프라인 에이전트(Offline Agent), 즉 "빠른 루프(Fast Loop)"입니다. 이 에이전트는 초활성 아이디어 생성기입니다. 이 에이전트는 5분마다 깨어나 방대한 양의 데이터를 살펴보고, 수백 개의 새로운 가설을 생성합니다. 이는 마치 요리사가 수프를 맛보고 즉시 "여기에 시나몬 한 꼬집을 넣으면 어떨까?" 또는 "칼 대신 블렌더를 사용하면 어떨까?"라고 생각하는 것과 같습니다. 이 에이전트는 '대리(proxy)' 지표, 즉 아이디어가 좋은지 암시하는 빠르고 측정하기 쉬운 신호를 사용하여 이러한 아이디어들을 빠르게 테스트합니다. 만약 테스트용 그릇의 수프 맛이 이상하다면, 에이전트는 다음 단계로 넘어갑니다.
두 번째 주자는 온라인 에이전트(Online Agent), 즉 "느린 루프(Slow Loop)"입니다. 이 주자는 신중한 전략가입니다. 이 에이전트는 빠른 루프에서 나온 최고의 아이디어들을 가져와 실제 사용자들에게, 즉 현실 세계에서 테스트합니다. 이것이 바로 "북극성(North Star)" 테스트입니다. 새로운 레시피가 실제로 사람들을 더 행복하게 만들었나요? 그리고 사람들이 더 오래 시청하도록 만들었나요? 실제 인간의 행동은 변화하는 데 시간이 걸리기 때문에, 이 과정에는 며칠 또는 몇 주가 소요됩니다. 온라인 에이전트는 어떤 아이디어를 유지하고 어떤 아이디어를 버릴지 결정하여, 가장 유망한 변화만이 최종 메뉴에 오를 수 있도록 보장합니다.
논문은 이 자율적인 팀이 놀라울 정도로 효과적이라는 것을 발견했습니다. 이 AI 에이전트들이 유튜브의 추천 시스템에 자유롭게 풀어 놓았을 때, 에이전트들은 단순히 설정을 조정하는 것을 넘어 소프트웨어의 구조를 설계하는 완전히 새로운 방식들을 발견해 냈습니다. 예를 들어, 에이전트들은 모델의 '엔진'을 한 종류의 수학 방식에서 다른 방식(Adagrad에서 RMSprop으로)으로 교체하는 것이 학습을 더 빠르게 만든다는 것을 알아냈습니다. 심지어 그들은 인간이 시도하지 않았던 정보의 흐름을 조절하는 영리한 방식인 '게이트 경로(gated path)' 아키텍처를 발명하기도 했습니다. 가장 인상적인 것은, 그들이 '보상' 시스템 자체를 재설계했다는 점입니다. 단순히 클릭 수를 세는 대신, 에이전트들은 사용자가 영상을 공유했는지 또는 얼마나 오래 시청했는지와 같은 복잡한 신호들을 결합하여 더 스마트한 '행복'의 정의를 만들어내는 방법을 찾아냈습니다.
결과는 측정 가능하며 유의미했습니다. 테스트에서 이 AI 기반의 변화들은 유튜브 사용자들을 위한 주요 지표들을 개선했으며, 동일한 기간 동안 인간 엔지니어들이 수행한 많은 변화들을 능가했습니다. 이 시스템은 인간이 따라잡을 수 없는 속도로 실험을 수행하여, 단 몇 개의 아이디어만을 테스트하는 인간과 달리 매주 수백 개의 아이디어를 테스트했습니다. 비록 이 논문이 AI가 여전히 큰 규칙을 설정하고 최종 결과를 확인하기 위해 인간의 도움이 필요하다고 언급하고 있지만, 이는 이러한 시스템을 구축하는 미래가 밤늦게까지 코딩하는 엔지니어 팀보다는, 매일 더 잘 자라나는, 스스로 가지를 치고 씨를 뿌리는 정원을 돌보는 정원사의 모습에 더 가까울 것임을 시사합니다. 저자들은 이 접근 방식이 실제 환경에서도 작동함을 확인하며, AI 에이전트가 단순한 수치적 조정을 넘어 구조적이고 의미론적인 개선을 발견해 내는 전문 엔지니어로서 역할을 할 수 있음을 입증했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.