← 최신 논문
💻 computer science

AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization

AgenticRecTune 는 대규모 언어 모델에 기반한 다중 에이전트 프레임워크로, 전문화된 에이전트들이 구성안을 제안하고 필터링하며 검증하도록 조정함으로써 복잡하고 다단계인 추천 시스템의 종단간 최적화를 자동화하며, 동시에 도메인 특화 통찰력을 포착하기 위해 기술 저장소를 지속적으로 진화시킵니다.

원저자: Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수백만 명의 승객 (사용자) 가 매초 도착하여 목적지로 데려다줄 완벽한 기차 (콘텐츠) 를 찾는 거대하고 고속의 기차역을 상상해 보세요. 이것이 구글 디스커버 (Google Discover) 와 같은 거대 추천 시스템이 작동하는 방식입니다.

전통적으로 이 역을 관리하는 것은 한 번에 하나의 악기만 조절할 수 있는 지휘자가 복잡한 오케스트라를 지휘하려는 것과 같았습니다. 만약 현악기 (랭킹 모델) 가 더 커지면, 지휘자는 음악의 균형을 맞추기 위해 드럼 (프리랭킹 모델) 과 금관악기 (리랭킹 모델) 를 수동으로 조정해야 했습니다. 이 과정은 느리고 비용이 많이 들며, 음악이 바뀔 때마다 인간 전문가가 매번 올바른 설정을 추측해야 했습니다.

이 논문은 이러한 전체 과정을 자동화하는 새로운 'AI 오케스트라 매니저'인 AgenticRecTune을 소개합니다. 인간이 추측하는 대신, 다섯 명의 전문 AI 에이전트 팀이 24 시간 내내 협력하여 전체 시스템의 완벽한 설정을 찾습니다.

다음은 간단한 비유를 사용한 팀의 작동 방식입니다:

1. 다섯 명의 에이전트 팀

시스템을 완벽한 제품을 출시하려는 스타트업 회사라고 생각하세요. 여기 다섯 가지 특정 역할이 필요합니다:

  • 액터 (아이디어 생성자): 이 에이전트는 창의적인 브레인스토머입니다. 현재 상황을 살펴보고 "다양성 (diversity) 을 5% 늘려볼까요?" 또는 "클릭 (click) 가중치를 약간 낮출까요?"라고 말합니다. 시도해 볼 다양한 설정 (구성) 을 제안합니다.
  • 크리틱 (품질 관리 관리자): 액터의 야심 찬 아이디어가 실제 적용되기 전에 크리틱이 개입합니다. 엄격한 편집자나 안전 검사관처럼 행동합니다. 아이디어를 확인합니다: "이것은 안전한가? 규칙을 따르는가? 이전에 시도했다가 실패한 적은 없는가?" 나쁜 아이디어를 걸러내고 최상의 아이디어만 진행되도록 합니다.
  • 온라인 에이전트 (현장 테스터): 크리틱이 아이디어를 승인하면, 이 에이전트는 그것을 현실 세계로 가져갑니다. 소수의 실제 사용자가 새로운 설정을 보는 라이브 실험 (A/B 테스트) 을 설정합니다. 전체 레스토랑에 제공하기 전에 몇몇 고객에게 새로운 레시피를 테스트하는 것과 같습니다.
  • 인사이트 에이전트 (데이터 탐정): 실험이 끝난 후, 이 에이전트는 결과를 살펴봅니다. 단순히 숫자를 보는 것이 아니라 패턴을 찾습니다. "사용자들이 왜 새로운 설정을 좋아했을까요? 다양성 때문이었나요, 아니면 속도 때문이었나요?"라고 묻습니다. 원시 데이터를 교훈으로 변환합니다.
  • 스킬 에이전트 (도서관 사서): 이 에이전트는 탐정으로부터 얻은 교훈을 가져와 '스킬북 (Skillbook)'에 기록합니다. 팀의 지식을 업데이트하여 다음 번에 같은 실수를 반복하지 않도록 합니다. 마치 셰프가 팀 전체가 배우도록 레시피 책에 새로운 비밀 재료를 적어두는 것과 같습니다.

2. '자기 진화'하는 스킬북

이 시스템의 가장 멋진 부분은 스킬허브 (Skillhub) 입니다. 과거에는 인간 엔지니어가 새로운 기술을 배웠다면 매뉴얼을 작성하고 모두가 읽기를 바랐습니다.

AgenticRecTune 에서는 인사이트 에이전트스킬 에이전트가 협력하여 이 스킬북을 자동으로 업데이트합니다.

  • 시스템이 설정을 시도했다가 실패하면, 스킬북은 "다시 하지 마라"라고 배웁니다.
  • 설정이 작동하면, 스킬북은 "이것은 좋은 기술이다. 변형을 시도해 보자"라고 배웁니다.
  • 시간이 지남에 따라 시스템은 인간이 지침을 작성할 필요 없이 스스로 더 똑똑해지며 '전문 지식'의 라이브러리를 구축합니다.

3. 왜 이것이 중요한가

논문은 추천 시스템이 매우 복잡하다고 설명합니다. 세 가지 주요 단계가 있습니다:

  1. 프리랭킹 (Pre-ranking): 수백만 개의 항목을 빠르게 필터링하여 수천 개를 찾습니다.
  2. 랭킹 (Ranking): 그 수천 개를 신중하게 점수 매겨 가장 좋은 항목을 찾습니다.
  3. 리랭킹 (Re-ranking): 목록이 다양하고 비즈니스 규칙을 따르도록 최종 조정을 가합니다.

한 부분을 변경하면 다른 부분이 종종 깨집니다. 완벽한 균형 (최적점) 을 찾는 것은 원바퀴 자전거를 타면서 저글링을 하려는 것과 같습니다. 인간은 한 번에 하나의 아이디어만 테스트할 수 있으므로 이 작업이 느립니다. AgenticRecTune 은 수천 개의 이러한 '저글링' 실험을 자동으로 실행하여 현실 세계에서 다양한 설정 조합을 테스트하고 가장 잘 작동하는 것을 찾습니다.

4. 결과

팀이 구글 디스커버 (Google Discover) (수백만 명이 사용하는 실제 라이브 제품) 에서 이 시스템을 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  • AI 팀은 인간 엔지니어가 수동으로 찾을 수 있는 것보다 더 나은 설정을 찾을 수 있었습니다.
  • 사용자 참여 (클릭 증가) 와 더 넓은 주제의 다양성 (다양성) 과 같은 경쟁 목표를 성공적으로 균형 잡았습니다.
  • 아이디어 생성자와 비평가 (크리틱) 를 두는 '액터 - 크리틱' 방법은 에이전트 하나가 추측하는 것보다 훨씬 잘 작동했습니다.
  • 시스템은 자신의 실험에서 학습하여 테스트 라운드마다 더 나아졌습니다.

간단히 말해: AgenticRecTune 은 초효율적이고 지치지 않는 엔지니어링 팀처럼 행동하는 자기 개선형 AI 에이전트 팀입니다. 끊임없이 실험하고, 실수에서 배우며, 추천 시스템이 최고 성능으로 작동하도록 자체 규칙집을 업데이트합니다. 모든 것이 인간이 매일 노브를 조절할 필요 없이 이루어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →