← 최신 논문
🤖 AI

SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategies Refinement in E-Commerce Recommendation

이 논문은 사용자 시뮬레이션, 진단 분석, 제약 조건이 있는 행동 실행을 통합함으로써 산업용 이커머스 추천 시스템의 포스트 랭킹 전략의 지속적인 정교화를 자동화하여 주문량과 사용자 참여도를 가시적으로 개선하는 동시에 운영 비용을 크게 절감하는 최초의 배포된 에이전트 프레임워크인 SR-Agent를 소개한다.

원저자: Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신의 취향에 따라 즉각적으로 재배치되는 거대하고 마법 같은 슈퍼마켓을 걷고 있다고 상상해 보세요. 이것은 이커머스 추천 시스템의 세계입니다. 수년 동안 이 디지털 점원들은 당신이 클릭하거나 구매할 단 하나의 아이템을 정확히 예측하는 데 집착해 왔습니다. 그들은 마치 당신의 다음 움직임을 내기하는 전문 도박사 같습니다. 하지만 여기 함정이 있습니다. 어떤 아이템이 '좋은 내기'라고 해서 전체 쇼핑 경험까지 즐겁다는 뜻은 아니라는 점입니다. 만약 상점이 연속으로 똑같은 빨간색 운동화 다섯 켤레를 보여주거나, 같은 종류의 망치를 브랜드만 다른 것으로 열 개나 보여준다면, 당신은 지루함을 느끼거나 혼란스러워지거나 짜증이 날 수 있습니다. 이것이 바로 정확도(맞는 아이템을 맞히는 것)와 사용자 경험(전체 여정을 즐겁고 유용하게 만드는 것)의 차이입니다.

이를 해결하기 위해 온라인 상점들은 포스트 랭킹(post-ranking) 전략을 사용합니다. 이것을 상점 매니저의 규칙 책이라고 생각하면 됩니다. 컴퓨터가 가장 좋은 아이템들을 뽑아낸 후, 매니저가 개입하여 "좋아, 하지만 빨간 신발 세 개를 같이 보여주지는 마"라거나 "다양한 가격대를 섞어서 보여줘"라고 말하는 식입니다. 문제는 이 규칙 책들이 대개 인간에 의해 작성된 후, 변하지 않는 정적인 상태로 선반 위에 놓여 있다는 점입니다. 하지만 제품과 사람의 세계는 항상 움직입니다. 새로운 아이템이 등장하고, 트렌드가 변하며, 어제의 좋은 규칙이 오늘의 나쁜 규칙이 될 수도 있습니다. 이러한 규칙이 낡게 되면 쇼핑 경험은 투박해집니다. 과학자와 엔지니어들의 큰 과제는 다음과 같습니다: 모든 쇼핑 목록을 읽고 규칙을 다시 쓰기 위해 지친 군단 같은 인력을 고용하지 않고도, 어떻게 이 규칙 책들을 최신 상태로 유지할 것인가?

여기서 논문은 이 쇼핑 목록을 자동으로 수정하기 위해 설계된 새로운 종류의 "디지털 탐정" 팀인 SR-Agent를 소개합니다. Kuaishou 이커머스 플랫폼과 협력한 연구진은 스스로 교정되는 루프처럼 작동하는 시스템을 구축했습니다. 문제가 발생할 때까지 기다리는 대신, SR-Agent는 추천 내용을 끊임없이 관찰하고, "매니저의 규칙"이 실패하는 지점을 포착하며, 왜 실패했는지 파악한 뒤, 안전하고 구체적인 해결책을 제안합니다.

팀의 작업 방식은 다음과 같습니다:

  1. UserSim 에이전트 (공감자): 이 시스템의 이 부분은 실제 쇼퍼인 척 행동합니다. 추천된 아이템 목록을 살펴보고 "내가 인간이라면, 이 비슷한 아이템 세 개를 보는 것이 지루할까?"라고 묻습니다. 단순히 클릭 수를 세는 것이 아니라, 목록 곳곳에 흩어져 있는 똑같이 생긴 바지 다섯 벌을 보는 것과 같은 "나쁜 사례(bad cases)"를 찾아냅니다.
  2. Analysis 에이전트 (탐정): UserSim이 나쁜 사례를 발견하면, Analysis 에이전트가 조사에 착수합니다. "왜 규칙 책이 이런 일을 허용했는가?"라고 묻습니다. 아마도 "유사 아이템"에 대한 규칙이 너무 느슨하거나, 혹은 상점의 카테고리가 엉망이기 때문일 수 있습니다. 이 에이전트는 복잡한 문제를 "이 특정 세션에 대해 바지의 규칙을 강화해야 한다"와 같은 명확한 진단으로 바꿉니다.
  3. Strategy Refinement Harness (신중한 설계자): 이것은 안전 가드 역할을 합니다. 탐정의 진단을 받아 해결책을 시도하지만, 엄격한 제한 범위 내에서만 수행합니다. 숫자를 아주 조금 조정하거나 카테고리 레이블을 수정하는 것과 같이, 오직 작고 승인된 변경 사항만을 만들 수 있습니다. 어떤 변경 사항이 실제로 적용되기 전에, 이 시스템은 엄격한 4단계 테스트를 거칩니다: 나쁜 사례들을 재테스트하고, 과거의 트래픽을 대상으로 변경 사항을 시뮬레이션하며, 인간의 검토를 거친 뒤, 마지막으로 온라인에서 작은 규모의 안전한 실험을 실행합니다.

이 "자기 진화형" 시스템의 결과는 매우 유망합니다. 연구팀이 한 달 동안 Kuaishou 플랫폼에서 SR-Agent를 테스트했을 때, 이 시스템은 단순히 쇼핑 경험을 개선했을 뿐만 아니라 비즈니스 자체도 개선했다는 것을 발견했습니다. 시스템은 주문 수를 0.71% 증가시켰고, 사람들이 상점을 더 깊이 둘러보게 만들어 **0.34%**의 성장을 이끌었으며, 사용자들이 더 다양한 카테고리를 클릭하도록 도와 **0.48%**의 성과를 냈습니다.

더욱 인상적인 것은 속도입니다. 기존의 규칙 수정 방식은 인간이 목록을 검사하고, 문제를 진단하고, 업데이트를 기다리는 과정을 포함하여 몇 주가 걸렸습니다. SR-Agent는 이 전체 주기를 단 3~5일로 압축했습니다. 시스템이 안전을 보장하기 위해 약 1%의 작업을 무작위로 인간이 체크하긴 하지만, 수천 개의 문제를 찾아내고 해결책을 제안하는 중대한 작업은 자동으로 처리했습니다.

논문은 이것이 모든 것을 즉각적으로 해결하는 마법 지팡이가 아님을 주의 깊게 명시합니다. 이 시스템은 작고 제한된 변경을 수행하고, 그로부터 학습하며 시간이 지남에 따라 발전합니다. 테스트에서 시스템이 특정 나쁜 사례를 해결하는 능력은 첫 번째 업데이트 시 약 **49%**에서 열 번째 업데이트 시 **83%**까지 향상되었으며, 이는 시스템이 실행될수록 점점 더 똑똑해진다는 것을 보여줍니다. 느리고 수동적인 프로세스를 빠르고 자동화된 루프로 전환함으로써, SR-Agent는 관리하는 인간들을 번아웃시키지 않고도 온라인 쇼핑 경험을 새롭고 흥미롭게 유지할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →