A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
이 논문은 계층적 경험 트리와 다중 경로 Tree-RAG를 활용하여 폐쇄 루프 A/B 테스트를 통해 산업용 추천 전략을 자율적으로 생성, 실행 및 반복적으로 개선함으로써 실제 이커머스 시스템에서 상당한 GMV 향상을 달성하는 자기 진화형 프레임워크인 A/B Agent를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 빠른 우주선(추천 시스템)의 선장이며, 모든 승객에게 완벽한 간식을 배달해야 한다고 상상해 보세요. 때로는 당신의 예측이 적중하여 모두가 행복해지기도 합니다. 하지만 어떤 때는 달콤한 것을 원했던 사람에게 매콤한 칩을 건네주기도 하고, 경로 계획을 잘 세우지 못해 연료가 바닥나기도 합니다. 현실 세계에서 콰이쇼우(Kuaishou)와 같은 기업들은 가장 좋은 경로를 찾아내기 위해 'A/B 테스트'라는 방법을 사용합니다. 이것은 마치 두 가지 다른 버전의 우주선을 동시에 운행하는 것과 같습니다. 하나는 기존의 지도를 사용하고, 다른 하나는 새로운 아이디어를 적용한 지도입니다. 만약 새로운 지도가 승객들에게 간식을 더 빠르게 전달한다면, 그 지도를 채택합니다. 하지만 문제는 이 과정을 수동으로 하는 것이 매우 진 빠지는 일이라는 점입니다. 전문 항해사 팀이 끊임없이 새로운 지도를 그리고, 테스트를 실행하고, 결과를 확인하며, 설정을 미세하게 조정해야 합니다. 이는 속도가 느릴 뿐만 아니라, 그들은 어제 실패했던 우회로에서 얻은 교훈을 종종 잊어버리곤 합니다.
최근 과학자들은 컴퓨터에게 '대규모 언어 모델(LLM, 텍스트를 읽고 이해하는 초스마트 AI)'과 'RAG(검색 증강 생성, AI가 말하기 전에 답을 찾아볼 수 있는 도서관을 제공하는 것)'를 사용하여 이러한 오래된 지도들을 읽고 이해하는 법을 가르치고 있습니다. 하지만 이 똑똑한 AI 조수들에게도 문제가 있습니다. 그들은 도서관을 마치 평평하게 쌓인 종이 더미처럼 취급하곤 합니다. 당신이 실제로 '산악 경로'가 필요할 때 '사막 경로'에 대한 이야기를 찾아낼 수도 있고, '간식'에 효과적이었던 전략이 '음료'에는 위험할 수 있다는 사실을 놓칠 수도 있습니다. 그들은 우선의 서로 다른 부분들이 어떻게 연결되는지에 대한 큰 그림을 보는 데 어려움을 겪으며, 인간 상사가 다음 할 일을 알려주지 않고서는 스스로의 실수로부터 쉽게 배우지 못합니다.
여기서 이 논문은 이러한 문제들을 해결하기 위해 설계된 새로운 종류의 '자기 진화형(self-evolving)' AI 항해사인 A/B Agent를 소개합니다. A/B Agent는 단순히 평평한 메모 더미를 읽는 대신, 거대하고 조직화된 '경험 트리(Experience Tree)'를 구축합니다. 나무의 뿌리가 거대한 비즈니스 목표이고, 가지가 우주선의 각 부분(간식 바 또는 엔진실 등)이며, 잎사귀가 과거에 성공했거나 실패했던 구체적인 전략이라고 상상해 보세요. AI가 새로운 아이디어가 필요할 때, 단순히 키워드를 검색하는 것이 아니라, 현재 상황과 정확히 일치하는 가지를 찾기 위해 나무를 타고 올라가 적절한 종류의 지식을 확보합니다.
일단 전략을 선택하면, A/B Agent는 거기서 멈추지 않습니다. 그것은 테스트를 실행하고, 결과를 관찰한 뒤, 즉시 자신의 트리를 업데이트하는 지치지 않는 과학자처럼 행동합니다. 만약 새로운 경로가 승객들을 더 많이 만족시켰지만 엔진을 과열시켰다면(가드레일 지표), AI는 이를 알아차리고 설정을 미세하게 조정한 뒤 다시 시도합니다. 이 AI는 최적의 균념을 찾을 때까지 생각하고, 테스트하고, 배우고, 자신의 지식 베이스를 업데이트하는 이 순환 과정을 계속 반복합니다. 논문은 이 시스템이 단순한 이론이 아님을 보여줍니다. 실제 숏폼 비디오 쇼핑 환경에서 테스트했을 때, 이 시스템은 모든 안전 지표를 긍정적으로 유지하면서 '총 상품 판매 가치(GMV, 사용자가 지출한 총 금액)'를 4.829% 개선하는 데 성공했습니다. 심지어 이 시스템은 올바르면서도 창의적인 전략을 만드는 데 있어 세계 최고 수준의 AI 모델들보다 뛰어난 성능을 보였습니다. 본질적으로, A/B Agent는 시행착오의 혼란스러운 과정을 스스로 점점 더 나아지는 스마트한 자기 개선 사이클로 변화시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.