Resumo Técnico: Agente A/B para Iteração de Estratégia Industrial
1. Definição do Problema
Os sistemas de recomendação industrial dependem fortemente de testes A/B em larga escala para iterar estratégias, um processo que é atualmente trabalhoso e demorado. Ele exige que especialistas humanos projetem repetidamente estratégias, configurem experimentos, analisem resultados e ajustem parâmetros. Um gargalo crítico é a fragmentação do conhecimento histórico; insights valiosos de experimentos passados estão espalhados por fontes heterogêneas (documentos, código, logs) sem uma abstração unificada, tornando a reutilização sistemática difícil.
Embora agentes de Geração Aumentada de Recuperação (RAG) tenham sido propostos para auxiliar, as abordagens existentes sofrem de duas limitações principais:
- Organização de Conhecimento Plana: Os sistemas RAG tradicionais recuperam fragmentos de texto baseados em similaridade semântica, falhando em modelar as relações hierárquicas entre cenários de negócios, estágios de recomendação, objetivos de otimização e contextos experimentais. Isso leva a uma recuperação desalinhada e a uma transferência deficiente entre cenários.
- Falta de Autoevolução: Os agentes atuais normalmente fornecem recomendações de etapa única (one-shot) sem um framework de otimização de longo horizonte. Eles não conseguem refinar autonomamente as estratégias com base no feedback sequencial de A/B ou consolidar progressivamente práticas bem-sucedidas em uma base de conhecimento.
Consequentemente, a indústria carece de um sistema automatizado capaz de transformar registros históricos fragmentados em experiências estruturadas e transferíveis e de refinar continuamente as estratégias através de loops de feedback online.
2. Metodologia
O artigo propõe o A/B Agent, um framework de loop fechado projetado para a otimização de estratégia de recomendação industrial. O framework consiste em três componentes fortemente acoplados:
2.1 Organização do Conhecimento de Estratégia Histórica
Para resolver a fragmentação do conhecimento, o sistema estrutura os registros de experimentos históricos em uma Árvore de Experiência Hierárquica.
- Estruturação de Registros: Relatórios de experimentos brutos são convertidos em um esquema unificado cobrindo contexto de negócio, cenário, estágio, objetivo, descrição da estratégia, parâmetros, métricas e riscos.
- Extração Agêntica: Um agente de estratégia decompõe os registros em "fragmentos de estratégia" atômicos e autossuficientes a partir de múltiplas perspectivas (problema, cenário, mecanismo).
- Construção da Árvore: Esses fragmentos são organizados em uma árvore TE=(VE,EE) onde os nós representam categorias (domínio, cenário, estágio, objetivo) e as folhas armazenam detalhes específicos da estratégia. Esta estrutura permite a recuperação precisa dentro de ramos correspondentes e a transferência de conhecimento entre ramos relacionados.
2.2 Geração de Estratégia Autônoma Orientada ao Objetivo
Dada uma nova solicitação de otimização, o agente gera estratégias executáveis usando uma abordagem Multi-Path Tree-RAG:
- Recuperação de Múltiplos Caminhos: O sistema mapeia a solicitação para um caminho semântico na árvore de experiência e recupera candidatos usando tanto recuperação esparsa (termos exatos) quanto densa (semântica).
- Impulsionamento Consciente do Contexto: Diferente do RAG plano, este módulo impulsiona candidatos que estruturalmente combinam com o cenário, estágio e objetivo da solicitação. Ele calcula uma pontuação de relevância de caminho de árvore baseada na distância de caminho mais curto entre os nós na hierarquia.
- Reclassificação e Geração: Um reclassificador (Qwen-Reranker) realiza a pontuação detalhada baseada em mecanismo e restrições. O gerador de estratégia então adapta mecanismos transferíveis para a tarefa alvo, considerando restrições de engenharia e condições de implantação.
- Julgamento: Candidatos gerados são avaliados por juízes baseados em agentes para relevância contextual, consistência de evidência e segurança antes de serem convertidos em uma configuração de teste A/B executável.
2.3 Autoevolução de Estratégia Guiada por Experimento
Pós-implantação, o sistema entra em um loop de autoevolução:
- Construção da Árvore de Experimento: Versões sucessivas de experimentos são organizadas em uma Árvore de Experimento (TA∗), onde os nós representam variantes de estratégia e as arestas representam modificações.
- Avaliação de Utilidade: O sistema define uma função de utilidade U(v) que equilibra ganhos de métricas principais contra a degradação de métricas de salvaguarda (penalizando impactos negativos na experiência do usuário ou estabilidade da plataforma).
- Ajuste Iterativo: O agente compara nós pai-filho e irmãos para identificar modificações eficazes. Se um ramo saturar ou violar as salvaguardas, ele recupera mecanismos alternativos da árvore de experiência para criar novos ramos. Os resultados validados são destilados de volta para a árvore de experiência, fechando o loop para acumulação contínua de conhecimento.
3. Principais Contribuições
O artigo descreve as seguintes contribuições:
- Framework A/B Agent: Um agente de loop fechado para minerar estratégias históricas, permitindo transferência entre cenários, análise de resultados de A/B e otimização de parâmetros em sistemas de recomendação industrial.
- Árvore de Experiência Hierárquica: Uma estrutura inovadora que decompõe estratégias históricas em habilidades transferíveis, suportando recuperação e geração estruturada e orientada ao alvo.
- Mecanismo de Autoevolução: Uma abordagem guiada pela árvore de experimentos para ajuste de A/B que permite análise conjunta de métricas, otimização de parâmetros e atualizações contínuas de conhecimento sem intervenção manual.
- Dataset Industrial: A construção de um dataset contendo 310 estratégias de recomendação históricas em três cenários de e-commerce, incluindo configurações, resultados e métricas multidimensionais.
- Validação Empírica: Avaliações offline e online extensas demonstrando a eficácia do framework.
4. Resultados Experimentais
O artigo avalia o A/B Agent em três cenários de e-commerce industrial na plataforma Kuaishou.
Desempenho Offline:
- O A/B Agent alcançou a maior pontuação média geral de 7.244, superando o LLM de propósito geral mais forte (Claude-Sonnet-4.6, 7.151) em 1,3%.
- Comparado ao baseline RAG mais forte em cada cenário, o A/B Agent melhorou a pontuação geral em 25,0%, 31,7% e 23,5%, respectivamente.
- Superou o GPT-5.5 em correção e o Claude-Sonnet-4.6 em novidade, demonstrando que o conhecimento industrial estruturado e a recuperação consciente da transferibilidade produzem resultados superiores.
Testes A/B Online:
- Em uma implantação real para recomendações de e-commerce de vídeos curtos, o A/B Agent alcançou um aumento de 4,829% no Cart GMV.
- Crucialmente, ele manteve ganhos positivos em todas as métricas de salvaguarda (incluindo Live GMV, Tempo de Visualização e Pedidos da Plataforma), enquanto as iterações experimentais anteriores do agente mostraram compensações (trade-offs) que foram posteriormente resolvidas através da autoevolução.
- O agente navegou com sucesso pela fronteira de Pareto, movendo-se de configurações iniciais com riscos de salvaguarda para um estado final que melhorou tanto as métricas de negócio quanto a segurança da plataforma.
Estudo de Ablação:
- Remover a base de conhecimento causou um declínio absoluto de 0,238 (aproximadamente 3,3% da pontuação total), destacando a importância da experiência histórica.
- Substituir o Tree-RAG hierárquico pelo RAG Plano resultou em um declínio absoluto de 0,015 (aproximadamente 0,2% do total), confirmando o valor da organização hierárquica.
- Remover melhorias de recuperação (ex: boosting consciente de cenário) levou a declínios absolutos variando de 0,070 a 0,122 (aproximadamente 1,0% a 1,7% do total).
5. Significância e Alegações
O artigo afirma que o A/B Agent aborda a lacuna entre agentes LLM gerais e os requisitos específicos e complexos da iteração de estratégia industrial. Sua significância reside em:
- Sistematização do Conhecimento Fragmentado: Ao organizar dados históricos não estruturados em uma árvore hierárquica, o sistema permite a transferência de conhecimento confiável entre diferentes contextos de negócio, algo que os sistemas RAG planos não conseguem alcançar.
- Melhoria Contínua Autônoma: O framework vai além da geração de etapa única para um loop de autoevolução onde o agente aprende com o feedback online, refinando estratégias e parâmetros autonomamente.
- Equilíbrio entre Otimização e Segurança: O mecanismo de autoevolução guiado por experimento modela explicitamente a compensação entre ganhos de métricas principais e restrições de salvaguarda, permitindo que o agente navegue em direção a soluções Pareto-ótimas que especialistas humanos poderiam ter dificuldade em encontrar manualmente.
Os autores concluem que o A/B Agent traduz efetivamente o conhecimento de estratégia histórica em melhorias mensuráveis de negócios online, oferecendo uma solução escalável para a otimização de estratégia industrial enquanto mantém a saúde do sistema. O trabalho futuro foca no alinhamento mais forte de requisitos e na verificação automatizada de viabilidade de engenharia.