← Últimos artigos
🤖 AI

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

Este artigo apresenta o Alipay-PIBench, um benchmark realista composto por 18 instâncias de tarefas em nove projetos para avaliar a capacidade dos agentes de codificação em lidar com integrações complexas de pagamentos do Alipay, demonstrando que o acesso a habilidades de integração específicas melhora significativamente o desempenho e fornecendo uma estrutura estruturada para diagnosticar as capacidades dos modelos no desenvolvimento de software relacionado a pagamentos.

Autores originais: Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

Publicado 2026-07-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde os computadores não apenas escrevem código como um robô digitando em um teclado, mas agem de fato como desenvolvedores juniores que conseguem abrir uma pasta de projeto, entender a lógica de negócio e corrigir bugs em múltiplos arquivos. Esta é a fronteira emocionante dos "agentes de codificação". Por muito tempo, testamos esses ajudantes de IA em quebra-cabeças simples e isolados — como pedir que resolvam um único problema matemático ou escrevam uma função minúscula. Mas, no mundo real, o software não é uma coleção de quebra-cabeças isolados; é uma cidade gigante e interconectada. Para construir um aplicativo real, uma IA precisa entender como a porta da frente se conecta ao escritório nos fundos, como os dados fluem entre as salas e como manter o edifício seguro contra intrusos. Isso é especialmente verdadeiro para algo tão de alto risco quanto lidar com dinheiro. Se uma IA errar um sistema de pagamento, não é apenas um erro de digitação; é um potencial desastre financeiro. Por isso, pesquisadores estão perguntando: essas agentes de IA podem realmente lidar com a realidade bagunçada, perigosa e complexa de integrar um sistema de pagamento em um aplicativo de negócios real?

Apresentamos o Alipay-PIBench, um novo "teste de direção" para agentes de codificação, criado pela equipe da Ant Group. Pense nisso como uma escola de condução especializada para IA, mas em vez de ensinar carros a fazer baliza, ela ensina como lidar com uma situação muito específica e de alta pressão: integrar um sistema de pagamento (especificamente o Alipay) em uma aplicação de negócios do mundo real. Os pesquisadores construíram um parquinho com 18 diferentes "cenários de direção" baseados em projetos reais. Eles dividiram esses cenários em dois níveis: Básico, onde a IA só precisa fazer o dinheiro ir do ponto A ao ponto B, e Avançado, onde a IA tem que lidar com congestionamentos, multas falsas e seguranças (lidando com riscos como pagamentos duplicados, reembolsos e verificações de segurança).

A equipe submeteu seis modelos de IA diferentes a este teste. Eles queriam ver duas coisas principais: o quão bons esses agentes de IA são no trabalho por conta própria, e se dar a eles uma "folha de cola" (um guia estruturado chamado alipay-payment-integration) os ajuda a desempenhar melhor. Os resultados foram reveladores. Sem a folha de cola, as IAs tinham dificuldades, muitas vezes criando códigos que pareciam corretos, mas falhavam quando você tentava realmente gastar dinheiro. No entanto, quando os pesquisadores deram aos agentes de IA o guia estruturado, a taxa média de sucesso saltou cerca de 10,31 pontos percentuais. A IA com melhor desempenho, Claude Opus 4.8, atingiu uma taxa de sucesso de 91,37% com o guia, enquanto a de menor desempenho, MiniMax M3, atingiu 68,58%.

Mas aqui está a parte mais interessante da história: o teste revelou que "parecer bom" não é o mesmo que "funcionar". Os pesquisadores usaram um sistema de inspeção de múltiplas camadas. Eles verificaram se o código estava (verificações estáticas), se ele conseguia rodar (testes de integração) e se seguia as regras do dinheiro (verificações de segurança e lógica). Eles descobriram uma grande lacuna: uma IA poderia escrever um código que passava na verificação "ele está lá?" com louvor (pontuando mais de 90% na estrutura), mas falhava miseravelmente ao tentar processar um pagamento real (pontuando menos de 40% na execução). É como um aluno que memoriza as definições de todas as peças de um carro, mas bate o veículo no momento em que tenta dirigir. O estudo sugere que, embora esses agentes de IA estejam ficando melhores, eles ainda precisam de ajuda para entender as regras profundas e invisíveis de segurança e lógica que impedem os sistemas de dinheiro do mundo real de desmoronarem. A "folha de cola" não apenas os tornou mais rápidos; ajudou-os a evitar os erros mais perigosos, provando que, no mundo dos agentes de codificação, ter um bom mapa é tão importante quanto ter um motor rápido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →