← Últimos artigos
💬 NLP

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

O artigo apresenta o QuantCode-Bench, um novo benchmark que avalia a capacidade de modelos de linguagem de gerar estratégias de trading algorítmico executáveis no framework Backtrader, revelando que as principais limitações atuais residem na operacionalização correta da lógica financeira e no uso da API, e não na sintaxe do código.

Autores originais: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

Publicado 2026-04-17
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você pediu a um chef de cozinha de elite (neste caso, um Modelo de Inteligência Artificial) que criasse uma receita de bolo baseada apenas em uma descrição falada: "Quero um bolo que cresça quando a temperatura da cozinha passar de 25 graus e que mude de cor se o açúcar acabar".

Até agora, os testes de IA focavam apenas em ver se o chef conseguia escrever a receita no papel sem erros de gramática (se as palavras estavam certas). Mas, no mundo real, não basta escrever a receita; o bolo precisa sair do forno, crescer de verdade e mudar de cor exatamente como você pediu.

O artigo "QuantCode-Bench" é como um novo e muito mais difícil teste de cozinha para essas IAs, focado especificamente em estratégias de negociação financeira (como comprar e vender ações automaticamente).

Aqui está a explicação simples do que eles descobriram:

1. O Desafio: Não é só escrever, é fazer funcionar

Os pesquisadores criaram um "campo de provas" com 400 tarefas. Eles pegaram ideias de negociação de fóruns da internet (como Reddit e StackExchange) e pediram para a IA transformar essas ideias em código de computador que funcionasse de verdade.

O teste tem 4 fases, como se fosse uma linha de montagem:

  1. A Receita (Sintaxe): O código foi escrito corretamente? Não tem erros de digitação?
  2. O Forno (Backtest): O código consegue rodar no computador sem travar?
  3. O Prato Pronto (Negociação): O código realmente "compra e vende" algo? (Muitos códigos funcionam, mas são tão perfeitos que nunca dão ordem de compra, então não servem de nada).
  4. O Sabor (Semântica): O bolo final é o que você pediu? (Ex: A IA fez um bolo de chocolate quando você pediu de baunilha, mas o bolo estava delicioso. Isso é um erro).

2. O Que Eles Descobriram? (A Grande Surpresa)

O Problema da Gramática já foi Resolvido:
As IAs mais modernas são incríveis em escrever o código sem erros de sintaxe. Quase 100% delas passam na fase 1. É como se todos os chefs soubessem escrever a receita perfeitamente.

O Problema é a "Lógica de Cozinhar":
Aqui é onde as coisas ficam difíceis.

  • Na primeira tentativa (Sem ajuda): Mesmo as IAs mais inteligentes acertam apenas 70% a 76% do teste final. Muitas vezes, o código roda, mas não gera nenhuma negociação, ou gera uma negociação que não tem nada a ver com o que o usuário pediu.
  • Com ajuda (Modo "Agente"): Quando os pesquisadores deixaram a IA tentar, errar, receber uma dica do erro e tentar de novo (até 10 vezes), o desempenho saltou para 95% a 98%.

A Analogia do Mecânico:
Imagine que você pede a um mecânico para consertar o freio do seu carro.

  • Modo Único: O mecânico tenta consertar de primeira. Ele aperta os parafusos certos (sintaxe), mas esquece de colocar a pastilha de freio (lógica). O carro parece pronto, mas não freia.
  • Modo Interativo: Você diz: "Ei, o carro ainda patina". O mecânico olha, vê que esqueceu a pastilha, coloca e testa de novo. Com essa conversa, ele conserta quase tudo.

3. Onde as IAs Mais Falham?

O estudo mostrou que o maior erro não é escrever código errado, mas sim:

  • Condições Impossíveis: A IA cria uma regra como "Compre se o preço subir 50% em 1 segundo". Isso nunca acontece na vida real, então o código nunca faz nada.
  • Confusão com Ferramentas: A IA usa a ferramenta certa (Backtrader, que é um software de testes), mas de um jeito estranho, como tentar usar uma chave de fenda para apertar um parafuso de roda.
  • Esquecer o Pedido: A IA cria um código que funciona perfeitamente, mas é uma estratégia totalmente diferente da que o usuário pediu.

4. Por que isso importa?

Antes, achávamos que o futuro era a IA escrevendo código sozinha. Este estudo mostra que, para tarefas complexas e específicas (como finanças), a IA precisa de conversa e correção.

  • Para o Mercado Financeiro: Não basta ter um robô que escreve código; ele precisa entender a intenção do trader.
  • Para o Futuro da IA: Os testes antigos (que só olhavam se o código compilava) estão obsoletos. Precisamos de testes que verifiquem se a IA realmente "entendeu o negócio" e não apenas se ela sabe "escrever a frase".

Resumo Final

O QuantCode-Bench é como um teste de direção para IAs.

  • Antes: A gente só olhava se a IA sabia segurar o volante e pisar no freio (código sem erros).
  • Agora: A gente está vendo se a IA consegue chegar ao destino certo, seguindo as placas e evitando buracos (estratégia que funciona e segue as regras).

As IAs hoje são ótimas motoristas, mas ainda precisam de um instrutor ao lado (feedback iterativo) para não se perderem em rotas complexas. Quando recebem essa ajuda, elas se tornam motoristas de elite.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →