← Últimos artigos
🤖 AI

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

O artigo apresenta o daVinci-Agency, um framework de eficiência de dados que aproveita sequências autênticas de Pull Requests para sintetizar dados de treinamento de alto nível e de longo horizonte para Grandes Modelos de Linguagem, permitendo ganhos de desempenho significativos em fluxos de trabalho agentes complexos sem custos de anotação proibitivos.

Autores originais: Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

Publicado 2026-02-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O "Tempo de Atenção Curto" da IA

Imagine que você tem um aluno brilhante que é incrível para responder perguntas isoladas, como "Quanto é 2+2?" ou "Escreva um poema sobre um gato". Este aluno é um Modelo de Linguagem de Grande Escala (LLM).

No entanto, se você pedir a este aluno para construir uma casa, ele terá dificuldades. Ele pode lançar os alicerces, depois esquecer que precisa de um telhado, ou pode construir uma parede no lugar errado e não perceber isso até o final. No mundo da IA, isso é chamado de tarefa de longo horizonte (long-horizon task). É um trabalho que exige muitas etapas, onde erros cometidos no início podem arruinar todo o projeto mais tarde.

O artigo argumenta que os modelos de IA atuais falham nessas tarefas longas porque não foram treinados com dados que lhes mostrem como planejar com antecedência, manter a consistência e corrigir seus próprios erros ao longo de um período prolongado.

A Solução: Aprendendo com a "Evolução de Software"

Os autores (da SII, SJTU e GAIR) perceberam que a melhor maneira de ensinar uma IA a lidar com projetos longos e complexos é observar como os humanos reais constroem software.

A Analogia: A Cadeia de "Pull Requests"
No desenvolvimento de software, quando um programador deseja adicionar uma funcionalidade ou corrigir um erro, ele não apenas joga o código final. Ele envia um "Pull Request" (PR).

  1. Passo 1: Ele envia uma pequena alteração (PR #15).
  2. Passo 2: Os revisores dizem: "Isso parece bom, mas você esqueceu uma rede de segurança".
  3. Passo 3: O programador corrige isso e envia uma nova alteração (PR #21) que se baseia na primeira.
  4. Passo 4: Isso continua por várias rodadas até que a funcionalidade esteja perfeita.

Os autores chamam isso de "Cadeia de Pull Requests". É como uma história onde cada capítulo depende do anterior, e os personagens (o código) evoluem e melhoram com o tempo.

A Inovação: daVinci-Agency

A equipe criou um novo sistema chamado daVinci-Agency. Em vez de inventar cenários falsos ou pagar humanos para escrever longas histórias para a IA aprender (o que é caro e lento), eles foram ao GitHub (uma gigantesca biblioteca de projetos de software reais) e colheram essas "Cadeias de Pull Requests" naturais.

Eles transformaram essas histórias reais de desenvolvimento em dados de treinamento.

  • O Treinamento: Eles pegaram um modelo (GLM-4.6) e mostraram a ele essas cadeias.
  • A Lição: A IA aprendeu que, para ter sucesso, ela deve:
    • Decompor: Quebrar um objetivo enorme em etapas pequenas e gerenciáveis.
    • Manter a Consistência: Lembrar do objetivo original mesmo após 50 etapas.
    • Refinar: Olhar para seus próprios erros (bugs) e corrigi-los sem precisar recomeçar do zero.

O Resultado "Mágico": Poucos Dados, Grandes Ganhos

Normalmente, para tornar uma IA mais inteligente, você precisa alimentá-la com milhões de exemplos.

  • O Jeito Antigo: Treinar com 66.000 exemplos (como outros conjuntos de dados no artigo).
  • O Jeito da daVinci: Treinar com apenas 239 exemplos.

O Resultado:
Apesar de usar 200 vezes menos dados, o modelo treinado com a daVinci-Agency teve um desempenho significativamente melhor do que modelos treinados com conjuntos de dados massivos.

  • No teste chamado Toolathlon (onde a IA deve usar ferramentas para resolver problemas), o modelo melhorou em 47%.
  • No SWE-bench (um teste para corrigir bugs reais de software), ele também obteve uma pontuação muito mais alta.

Por quê? Porque os 239 exemplos eram de alta qualidade. Eles não eram aleatórios; eram histórias reais de como problemas complexos são resolvidos ao longo do tempo. A IA não apenas memorizou fatos; ela aprendeu o hábito da persistência e da correção.

O que a IA Realmente Aprendeu (As "Meta-Habilidades")

O artigo mostra que a IA não ficou apenas melhor em codificação; ela ficou melhor em pensar.

  • Antes: Se a IA cometesse um erro, ela ficava confusa, perdia o foco em tópicos irrelevantes ou desistia (chamado de "escapismo").
  • Depois: Quando a IA cometia um erro, ela pausava, percebia: "Espere, estou fazendo isso errado", e corrigia. Ela aprendeu a planejar e a manter o foco.

Eficiência: Fazer Mais com Menos

O artigo também descobriu que a nova IA é mais eficiente.

  • Analogia: Imagine duas pessoas tentando resolver um labirinto.
    • Pessoa A (IA Antiga): Corre para todos os becos sem saída, grita e tenta 100 caminhos errados diferentes.
    • Pessoa B (IA da daVinci): Olha o mapa, vê os becos sem saída e pega o caminho direto.
  • A IA treinada pela daVinci usou menos palavras (tokens) e menos cliques de ferramentas para resolver os mesmos problemas. Ela não desperdiçou energia com confusão.

A Descoberta de "Escalabilidade"

Finalmente, os autores testaram o que acontece se tornarmos as histórias de treinamento ainda mais longas.

  • Eles descobriram que, se treinassem a IA em cadeias com mais etapas (cadeias de Pull Request mais longas), a IA ficava ainda melhor.
  • Isso sugere que, quanto mais a IA pratica o pensamento de "longa distância", melhor ela se torna para resolver problemas muito longos e complexos.

Resumo

daVinci-Agency é uma nova forma de treinar agentes de IA. Em vez de forçá-los a memorizar milhões de tarefas curtas e falsas, ela os ensina mostrando-lhes histórias reais e longas de como humanos constroem software. Ao aprender com essas "cadeias de eventos" naturais, a IA aprende a planejar, manter a consistência e corrigir seus próprios erros, tornando-se muito mais inteligente e eficiente com muito menos dados do que antes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →