← Últimos artigos
💬 NLP

FlowBot: Inducing LLM Workflows with Bilevel Optimization and Textual Gradients

Este artigo apresenta o FlowBot, um framework orientado por dados que induz e otimiza automaticamente fluxos de trabalho de LLMs ao formular o processo como um problema de otimização bilevel resolvido por meio de gradientes textuais modulares, alcançando desempenho competitivo com as bases de referência criadas por humanos.

Autores originais: Hongyeon Yu, Young-Bum Kim, Yoon Kim

Publicado 2026-04-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hongyeon Yu, Young-Bum Kim, Yoon Kim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar uma equipe de robôs especializados a resolver um quebra-cabeça muito difícil. No passado, os humanos tinham que sentar e escrever manualmente um manual de instruções rigoroso para cada robô individual, decidindo exatamente a ordem em que deveriam trabalhar e quais palavras específicas dizer a cada um. Isso é lento, caro e difícil de escalar.

O artigo apresenta o FLOWBOT, um novo método que permite que os robôs ensinem a si mesmos como se organizar e conversar entre si, sem precisar que um humano escreva o manual primeiro.

Veja como funciona, usando uma analogia simples:

O Sistema de Treinamento de Dois Níveis

Pense no FLOWBOT como um sistema de treinamento com dois níveis: um Treinador Chefe e um Treinador de Posição.

1. O Treinador Chefe (O Loop Externo): "Corrigindo o Plano de Jogo"
O Treinador Chefe observa o quadro geral. Ele não se preocupa com as palavras específicas que um jogador diz; ele se preocupa com a estrutura do jogo.

  • O Problema: Talvez a equipe esteja tentando resolver um problema matemático começando por desenhar uma imagem, o que é a ordem errada. Ou talvez estejam omitindo uma etapa inteira, como "verificar a pontuação".
  • A Correção: O Treinador Chefe analisa onde a equipe falhou e diz: "Ok, precisamos adicionar uma etapa para verificar a pontuação antes de tentar desenhar a imagem", ou "Vamos remover a etapa de desenhar completamente".
  • No Artigo: Isso é o Loop Externo. Ele otimiza o "esboço do fluxo de trabalho". Ele decide quantas etapas existem, em que ordem elas ocorrem e se deve adicionar ou remover ferramentas (como motores de busca).

2. O Treinador de Posição (O Loop Interno): "Refinando o Livro de Jogadas"
Uma vez que o Treinador Chefe define o plano de jogo, o Treinador de Posição trabalha com jogadores individuais (as chamadas específicas de LLM) para aperfeiçoar suas instruções específicas.

  • O Problema: O jogador sabe o que fazer (por exemplo, "buscar fatos"), mas está fazendo isso mal. Talvez estejam alucinando (inventando coisas) ou omitindo um detalhe crucial.
  • A Correção: Em vez de apenas dizer "faça melhor", o Treinador de Posição usa um truque especial chamado Gradientes Textuais.
    • Imagine que a resposta final está errada. O Treinador de Posição pergunta a um juiz de IA: "Por que isso aconteceu?"
    • O juiz fornece um comentário em texto: "Você cometeu um erro porque não verificou sua fonte."
    • Esse comentário é passado para trás para o jogador anterior, que diz: "Ah, preciso garantir que minha fonte esteja clara para a próxima pessoa."
    • Isso continua até chegar ao primeiro jogador.
  • No Artigo: Isso é o Loop Interno. Ele usa "Backpropagation Textual". Assim como uma rede neural usa matemática para ajustar números, o FLOWBOT usa feedback em linguagem natural para ajustar os prompts de texto de cada etapa.

A Magia do "Gradiente Textual"

Na ciência da computação tradicional, se um cálculo está errado, o computador usa matemática para calcular exatamente quanto ajustar os números para corrigi-lo. Isso é chamado de "backpropagation".

Os LLMs (Modelos de Linguagem de Grande Escala) não entendem matemática da mesma forma; eles entendem linguagem. Portanto, o FLOWBOT inventou os Gradientes Textuais.

  • Em vez de um número como +0,5, o sistema recebe uma frase como: "Sua resposta estava errada porque você assumiu X, mas as evidências mostram Y. Por favor, verifique suas fontes na próxima vez."
  • O sistema passa essa frase para trás através da cadeia de robôs. Cada robô lê o feedback, entende o que deu errado nas etapas após a sua e reescreve suas próprias instruções para evitar esse erro no futuro.

O Que Eles Descobriram?

Os pesquisadores testaram o FLOWBOT em muitas tarefas diferentes, como responder a perguntas de trivia complexas, escrever código e seguir instruções rigorosas.

  • Funciona do zero: Ao contrário de outros métodos que precisam que um humano forneça um bom plano inicial, o FLOWBOT pode começar com uma folha em branco e descobrir o melhor fluxo de trabalho por conta própria.
  • Supera a concorrência: Ele teve desempenho tão bom quanto (ou melhor do que) sistemas onde humanos gastaram muito tempo criando manualmente o fluxo de trabalho perfeito.
  • Economiza dinheiro: Como aprende com tanta eficiência, requer menos "chamadas de API" (que custam dinheiro) para encontrar a solução correta em comparação com outros métodos automatizados.

A Conclusão

O FLOWBOT é como uma linha de montagem que se autoaperfeiçoa. Ele não apenas ajusta as instruções nas máquinas; ele também reorganiza as próprias máquinas. Ao usar feedback em linguagem natural para "backpropagar" erros, ele descobre automaticamente a melhor maneira de organizar uma equipe de modelos de IA para resolver problemas complexos, eliminando a necessidade de humanos serem os arquitetos de cada fluxo de trabalho individual.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →