← Últimos artigos
💻 computer science

Harnessing LLM Agents with Skill Programs

O artigo apresenta o HASP, um framework modular que transforma habilidades textuais de consultoria em Funções de Programa (PFs) executáveis para intervir ativamente nos loops de agentes de LLM, melhorando significativamente o desempenho em tarefas complexas como pesquisa na web, raciocínio matemático e programação por meio de orientação no momento da inferência, supervisão pós-treinamento ou autoaperfeiçoamento.

Autores originais: Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico muito inteligente, mas às vezes desajeitado. Você pede a ele para resolver um quebra-cabeça complexo, como encontrar um fato específico na internet ou escrever um trecho de código. O robô tenta o seu melhor, mas continua cometendo os mesmos erros: desiste muito cedo, busca as coisas erradas ou fica confuso com nomes de som semelhante.

Geralmente, quando tentamos corrigir isso, apenas damos ao robô uma lista de instruções escritas (como um manual) dizendo: "Lembre-se de verificar seu trabalho!" ou "Não chute!". Mas o robô frequentemente ignora essas anotações porque são apenas texto passivo. Ele não sabe exatamente quando parar e ouvir, ou como mudar sua ação.

HASP (Aproveitando Agentes LLM com Programas de Habilidade) é um novo framework que muda o jogo. Em vez de dar ao robô um manual passivo, os pesquisadores fornecem a ele um conjunto de Programas de Habilidade Executáveis (PFs). Pense neles não como um livro, mas como um cinto de segurança inteligente ou um co-piloto que fica sentado bem ao lado do cérebro do robô.

Veja como funciona, usando analogias simples:

1. De "Conselho Passivo" a "Barreiras Ativas"

  • O Jeito Antigo (Habilidades Textuais): Imagine um instrutor de direção sentado no banco de trás gritando: "Você deveria diminuir a velocidade!". O motorista pode ouvir, pode ignorar ou pode não perceber exatamente quando pisar no freio. É apenas um conselho.
  • O Jeito HASP (Funções de Programa): Agora, imagine que o carro tem um cinto de segurança inteligente. Se o carro começar a desviar em direção a um penhasco (um "estado propenso a falhas"), o cinto não apenas grita conselhos. Ele intervém fisicamente. Pode virar suavemente o volante de volta para o centro ou injetar um sinal de alerta diretamente na visão do motorista.
  • No Artigo: Esses "Programas de Habilidade" são pequenos trechos de código que observam cada movimento do robô. Se o robô estiver prestes a cometer um erro (como finalizar uma resposta sem ler as evidências), o Programa de Habilidade intervém. Ele pode reescrever a ação do robô (transformando uma consulta de busca ruim em uma boa) ou inserir uma dica (dizendo ao robô: "Espere, você ainda não leu o documento!").

2. As Três Maneiras de Usar o Cinto

O artigo mostra que esse "cinto" pode ser usado de três maneiras diferentes, como treinar um estudante:

  • Modo A: A Correção Instantânea (Intervenção no Tempo de Inferência)

    • Analogia: Você coloca o cinto no robô enquanto ele está trabalhando. O cinto captura erros em tempo real e os corrige imediatamente. O robô não precisa aprender nada novo; o cinto apenas faz o trabalho pesado.
    • Resultado: O robô resolve problemas muito melhor imediatamente, mesmo sem nenhum treinamento extra.
  • Modo B: O Guia de Estudo (Pós-Treinamento)

    • Analogia: Depois que o cinto corrige os erros do robô, os pesquisadores gravam um vídeo do caminho "corrigido" e o mostram ao robô como uma lição. O robô estuda esses exemplos e aprende a fazer as escolhas certas por conta própria na próxima vez.
    • Resultado: O robô internaliza as habilidades. Ele começa a agir como se o cinto fosse parte de seu próprio cérebro, precisando de menos ajuda com o tempo.
  • Modo C: A Biblioteca de Autoaperfeiçoamento (Evolução)

    • Analogia: Se o robô encontrar um novo tipo de erro que o cinto nunca viu antes, o sistema pausa. Ele pede a um "Professor" (uma IA muito inteligente) que escreva um novo Programa de Habilidade especificamente para aquele erro. Antes de adicionar essa nova habilidade à caixa de ferramentas, o Professor a verifica para garantir que seja segura e útil.
    • Resultado: A caixa de ferramentas de habilidades do robô fica mais inteligente com o tempo, aprendendo com seus próprios fracassos sem precisar que humanos escrevam cada regra individual.

3. Por Que Funciona Tão Bem

O artigo testou isso em três tarefas difíceis:

  • Pesquisa na Web: Encontrar respostas que exigem conectar múltiplas peças de informação (como um detetive resolvendo um mistério).
  • Matemática: Resolver equações complexas.
  • Programação: Escrever programas de computador.

Os Resultados:

  • A abordagem de "cinto" superou quase todos os outros métodos com os quais os pesquisadores a compararam.
  • Para pesquisa na web, apenas usar o cinto (sem treinar o robô) melhorou o desempenho em 25% em comparação com métodos padrão.
  • Quando permitiram que o robô aprendesse com o cinto (Pós-Treinamento), ele ficou ainda melhor.
  • Crucialmente, o sistema é modular. É como um canivete suíço; você pode usar apenas as ferramentas, ou pode usar as ferramentas para ensinar o robô, ou pode deixar o robô construir novas ferramentas.

A Conclusão

HASP transforma "experiência reutilizável" de uma ideia vaga em uma ferramenta concreta e executável. Em vez de esperar que um robô lembre de uma regra, HASP fornece ao robô um conjunto de verificações de segurança automáticas que capturam erros no momento em que ocorrem, corrigem-nos e ajudam o robô a aprender a evitá-los no futuro. É a diferença entre dar a um estudante um livro didático e dar a ele um tutor que senta bem ao lado, corrigindo seu trabalho enquanto ele o faz.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →