Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
O artigo propõe Skill-as-Pseudocode (SaP), um método automático que converte bibliotecas de habilidades em markdown livremente formatado em pseudocódigo tipado com verificação determinística, permitindo que agentes de LLM alcancem taxas de sucesso significativamente mais altas e reduzam o uso de tokens no benchmark ALFWorld ao fornecer assinaturas tipadas claras e modelos concretos de invocação.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está ensinando um robô muito inteligente, mas literal, a realizar tarefas domésticas, como limpar uma casa ou organizar uma cozinha. Você dá ao robô um manual de instruções gigante e bagunçado, escrito em inglês comum (Markdown).
O Problema: O "Loop Confuso"
Toda vez que o robô precisa fazer algo, ele tem que ler longos parágrafos de texto para descobrir duas coisas:
- O que é a tarefa (por exemplo, "mover a caneca").
- Exatamente como dizer isso ao sistema de computador da casa (por exemplo, o sistema só aceita o comando
move mug to shelf, nãoput mug on shelf).
Como as instruções estão enterradas em parágrafos, o robô frequentemente adivinha errado. Ele tenta "colocar" a caneca, a casa diz "Nada acontece", e o robô fica confuso. Então, ele volta a ler o manual novamente, adivinha errado de novo e fica preso em um loop de falha. Isso desperdiça tempo e faz o robô gastar energia (ou "tokens", em termos de IA).
A Solução: "Habilidade-Como-Pseudocódigo" (SaP)
Os autores deste artigo criaram um sistema chamado Habilidade-Como-Pseudocódigo (SaP). Pense nisso como um "tradutor" que pega o manual humano bagunçado e o reescreve em uma folha de dicas limpa e estruturada para o robô.
Veja como o tradutor funciona, usando uma analogia simples:
1. O Detetive (Encontrando Padrões)
Imagine um bibliotecário que examina centenas de manuais de instruções diferentes. Ele nota que muitos manuais dizem a mesma coisa de maneiras diferentes.
- Manual A diz: "Vá para a cozinha, pegue o sal e coloque-o no armário."
- Manual B diz: "Encontre o sal no balcão e mova-o para o armário."
O bibliotecário percebe que essas são, na verdade, a mesma ação subjacente. Ele agrupa essas instruções semelhantes em um "clúster".
2. O Arquiteto (Rascunhando o Projeto)
Para cada grupo de instruções semelhantes, o sistema pede a uma IA que redija um Contrato Tipado.
- Em vez de um parágrafo, esse contrato parece uma função de computador:
move_object(from: "counter", to: "cabinet"). - Ele lista claramente: Quais entradas são necessárias? O que acontece depois? Quais são as regras?
3. O Inspetor de Segurança (As Quatro Verificações)
Antes de o sistema permitir que o robô use esse novo projeto, um Inspetor de Segurança rigoroso executa quatro verificações específicas para garantir que a tradução seja perfeita:
- Cobertura: Perdemos algum detalhe importante do texto original?
- Vinculação: Sabemos exatamente de onde obter o "sal" ou a "caneca" da frase original?
- Substituição: Se substituirmos o antigo parágrafo por este novo projeto, o restante do manual ainda faz sentido?
- Risco: Esta nova instrução acidentalmente diz ao robô para fazer algo perigoso (como excluir um arquivo ou quebrar uma janela)?
Se o projeto passar nas quatro verificações, ele é aprovado. Se falhar em apenas uma, é descartado para evitar que o robô fique confuso.
4. A Entrega (O "Pacote")
Quando o robô precisa realizar uma tarefa, ele não recebe o manual antigo e bagunçado. Em vez disso, recebe um Pacote com três partes, apresentadas na ordem perfeita:
- O Modelo "Como Fazer": As palavras exatas que o robô deve digitar no computador da casa (por exemplo,
move {object} to {target}). - A Assinatura "O Que": Um resumo claro do que a habilidade faz.
- O Contexto: O restante das instruções, agora limpo para que não contradiga o novo modelo.
Os Resultados
Os pesquisadores testaram isso em um jogo chamado ALFWorld, onde um agente de IA precisa resolver quebra-cabeças domésticos.
- Método Antigo (Grafo de Habilidades): O robô lia o manual bagunçado, adivinhava errado, ficava preso em loops e falhava frequentemente.
- Método Novo (SaP): O robô recebeu a "folha de dicas" limpa. Ele sabia exatamente o que fazer e como dizer imediatamente.
O Resultado:
- O robô resolveu 82 de 134 jogos com o novo método, comparado a apenas 47 com o método antigo.
- Também usou 22% menos memória e fez 14% menos chamadas ao cérebro de IA porque não precisou reler o manual repetidamente quando ficou preso.
Em Resumo:
O artigo mostra que, se você parar de dar aos agentes de IA longos parágrafos bagunçados e, em vez disso, der instruções estruturadas e verificadas, semelhantes a código, eles param de ficar confusos, param de cometer erros e realizam o trabalho muito mais rápido. O sistema atua como um editor rigoroso que transforma prosa humana em projetos prontos para robôs.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.