← Últimos artigos
🤖 AI

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

Este levantamento propõe um framework de model-harness para agentes baseados em LLM que desloca o foco da resposta passiva a perguntas para a conclusão ativa de tarefas ao analisar como o acoplamento entre modelos de fundação e ambientes de execução — compreendendo seis responsabilidades principais — determina o desempenho, a confiabilidade e a generalização do sistema.

Autores originais: Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yu
Publicado 2026-06-23
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Não é Apenas Sobre o Cérebro

Imagine que você contrata um chef de classe mundial, brilhante (o Modelo de IA) para cozinhar um jantar complexo de vários pratos para uma festa. No passado, as pessoas pensavam que a única coisa que importava era o quão inteligente era o chef. Se o chef conhecesse todas as receitas, a refeição seria perfeita.

Mas este artigo argumenta que o chef é apenas metade da história.

Se você der a esse chef um fogão quebrado, sem ingredientes, um cardápio confuso e ninguém para avisá-lo quando a sopa está queimando, a refeição falhará — mesmo que o chef seja um gênio. O "fogão", os "ingredientes" e o "gerente da cozinha" são o que os autores chamam de Harness (Arreio/Estrutura de Suporte).

A principal afirmação do artigo é: o desempenho do agente não depende apenas de quão inteligente é a IA; trata-se de quão bem a IA é combinada com a "cozinha" (o Harness) na qual ela trabalha.


As Quatro Etapas do Crescimento

Os autores descrevem como construímos esses "agentes" de IA em quatro estágios distintos, como uma criança crescendo:

  1. Fase 1: O Engenheiro de Prompt (O Estágio do "Por Favor, Seja Gentil")

    • A Analogia: Você está tentando fazer com que um aluno inteligente, mas tímido, responda a uma pergunta. Você tenta diferentes formas de perguntar: "Por favor, explique isso", "Aqui está um exemplo" ou "Pense passo a passo".
    • O Limite: Você só consegue fazer perguntas gentis por um tempo. Se o aluno não souber a resposta, ou se a pergunta exigir que ele vá à biblioteca, abra um livro e escreva um relatório, apenas pedir gentilmente não ajudará.
  2. Fase 2: O Engenheiro de Contexto (O Estágio do "Assistente de Biblioteca")

*   **A Analogia:** Agora você percebe que o aluno precisa de ajuda para encontrar os livros certos. Você constrói um sistema que busca as páginas corretas, resume-as e as entrega ao aluno antes de ele responder.
*   **O Limite:** Você ainda está apenas entregando informações a ele. Se o aluno começar a escrever algo errado ou se distrair, você não tem um sistema para pará-lo, verificar seu trabalho ou corrigir seus erros.
  1. Fase 3: O Engenheiro de Harness (O Estágio do "Gerente de Projeto")
*   **A Analogia:** Esta é a grande mudança. Você para de apenas dar instruções e começa a construir um **sistema operacional completo** ao redor do aluno.
    *   **Observação:** Você dá a ele uma câmera para ver o que está acontecendo.
    *   **Controle:** Você tem um cronômetro e um botão de parada.
    *   **Ação:** Você dá a ele um teclado e um mouse.
    *   **Verificação:** Você tem um professor que verifica cada passo. Se o aluno escrever um código que quebre, o sistema automaticamente reverte a ação e diz: "Tente novamente".
*   **O Resultado:** O artigo mostra que, apenas redesenhando esta "cozinha" (o Harness), você pode fazer um chef medíocre cozinhar uma refeição de 5 estrelas, ou fazer um chef gênio cozinhar ainda melhor.
  1. Fase 4: O Estágio de Coevolução (O Estágio da "Equipe de Autoaperfeiçoamento")
    • A Analogia: Agora, o aluno e o gerente da cozinha aprendem um com o outro. O aluno melhora sua culinária praticando nesta cozinha específica, e o gerente da cozinha melhora sua gestão ao observar como o aluno cozinha. Eles evoluem juntos.

As Seis Partes da "Cozinha" (A Anatomia do Harness)

O artigo divide este "Harness" em seis tarefas específicas, como uma equipe de cozinha bem organizada:

  1. Observação (Os Olhos): Como a IA vê o mundo? Ela está olhando para uma captura de tela borrada ou para uma lista de dados clara e organizada?
  2. Contexto (A Memória): Quais informações a IA lembra? Nós fornecemos todo o histórico da conversa ou apenas as notas mais importantes?
  3. Controle (O Maestro): Quem decide o que acontece a seguir? A IA continua seguindo até se cansar, ou um gerente diz a ela quando parar, quando pedir ajuda ou quando mudar de tarefa?
  4. Ação (As Mãos): Como a IA realmente faz as coisas? Ela pode clicar em um botão ou apenas diz "eu cliquei"? O harness transforma as palavras da IA em ações reais.
  5. Estado (O Arquivo): Onde a IA armazena seu trabalho? Se ela escreve um rascunho, ele é salvo em um arquivo ou é perdido quando a tela é atualizada?
  6. Verificação (O Inspetor de Segurança): Isso é crucial. Antes de a IA enviar um arquivo para um cliente, uma verificação de segurança é executada? Se a IA fizer um movimento perigoso, o sistema a interrompe?

Por Que Isso Importa: A Mudança do "Gargalo"

O artigo analisou muitos testes (benchmarks) onde a IA tenta realizar trabalhos reais, como consertar códigos de computador ou navegar na web.

  • A Visão Antiga: Pensávamos que, se apenas tornássemos o cérebro da IA maior e mais inteligente, ela resolveria tudo.
  • A Nova Visão: O artigo descobriu que o "cérebro" atingiu um limite. Tornar o cérebro maior traz apenas melhorias minúsculas. O verdadeiro gargalo agora é o Harness.

A Evidência:

  • Em testes de codificação, o mesmo modelo de IA obteve uma taxa de sucesso de 23% com um harness simples, mas de 72% com um harness melhor projetado.
  • É como ter um motor de Ferrari (a IA), mas colocá-lo em um quadro de bicicleta (um harness ruim). Ele não irá rápido. Coloque esse mesmo motor em um chassi de carro de corrida (um bom harness) e ele vence.

A Conclusão

Estamos deixando de pensar na IA apenas como um "chatbot" que responde perguntas. Estamos construindo trabalhadores autônomos.

Para construir um trabalhador confiável, você não pode apenas escolher o cérebro mais inteligente. Você tem que projetar todo o ambiente em que eles trabalham:

  • O que eles veem?
  • Quais ferramentas eles têm?
  • Quem verifica o trabalho deles?
  • Como eles se recuperam quando cometem um erro?

O artigo conclui que o futuro da IA não é apenas sobre modelos maiores; é sobre uma melhor engenharia dos sistemas que cercam esses modelos. A qualidade do agente vem da parceria entre o modelo e o seu harness.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →