← Últimos artigos
🤖 AI

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

Este artigo refuta a suposição de que a complexidade ótima do harness diminui monotonicamente com a capacidade do modelo, revelando, por meio de um experimento com 432 execuções, que a sensibilidade do harness é não monotônica e depende criticamente do tipo de modelo, com estruturas verbosas prejudicando os modelos de chat de ponta enquanto orientações estritas beneficiam os modelos de raciocínio de ponta.

Autores originais: Yong-eun Cho

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yong-eun Cho

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando uma equipe de diferentes trabalhadores para arrumar um quarto bagunçado (o "ambiente de trabalho"). Você tem um gerente que dá instruções a eles (o "arnês").

A crença comum no mundo da IA tem sido: "Quanto mais inteligente o trabalhador, menos detalhadas as instruções que ele precisa." Em outras palavras, um gênio precisa de uma nota simples, enquanto um iniciante precisa de um manual estrito, passo a passo. Este artigo argumenta que essa crença está errada.

Aqui está a análise do que os pesquisadores descobriram, usando analogias simples:

1. O Experimento: Uma Cozinha de Testes para IA

Os pesquisadores montaram uma "cozinha de testes" chamada HEAT-24.

  • O Quarto: Um ambiente de trabalho digital com 12 arquivos (como código, notas e dados).
  • Os Trabalhos: 24 tarefas específicas, como "corrija este código quebrado", "encontre um arquivo específico" ou "escreva um relatório em um formato estrito".
  • Os Trabalhadores: Eles testaram 6 modelos de IA diferentes, variando de "Fronteira" (superinteligente, caro) a "Constrito" (menor, mais barato).
  • As Instruções: Eles deram aos trabalhadores três tipos de manuais de instrução:
    • Leve: Uma nota simples de duas frases.
    • Equilibrado: Um guia de quatro passos com uma lista de arquivos permitidos.
    • Estrito: Um manual massivo de 6 etapas com regras estritas sobre como verificar o trabalho e exatamente como formatar a saída.

Eles realizaram este experimento 432 vezes para ver qual combinação funcionava melhor.

2. A Grande Surpresa: A Regra "Tamanho Único" Está Quebrada

Os pesquisadores esperavam uma curva suave: IA mais inteligente = Instruções mais simples. Em vez disso, encontraram uma bagunça caótica e não linear. O estilo de instrução "melhor" depende inteiramente de que tipo de IA você está usando, não apenas de quão inteligente ela é.

O "Superpensador" (Modelo de Chat de Fronteira)

  • Quem é: Um modelo muito inteligente projetado para conversar (como um conversador).
  • O que aconteceu: Quando recebeu o manual Estrito, ele falhou. Sua taxa de sucesso caiu quase 30%.
  • A Analogia: Imagine pedir a um poeta brilhante que preencha um formulário de impostos complexo. Se você der a ele um prompt simples ("Escreva um poema"), ele é perfeito. Mas se você der a ele um contrato legal de 10 páginas sobre como escrever o poema, ele fica confuso, começa a divagar e esquece de realmente escrever o poema.
  • O Resultado: Para este tipo de IA, menos é mais. Instruções simples funcionam melhor.

O "Arquiteto" (Modelo de Raciocínio de Fronteira)

  • Quem é: Um modelo superinteligente projetado para lógica profunda e resolução de problemas (com "pensamento estendido" ativado).
  • O que aconteceu: Quando recebeu o manual Estrito, ele performou melhor do que com notas simples. Ele também terminou o trabalho mais rápido.
  • A Analogia: Imagine um arquiteto mestre. Se você disser "Construa uma casa", ele pode vaguear pensando em 100 possibilidades diferentes. Mas se você der a ele uma planta baixa estrita com medidas exatas e uma lista de verificação, ele começa a trabalhar imediatamente, ignora distrações e constrói a casa perfeitamente.
  • O Resultado: Para este tipo de IA, mais estrutura é melhor. Ele usa as regras estritas como um andaime para focar seu pensamento.

O "Pequeno mas Poderoso" (Modelo Constrito)

  • Quem é: Um modelo minúsculo (apenas 2 bilhões de parâmetros) que foi surpreendentemente bem treinado.
  • O que aconteceu: Ele performou tão bem quanto os modelos grandes e caros em todos os tipos de instrução.
  • A Analogia: Isso é como um aprendiz pequeno e altamente disciplinado que, apesar de ter um cérebro pequeno, foi treinado tão bem em como seguir ordens que consegue fazer o trabalho tão bem quanto um professor doutor.
  • O Resultado: Você não pode julgar as "necessidades de arnês" de um modelo apenas pelo seu tamanho (contagem de parâmetros). A qualidade do treinamento importa mais.

O "Iniciante Perdido" (Modelos de Baixa Capacidade)

  • Quem é: Modelos menores com menos treinamento.
  • O que aconteceu: Eles lutaram com tudo. Notas simples faziam com que escolhessem os arquivos errados; notas estritas os sobrecarregavam.
  • O Resultado: Eles precisam de uma abordagem "Cachinhos Dourados" — estrutura suficiente para guiá-los, mas não tanta a ponto de ficarem confusos.

3. Os Dois Principais Erros

Os pesquisadores categorizaram por que a IA falhou:

  1. O Erro "Tagarela" (Violação de Formato): Os modelos inteligentes entendiam a tarefa, mas não conseguiam parar de falar. Em vez de fornecer os dados necessários (como um arquivo JSON), eles escreviam uma longa história explicando por que fizeram isso. Isso aconteceu principalmente quando as instruções eram muito complexas.
  2. O Erro "Porta Errada" (Arquivo Errado): Os modelos menores frequentemente não sabiam qual arquivo tocar. Sem uma lista clara de "arquivos permitidos", eles editariam o documento errado.

4. A Conclusão: Pare de Adivinhar, Comece a Combinar

O artigo conclui que não há uma única maneira "melhor" de fazer prompts para uma IA.

  • Se você tem uma IA de Chat, mantenha as instruções leves e simples. Não explique demais.
  • Se você tem uma IA de Raciocínio, dê a ela regras estritas e detalhadas. Ela prospera com estrutura.
  • Se você tem uma IA pequena e bem treinada, ela pode ser tão boa quanto as grandes, independentemente das instruções.

Em resumo: Você não daria a uma criança um contrato legal complexo, e não daria a um juiz da Suprema Corte um post-it. Você deve combinar o estilo de instrução com o tipo de trabalhador, não apenas com seu nível de inteligência.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →