← Últimos artigos
💬 NLP

ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

O artigo introduz o ISE, um paradigma de síntese de três estágios que gera trajetórias de agentes de SO de múltiplos turnos, de alta qualidade e fundamentadas em execução, para melhorar significativamente o desempenho de uso de ferramentas em modelos ajustados, superando baselines zero-shot maiores.

Autores originais: Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu

Publicado 2026-06-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô muito inteligente, mas inexperiente, a usar um computador. Você quer que ele seja capaz de lidar com tarefas complexas, como "organizar meus arquivos, escrever um relatório baseado neles e enviá-lo por e-mail para o meu chefe".

O problema, de acordo com este artigo, é que os "livros didáticos" (dados de treinamento) que temos usado para ensinar esses robôs são falhos de três maneiras específicas:

  1. Eles começam com as ferramentas, não com o usuário: A maioria dos dados é construída olhando para uma lista de comandos de computador disponíveis (como "deletar arquivo" ou "enviar e-mail") e inventando um motivo para usá-los. É como ensinar um chef dizendo: "Aqui está uma faca, agora imagine um motivo para picar algo", em vez de começar com "Estou com fome, faça um sanduíche para mim".
  2. Eles são curtos demais: A vida real envolve um vai e vem. Se um robô comete um erro, você o corrige. Se ele tem sucesso, você pede o próximo passo. A maioria dos dados de treinamento é apenas uma pergunta e uma resposta, como uma transação de máquina de vendas, em vez de uma conversa real.
  3. Eles são falsos: Os robôs geralmente são treinados em resultados "simulados". O computador pretende deletar um arquivo ou adivinha qual seria a mensagem de erro. Ele nunca toca em um computador real, então nunca aprende o que fazer quando as coisas dão errado de verdade.

A Solução: ISE (Intenção → Simulação → Execução)

Os autores propõem uma nova receita de três etapas chamada ISE para corrigir esses problemas. Pense nisso como uma escola de alta gastronomia para robôs.

Passo 1: O Menu (Intenção)

Em vez de começar com uma lista de ferramentas, eles começam com necessidades humanas reais.

  • A Analogia: Imagine um chef que cria um menu baseado no que diferentes tipos de pessoas realmente querem comer, não apenas nos ingredientes que existem na despensa.
  • Como eles fizeram: Eles criaram 50.000 "personas" únicas (como um gerente financeiro ocupado, um escritor criativo ou um estudante) e as misturaram com diferentes tipos de tarefas e níveis de dificuldade. Isso garante que o robô aprenda a lidar com uma grande variedade de pedidos do mundo real, não apenas com os fáceis e comuns.

Passo 2: O Jogo de Atuação (Simulação)

É aqui que eles corrigem o problema do "curto demais". Eles usam uma IA especial para atuar como o usuário humano.

  • A Analogia: Imagine um ator de método interpretando o papel de um cliente frustrado. Esse ator não diz apenas "Faça um sanduíche" e para. Se o robô deixar cair o pão, o ator diz: "Ei, você deixou o pão cair, pegue-o!". Se o rob em fizer um bom trabalho, o ator diz: "Ótimo, agora coloque o queijo".
  • O Ingrediente Secreto: Os autores garantiram que esse "ator" de IA permaneça no personagem. Ele não se transforma acidentalmente em um assistente prestativo (o que arruinaria o treinamento). Ele permanece estritamente no papel do usuário, reagindo ao que o robô realmente faz, não ao que o robô acha que fez.

Passo 3: A Cozinha Real (Execução)

Este é o passo mais crítico. O robô não apenas adivinha o que acontece; ele realmente faz o trabalho em um computador real e isolado.

  • A Analogia: Em vez de um chef fingindo picar vegetais em uma tábua que não é real, o chef realmente pica vegetais reais. Se a faca escorregar e cortar a mesa, o sistema registra esse erro real.
  • Por que isso importa: Quando o robô tenta executar um comando e ele falha (ex: "Arquivo não encontrado"), o usuário "ator" vê a mensagem de erro real e reage a ela. Isso ensina o robô a se recuperar de desastres do mundo real, algo que simulações falsas não podem fazer.

Os Resultados

Eles pegaram este novo "livro didático" (chamado ISETrace) e o usaram para treinar um robô (especificamente um modelo chamado Qwen3-8B).

  • Antes: Sem este novo treinamento, o robô conseguia resolver apenas cerca de 19% das tarefas de computador complexas e de múltiplamente etapas.
  • Depois: Com este novo treinamento, o robô resolveu 37% das tarefas.
  • A Comparação: Este robô treinado com 8 bilhões de parâmetros performou melhor do que:
    • Um robô muito maior (32 bilhões de parâmetros) que não foi treinado com esses dados.
    • Um robô comercial muito famoso e caro (GPT-4o) que não foi treinado com esses dados.

A Conclusão

O artigo argumenta que como você cria os dados de treinamento é tão importante quanto quais dados você cria. Ao começar com necessidades humanas reais, forçar conversas longas e fazer o robô praticar em computadores reais (incluindo as falhas), eles criaram um agente muito mais inteligente.

Eles também provaram que a parte da "conversa longa" foi a chave. Quando reduziram os dados de treinamento para apenas perguntas individuais (removendo o vai e vem), o desempenho do robô caiu significativamente. Isso mostra que aprender a lidar com uma conversa é essencial para que um robô seja verdadeiramente útil.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →