← Últimos artigos
🤖 AI

TOM-SWE: User Mental Modeling For Software Engineering Agents

O artigo apresenta o ToM-SWE, uma arquitetura de dois agentes que combina um agente de engenharia de software com um parceiro de teoria da mente para modelar a intenção do usuário e manter memória persistente, melhorando significativamente as taxas de sucesso nas tarefas e a satisfação do usuário tanto em avaliações de benchmark quanto em um estudo do mundo real com desenvolvedores profissionais.

Autores originais: Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

Publicado 2026-02-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O Robô de Programação "Esquecido"

Imagine que você contratou um assistente robô brilhante, mas amnésico, para ajudá-lo a construir um site.

  • O Robô: Ele é incrivelmente inteligente para escrever código, corrigir bugs e executar testes.
  • O Problema: Toda vez que você inicia uma nova conversa, o robô não tem memória de quem você é. Ele não sabe que você odeia explicações longas, que prefere usar ferramentas específicas ou que sempre quer testar seu código antes de implementá-lo.
  • O Resultado: Você tem que se repetir constantemente. "Faça mais curto", "Use esta biblioteca", "Não me faça tantas perguntas". O robô continua adivinhando, muitas vezes errando, o que desperdiça tempo e causa frustração.

Os agentes de codificação de IA atuais são como este robô: eles são ótimos no trabalho técnico, mas terríveis em entender você.

A Solução: O Parceiro "Leitor de Mentes" (ToM-SWE)

Os autores deste artigo criaram um novo sistema chamado ToM-SWE. Em vez de apenas um robô, eles construíram uma equipe de duas pessoas:

  1. O Construtor (Agente SWE): Este é o robô de programação original. Ele foca 100% em escrever código, executar testes e corrigir erros. Ele não se preocupa com sua personalidade; ele apenas faz o trabalho pesado.
  2. O Leitor de Mentes (Agente ToM): Este é um novo parceiro, leve. O único trabalho dele é estudar você. Ele observa como você fala, do que você gosta e o que você fez no passado. Ele constrói um "modelo mental" das suas preferências.

Como eles trabalham juntos:
Antes do Construtor começar a programar, ele pergunta ao Leitor de Mentes: "Ei, o que este usuário gosta? Ele quer respostas curtas? Ele usa Python ou JavaScript? Ele mencionou uma ferramenta específica na semana passada?"
O Leitor de Mentes verifica suas notas e diz: "Este usuário é um professor que gosta de respostas concisas e prefere usar Vercel para hospedagem. Não faça muitas perguntas a ele."
O Construtor então ajusta seu plano e escreve um código que se ajusta perfeitamente ao seu estilo.

A Analogia do "Modelo Mental"

Pense no Leitor de Mentes como um assistente pessoal muito atento que mantém um diário de seus hábitos.

  • Sessão 1: Você diz ao sistema: "Faça um site para mim". O Leitor de Mentes anota: Usuário é um professor, gosta de estilos acadêmicos, prefere Vercel.
  • Sessão 2 (Na semana seguinte): Você diz "Faça um site para mim" novamente.
    • Robô Antigo: "Ok, vou adivinhar um site genérico."
    • ToM-SWE: O Construtor pergunta ao Leitor de Mentes. O Leitor de Mentes diz: "Lembra da última vez? Isso é para um projeto universitário. Use fontes acadêmicas e hospede no Vercel."
    • Resultado: O código é exatamente o que você queria, mesmo que você não tenha dito isso novamente.

Como Eles Testaram

Os pesquisadores não apenas adivinharam que isso funcionaria; eles realizaram dois tipos de testes:

  1. O Teste de "Simulação" (Benchmarks):
    Eles criaram um mundo fictício onde a IA tinha que falar com um "usuário simulado" (outra IA agindo como um humano). Eles deram ao usuário simulado diferentes personalidades (ex: um que é muito comunicativo, outro que é muito breve).

    • O Resultado: A equipe ToM-SWE resolveu 59,7% das tarefas com sucesso. O melhor robô anterior (OpenHands) resolveu apenas 18,1%.
    • A Pontuação de "Satisfação": Os usuários simulados avaliaram a equipe ToM-SWE muito mais alto (3,62 de 5) porque a equipe "ouviu" melhor e não os irritou com perguntas desnecessárias.
  2. O Teste de "Vida Real" (Estudo Humano):
    Eles deixaram 17 desenvolvedores profissionais reais usarem o sistema durante três semanas em seu trabalho diário real.

    • O Resultado: Os desenvolvedores acharam as sugestões do Leitor de Mentes úteis 86% das vezes.
    • O que eles gostaram: O sistema dizia coisas como: "Você costuma adicionar testes para novas funções, então eu os adicionei aqui", ou "Você prefere edições mínimas de código, então mantive as alterações pequenas".

Por Que Isso Importa

O artigo afirma que, para a IA ser verdadeiramente útil na engenharia de software, ela não pode ser apenas um gerador de código. Ela precisa ser uma colaboradora que entende a intenção humana.

  • Jeito Antigo: Você diz à IA o que fazer, e ela adivinha o resto.
  • Novo Jeito (ToM-SWE): A IA lembra quem você é, do que você gosta e como você trabalha, para que possa antecipar suas necessidades antes mesmo de você pedir.

Resumo em Uma Sentença

ToM-SWE é um sistema de dois agentes onde um agente escreve o código e um segundo agente "leitor de mentes" lembra de suas preferências pessoais e hábitos, permitindo que a equipe trabalhe com você de forma muito mais eficiente e com menos frustração.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →