← Últimos artigos
🤖 machine learning

Reinforcing Human Behavior Simulation via Verbal Feedback

Este artigo apresenta o DITTO, um modelo treinado por meio de aprendizado por reforço com feedback verbal para simular melhor o comportamento humano, juntamente com a suíte de benchmarks SOUL, demonstrando melhorias significativas de desempenho em relação aos modelos base e superando o GPT-5.4 em múltiplas tarefas de simulação humana.

Autores originais: Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Ensinar IA a "Agir como Humano" Conversando com Ela

Imagine que você está ensinando uma criança a se comportar em uma festa de jantar.

  • O Jeito Antigo (Recompensas Escalares): Você dá à criança uma nota de "6 em 10" depois que ela termina de comer. Você não diz a ela por que ela tirou 6. Ela falou demais? Usou o garfo errado? Derrubou a sopa? Ela não tem ideia de como melhorar, então apenas chuta na próxima vez.
  • O Jeito Novo (Feedback Verbal): Você a senta e diz: "Você se saiu muito bem com o guardanapo, mas falou por cima da sua avó, e isso foi rude. Da próxima vez, espere ela terminar de falar."

Este artigo argumenta que os modelos de IA atuais (LLMs) estão sendo treinados como a criança que recebe uma nota de "6". Eles são bons em matemática e programação porque essas coisas têm respostas claras de certo/errado (como uma nota de prova). Mas quando pedimos à IA para simular comportamento humano—como atuar como um paciente, um estudante ou um amigo—notas simples não funcionam. Humanos aprendem normas sociais através de palavras, explicações e correções, não números.

Os autores construíram um novo sistema chamado DITTO que ensina a IA a agir como humana usando esse método de "feedback verbal".


Como o DITTO Funciona: O Jogo de "Rascunho e Polimento"

Pense no DITTO como um workshop de escrita criativa onde a IA é tanto o aluno quanto o editor. Aqui está o processo:

  1. O Primeiro Rascunho (O Aluno): A IA tenta responder a um prompt (por exemplo, "Atue como um professor rabugento"). Ela escreve uma resposta.
  2. A Crítica (O Juiz): Uma IA "juíza" poderosa lê o rascunho e dá feedback verbal. Ela não diz apenas "Bom trabalho". Ela diz: "Você foi muito educado. Um professor rabugento seria mais impaciente. Além disso, você esqueceu de mencionar a lição de casa."
  3. O Segundo Rascunho (O Professor): A IA pega esse feedback específico e escreve uma nova versão aprimorada da resposta.
  4. A Lição (A Magia): O sistema treina a IA para olhar o prompt original e gerar imediatamente a versão melhorada, sem precisar mais do texto do feedback. É como o aluno ler as anotações do professor, corrigir o ensaio e, em seguida, memorizar a sensação de como escrever um bom ensaio para não precisar das anotações na próxima vez.

O Resultado: A IA aprende a "internalizar" o conselho. Quando você conversa com ela mais tarde, ela age mais como humana porque aprendeu por que certos comportamentos são melhores, não apenas que são melhores.


O Campo de Treino: SOUL (Ginásio de Simulação)

Para testar se isso realmente funciona, os pesquisadores construíram um ginásio gigante chamado SOUL (Ginásio de Simulação de Comportamento Semelhante ao Humano).

Imagine um ginásio com 10 estações diferentes, cada uma testando um tipo diferente de habilidade "humana":

  • Teoria da Mente: A IA consegue entender que outra pessoa sabe algo que ela não sabe? (Como um jogo de esconde-esconde).
  • Interpretação de Papéis: Ela consegue atuar como um personagem específico de um livro sem quebrar o personagem?
  • Habilidades Sociais: Ela consegue navegar em uma conversa para atingir um objetivo (como pedir um aumento) sem ser rude?
  • Simulação de Usuário: Ela consegue fingir ser um cliente confuso falando com um suporte técnico?

Eles descobriram que os modelos de IA existentes frequentemente falhavam nesses testes. Eles soavam muito robóticos, muito perfeitos ou muito semelhantes entre si.

Os Resultados: O DITTO Vence o Ginásio

Os pesquisadores testaram seu novo modelo (DITTO) contra os melhores modelos existentes (incluindo gigantes de grandes empresas de tecnologia).

  • A Pontuação: O DITTO melhorou 36% em comparação com o modelo básico.
  • O Confronto: O DITTO venceu o modelo de ponta "GPT-5.4" em 6 dos 10 desafios.
  • Onde Brilhou: Ele foi especialmente bom em tarefas que exigem nuances, como habilidades sociais e interpretação de papéis. Aprendeu a guardar segredos melhor e a lidar com conversas complexas sem ficar "preso" ou soar falso.

Por Que Isso Importa (Segundo o Artigo)

O artigo afirma que, para tornar a IA verdadeiramente útil na simulação de pessoas (como em bots de terapia, tutores educacionais ou treinamento de atendimento ao cliente), precisamos parar de tratá-las como alunos de matemática que precisam apenas de uma nota. Temos que tratá-las como seres sociais que precisam de explicações.

Ao usar feedback verbal (palavras) em vez de apenas recompensas escalares (números), a IA aprende a textura do comportamento humano. Ela aprende que ser "rude" não é apenas uma nota baixa; é uma maneira específica de falar que fere sentimentos.

Em resumo: O DITTO é uma IA que aprendeu a agir como humana ouvindo críticas detalhadas de um professor, praticando as correções e, em seguida, esquecendo as anotações do professor porque finalmente "entendeu".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →