← Últimos artigos
💬 NLP

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

O artigo apresenta o HoWToBench, um benchmark abrangente para avaliar a capacidade de escrita de modelos de linguagem em nível humano, e propõe o método Tree-of-Writing (ToW), que utiliza uma estrutura em árvore para agregar sub-recursos de avaliação, demonstrando maior robustez e forte correlação com julgamentos humanos em comparação com métricas tradicionais e práticas atuais de "LLM como juiz".

Autores originais: Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

Publicado 2026-04-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um professor tentando avaliar os trabalhos de redação de seus alunos. Antigamente, você usava uma régua simples: contava quantas palavras estavam certas ou quantas erros de gramática havia. Mas, com a chegada das Inteligências Artificiais (IAs) que escrevem textos incríveis, essa "régua" antiga não funciona mais. Ela não consegue medir a beleza de uma metáfora, a profundidade de uma emoção ou se a história faz sentido no coração do leitor.

É aqui que entra o HoWToBench e o Tree-of-Writing (ToW), o tema deste novo estudo. Vamos explicar como se estivéssemos conversando no café:

1. O Problema: O "Jogo de Espelhos" e o Juiz Confuso

Até hoje, para avaliar se uma IA escreve bem, os pesquisadores faziam duas coisas que não funcionavam muito bem:

  • O Jogo de Espelhos (Mimicry Game): Eles davam uma instrução simples (ex: "escreva um poema sobre chuva") e viam se a IA seguia a regra. Mas isso é como avaliar um pintor apenas por ele ter colocado a tinta na tela, sem olhar se a pintura é bonita.
  • O Juiz Confuso (LLM-as-a-Judge): Eles pediam para outra IA julgar a primeira. O problema é que essa IA "juíza" muitas vezes fica confusa. Ela dá notas para "gramática", "criatividade" e "formato", e depois tenta somar tudo. Às vezes, ela decide que a gramática é mais importante hoje e amanhã decide que a emoção é o que importa. Isso gera resultados inconsistentes, como um juiz de futebol que muda as regras do jogo a cada minuto.

2. A Solução: A Árvore de Escrita (Tree-of-Writing)

Os pesquisadores criaram uma nova forma de avaliar, chamada Tree-of-Writing (ToW). Pense nisso como uma árvore genealógica de avaliação, em vez de uma lista de verificação.

  • A Raiz: É a nota final do texto.
  • Os Galhos Principais: A árvore se divide em três grandes áreas: Conteúdo (a história faz sentido?), Formato (está bem estruturado?) e Impressão (como o texto me faz sentir?).
  • As Folhas: Cada galho tem folhas menores. Por exemplo, no galho "Conteúdo", há folhas para "Lógica", "Emoção" e "Início/Fim".

A Mágica do "Negociador":
O grande diferencial é que, antes de começar a avaliar, um "Negociador" (uma IA especializada) olha para a tarefa específica.

  • Se o aluno pediu para escrever um poema, o negociador diz: "Nesta árvore, a folha 'Emoção' vale muito mais peso que a folha 'Lógica'".
  • Se o pedido foi para um contrato legal, o negociador diz: "Agora, a folha 'Lógica' e 'Formato' são tudo, e a 'Emoção' quase não importa".

Isso evita que a IA tente dar a mesma importância para tudo, como se fosse um juiz que não sabe a diferença entre avaliar um poema e um contrato. É como ter um maestro que sabe exatamente qual instrumento (critério) deve tocar mais alto em cada música (tarefa).

3. O Banco de Dados: O "Super Mercado" de Textos (HoWToBench)

Para testar essa nova árvore, os autores criaram o HoWToBench. Imagine um supermercado gigante com 1.302 receitas (instruções) de escrita, cobrindo 12 tipos diferentes de gêneros:

  • Ficção: Histórias de ficção.
  • Poesia: Versos e rimas.
  • Funcional: Contratos, cartas, discursos, planos de negócios.

Eles não pegaram textos aleatórios da internet. Eles pegaram textos escritos por humanos especialistas (escritores profissionais, jornalistas, advogados) para servir de "padrão ouro". É como ter uma galeria de arte famosa para comparar com as pinturas das IAs.

Eles testaram essa avaliação em três níveis de dificuldade:

  1. Completar: A IA tem que terminar uma história que já começou (como preencher lacunas).
  2. Guiada: A IA tem um esboço e precisa expandir (como seguir uma receita).
  3. Aberta: A IA recebe apenas um tema e precisa criar tudo do zero (como um chef criando um prato novo sem receita).

4. O Que Eles Descobriram?

Ao usar essa "Árvore" para avaliar as IAs mais famosas do mundo (como GPT-4, Claude, Gemini), eles descobriram coisas interessantes:

  • A IA é ótima em seguir regras, mas ruim em criar do zero: As IAs brilham quando têm muito contexto (nível 1), mas quando precisam criar algo totalmente novo sem ajuda (nível 3), a qualidade cai drasticamente.
  • Mais texto não significa melhor texto: Antigamente, achavam que IAs que escreviam textos longos eram melhores. O estudo mostrou o contrário: em tarefas criativas, textos muito longos muitas vezes têm notas menores. A qualidade está na densidade das ideias, não no tamanho do texto.
  • A Árvore é Robusta: Se você tentar "enganar" a avaliação jogando repetições estranhas ou mudando o gênero do texto, a "Árvore" percebe a falha e baixa a nota. Outros métodos de avaliação (como os antigos) muitas vezes não percebem e continuam dando nota alta.

Resumo em uma Metáfora Final

Imagine que avaliar a escrita de uma IA é como avaliar um restaurante.

  • Os métodos antigos eram como contar quantos pratos o garçom trouxe (quantidade) ou verificar se o cardápio estava escrito corretamente (regras).
  • O HoWToBench e a Tree-of-Writing são como ter um crítico gastronômico experiente que sabe que, para um restaurante de sushi, a frescura do peixe é o mais importante, mas para uma confeitaria, a doçura e a apresentação são o que contam. Ele ajusta seus critérios de avaliação para cada tipo de prato, garantindo que a avaliação seja justa, precisa e realmente reflita a qualidade da "comida" (o texto).

Em suma, este trabalho nos dá uma ferramenta muito mais inteligente e humana para entender se as IAs realmente aprenderam a escrever como nós, ou se apenas estão repetindo o que viram.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →