← Últimos artigos
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

O artigo apresenta o Prosa, o primeiro benchmark de conversas em português brasileiro com múltiplas trocas de mensagens e usuários reais, e demonstra que o uso de pontuação por rubrica binária com filtragem por múltiplos juízes melhora significativamente a estabilidade da avaliação e o poder discriminativo em comparação com os métodos tradicionais de LLM como juiz holístico.

Autores originais: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

Publicado 2026-05-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando classificar os melhores chefs de uma cidade. No passado, você poderia pedir a um crítico gastronômico que provasse um prato e lhe desse uma única pontuação de 1 a 10. Isso é como a maioria dos modelos de IA é avaliada atualmente: uma IA "juíza" lê uma resposta e atribui uma pontuação holística única.

O problema, conforme explica este artigo, é que diferentes críticos têm gostos diferentes. Um pode adorar comida picante, enquanto outro a odeia. Se você pedir a três críticos diferentes que classifiquem os mesmos 16 chefs, todos podem concordar sobre quem é o pior, mas podem discordar completamente sobre quem é o melhor. Isso torna a classificação pouco confiável.

A Solução do Artigo: O Método "Lista de Verificação"

Os pesquisadores por trás do Prosa (um novo benchmark para chats de IA em português do Brasil) decidiram mudar o jogo. Em vez de perguntar ao juiz: "Quão bom é este prato no geral?", eles deram aos juízes uma lista de verificação específica de perguntas binárias (Sim/Não).

  • Método Antigo (Holístico): "Avalie esta conversa de 1 a 10." (Subjetivo, propenso a viés).
  • Novo Método (Baseado em Rubrica): "A IA respondeu à pergunta? Sim/Não. Ela manteve a polidez? Sim/Não. Ela evitou inventar coisas? Sim/Não."

Pense nisso como uma prova de direção. Em vez de um instrutor dizer: "Você dirigiu muito bem, vou te dar um 8", ele verifica caixas específicas: "Você usou a seta? Sim/Não. Você parou no sinal vermelho? Sim/Não."

A Magia do "Filtragem"

Os pesquisadores perceberam que, às vezes, os próprios itens da lista de verificação estão quebrados. Talvez uma pergunta seja tão fácil que todos os chefs a passem, ou tão difícil que todos falhem. Essas "perguntas quebradas" atrapalham a classificação.

Então, eles adicionaram uma etapa de filtragem. Antes de finalizar as pontuações, eles submeteram a lista de verificação a uma equipe de "controle de qualidade". Eles descartaram as perguntas que eram muito fáceis, muito difíceis ou confusas. Isso deixou com eles um conjunto afiado e de alta qualidade de perguntas que realmente podiam distinguir um bom chef de um excelente.

A Grande Descoberta

Aqui está a parte mais surpreendente de suas descobertas:

  1. O Juiz Importa Menos que o Método: Quando usaram o antigo método "de 1 a 10", três juízes de IA diferentes (de empresas diferentes) deram classificações completamente diferentes para os melhores chefs. Mas quando mudaram para o método "Lista de Verificação + Filtragem", todos os três juízes concordaram na mesma classificação exata para todos os 16 chefs.
  2. É Mais Barato: Como a lista de verificação divide a tarefa em perguntas simples Sim/Não, você não precisa de uma IA supercara e "superinteligente" para fazer a avaliação. Você pode usar uma IA mais barata e rápida (como a Gemini 3 Flash) e ainda obter a mesma classificação perfeita. Custa cerca de US$ 2,10 avaliar um novo modelo com este método, comparado a custos muito mais altos de outros métodos.

O que é o Prosa?

O Prosa é o primeiro benchmark deste tipo para o português do Brasil.

  • Vida Real: Em vez de usar perguntas de teste inventadas (como um exame escolar), eles usaram 1.000 conversas reais que pessoas reais tiveram com IA no Brasil. Isso captura como as pessoas realmente falam, a gíria que usam e os problemas reais que tentam resolver.
  • O Resultado: Eles classificaram 16 modelos de IA diferentes. O primeiro lugar foi para o GPT-5.2 da OpenAI, seguido de perto por modelos do Google e da Alibaba. Curiosamente, um modelo de código aberto (Qwen3-235B) performou tão bem que superou vários modelos proprietários e caros.

Em Resumo

O artigo argumenta que, para classificar modelos de IA de forma justa, devemos parar de pedir aos juízes uma "sensação" vaga de qualidade e começar a usar uma lista de verificação estrita e filtrada de fatos simples. Este método remove o viés do juiz específico, torna a classificação muito mais estável e economiza dinheiro, tudo isso usando conversas do mundo real do Brasil como campo de teste.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →