CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
O artigo apresenta o CAPITU, um benchmark inovador para avaliar a capacidade de seguir instruções de modelos de linguagem em português brasileiro, contextualizando tarefas em obras literárias canônicas e oferecendo métricas automaticamente verificáveis que revelam tanto o alto desempenho de modelos de raciocínio quanto a eficiência de custo de modelos especializados na língua.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um grupo de assistentes muito inteligentes (os modelos de IA), mas eles são um pouco teimosos. Às vezes, você pede algo simples, como "escreva um texto sobre Machado de Assis", e eles escrevem um texto lindo, mas ignoram se você pediu para não usar a letra "A" ou para ter exatamente 100 palavras.
O artigo que você leu apresenta o CAPITU, que é como um grande "jogo de regras" criado especialmente para testar se esses assistentes sabem seguir ordens em Português do Brasil.
Aqui está a explicação do que eles fizeram, usando analogias simples:
1. O Cenário: Um Teatro de Literatura Brasileira
Em vez de pedir para a IA escrever sobre coisas genéricas (como "faça uma lista de frutas"), os criadores do CAPITU colocaram a IA dentro de um palco de teatro feito com os 8 maiores livros da literatura brasileira (como Dom Casmurro, Iracema e Grande Sertão: Veredas).
- A Analogia: Imagine que você é um diretor de teatro. Você não quer apenas que o ator fale bem; você quer que ele fale bem enquanto usa um chapéu vermelho, enquanto não pisca os olhos e enquanto termina cada frase com a palavra "sim". O CAPITU faz isso: ele pede para a IA escrever sobre esses livros clássicos, mas com regras muito específicas e difíceis.
2. As Regras do Jogo (As Instruções)
O jogo tem 59 tipos de regras diferentes. Algumas são fáceis, outras são armadilhas para a IA.
- Regras de "Contagem": "Escreva exatamente 120 palavras." (A IA adora escrever muito ou pouco, acertar o número exato é difícil).
- Regras de "Forma" (Muito Brasileiras): O português tem jeitos únicos que o inglês não tem. O CAPITU testa coisas como:
- "Use palavras que terminem com -inho ou -zinha" (o diminutivo carinhoso).
- "Use palavras que terminem com -mente" (como rapidamente, felizmente).
- "Não use a primeira pessoa" (não diga "eu acho").
- Regras de "Estrutura": "Comece cada parágrafo com a letra 'A' para formar a palavra AMOR" (isso é chamado de acróstico).
3. O Grande Diferencial: Sem Juízes Humanos
Antes, para saber se a IA obedeceu, precisava de um humano ler tudo e dizer: "Hum, acho que ele seguiu a regra". Isso é caro e lento.
O CAPITU é como um robô fiscalizador automático. Ele usa um "scanner" de computador que verifica instantaneamente:
- "Tem 120 palavras? Sim/Não."
- "Tem a palavra 'muito' proibida? Sim/Não."
- "Termina com -inho? Sim/Não."
Isso torna o teste justo, rápido e impossível de ser "trapaceado" por um humano cansado.
4. O Teste de Resistência (Conversas Longas)
O teste não foi só de uma vez. Eles fizeram uma conversa de 3 turnos (como um chat de WhatsApp):
- Turno 1: "Fale sobre o livro."
- Turno 2: "Agora fale mais, mas lembre-se: não use a palavra 'sim' e use 3 palavras terminadas em -inho."
- Turno 3: "Continue a conversa, mas agora também não pode usar números e deve terminar com um ponto de exclamação."
O problema: Muitas IAs esquecem as regras do Turno 1 quando chegam no Turno 3. O CAPITU mede exatamente isso: a capacidade de não esquecer as regras enquanto a conversa avança.
5. Quem Ganhou? (Os Resultados)
Eles testaram 18 modelos diferentes (os "candidatos"):
- Os Gigantes (GPT-5, Gemini, Claude): Os modelos mais avançados e caros do mundo foram os melhores. O GPT-5.2 (com "pensamento" ativado) acertou quase tudo (98,5%). Ele é como o aluno que decorou todas as regras e não erra.
- Os Especialistas Brasileiros (Sabiá): A Maritaca AI criou modelos feitos especificamente para o português. O Sabiazinho-4 foi uma surpresa! Ele não é o mais inteligente do mundo, mas foi muito eficiente. Ele acertou 87% das regras e custou 8 vezes menos que o modelo pequeno da Anthropic (Claude Haiku).
- Analogia: É como ter um carro de luxo (GPT-5) que vai muito bem, mas um carro popular brasileiro (Sabiazinho) que consome menos gasolina e faz o mesmo trajeto na cidade muito bem.
- Onde eles falharam:
- Contar palavras exatas é um pesadelo para quase todos.
- Lembrar de regras em conversas longas (Turno 3) é onde a maioria "esquece" e erra.
- Modelos da família Claude tiveram muita dificuldade com regras de estrutura (como fazer acrósticos), preferindo escrever textos bonitos mas desobedecendo a forma.
Resumo Final
O CAPITU é um novo "olhômetro" para o português. Ele prova que:
- As IAs ainda têm dificuldade em seguir regras estritas em português, especialmente as que envolvem a gramática específica do nosso idioma (como os diminutivos).
- Modelos feitos no Brasil para o Brasil (como o Sabiá) são uma opção excelente e barata.
- Para usar IA em tarefas reais (como criar contratos ou textos técnicos), não basta ela ser "inteligente"; ela precisa ser obediente.
O artigo libera todo o jogo para que qualquer pessoa possa testar suas próprias IAs e ver se elas realmente sabem ouvir o que o usuário pede.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.