← Últimos artigos
💬 NLP

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

Este artigo apresenta o CLARIN-PT-LDB, um novo *leaderboard* aberto e benchmarks específicos para avaliar modelos de linguagem de grande escala em português de Portugal, preenchendo lacunas na avaliação ao incluir métricas de segurança, alinhamento cultural e civilidade.

Autores originais: João Silva, Luís Gomes, António Branco

Publicado 2026-03-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: João Silva, Luís Gomes, António Branco

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que o mundo das Inteligências Artificiais (IA) é como uma grande escola onde os alunos são os "Modelos de Linguagem" (como o ChatGPT, Llama, Mistral, etc.). Até agora, existiam muitos exames e rankings para avaliar esses alunos, mas quase todos eram feitos em inglês.

Se um aluno fosse português, mas só tivesse exames em inglês, como saberíamos se ele realmente entende a nossa cultura, se sabe responder às perguntas típicas de um português ou se consegue recusar pedidos perigosos da nossa forma?

É aqui que entra o CLARIN-PT-LDB, o novo "ranking" criado pelos autores deste artigo para a Inteligência Artificial em Português de Portugal.

Aqui está a explicação simples, usando analogias do dia a dia:

1. O Problema: A "Falta de Exames Nacionais"

Até agora, não havia um lugar oficial onde pudessemos ver quem é o melhor modelo de IA para falar Português de Portugal.

  • A Analogia: Imagine que quer comprar um carro, mas só existem testes de colisão feitos nos EUA. O carro pode ser ótimo lá, mas será que aguenta as nossas estradas de montanha ou as nossas curvas apertadas? Precisamos de um teste feito aqui, na nossa terra.
  • A Solução: Os autores criaram um "tabuleiro de classificação" (leaderboard) onde qualquer modelo aberto pode ser testado especificamente na nossa variante do idioma.

2. O Que Eles Testam? (Os 10 "Jogos" do Ranking)

O ranking não é apenas uma pergunta de "sim ou não". Eles criaram 10 desafios diferentes, como se fossem 10 disciplinas escolares:

  • A Prova de Cultura (Tuguesice-PT):
    • O que é: Um teste criado do zero, com perguntas que só um português de Portugal entenderia bem.
    • A Analogia: É como perguntar: "Qual é a cidade mais a norte do país?" ou "Qual é a ponte mais longa?". Um modelo treinado apenas no Brasil poderia responder "Brasília" ou "Rio de Janeiro" (errado para nós), ou um modelo genérico não saberia. Aqui, a IA tem de provar que "nasceu e cresceu" em Portugal.
  • O Teste de Segurança (DoNotAnswer-PT):
    • O que é: Perguntas perigosas para ver se a IA recusa responder.
    • A Analogia: É como um teste de "polícia". Alguém pede: "Como faço um crime?" ou "Dê-me uma receita de veneno". Uma boa IA deve dizer "Não, não posso fazer isso". Se ela obedecer, reprova. Eles traduziram este teste para o nosso sotaque e contexto.
  • O Raciocínio Lógico (MuSR e CoPA):
    • O que é: Histórias de detetive ou situações onde a IA tem de ligar pontos para encontrar a resposta.
    • A Analogia: É como um jogo de "Quem matou?". A IA tem de ler uma história longa, ignorar as pistas falsas e deduzir quem é o culpado.
  • O Conhecimento Geral (MMLU, GPQA, etc.):
    • O que é: Perguntas de múltipla escolha sobre ciência, história, matemática e leis.
    • A Analogia: É o "Exame Nacional" da IA. Perguntas difíceis que exigem que a IA saiba de tudo, desde física quântica até literatura.

3. Como Funciona a Avaliação? (O "Júri" Secreto)

A forma como avaliam é interessante. Eles não pedem à IA para escolher uma opção num menu (A, B, C ou D). Eles pedem à IA para escrever a resposta.

  • A Analogia: Em vez de a IA assinalar um "X" num papel, ela tem de escrever a resposta numa folha em branco. Isso é mais realista, porque é assim que usamos os chatbots hoje em dia: escrevemos uma pergunta e eles escrevem uma resposta.
  • Para saber se a resposta está certa, usam "juízes" (outros modelos de IA muito inteligentes) que leem a resposta e dizem: "Isso está correto", "Isso é uma recusa" ou "Isso é uma mentira".

4. Quem Já Passou no Teste?

O artigo mostra os resultados de alguns modelos famosos:

  • Gervásio: Um modelo que foi "estudado" especificamente com dados de Portugal.
  • Llama e Mistral: Modelos gigantes internacionais.
  • O Resultado: O modelo "Gervásio" (o português) mostrou-se muito melhor na prova de cultura (Tuguesice) do que os modelos internacionais, provando que treinar com a nossa língua e cultura faz toda a diferença.

5. Por Que Isso é Importante?

Este trabalho é como abrir uma escola pública de qualidade para a nossa língua.

  • Garante que as IAs não são apenas "tradutores" do inglês, mas sim entidades que entendem a nossa cultura, a nossa história e os nossos valores.
  • Permite que desenvolvedores e empresas saibam qual IA escolher para criar assistentes virtuais que falem realmente como nós.

Em resumo: Os autores criaram o "Campeonato Nacional de Inteligência Artificial em Português". É um lugar transparente onde podemos ver quem é o mais inteligente, o mais seguro e o que melhor entende a nossa cultura, garantindo que a tecnologia do futuro respeite a nossa identidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →