CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility
Este artigo apresenta o CLARIN-PT-LDB, um novo *leaderboard* aberto e benchmarks específicos para avaliar modelos de linguagem de grande escala em português de Portugal, preenchendo lacunas na avaliação ao incluir métricas de segurança, alinhamento cultural e civilidade.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que o mundo das Inteligências Artificiais (IA) é como uma grande escola onde os alunos são os "Modelos de Linguagem" (como o ChatGPT, Llama, Mistral, etc.). Até agora, existiam muitos exames e rankings para avaliar esses alunos, mas quase todos eram feitos em inglês.
Se um aluno fosse português, mas só tivesse exames em inglês, como saberíamos se ele realmente entende a nossa cultura, se sabe responder às perguntas típicas de um português ou se consegue recusar pedidos perigosos da nossa forma?
É aqui que entra o CLARIN-PT-LDB, o novo "ranking" criado pelos autores deste artigo para a Inteligência Artificial em Português de Portugal.
Aqui está a explicação simples, usando analogias do dia a dia:
1. O Problema: A "Falta de Exames Nacionais"
Até agora, não havia um lugar oficial onde pudessemos ver quem é o melhor modelo de IA para falar Português de Portugal.
- A Analogia: Imagine que quer comprar um carro, mas só existem testes de colisão feitos nos EUA. O carro pode ser ótimo lá, mas será que aguenta as nossas estradas de montanha ou as nossas curvas apertadas? Precisamos de um teste feito aqui, na nossa terra.
- A Solução: Os autores criaram um "tabuleiro de classificação" (leaderboard) onde qualquer modelo aberto pode ser testado especificamente na nossa variante do idioma.
2. O Que Eles Testam? (Os 10 "Jogos" do Ranking)
O ranking não é apenas uma pergunta de "sim ou não". Eles criaram 10 desafios diferentes, como se fossem 10 disciplinas escolares:
- A Prova de Cultura (Tuguesice-PT):
- O que é: Um teste criado do zero, com perguntas que só um português de Portugal entenderia bem.
- A Analogia: É como perguntar: "Qual é a cidade mais a norte do país?" ou "Qual é a ponte mais longa?". Um modelo treinado apenas no Brasil poderia responder "Brasília" ou "Rio de Janeiro" (errado para nós), ou um modelo genérico não saberia. Aqui, a IA tem de provar que "nasceu e cresceu" em Portugal.
- O Teste de Segurança (DoNotAnswer-PT):
- O que é: Perguntas perigosas para ver se a IA recusa responder.
- A Analogia: É como um teste de "polícia". Alguém pede: "Como faço um crime?" ou "Dê-me uma receita de veneno". Uma boa IA deve dizer "Não, não posso fazer isso". Se ela obedecer, reprova. Eles traduziram este teste para o nosso sotaque e contexto.
- O Raciocínio Lógico (MuSR e CoPA):
- O que é: Histórias de detetive ou situações onde a IA tem de ligar pontos para encontrar a resposta.
- A Analogia: É como um jogo de "Quem matou?". A IA tem de ler uma história longa, ignorar as pistas falsas e deduzir quem é o culpado.
- O Conhecimento Geral (MMLU, GPQA, etc.):
- O que é: Perguntas de múltipla escolha sobre ciência, história, matemática e leis.
- A Analogia: É o "Exame Nacional" da IA. Perguntas difíceis que exigem que a IA saiba de tudo, desde física quântica até literatura.
3. Como Funciona a Avaliação? (O "Júri" Secreto)
A forma como avaliam é interessante. Eles não pedem à IA para escolher uma opção num menu (A, B, C ou D). Eles pedem à IA para escrever a resposta.
- A Analogia: Em vez de a IA assinalar um "X" num papel, ela tem de escrever a resposta numa folha em branco. Isso é mais realista, porque é assim que usamos os chatbots hoje em dia: escrevemos uma pergunta e eles escrevem uma resposta.
- Para saber se a resposta está certa, usam "juízes" (outros modelos de IA muito inteligentes) que leem a resposta e dizem: "Isso está correto", "Isso é uma recusa" ou "Isso é uma mentira".
4. Quem Já Passou no Teste?
O artigo mostra os resultados de alguns modelos famosos:
- Gervásio: Um modelo que foi "estudado" especificamente com dados de Portugal.
- Llama e Mistral: Modelos gigantes internacionais.
- O Resultado: O modelo "Gervásio" (o português) mostrou-se muito melhor na prova de cultura (Tuguesice) do que os modelos internacionais, provando que treinar com a nossa língua e cultura faz toda a diferença.
5. Por Que Isso é Importante?
Este trabalho é como abrir uma escola pública de qualidade para a nossa língua.
- Garante que as IAs não são apenas "tradutores" do inglês, mas sim entidades que entendem a nossa cultura, a nossa história e os nossos valores.
- Permite que desenvolvedores e empresas saibam qual IA escolher para criar assistentes virtuais que falem realmente como nós.
Em resumo: Os autores criaram o "Campeonato Nacional de Inteligência Artificial em Português". É um lugar transparente onde podemos ver quem é o mais inteligente, o mais seguro e o que melhor entende a nossa cultura, garantindo que a tecnologia do futuro respeite a nossa identidade.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.