← Últimos artigos
💬 NLP

EuroLLM-22B: Technical Report

Este artigo apresenta o EuroLLM-22B, um grande modelo de linguagem treinado do zero para suportar 35 idiomas (incluindo todos os 24 idiomas oficiais da UE), abordando a sub-representação das línguas europeias em modelos existentes ao mesmo tempo em que alcança um desempenho competitivo em raciocínio, seguimento de instruções e tradução, com todos os conjuntos de dados, modelos e códigos relacionados disponibilizados para apoiar pesquisas futuras.

Autores originais: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Ma
Publicado 2026-02-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

EuroLLM-22B: O Bibliotecário Multilíngue da Europa

Imagine o mundo da Inteligência Artificial como uma biblioteca massiva. Durante muito tempo, esta biblioteca foi dominada por livros escritos em inglês. Se você entrasse e pedisse uma história em francês, alemão ou português, poderia encontrar alguns livros, mas eram frequentemente traduções de histórias inglesas ou escritos por autores que não compreendiam totalmente a cultura local.

EuroLLM-22B é um novo e massivo projeto desenhado para corrigir isso. É um "Modelo de Linguagem de Grande Escala" (pense nele como um bibliotecário digital superinteligente) construído do zero especificamente para falar, compreender e raciocinar em todas as 24 línguas oficiais da União Europeia, além de outras 11 línguas importantes como árabe, chinês e japonês.

Aqui está como a equipa construiu este bibliotecário digital, explicado em termos simples:

1. O Projeto (A Arquitetura)

Antes de construir a casa, precisa de um projeto. A equipa não se limitou a copiar e colar um design existente; eles ajustaram o projeto para lidar com uma quantidade massiva de informação.

  • O Tamanho: Este modelo possui 22 mil milhões de "neurónios" (parâmetros). Para usar uma analogia, se a versão anterior (9B) era um aluno inteligente do ensino secundário, esta é um professor universitário experiente com uma memória muito vasta.
  • A Memória Longa: Uma das maiores melhorias é a "janela de contexto". Imagine tentar ler um romance. Os modelos mais antigos conseguiam apenas recordar as últimas páginas antes de esquecerem o início. O EuroLLM-22B consegue manter 32.000 palavras na cabeça ao mesmo tempo. Pode ler um conto inteiro ou um documento jurídico longo e recordar os detalhes da primeira página até à última sem se perder.

2. A Dieta de Treino (Os Dados)

Não se pode fazer um grande chef com ingredientes de má qualidade. A equipa foi muito exigente com a "comida" que deu ao modelo durante o seu treino.

  • O Filtro: Eles não despejaram simplesmente toda a internet no modelo. Utilizaram um filtro especial (chamado EuroFilter) para avaliar a qualidade do texto, atribuindo-lhe uma pontuação de 0 a 5. Deitaram fora o lixo (como código aleatório ou páginas web de baixa qualidade) e mantiveram apenas o conteúdo educativo e literário de alta qualidade.
  • As Fases: Treinaram o modelo em três etapas, como um estudante a progredir na escola:
    1. Ensino Primário: Começaram com uma enorme quantidade de dados gerais para ensinar o básico.
    2. Ensino Secundário: Introduziram dados de maior qualidade para refinar o seu raciocínio.
    3. Pós-Graduação: Na fase final, alimentaram-no com os melhores dados disponíveis, incluindo matemática complexa, programação e livros traduzidos, para afiar a sua inteligência.
  • A Mistura de Línguas: Ao contrário de outros modelos que se focam intensamente no inglês, o EuroLLM-22B foi alimentado com uma dieta equilibrada de todas as línguas europeias desde o primeiro dia, garantindo que não favorece uma sobre as outras.

3. O Polimento Final (Ajuste de Instrução)

Depois de o modelo ter aprendido os factos, precisava de aprender como se comportar. Isto é chamado de "pós-treino".

  • A Sala de Aula: A equipa utilizou um novo conjunto de dados chamado EuroBlocks. Imagine isto como uma enorme coleção de perguntas e respostas de prática, abrangendo tudo, desde "Escreva um poema sobre a chuva" a "Resolva este problema matemático" e "Traduza esta frase".
  • O Professor: Utilizaram outros modelos de IA avançados para gerar respostas de alta qualidade para estas perguntas e, depois, selecionaram as melhores para ensinar o EuroLLM-22B a seguir instruções com precisidade. Removeram quaisquer "traços de raciocínio" (o monólogo interno) para tornar o resultado final limpo e direto.

4. O Boletim Escolar (Os Resultados)

A equipa testou o EuroLLM-22B contra outros modelos de IA famosos para ver como se comportava.

  • A Competição: Compararam-no com outros modelos "totalmente abertos" (modelos onde o código e os pesos são gratuitos para qualquer pessoa usar) e alguns modelos de "pesos abertos" (onde pode usar o modelo, mas não consegue ver como foi construído).
  • O Desfecho:
    • Campeão Europeu: Entre os modelos totalmente abertos feitos na Europa, o EuroLLM-22B é o mais forte. Superou outros modelos europeus, mesmo aqueles que eram muito maiores (como um modelo de 70 mil milhões de parâmetros).
    • Tradução: É excelente a traduzir entre línguas, muitas vezes igualando o desempenho de modelos que têm o dobro do seu tamanho.
    • Raciocínio: É muito bom em enigmas de lógica, matemática e em seguir instruções complexas.
    • Eficiência: O artigo refere que o EuroLLM-22B alcançou estes resultados com uma quantidade "modesta" de dados de treino (4 biliões de palavras) comparativamente a alguns concorrentes que utilizaram 15 biliões, sugerindo que a qualidade dos dados importa mais do que apenas uma quantidade massiva.

5. O Presente para o Mundo

A parte mais importante deste artigo é que a equipa não guardou a biblioteca para si mesma. Eles estão a disponibilizar tudo ao público:

  • Os Modelos: Tanto a versão "base" (o cérebro bruto) como a versão "instruct" (o assistente prestativo).
  • Os Dados: Os conjuntos de dados reais que utilizaram para treinar o modelo (EuroWeb e EuroBlocks), para que outros investigadores possam aprender com eles.
  • O Código: As ferramentas de software que utilizaram para construir e testar o modelo.

Em resumo: O EuroLLM-22B é uma ferramenta de IA poderosa e de código aberto, desenhada para garantir que as línguas europeias não fiquem para trás na revolução da IA. Prova que, com uma seleção cuidadosa de dados e um foco na qualidade, é possível construir uma IA de classe mundial que fale a sua língua fluentemente, sem precisar de ser um projeto fechado e secreto.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →