EuroLLM-22B: Technical Report
Este artigo apresenta o EuroLLM-22B, um grande modelo de linguagem treinado do zero para suportar 35 idiomas (incluindo todos os 24 idiomas oficiais da UE), abordando a sub-representação das línguas europeias em modelos existentes ao mesmo tempo em que alcança um desempenho competitivo em raciocínio, seguimento de instruções e tradução, com todos os conjuntos de dados, modelos e códigos relacionados disponibilizados para apoiar pesquisas futuras.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
EuroLLM-22B: O Bibliotecário Multilíngue da Europa
Imagine o mundo da Inteligência Artificial como uma biblioteca massiva. Durante muito tempo, esta biblioteca foi dominada por livros escritos em inglês. Se você entrasse e pedisse uma história em francês, alemão ou português, poderia encontrar alguns livros, mas eram frequentemente traduções de histórias inglesas ou escritos por autores que não compreendiam totalmente a cultura local.
EuroLLM-22B é um novo e massivo projeto desenhado para corrigir isso. É um "Modelo de Linguagem de Grande Escala" (pense nele como um bibliotecário digital superinteligente) construído do zero especificamente para falar, compreender e raciocinar em todas as 24 línguas oficiais da União Europeia, além de outras 11 línguas importantes como árabe, chinês e japonês.
Aqui está como a equipa construiu este bibliotecário digital, explicado em termos simples:
1. O Projeto (A Arquitetura)
Antes de construir a casa, precisa de um projeto. A equipa não se limitou a copiar e colar um design existente; eles ajustaram o projeto para lidar com uma quantidade massiva de informação.
- O Tamanho: Este modelo possui 22 mil milhões de "neurónios" (parâmetros). Para usar uma analogia, se a versão anterior (9B) era um aluno inteligente do ensino secundário, esta é um professor universitário experiente com uma memória muito vasta.
- A Memória Longa: Uma das maiores melhorias é a "janela de contexto". Imagine tentar ler um romance. Os modelos mais antigos conseguiam apenas recordar as últimas páginas antes de esquecerem o início. O EuroLLM-22B consegue manter 32.000 palavras na cabeça ao mesmo tempo. Pode ler um conto inteiro ou um documento jurídico longo e recordar os detalhes da primeira página até à última sem se perder.
2. A Dieta de Treino (Os Dados)
Não se pode fazer um grande chef com ingredientes de má qualidade. A equipa foi muito exigente com a "comida" que deu ao modelo durante o seu treino.
- O Filtro: Eles não despejaram simplesmente toda a internet no modelo. Utilizaram um filtro especial (chamado EuroFilter) para avaliar a qualidade do texto, atribuindo-lhe uma pontuação de 0 a 5. Deitaram fora o lixo (como código aleatório ou páginas web de baixa qualidade) e mantiveram apenas o conteúdo educativo e literário de alta qualidade.
- As Fases: Treinaram o modelo em três etapas, como um estudante a progredir na escola:
- Ensino Primário: Começaram com uma enorme quantidade de dados gerais para ensinar o básico.
- Ensino Secundário: Introduziram dados de maior qualidade para refinar o seu raciocínio.
- Pós-Graduação: Na fase final, alimentaram-no com os melhores dados disponíveis, incluindo matemática complexa, programação e livros traduzidos, para afiar a sua inteligência.
- A Mistura de Línguas: Ao contrário de outros modelos que se focam intensamente no inglês, o EuroLLM-22B foi alimentado com uma dieta equilibrada de todas as línguas europeias desde o primeiro dia, garantindo que não favorece uma sobre as outras.
3. O Polimento Final (Ajuste de Instrução)
Depois de o modelo ter aprendido os factos, precisava de aprender como se comportar. Isto é chamado de "pós-treino".
- A Sala de Aula: A equipa utilizou um novo conjunto de dados chamado EuroBlocks. Imagine isto como uma enorme coleção de perguntas e respostas de prática, abrangendo tudo, desde "Escreva um poema sobre a chuva" a "Resolva este problema matemático" e "Traduza esta frase".
- O Professor: Utilizaram outros modelos de IA avançados para gerar respostas de alta qualidade para estas perguntas e, depois, selecionaram as melhores para ensinar o EuroLLM-22B a seguir instruções com precisidade. Removeram quaisquer "traços de raciocínio" (o monólogo interno) para tornar o resultado final limpo e direto.
4. O Boletim Escolar (Os Resultados)
A equipa testou o EuroLLM-22B contra outros modelos de IA famosos para ver como se comportava.
- A Competição: Compararam-no com outros modelos "totalmente abertos" (modelos onde o código e os pesos são gratuitos para qualquer pessoa usar) e alguns modelos de "pesos abertos" (onde pode usar o modelo, mas não consegue ver como foi construído).
- O Desfecho:
- Campeão Europeu: Entre os modelos totalmente abertos feitos na Europa, o EuroLLM-22B é o mais forte. Superou outros modelos europeus, mesmo aqueles que eram muito maiores (como um modelo de 70 mil milhões de parâmetros).
- Tradução: É excelente a traduzir entre línguas, muitas vezes igualando o desempenho de modelos que têm o dobro do seu tamanho.
- Raciocínio: É muito bom em enigmas de lógica, matemática e em seguir instruções complexas.
- Eficiência: O artigo refere que o EuroLLM-22B alcançou estes resultados com uma quantidade "modesta" de dados de treino (4 biliões de palavras) comparativamente a alguns concorrentes que utilizaram 15 biliões, sugerindo que a qualidade dos dados importa mais do que apenas uma quantidade massiva.
5. O Presente para o Mundo
A parte mais importante deste artigo é que a equipa não guardou a biblioteca para si mesma. Eles estão a disponibilizar tudo ao público:
- Os Modelos: Tanto a versão "base" (o cérebro bruto) como a versão "instruct" (o assistente prestativo).
- Os Dados: Os conjuntos de dados reais que utilizaram para treinar o modelo (EuroWeb e EuroBlocks), para que outros investigadores possam aprender com eles.
- O Código: As ferramentas de software que utilizaram para construir e testar o modelo.
Em resumo: O EuroLLM-22B é uma ferramenta de IA poderosa e de código aberto, desenhada para garantir que as línguas europeias não fiquem para trás na revolução da IA. Prova que, com uma seleção cuidadosa de dados e um foco na qualidade, é possível construir uma IA de classe mundial que fale a sua língua fluentemente, sem precisar de ser um projeto fechado e secreto.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.