← Últimos artigos
💬 NLP

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

O artigo apresenta o AdaMame, uma receita de treinamento de dois estágios que combina o ajuste fino supervisionado com um novo algoritmo GRPO adaptativo (AdaMame-GRPO) para permitir que Grandes Modelos de Raciocínio raciocinem no idioma da consulta sem sacrificar a precisão ou a eficiência de tokens, superando, assim, o fenômeno do colapso linguístico.

Autores originais: Dayeon Ki, Kevin Duh, Marine Carpuat

Publicado 2026-06-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Dayeon Ki, Kevin Duh, Marine Carpuat

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma estudante brilhante e multilíngue chamada Ada. Ada é incrivelmente inteligente na resolução de problemas matemáticos, mas ela tem um mau hábito: não importa em qual língua você faça uma pergunta a ela (francês, telugo ou tailandês), ela insiste em pensar e responder em inglês.

Isso é um problema conhecido como "colapso linguístico" (language collapse). Mesmo que você pergunte "Quantos ovos há em uma dúzia?" em francês, Ada pode pensar: "Ok, deixe-me calcular em inglês... 12 ovos", e então apenas traduzir a resposta. Ela não realmente pensa na língua em que você perguntou.

As tentativas existentes para corrigir isso são como um professor rigoroso que diz: "Se você não falar francês, ganha zero!". Isso força Ada a falar francês, mas muitas vezes a deixa nervosa. Ela pode começar a gaguejar (alternando entre o francês e o inglês no meio de uma frase), dar respostas erradas por estar focada demais na regra da língua, ou falar por muito tempo apenas para provar que está tentando.

AdaMame é uma nova e inteligente receita de treinamento projetada para corrigir o mau hábito de Ada sem deixá-la nervosa ou lenta. Veja como funciona, dividido em etapas simples:

A Receita de Treinamento de Dois Estágios

Os autores treinaram Ada usando um processo de dois passos, como um treinador preparando um atleta para as Olimpíadas.

Estágio 1: O "Acampamento de Imersão" (SFT)
Primeiro, eles colocaram Ada em um acampamento onde ela interage apenas com falantes nativos de cinco línguas diferentes (francês, português, japonês, coreano e tailandês).

  • O que eles fizeram: Mostraram a ela milhares de problemas matemáticos onde o processo de pensamento (os "pensamentos") já estava escrito perfeitamente na língua local.
  • O Resultado: Ada aprendeu que é possível resolver problemas matemáticos nessas línguas. Ela parou de recorrer ao inglês imediatamente. No entanto, ela ainda estava um pouco instável quando confrontada com línguas nas quais não havia praticado (como o suaíli ou o bengali).

Estágio 2: O "Treinador Inteligente" (AdaMame-GRPO)
Esta é a parte mágica. No segundo estágio, eles usaram um método de treinamento especial chamado AdaMame-GRPO.

  • O Problema com os Treinadores Antigos: Métodos anteriores davam a Ada uma recompensa apenas se ela acertasse a resposta e falasse a língua correta. Isso era como um interruptor de "tudo ou nada". Se ela acertasse a resposta, mas falasse inglês, ela não recebia recompensa nenhuma. Isso a deixava com medo de experimentar.
  • A Solução AdaMame: O novo treinador usa uma estratégia de crescimento gradual.
    • No início do treinamento: O treinador é tolerante. "Ei, apenas tente resolver o problema! Não importa se você pensa em inglês ou francês agora, apenas acerte a matemática." Isso permite que Ada explore e encontre a melhor maneira de resolver o problema.
    • Mais tarde no treinamento: À medida que o treinamento progride, o treinador aumenta gradualmente o volume da regra da língua. "Ok, você está ficando boa em matemática. Agora, você deve pensar na língua que o usuário pediu."
    • A Analogia: Imagine ensinar uma criança a andar de bicicleta. No início, você a deixa balançar e cair (explorar). Uma vez que ela esteja estável, você a guia gentilmente para permanecer na faixa da bicicleta (alinhar-se com a língua da consulta). Você não grita "Fique na faixa!" no primeiríssimo segundo, ou ela vai bater.

Por Que Isso é Importante

O artigo testou este novo método contra métodos antigos e encontrou três grandes vitórias:

  1. Sem mais "Alternância de Código" (Code-Switching): Ada parou com o hábito irritante de alternar línguas no meio de uma frase (ex: começar um pensamento em francês e terminar em inglês). Agora ela é consistente.
  2. Sem mais "Pensar Demais": Os métodos antigos faziam Ada falar por muito tempo apenas para provar que estava tentando. O AdaMame tornou-a eficiente. Ela usa menos palavras (tokens) para obter o mesmo resultado.
  3. O "Efeito Underdog": A maior melhoria ocorreu com as línguas de baixos recursos (línguas com menos dados disponíveis, como o telugo ou o suaíli). Enquanto outros métodos tinham dificuldades com essas línguas, o AdaMame ajudou Ada a ter um desempenho surpreendentemente bom, tornando a tecnologia mais justa para todos, não apenas para os falantes de línguas principais.

A Conclusão

O artigo afirma que o AdaMame cria um modelo que é:

  • Preciso: Ele acerta a matemática.
  • Fiel: Ele pensa na língua que você pediu.
  • Eficiente: Não desperdiça tempo ou palavras.

Ele alcança o que os autores chamam de "desempenho Pareto-ótimo", que é uma forma elegante de dizer: "Obtivemos o melhor equilíbrio possível entre esses três objetivos sem sacrificar um pelos outros". É como conseguir um carro que é rápido, seguro e econômico, enquanto modelos anteriores eram geralmente rápidos mas inseguros, ou seguros mas lentos.

Os autores liberaram seus dados e código para que outros possam usar esta "receita de treinamento" para construir uma IA multilíngue melhor, especificamente para o raciocínio matemático, sem precisar depender do inglês como a língua de pensamento padrão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →