Resumo Técnico: Alternância de Código Gradual como Alinhamento de Representação Translinguística em Tempo de Inferência para LLMs
Declaração do Problema
Apesar do progresso significativo nas capacidades multilíngues, os Grandes Modelos de Linguagem (LLMs) exibem um desempenho desigual entre diferentes idiomas. Essa disparidade decorre de uma dependência excessiva de representações latentes centradas no inglês. Estudos recentes indicam que os LLMs frequentemente traduzem internamente entradas não inglesas para o inglês antes de raciocinar, criando uma "barreira de tradução". Se essa tradução interna inicial falhar, a qualidade do resultado final degrada-se drasticamente.
Abordagens existentes para mitigar isso, como o Aprendizado em Contexto Translinguístico (X-ICL), geralmente dependem de um pivô abrupto e de etapa única. Por exemplo, um modelo pode ser instruído com demonstrações em inglês para resolver uma tarefa em um idioma alvo, ou uma consulta pode ser totalmente traduzida para o inglês antes do raciocínio. Esses métodos costumam transferir padrões de tarefas superficiais (ex: formatos de saída) sem efetivamente construir a ponte para a lacuna representacional subjacente entre o idioma alvo e o espaço latente do modelo, centrado no inglês. Consequentemente, o desempenho em idiomas de baixos recursos e não vistos permanece subótimo.
Metodologia: Aprendizado em Contexto com Alternância de Código (CSICL)
Os autores propõem o CSICL, um mecanismo de tempo de inferência que não requer treinamento, projetado para alinhar representações translinguísticas ao estruturar explicitamente a trajetória de raciocínio. Em vez de uma transição abrupta, o CSICL emprega uma estratégia de alternância de código gradual que transita do idioma alvo para o inglês.
Mecanismo Central
O CSICL opera através de dois componentes primários:
- Instrução de Tradução Gradual: O modelo é instruído a processar uma entrada não inglesa traduzindo-a gradualmente para o inglês, pensando em inglês e, então, gerando a resposta final no idioma alvo.
- Demonstrações de Alternância de Código Gradual: Os exemplos de poucos disparos (few-shot) fornecidos ao modelo não alternam de idioma abruptamente. Em vez disso, eles seguem uma progressão por etapas:
- 0% (Idioma Alvo): A consulta está inteiramente no idioma alvo.
- 25% - 75% (Etapas Intermediárias): A consulta incorpora progressivamente tokens em inglês enquanto mantém a estrutura gramatical do idioma alvo (modelo Matrix Language Frame).
- 100% (Inglês): A consulta está totalmente traduzida para o inglês.
Essa mudança gradual atua como uma "ponte linguística", induzindo o LLM a alinhar dinamicamente as entradas não inglesas com seu espaço de raciocínio centrado no inglês antes que a etapa de raciocínio real ocorra.
Detalhes de Implementação
- Construção de Demonstração: Para cada idioma alvo, os autores geram sequências de alternância de código gradual. Embora a implementação padrão utilize o GPT-5 para a construção das demonstrações, o CSICL não é fundamentalmente restrito a um oráculo externo. O método suporta autogeração (usando o mesmo modelo) ou geração baseada em regras. O método não é restrito ao uso do GPT-5 como o modelo de inferência; o artigo avalia o CSICL em quatro LLMs multilíngues distintos: Qwen3-32B, deepseek-chat-v3.1, grok-4-fast e Gemini 2.5 Flash.
- Direcionalidade: O método transita especificamente de Idioma Alvo → Inglês. Estudos de ablação sugerem que esta direção é superior à inversa (Inglês → Idioma Alvo), pois alinha a entrada com o espaço latente do modelo em vez de divergir dele.
- Granularidade: Os autores testaram várias contagens de etapas (ex: transições de 3, 5 ou 7 etapas) e descobriram que uma transição linear de 5 etapas geralmente oferece o melhor equilíbrio entre desempenho e eficiência de tokens.
Contribuições Principais
- Proposta do CSICL: Um novo mecanismo de tempo de inferência que une idiomas alvo e representações em inglês através de uma alternância de código estruturada e gradual, evitando as armadilidades de pivôs abruptos.
- Evidência Empírica Sistemática: Avaliação abrangente em 4 LLMs multilíngues (Qwen3, DeepSeek, Grok, Gemini), 6 conjuntos de dados (incluindo Global MMLU, MedExpQA, PolyMath) e 10 idiomas (abrangendo configurações de altos, médios e baixos recursos).
- Visualização do Espaço Latente: O artigo fornece evidência visual (via PCA de estados ocultos) mostrando que o CSICL desloca sistematicamente as representações de entrada não inglesas para mais perto do âncora em inglês no espaço latente, validando a hipótesia de alinhamento.
- Análise de Fatores de Design: Os autores analisam fatores críticos, incluindo direcionalidade, granularidade e a origem da geração de demonstrações, demonstrando que o CSICL permanece eficaz mesmo quando utilizando demonstrações autogeradas ou baseadas em regras.
Resultados Experimentais
O CSICL supera consistentemente as linhas de base padrão de X-ICL (incluindo abordagens monolíngues, paralelas e de prompting baseadas em tradução) em todas as configurações avaliadas.
- Ganhos de Desempenho:
- Idiomas Alvo: Ganho médio de 6,0 pontos percentuais (pp) sobre as linhas de base monolíngues.
- Idiomas Não Vistos: Ganho médio de 4,8 pp.
- Configurações de Baixos Recursos: As melhorias são mais pronunciadas em cenários de baixos recursos, com ganhos de 14,7 pp em idiomas alvo e 5,3 pp em idiomas não vistos.
- Especificidade de Tarefa:
- Tradução: O CSICL alcançou os maiores ganhos (+6,8 pp em idiomas alvo), pois a transição gradual estrutura diretamente o processo de tradução latente.
- Raciocínio: Melhorias significativas foram observadas em tarefas orientadas ao raciocínio (+5,4 pp), sugerindo que "pensar em inglês" via alinhamento gradual mitiga a interferência representacional.
- Conhecimento: Ganhos modestos, porém consistentes, foram encontrados em tarefas de conhecimento cultural e viés social.
- Eficiência: Embora a configuração completa do CSICL (5 disparos, 5 etapas) utilize mais tokens do que as linhas de base mais simples, o overhead é gerenciável dentro das janelas de contexto padrão. Notavelmente, mesmo as versões zero-shot e one-shot do CSICL superam bases fortes utilizando menos tokens do que muitas alternativas de X-ICL existentes.
Significância e Alegações
O artigo posiciona o CSICL como uma abordagem robusta e eficaz para reduzir o desalinhamento translinguístico durante a inferência sem exigir o retreinamento ou ajuste fino (fine-tuning) do modelo.
- Implantação Equitativa: Ao melhorar o desempenho em idiomas de baixos recursos e não vistos, o CSICL aproxima os LLMs de sistemas multilíngues mais equitativos, abordando a limitação atual onde a competência é fortemente enviesada para o inglês.
- Insight de Mecanismo: O trabalho estabelece que a alternância de código gradual não é meramente uma escolha estilística, mas um mecanismo funcional que controla a trajetória de raciocínio, permitindo que os modelos aproveitem suas capacidades de raciocínio mais fortes em inglês enquanto mantêm a fidelidade ao idioma alvo.
- Utilidade Prática: O método é apresentado como uma solução leve e ajustável que oferece uma relação favorável entre eficiência e precisão, tornando-o adequado tanto para configurações com restrição de orçamento (via variantes 0/1-shot) quanto para requisitos de alta precisão.
Os autores concluem que o CSICL representa uma nova perspectiva para o alinhamento translinguístico, demonstrando que estruturar explicitamente a transição do idioma alvo para o inglês pode aumentar significativamente as capacidades multilíngues dos LLMs existentes.