← Últimos artigos
💻 computer science

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

O artigo apresenta o IRIS, um novo framework que combina aprendizado por reforço intercalado com um currículo incremental em etapas e um novo conjunto de dados multilíngue (CL-Math) para aprimorar significativamente as capacidades de raciocínio matemático entre idiomas, particularmente em línguas indianas de recursos limitados.

Autores originais: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

Publicado 2026-04-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um aluno a resolver problemas matemáticos complexos. Se você apenas jogar um livro didático difícil nas mãos dele e disser: "Descubra sozinho", é provável que ele fique travado, chute aleatoriamente ou desista. Este é exatamente o problema que os pesquisadores enfrentaram com modelos de IA tentando fazer matemática, especialmente ao alternar entre idiomas como inglês, hindi e marata.

O artigo apresenta um novo método de treinamento chamado IRIS (Reforço Intercalado com Currículo Incremental em Etapas). Pense no IRIS como um sistema de tutoria altamente estruturado, dividido em duas partes, projetado para transformar uma IA confusa em uma solucionadora de problemas matemáticos confiante.

Veja como funciona, dividido em conceitos simples:

1. O Plano de Treinamento de Dois Eixos

Os autores perceberam que ensinar matemática exige duas coisas diferentes acontecendo ao mesmo tempo. Eles construíram um quadro com dois "eixos" (como um gráfico X e Y):

  • O Eixo Vertical (Subindo a Escada de Dificuldade):
    Imagine um videogame onde você começa no "Nível 1" (problemas fáceis) e só avança para o "Nível 2" depois de dominá-lo. A maioria dos treinamentos de IA joga todos os níveis de uma vez no modelo. O IRIS é diferente. Ele começa a IA com problemas matemáticos fáceis, permite que ela se torne boa neles e, então, introduz gradualmente problemas médios e difíceis. Isso constrói uma base sólida antes de enfrentar as coisas difíceis.

  • O Eixo Horizontal (O Jogo "Complete a História"):
    Esta é a parte inteligente. Geralmente, uma IA recebe um problema e a resposta completa. O IRIS muda o jogo. Ele dá à IA a pergunta e os primeiros passos da solução, e depois diz: "Ok, agora você está por conta própria. Termine o resto."

    • Estágio inicial: A IA recebe a maioria dos passos e só precisa escrever os últimos dois.
    • Estágio posterior: A IA recebe apenas a pergunta e tem que escrever a solução inteira do zero.
      Isso força a IA a aprender a planejar e continuar seu próprio raciocínio, em vez de apenas memorizar respostas completas.

2. A "Recompensa Composta" (A Planilha de Pontuação)

No Aprendizado por Reforço, a IA ganha pontos (recompensas) por se sair bem. Geralmente, ela só ganha pontos se a resposta final estiver correta. Mas em matemática, uma resposta correta com lógica ruim ainda é ruim.

O IRIS usa uma recompensa composta, que é como um professor avaliando um aluno em quatro coisas ao mesmo tempo:

  1. Você chegou à resposta certa? (A parte mais importante).
  2. Seus passos fazem sentido? (Você seguiu um caminho lógico semelhante ao correto?).
  3. Você manteve o fluxo? (Você continuou de onde o passo anterior parou, ou reiniciou a numeração?).
  4. O número está formatado corretamente? (Você produziu um número limpo?).

Isso garante que a IA aprenda como pensar, e não apenas qual é a resposta.

3. A "Âncora em Inglês" (O Segredo Multilíngue)

Um dos maiores desafios é ensinar matemática em idiomas com menos recursos, como hindi ou marata. Não há tantos dados matemáticos de alta qualidade disponíveis para esses idiomas quanto para o inglês.

O artigo descobriu um truque fascinante: Use o inglês como uma "Âncora de Raciocínio".

  • Imagine que a capacidade da IA de pensar logicamente está armazenada em inglês, e sua capacidade de falar hindi ou marata é uma habilidade separada.
  • Ao treinar a IA com uma mistura de problemas em inglês e hindi/marata (mesmo que apenas 20% em inglês), os dados em inglês atuam como uma âncora estável. Eles mantêm o raciocínio lógico da IA afiado e consistente.
  • A IA então "transfere" essa forte capacidade de raciocínio para o hindi e o marata. Sem essa âncora em inglês, a IA luta para manter a consistência lógica nos idiomas com menos recursos, frequentemente ficando travada ou desistindo.

4. Os Resultados

Os pesquisadores testaram isso em um novo conjunto de dados que criaram, chamado CL-Math, que contém 29.000 problemas matemáticos com soluções passo a passo em inglês, hindi e marata.

  • Melhores Habilidades Matemáticas: Os modelos treinados com IRIS resolveram significativamente mais problemas corretamente do que os modelos padrão, especialmente nas perguntas mais difíceis.
  • Impulso Linguístico: As maiores melhorias foram vistas no hindi e no marata. A estratégia de "Âncora em Inglês" ajudou a IA a raciocinar nesses idiomas muito melhor do que se tivesse sido treinada apenas nesses idiomas sozinhos.
  • Generalização: Mesmo tendo sido treinada em seu conjunto de dados específico, a IA teve um desempenho melhor em outros testes matemáticos padrão (como GSM8K e MATH) também, provando que o método funciona amplamente.

Resumo

Em resumo, o IRIS é um método de treinamento que ensina a IA a fazer matemática ao:

  1. Começar fácil e ficar mais difícil (Vertical).
  2. Fazer a IA completar soluções parciais (Horizontal).
  3. Avaliá-la tanto na resposta quanto na lógica (Recompensa Composta).
  4. Usar o inglês como uma "rodinha de treinamento" para ajudá-la a aprender matemática em outros idiomas (Âncora Multilíngue).

O resultado é uma IA mais inteligente e lógica que pode resolver problemas matemáticos em vários idiomas, não apenas chutando, mas realmente entendendo os passos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →