← Últimos artigos
🤖 AI

AdaR: A Framework for Equipping LLMs with Adaptive Reasoning

O framework AdaR aumenta a robustez e a generalização do raciocínio matemático de grandes modelos de linguagem ao treiná-los com Aprendizado por Reforço em consultas logicamente equivalentes e sintetizadas automaticamente para penalizar correlações espúrias e incentivar o raciocínio adaptativo.

Autores originais: Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

Publicado 2026-08-25
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No vasto cenário da inteligência artificial, os grandes modelos de linguagem emergiram como ferramentas poderosas capazes de resolver problemas complexos, desde escrever poesia até depurar código. Entre seus feitos mais impressionantes está o raciocínio matemático, onde esses sistemas decompõem uma questão em uma série de etapas lógicas para chegar a uma solução. Durante anos, pesquisadores celebraram essa habilidade, assumindo que, quando um modelo resolve um problema corretamente, ele realmente compreende a lógica por trás dele. No entanto, um olhar mais atento revela uma falha preocupante: muitos desses modelos não estão, de fato, raciocinando sobre o problema. Em vez disso, eles frequentemente memorizam padrões de seus dados de treinamento. Eles aprendem a associar números ou frases específicas com certas respostas, tal como um estudante que memoriza o gabarito de um teste prático sem compreender a matemática subjacente. Quando o teste muda ligeiramente — quando os números são diferentes ou a redação é alterada — esses modelos frequentemente tropeçam, falhando em se adaptar porque seu "raciocínio" nunca foi real para começo de conversa.

Este é o desafio central abordado por um novo estudo de pesquisadores da Universidade de Nanjing e da Meituan, que desenvolveram um framework chamado AdaR para ensinar as máquinas a pensar de forma adaptativa. A equipe descobriu que a raiz do problema reside no que chamam de "raciocínio espúrio". Isso ocorre quando um modelo depende de conexões superficiais, como o valor específico de um número em uma questão, em vez da lógica estrutural do próprio problema. Para ilustrar, imagine um modelo treinado para resolver um problema onde um número é elevado ao cubo. Se os dados de treinamento sempre usaram o número 3, o modelo pode aprender a simplesmente emitir "cubo" sempre que vir um problema de multiplicação, independentemente dos números reais envolvidos. Se o problema mudar para envolver um número diferente, o modelo falha porque nunca aprendeu a regra de elevar ao cubo; ele apenas aprendeu a reconhecer o padrão do número 3. Os pesquisadores descobriram que mesmo modelos avançados, que performam brilhantemente em testes padrão, sofrem com essa fragilidade, sendo incapazes de generalizar suas habilidades para novos cenários, ligeiramente diferentes.

Para corrigir isso, os pesquisadores criaram um sistema que força o modelo a aprender a lógica em vez dos números. Eles começaram pegando problemas matemáticos existentes e reduzindo-os à sua estrutura central, ou template. Em seguida, utilizaram um programa de computador para gerar automaticamente milhares de novas versões desses problemas, alterando os números específicos enquanto mantinham as etapas lógicas exatamente iguais. Crucialmente, eles não apenas pediram a um modelo de linguagem para adivinhar as novas respostas; eles escreveram código executável para calcular as respostas corretas com absoluta certeza. Isso garantiu que cada novo problema criado fosse válido e tivesse uma solução verificada. Eles então submeteram seus modelos a um processo de treinamento rigoroso usando esses novos e variados problemas. Em vez de simplesmente mostrar ao modelo a resposta certa, eles usaram um método que recompensava o modelo apenas quando ele conseguia resolver todo o conjunto de problemas variados corretamente. Se o modelo dependesse de padrões memorizados, ele falharia nos novos números e receberia uma penalidade. Se aprendesse a lógica real, teria sucesso em todas as variações e receberia uma recompensa.

Os resultados desta abordagem foram impressionantes. Quando testados em tipos de problemas matemáticos familiares e completamente novos, os modelos treinados com este framework adaptativo mostraram melhorias significativas. Em média, seu desempenho saltou mais de oito pontos em comparação com outros métodos, um ganho substancial no mundo da inteligência artificial. Mais importante ainda, os modelos tornaram-se muito mais robustos. Eles conseguiram lidar com mudanças nos números de um problema sem entrar em colapso, provando que aprenderam as regras subjacentes em vez de apenas memorizar exemplos específicos. Os pesquisadores também observaram uma mudança na forma como os modelos "pensavam". Antes deste treinamento, os modelos tendiam a focar nos números específicos de uma questão, ignorando a estrutura. Após o treinamento, sua atenção mudou para a própria estrutura do problema, permitindo que tratassem variáveis desconhecidas com o mesmo cuidado lógico que números conhecidos. Essa mudança sugere que os modelos estavam desenvolvendo uma forma de pensamento algébrico, tratando problemas como sistemas de relações em vez de listas de fatos a serem recordados.

O estudo também explorou como diferentes tipos de mudanças afetaram o processo de aprendizagem. Eles descobriram que alterar os números nos problemas era muito mais eficaz para ensinar o modelo a raciocinar do que simplesmente reescrever as questões com palavras diferentes. Isso indica que a chave para o raciocínio adaptativo é expor o modelo a uma ampla variedade de cenários numéricos, forçando-o a depender da lógica para navegar pelas diferenças. Os pesquisadores observaram que, embora o método funcionasse bem, ele tinha limites; exigia que os problemas fossem solucionáveis por um programa de computador, o que significava que era mais adequado para tarefas de matemática e lógica do que para campos mais abstratos, como a prova de teoremas complexos. Além disso, o sucesso do método dependia de o modelo já possuir uma base sólida de conhecimento matemático. O sistema não podia ensinar o raciocínio do zero para um modelo que nada sabia; ele só podia refinar o raciocínio de um modelo que já possuía os blocos de construção básicos.

Em última análise, este trabalho oferece um caminho claro para tornar a inteligência artificial mais confiável. Ao se afastar da simples memorização e caminhar em direção ao raciocínio adaptativo, os pesquisadores mostraram que é possível construir modelos que possam lidar com o inesperado. As descobertas sugerem que o futuro dos sistemas inteligentes reside não apenas em torná-los maiores ou mais rápidos, mas em ensiná-los a entender as regras que governam o mundo, em vez de apenas os exemplos específicos que já viram antes. À medida que esses modelos se tornam mais integrados às nossas vidas diárias, desde a resolução de equações financeiras até o planejamento de logística complexa, a capacidade de se adaptar a novas informações sem falhar será essencial. O framework AdaR fornece um roteiro para alcançar isso, transformando máquinas frágeis de reconhecimento de padrões em pensadores flexíveis e lógicos, capazes de navegar em um mundo que está em constante mudança.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →