← Últimos artigos
🤖 AI

QA-Merging: Query-Adaptive Reasoning via Layer Selective Model Merging

O artigo apresenta o QA-Merging, um framework livre de treinamento que combina adaptativamente modelos Long-CoT e Short-CoT ao calibrar seletivamente apenas as camadas transformer com alta divergência de padrão de raciocínio, reduzindo assim os custos de inferência enquanto mantém um desempenho sólido em diversas tarefas de raciocínio.

Autores originais: Zhaofeng Zhong, Wei Yuan, Tong Chen, Liang Qu, Xiangyu Zhao, Quoc Viet Hung Nguyen, Hongzhi Yin

Publicado 2026-08-18
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Zhaofeng Zhong, Wei Yuan, Tong Chen, Liang Qu, Xiangyu Zhao, Quoc Viet Hung Nguyen, Hongzhi Yin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo em rápida evolução da inteligência artificial, uma classe específica de programas de computador conhecida como grandes modelos de raciocínio surgiu como uma ferramenta poderosa para resolver problemas complexos. Esses sistemas são projetados para imitar processos de pensamento humano, gerando uma longa cadeia de raciocínio passo a passo antes de chegar a uma resposta final. Este método, frequentemente chamado de "longa cadeia de pensamento", permite que o modelo verifique seu próprio trabalho, corrija erros e navegue por enigmas lógicos difíceis com alta precisão. No entanto, essa meticulosidade vem com um custo significativo. Ao enfrentar uma questão simples que requer apenas alguns passos, o modelo frequentemente continua a gerar explicações longas e desnecessárias. Esse comportamento, às vezes descrito como "pensar demais" (overthinking), desperdiça poder de computação, retarda o tempo de resposta e pode até introduzir novos erros onde não existiam antes. O desafio para os pesquisadores tem sido criar um sistema que saiba quando pensar profundamente e quando fornecer uma resposta rápida e direta, sem ter que reconstruir todo o modelo do zero a cada vez.

Uma equipe de pesquisadores da Universidade de Queensland e outras instituições abordou esse dilema com uma nova abordagem chamada QA-Merging. Em vez de treinar um único modelo para aprender como alternar entre o pensamento profundo e as respostas rápidas — um processo que exige quantidades massivas de dados e tempo de computação caro — eles combinaram dois modelos existentes em um só. Um modelo era especializado em gerar cadeias de pensamento detalhadas e longas para problemas difíceis, enquanto o outro foi treinado para dar respostas concisas e curtas para tarefas simples. Ao fundir essas duas "personalidades" distintas em uma única entidade, os pesquisadores criaram um sistema que pode adaptar seu comportamento com base na questão específica que recebe. O resultado é um modelo que mantém a capacidade de resolver problemas matemáticos complexos com raciocínio profundo, mas pode alternar instantaneamente para uma resposta breve e eficiente para consultas mais fáceis, eliminando efetivamente o desperdício de pensar demais.

O cerne desta descoberta reside em como os pesquisadores decidiram combinar os dois modelos. Eles não simplesmente tiraram a média das configurações matemáticas dos dois programas, uma técnica comum que frequentemente obscurece suas forças únicas. Em vez disso, observaram que a diferença entre o raciocínio longo e o curto não está espalhada uniformemente pelas camadas internas do modelo. Pense no modelo como uma estrutura multicamadas onde a informação passa por muitos estáções. Os pesquisadores descobriram que a divergência entre os dois estilos de pensamento está concentrada em apenas algumas camadas específicas, enquanto o restante da estrutura permanece bastante semelhante. Ao identificar essas camadas críticas, eles puderam concentrar seus esforços em calibrar apenas essas partes, deixando as outras para serem ajustadas com um método muito mais simples e rápido. Essa estratégia seletiva permitiu preservar as capacidades de raciocínio profundo do modelo complexo enquanto integrava a eficiência do modelo simples, tudo isso sem o alto custo de retreinamento.

Para ensinar o modelo fundido a escolher o caminho certo, a equipe construiu um conjunto de dados pequeno e cuidadosamente rotulado. Eles alimentaram uma variedade de perguntas tanto com os modelos de pensamento longo quanto com os de pensamento curto e compararam os resultados. Se uma pergunta fosse difícil e apenas o modelo de pensamento longo a resolvesse corretamente, o modelo fundido era instruído a seguir o padrão de pensamento longo. Se uma pergunta fosse simples e ambos os modelos a acertassem, o sistema era guiado para preferir a resposta mais curta e eficiente. Esse processo criou um conjunto de regras que dizia ao modelo fundido exatamente qual estilo de raciocínio adotar para cada consulta específica. Os pesquisadores então aplicaram uma técnica chamada alinhamento de características às camadas críticas, garantindo que o estado interno do modelo fundido correspondesse ao estilo preferido para aquela questão específica. Para as camadas restantes, utilizaram uma correção matemática que ajustava a saída sem a necessidade de cálculos complexos, garantindo que o sistema permanecesse estável e eficiente.

Os resultados desta abordagem foram impressionantes. Quando testado em sete diferentes benchmarks de raciocínio, variando de problemas matemáticos do ensino fundamental a questões científicas avançadas de nível de pós-graduação, o modelo fundido superou consistentemente os métodos existentes. Em um modelo específico de 1,5 bilhão de parâmetros, a nova abordagem reduziu o comprimento médio da resposta em 70 por cento em comparação com o modelo de pensamento longo, enquanto na verdade melhorou a precisão geral. Isso significa que o sistema não era apenas mais rápido e barato de operar, mas também mais correto. Ele conseguiu resolver problemas difíceis com a mesma profundidade do modelo complexo original, mas evitou o pensamento excessivo e desnecessário em tarefas mais simples. Em contraste, outros métodos que tentaram alcançar objetivos semelhantes ou exigiam retreinamento extensivo, que é lento e caro, ou dependiam de comandos (prompts) simples que frequentemente falhavam em guiar o modelo corretamente. O novo método alcançou um equilíbrio que as técnicas anteriores não conseguiram, provando que é possível ter tanto velocidade quanto inteligência em um único sistema.

O estudo também destacou a importância de não tratar todas as partes de um modelo de inteligência artificial da mesma maneira. Ao demonstrar que apenas um pequeno subconjunto de camadas é responsável pela diferença entre o raciocamento profundo e o superficial, os pesquisadores demonstraram que uma abordagem direcionada é muito mais eficaz do que uma abordagem generalista. Essa percepção sugere que as melhorias futuras na inteligência artificial podem não exigir sempre a construção de modelos maiores ou mais complexos, mas sim encontrar maneiras mais inteligentes de combinar e refinar as capacidades dos modelos existentes. O trabalho fornece um caminho claro para tornar essas ferramentas poderosas mais práticas para o uso cotidiano, onde a velocidade e o custo são tão importantes quanto a precisão. Ao aprender a alternar entre modos de pensamento, o modelo fundido imita uma eficiência mais humana, sabendo quando pausar e pensar profundamente e quando agir rapidamente, tudo sem a necessidade de treinamento caro ou instruções complexas.

Os pesquisadores verificaram suas descobertas em dois tamanhos diferentes de modelos, confirmando que o método funciona independentemente da escala do sistema. Eles compararam seus resultados com uma ampla gama de competidores, incluindo modelos treinados com aprendizado por reforço e aqueles guiados por comandos específicos. Em todos os casos, o modelo fundido ofereceu um melhor equilíbrio entre precisão e eficiência. Ele foi capaz de igualar o desempenho dos modelos mais minuciosos em tarefas difíceis, enquanto gerava significativamente menos palavras, o que se traduz diretamente em menor consumo de energia e tempos de resposta mais rápidos. O estudo conclui que esta técnica de fusão seletiva de camadas é uma alternativa viável e eficiente aos métodos de treinamento dispendiosos atualmente usados para adaptar grandes modelos. Ela oferece uma solução prática para o problema do pensamento excessivo, garantindo que a inteligência artificial possa ser ao mesmo tempo poderosa e econômica, pronta para lidar com tudo, desde aritmética simples até deduções lógicas complexas, com o nível de esforço apropriado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →