← Últimos artigos
💬 NLP

Short Chains, Deep Thoughts: Balancing Reasoning Efficiency and Intra-Segment Capability via Split-Merge Optimization

O artigo apresenta o CoSMo, um framework que aprimora Modelos de Raciocínio de Grande Escala por meio de um algoritmo de divisão e fusão guiado por consistência e aprendizado por reforço alinhado à estrutura, eliminando redundância estrutural e, assim, melhorando significativamente a precisão enquanto reduz a sobrecarga computacional.

Autores originais: Runquan Gui, Jie Wang, Zhihai Wang, Chi Ma, Jianye Hao, Feng Wu

Publicado 2026-05-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Runquan Gui, Jie Wang, Zhihai Wang, Chi Ma, Jianye Hao, Feng Wu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça complexo, como um "Onde está o Wally?", mas com fatos em vez de uma camisa listrada. Você tem uma equipe de detetives (a IA) tentando encontrar a resposta.

No passado, esses detetives eram instruídos a "pensar passo a passo". Eles faziam isso, mas frequentemente pensavam demais. Eles escreviam cada único pensamento, até mesmo aqueles que apenas repetiam o que já sabiam ou verificavam coisas que não precisavam ser verificadas. Isso resultava em um caderno enorme e bagunçado, cheio de anotações redundantes. Levava muito tempo para ler, desperdiçava muito papel (poder de computação) e, às vezes, o volume enorme de anotações confundia o próprio detetive, fazendo-o perder a resposta óbvia.

Este artigo apresenta um novo método chamado CoSMo (Otimização de Fusão e Divisão Guiada por Consistência) para corrigir isso. Pense no CoSMo como um editor inteligente que ensina o detetive a escrever uma história concisa e perfeita, sem perder nenhum ponto importante do enredo.

Veja como o CoSMo funciona, usando analogias simples:

1. O Problema: Demasiada Conversa

O artigo argumenta que os modelos de IA atuais são como pessoas que falam demais. Elas não dizem apenas "A resposta é X"; elas dizem: "Estou pensando sobre X, e também estou pensando sobre X novamente, e talvez eu deva verificar se X é verdadeiro, e oh, veja, X é verdadeiro novamente."

  • O Problema: Essa "conversa" cria redundância estrutural. Não é que as palavras sejam longas demais, mas que o número de etapas distintas (segmentos) é muito alto.
  • A Analogia: Imagine tentar caminhar da sua casa até a loja. Uma pessoa normal vai direto lá. Uma IA que pensa demais pode caminhar até o parque, verificar as horas, voltar, caminhar até a biblioteca, verificar as horas novamente e, então, caminhar até a loja. A distância (contagem de tokens) pode ser similar, mas o número de paradas (segmentos) é enorme e ineficiente.

2. A Solução: O Algoritmo de "Divisão e Fusão"

O CoSMo trata a cadeia de raciocínio da IA como uma frase que precisa de edição. Ele usa um processo de duas etapas para limpá-la:

  • A Fusão (Cortando o Supérfluo): Se a IA escrever duas etapas que dizem a mesma coisa ou são apenas variações menores uma da outra, o CoSMo diz: "Ei, isso é o mesmo pensamento!" Ele funde essas etapas em uma única frase forte e clara.
    • Analogia: Em vez de dizer "Estou com fome. Sinto um ronco no meu estômago", o editor combina isso em "Estou com fome".
  • A Divisão (Preenchendo as Lacunas): Às vezes, a IA tenta ser demasiado eficiente e pula etapas, saltando de "A" para "C" sem explicar "B". O CoSMo identifica esse "salto lógico" e diz: "Espere, você pulou uma etapa!" Ele divide esse grande salto em duas etapas menores e lógicas.
    • Analogia: Se a IA diz "Vi um cachorro, então comprei uma coleira", o CoSMo divide isso: "1. Vi um cachorro. 2. Preciso de uma coleira para o cachorro".

3. O Treinamento: Aprendendo a Ser "Justo"

O artigo descreve um processo de treinamento em duas fases para ensinar à IA essa nova forma de pensar:

  • Fase 1: O Editor (Ajuste Fino Supervisionado): Os pesquisadores pegam as respostas bagunçadas e excessivamente longas da IA e usam o algoritmo de Divisão e Fusão para reescrevê-las em versões perfeitas e concisas. Em seguida, ensinam a IA a imitar essas versões perfeitas. É como um estudante estudando um modelo de redação para aprender a escrever com clareza.
  • Fase 2: O Treinador (Aprendizado por Reforço): Agora, a IA tenta resolver problemas sozinha. O "Treinador" (o sistema de recompensa) não conta apenas quantas palavras a IA usa. Em vez disso, ele conta quantas etapas distintas a IA dá.
    • A Reviravolta: O Treinador diz: "Você pode escrever tantas palavras quanto precisar dentro de uma etapa para ser muito detalhado e preciso. Mas, você não deve dar demasiadas etapas."
    • Por que isso importa: Métodos anteriores tentavam limitar o número total de palavras. O CoSMo percebe que, às vezes, você precisa de uma frase longa para explicar uma ideia complexa. Portanto, ele pune a IA por dar muitas paradas (segmentos), e não por escrever frases longas.

4. Os Resultados: Cadeias Mais Curtas, Pensamentos Mais Profundos

O artigo testou isso em várias perguntas difíceis (como trivia de múltiplos passos ou compreensão de leitura).

  • O Resultado: O CoSMo produziu respostas que foram mais precisas e usaram menos etapas do que outros métodos.
  • A Metáfora: Imagine uma corrida. Outros corredores estavam correndo em círculos (etapas redundantes) ou dando saltos gigantes e desajeitados (pulando lógica). O corredor do CoSMo seguiu o caminho mais direto, parando exatamente o número certo de vezes para verificar seu mapa, mas nunca parando para amarrar o cadarço duas vezes.
  • As Estatísticas: O artigo afirma que o CoSMo melhorou a precisão em cerca de 3,3 pontos, enquanto reduziu o número de etapas de raciocínio em quase 29%.

Resumo

Em resumo, este artigo diz: Não faça apenas a IA falar menos; faça-a pensar com mais eficiência.

Ao ensinar a IA a fundir seus pensamentos repetitivos e dividir suas etapas puladas, o CoSMo cria um estilo de raciocínio "Cachinhos Dourados": nem muito curto (o que perde detalhes), nem muito longo (o que desperdiça tempo), mas justo para a complexidade do problema. Isso permite que a IA seja profunda e detalhada onde precisa ser, ao mesmo tempo que elimina a desordem estrutural que a atrasa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →