← Últimos artigos
💻 computer science

When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

Este artigo apresenta o Raciocínio Intercalado Lado a Lado (SxS), um framework que permite que modelos de linguagem de grande escala controlem dinamicamente o momento da divulgação de conteúdo durante a geração para equilibrar o compromisso entre o tempo de deliberação e o comprometimento prematuro, melhorando assim o desempenho de precisão-latência em diversos benchmarks.

Autores originais: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

Publicado 2026-05-06
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está pedindo ajuda a um amigo brilhante, mas muito cauteloso, para resolver um quebra-cabeça complexo.

O Jeito Antigo: A "Taxa do Silêncio"
Na forma atual como os Modelos de Linguagem de Grande Escala (LLMs) funcionam, seu amigo precisa pensar em voz alta. Mas eis o problema: assim que ele diz uma palavra, essa palavra se torna pública. Ele não pode retirá-la.

  • Se ele ficar em silêncio para pensar profundamente, você fica ali esperando em um silêncio constrangedor (a "Taxa do Silêncio").
  • Se ele começar a falar imediatamente para ser educado, pode dizer algo errado ou mal elaborado. Como ele já disse aquilo, agora está "comprometido" com essa ideia, o que pode dificultar corrigir o rumo mais tarde. Ele é forçado a continuar construindo sobre uma base instável apenas porque falou cedo demais.

A Nova Ideia: Raciocínio Intercalado Lado a Lado (SxS)
Este artigo apresenta uma nova forma de o IA falar, chamada Raciocínio Intercalado Lado a Lado (SxS).

Pense nisso como um programa de culinária ao vivo com um ingrediente secreto.

  • O Modo "Pensar" (Privado): O chef (a IA) está na cozinha, picando, provando e misturando ingredientes. Você não pode ver essa parte. É seu espaço de trabalho privado.
  • O Modo "Falar" (Público): O chef sai para o balcão e diz: "Estou adicionando sal agora".
  • A Regra Mágica: O chef só pode sair e falar se já provou o prato e tiver 100% de certeza de que o sal é a jogada certa. Ele não apenas grita palpites para preencher o silêncio.

Como Funciona (O Truque da "Entailment")
O artigo ensina à IA uma regra específica: "Não fale até que seu pensamento sustente o que você está prestes a dizer."

  1. Treinando o Chef: Os pesquisadores pegaram milhares de exemplos onde uma IA resolveu um problema. Eles usaram um "supervisor" (outra IA) para verificar: "Esta etapa específica de pensamento realmente prova esta etapa específica da resposta?"
  2. A Dança Intercalada: Eles criaram um novo formato de treinamento onde a IA pratica alternar entre "Pensar" (privado) e "Falar" (público).
    • Pensar: "Preciso calcular a área." (Privado)
    • Pensar: "A fórmula é comprimento vezes largura." (Privado)
    • Falar: "A área é 50." (Público, porque o pensamento acabou de provar isso).
    • Pensar: "Espere, deixe-me verificar as unidades novamente." (Privado)
    • Falar: "Então, 50 metros quadrados." (Público).

Os Resultados: O Melhor dos Dois Mundos
O artigo testou isso em problemas de matemática (AIME25) e perguntas de ciência (GPQA-Diamond) usando dois tamanhos diferentes de modelos de IA.

  • Atualizações Mais Rápidas: Em vez de esperar 20.000 tokens (um tempo muito longo) pela resposta final, a IA agora fornece pequenos pedaços verificados da resposta muito mais cedo. É como obter uma barra de progresso que realmente avança, em vez de uma roda girando.
  • Sem "Enchimento": Como a IA é treinada para falar apenas quando tem prova, ela não apenas divaga sem sentido para preencher o silêncio.
  • Precisão Permanece Alta: Às vezes, forçar uma IA a falar cedo a torna menos inteligente. Mas, como este método usa um processo de treinamento em duas etapas (primeiro aprendendo como alternar modos, depois usando aprendizado por reforço para garantir que as respostas ainda estejam corretas), a IA permanece inteligente.
  • A Vitória "Pareto": O artigo afirma que isso cria um equilíbrio melhor (uma "troca Pareto"). Você obtém atualizações mais rápidas e frequentes sem sacrificar a qualidade da resposta final.

Em Resumo
Este artigo resolve a "Taxa do Silêncio" ensinando à IA a ser uma falante confiante e verificada. Isso permite que o modelo mantenha seu "chapéu de pensamento" enquanto trabalha, e só o tire para compartilhar uma parte da solução quando souber que aquela parte é sólida. Isso torna a interação mais rápida e responsiva, sem forçar a IA a adivinhar ou mentir para preencher o silêncio.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →