← Últimos artigos
💬 NLP

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search introduz um framework de auto-distilação retrospectiva on-policy que permite que agentes de raciocínio aumentados por busca gerem sinais de supervisão em nível de passo internamente, treinando um modelo estudante para imitar um professor condicionado à retrospectiva, superando assim as limitações de atribuição de crédito do aprendizado por reforço baseado em recompensa de resultado sem exigir professores externos ou anotações adicionais.

Autores originais: Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno a resolver um mistério complexo. O aluno tem uma biblioteca (a internet) que pode pesquisar, mas não sabe o que perguntar ao bibliotecário.

No estado atual da pesquisa em IA, a maioria dos métodos de treinamento é como um professor que avalia o aluno apenas com base na resposta final.

  • O Problema: Se o aluno obtiver a resposta correta, o professor diz: "Ótimo trabalho!" Mas, se o aluno tiver sorte com uma pergunta ruim e uma resposta afortunada, o professor ainda diz "Ótimo trabalho!" O aluno nunca aprende que sua pergunta específica era, na verdade, terrível. Ele apenas sabe que o resultado foi bom. Isso é chamado de "Recompensa de Resultado".
  • A Solução Antiga: Alguns pesquisadores tentaram corrigir isso contratando um "Detetive Mestre" superinteligente e caro (uma IA externa massiva) para observar o aluno e dizer: "Essa foi uma boa pergunta" ou "Essa foi uma má pergunta". Isso funciona, mas é incrivelmente caro e lento, pois você precisa desse gigante Detetive Mestre para cada sessão de treinamento individual.

SD-Search é uma nova e inteligente maneira de ensinar o aluno sem precisar do caro Detetive Mestre. Eis como funciona, usando uma analogia simples:

A Sala de Aula de "Viagem no Tempo"

Imagine que o aluno está fazendo uma prova.

  1. O Aluno (O "Eu" do "Agora"): O aluno está sentado à sua mesa, olhando para a pergunta. Ele precisa decidir o que pesquisar agora, sem saber se acertará ou errará. Ele está chutando com base no que sabe naquele momento.
  2. O Professor (O "Eu" do "Futuro"): Agora, imagine o mesmo aluno, mas desta vez, ele tem um caderno mágico de viagem no tempo. Este caderno contém os resultados de muitas tentativas da mesma pergunta. Ele diz: "Na Tentativa A, perguntamos 'Quem é o pai?' e obtivemos a resposta correta. Na Tentativa B, perguntamos 'Qual é a cor do céu?' e erramos."

SD-Search usa esse caderno mágico para criar uma versão "Professor" do aluno.

  • O Professor olha para a pergunta e lê o caderno. Como o Professor sabe quais perguntas levaram ao sucesso e quais levaram ao fracasso, ele pode dizer: "Ah, vejo que perguntar sobre o pai foi a jogada certa. Eu teria perguntado isso."
  • O Aluno (que ainda não tem o caderno) é então solicitado a copiar as escolhas do Professor. O objetivo é fazer com que os palpites do Aluno correspondam à sabedoria de "retrospectiva" do Professor.

Como Funciona na Prática

O artigo chama isso de "Auto-Distilação de Retrospectiva On-Policy". Vamos decompor isso:

  • Auto-Distilação: A IA está ensinando a si mesma. Ela não precisa de um especialista externo. Ela gera várias tentativas (rollouts), observa os resultados e, em seguida, usa os padrões "bem-sucedidos" para ensinar a versão "aluno" de si mesma.
  • Retrospectiva: Ela olha para trás, para o que aconteceu após a decisão ser tomada, para julgar se a decisão foi boa.
  • On-Policy: Ela faz isso usando seus próprios dados atuais, não dados de uma IA diferente e maior.

O Foco na "Consulta de Pesquisa"

O artigo foca especificamente nas consultas de pesquisa (as perguntas que a IA faz ao mecanismo de busca).

  • Nos métodos antigos, se a resposta final estivesse correta, cada palavra que a IA escreveu (incluindo as perguntas de pesquisa) recebia um adesivo de "bom trabalho", mesmo que a pergunta de pesquisa fosse vaga ou errada.
  • No SD-Search, a IA recebe um sinal específico de "bom trabalho" ou "mal trabalho" para cada pergunta de pesquisa específica. Se a pergunta de pesquisa levou a um beco sem saída, o Professor (com o caderno de viagem no tempo) mostra ao Aluno uma pergunta diferente e melhor. O aluno aprende a imitar a pergunta melhor.

Os Resultados (O "Placar")

Os pesquisadores testaram isso em sete benchmarks diferentes de resposta a perguntas (como um teste de cultura geral).

  • Desempenho: Seu método (SD-Search) teve desempenho tão bom quanto os métodos caros que usam uma IA gigante de "Detetive Mestre" com 72 bilhões de parâmetros, e melhor do que os métodos que apenas olham para a resposta final.
  • Eficiência: Eles fizeram isso sem precisar de ajuda externa, sem APIs caras e sem etapas de treinamento extras. Eles apenas usaram o loop de treinamento padrão, adicionando uma pequena etapa de "viagem no tempo" onde a IA revisa suas próprias tentativas passadas.
  • Escalabilidade: À medida que o modelo de IA ficava maior (de 3 bilhões para 7 bilhões de parâmetros), esse método de autoensino continuava melhorando, enquanto os métodos que dependiam do "Detetive Mestre" começavam a perder sua vantagem.

Em Resumo

SD-Search é como um aluno que, após fazer uma prova, tem a chance de olhar para o gabarito e para as anotações de seus amigos que fizeram a prova ao mesmo tempo. Em seguida, ele refaz a prova, tentando fazer exatamente as mesmas perguntas que as versões "bem-sucedidas" de si mesmo fizeram. Ele aprende com seus próprios erros e sucessos passados, tornando-se mais inteligente sem nunca precisar de um professor humano ou de um supercomputador para dizer o que fazer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →