Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning
Search-E1 é um método de auto-evolução que aprimora agentes de raciocínio aumentados por busca utilizando apenas GRPO vanilla e auto-distilação offline para alcançar desempenho de última geração em benchmarks de QA, sem depender de supervisão externa complexa ou módulos auxiliares.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um aluno muito inteligente, mas um pouco desajeitado (a IA) que está tentando responder a perguntas difíceis de cultura geral. Para obter a resposta correta, esse aluno tem permissão para usar uma biblioteca (um mecanismo de busca) para consultar fatos, mas ele precisa decidir quando consultar e o que perguntar.
A maioria dos métodos atuais ensina esse aluno esperando até que ele termine toda a redação. Se a resposta final estiver correta, o professor dá uma estrela dourada. Se estiver errada, o professor dá um X vermelho. O problema? O aluno não sabe qual etapa específica foi o erro. Ele fez a pergunta errada? Leu o parágrafo errado? Ficou distraído? Ele apenas sabe que toda a tentativa falhou.
Search-E1 é uma maneira nova e mais simples de ensinar esse aluno. Ele não precisa de um professor humano superinteligente, de um robô extra sofisticado ou de um sistema de recompensas especial. Em vez disso, usa uma técnica chamada "Auto-Evolução" através de uma dança de dois passos:
Passo 1: A Fase "Tente Tudo" (GRPO)
Primeiro, o aluno recebe a mesma pergunta cinco vezes.
- Em uma tentativa, ele pode vaguear pela biblioteca, fazer perguntas tolas e falhar.
- Em outra tentativa, ele pode fazer as perguntas perfeitas, encontrar o livro certo e obter a resposta correta rapidamente.
O sistema analisa essas cinco tentativas e diz: "Ok, a que obteve a resposta correta é o 'Padrão Ouro' para esta rodada". Mas, como antes, isso apenas diz ao aluno: "Bom trabalho naquela redação inteira", e não "Bom trabalho em fazer aquela pergunta específica".
Passo 2: A Fase "Rebobinar e Aprender" (Auto-Distilação Offline)
É aqui que a mágica acontece. O sistema pega a tentativa falha (o "Aluno") e a tentativa bem-sucedida (o "Professor").
Aqui está o truque inteligente:
- O sistema dá ao Aluno a pergunta original.
- O sistema dá ao Professor a mesma pergunta, mas também entrega a ele uma cola: o caminho bem-sucedido completo que o aluno seguiu na outra tentativa.
- O Professor lê a cola e diz: "Se eu estivesse respondendo a essa pergunta agora, sabendo o caminho certo, exatamente o que eu diria a seguir".
- O Aluno é então forçado a ouvir o Professor e tentar combinar suas palavras, passo a passo.
O Aluno não está apenas sendo informado "Você estava certo/errado". Ele está sendo mostrado, token por token (palavra por palavra), exatamente como pensar melhor. "Ah, entendi! Quando eu perguntei 'Quem é o presidente?', o Professor perguntou 'Quem foi o presidente em 1990?' Essa é a diferença!"
Por que isso é especial?
- Sem Professores Externos: Geralmente, para obter esse nível de detalhe, você precisa de uma IA superinteligente (como um modelo de 72 bilhões de parâmetros) para avaliar cada etapa individual. Search-E1 usa as próprias tentativas bem-sucedidas do aluno como professor. É como um aluno estudando sua própria prova depois de tirar um A, em vez de esperar que um professor a corrija.
- Sem Maquinário Extra: Outros métodos adicionam ferramentas complexas para descobrir quais etapas foram boas. Search-E1 apenas usa o loop padrão "tentar e tentar novamente" e adiciona essa etapa de "estude seu próprio sucesso" no meio.
- Os Resultados: Quando testaram isso em sete desafios diferentes de cultura geral, o aluno usando Search-E1 obteve pontuações significativamente melhores do que outros alunos usando métodos mais complicados. Foi especialmente bom em perguntas de "múltiplos saltos" (onde você precisa conectar vários pontos), porque essas perguntas têm muitas etapas onde você pode errar, e esse método corrige as etapas específicas que estavam quebradas.
Em resumo: Search-E1 ensina uma IA a ficar mais inteligente permitindo que ela falhe, e depois fazendo-a estudar suas próprias tentativas bem-sucedidas como se fossem um livro didático perfeito, aprendendo exatamente o que dizer em cada momento sem precisar de ajuda externa.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.