← Últimos artigos
💬 NLP

Cross-Domain Hybrid OPD for Generalizable Search Agents

Este artigo introduz um framework de treinamento híbrido para o agente de busca Yuanbao que utiliza a Destilação On-Policy de especialistas cross-domain para alcançar capacidades de busca especializadas sem sacrificar, e até mesmo aprimorar, a inteligência de propósito geral, mitigando, assim, o típico imposto de alinhamento associado à otimização de Aprendizado por Reforço.

Autores originais: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Publicado 2026-08-04
📖 9 min de leitura🧠 Leitura aprofundada

Autores originais: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde seu assistente de IA favorito é como um estudante brilhante que acabou de aprender a ser um mestre detetive. Este estudante pode vasculhar a internet, conectar pontos entre diferentes notícias e encontrar fatos ocultos mais rápido do que qualquer outra pessoa. Mas há uma pegadinha: no processo de se tornar um superdetetive, ele começou a esquecer como escrever um poema engraçado, resolver um enigma matemático difícil ou apenas ter uma conversa normal sobre o seu dia. Este é o problema da "especialização" no mundo da Inteligência Artificial. Os cientistas chamam o preço que você paga por se tornar muito bom em algo específico de "imposto de alinhamento" (alignment tax). É como se um chef se tornasse tão obcecado em aperfeiçoar sua sopa que esquecesse como assar um bolo. A grande questão para os pesquisadores é: Podemos treinar uma IA para ser um especialista em busca de classe mundial sem fazê-la esquecer como ser uma amiga útil e versátil?

É exatamente isso que a equipe do Tencent Yuanbao se propôs a resolver em seu novo relatório técnico. Eles construíram um agente de IA inteligente projetado para caçar informações na web, mas estavam preocupados que treiná-lo para pesquisar tanto o tornasse "burro" em todo o resto. Para corrigir isso, eles inventaram um método de treinamento inteligente de duas etapas. Primeiro, ensinaram a IA a ser uma profissional de busca usando uma técnica chamada Aprendizado por Reforço (Reinforcement Learning), que é como deixar a IA jogar um jogo onde ela ganha pontos por encontrar as respostas certas. Depois, para evitar que ela perdesse sua inteligência geral, usaram um método chamado "Destilação Híbrida On-Policy entre Domínios" (Cross-Domain Hybrid On-Policy Distillation). Pense nisso como contratar quatro tutores gênios diferentes — um para matemática, um para programação, um para lógica e um para ciências — para ensinar a IA especialista em busca a ser novamente um aluno bem arredondado. O resultado? Uma IA que consegue encontrar informações na web tão bem quanto a versão especializada e, embora não tenha se tornado um gênio da matemática em todos os testes, ela recuperou a maior parte do terreno perdido e, na verdade, ficou melhor do que antes em várias áreas importantes, como raciocínio lógico e programação. Eles não apenas corrigiram o problema; eles tornaram a IA mais inteligente em muitas coisas ao mesmo tempo, sem sacrificar suas habilidades de busca.

O Detetive que Esqueceu Como Malabarismo

Vamos mergulhar na história do agente de busca Yuanbao. Imagine que você tem um robô chamado "Search-Bot". Você quer que o Search-Bot seja o melhor em encontrar respostas na internet. Então, você o coloca em um parquinho virtual onde ele tem que resolver mistérios clicando em links, lendo artigos e fazendo perguntas. Isso é chamado de Aprendizado por Reforço (RL). É como treinar um cachorro: toda vez que o Search-Bot encontra a informação correta, ele ganha um petisco (uma recompensa). Toda vez que ele se perde, recebe um "não" gentil.

Depois de um tempo, o Search-Bot torna-se incrível em encontrar coisas. Mas aqui está a parte estranha: conforme ele melhora na busca, começa a piorar em outras coisas. Ele esquece como resolver um problema matemático simples ou escrever uma história criativa. O artigo chama isso de Imposto de Alinhamento (Alignment Tax). É como se você passasse todos os dias praticando seus chutes no futebol até que suas pernas ficassem super fortes, mas esquecesse como andar em linha reta porque nunca mais praticou o ato de caminhar. A IA tornou-se tão especializada em "buscar" que perdeu seu poder cerebral "geral".

A Missão de Resgate em Duas Etapas

A equipe da Tencent percebeu que apenas ensinar o Search-Bot a buscar com mais força não era a solução. Eles precisavam de uma maneira de manter as habilidades de busca e trazer de volta a inteligência geral. Então, eles criaram um plano de treinamento de dois estágios.

Estágio 1: O Campo de Treinamento de Busca
Primeiro, eles pegaram seu modelo de IA base (um modelo inteligente chamado Hunyuan3) e o enviaram para o "Campo de Treinamento de Busca". Aqui, a IA apenas praticava a busca. Ela aprendeu a planejar seus movimentos, usar ferramentas como busca na web e busca de imagens, e reunir informações de diferentes lugares. Como esperado, ela ficou muito boa em buscar. Mas, como o artigo previu, ela começou a perder o toque com a matemática, ciência e lógica. O "Imposto de Alinhamento" atingiu em cheio.

Estágio 2: A Mistura do "Super-Tutor"
É aqui que a mágica acontece. Em vez de apenas deixar a IA continuar falhando em matemática, a equipe trouxe quatro Professores Especialistas. Estes não eram apenas quaisquer professores; eram modelos de IA superespecializados treinados especificamente em:

  1. Matemática (resolvendo equações complexas)
  2. Programação (escrevendo programas de computador)
  3. Lógica (resolvendo enigmas e raciocínio)
  4. Ciência (compreendendo o mundo natural)

A equipe usou uma técnica chamada Destilação On-Policy (OPD). Esta é uma forma sofisticada de dizer: "Vamos fazer o aluno (Search-Bot) tentar resolver um problema e, em seguida, fazer o Professor Especialista observar e dizer: 'Ei, você fez desta forma, mas aqui está uma maneira melhor de pensar sobre isso'".

A parte legal é que eles não ensinaram apenas matemática ou busca. Eles misturaram as duas! Em cada sessão de treinamento, a IA praticava buscar um fato e, imediatamente depois, praticava resolver um problema matemático ou escrever um código, tudo isso sendo guiada pelo Professor Especialista correto. Era como um aluno que vai ao treino de futebol pela manhã e depois vai às aulas de piano à tarde, mas o professor de piano também está observando o treino de futebol para garantir que o aluno permaneça focado e disciplinado.

Os Resultados: O Melhor dos Dois Mundos

A equipe testou seu novo IA "Híbrido" contra as versões antigas. Aqui está o que descobriram:

  • As Habilidades de Busca: A nova IA era tão boa em buscar quanto aquela que apenas praticava a busca. Na verdade, em alguns testes de busca complicados, ela ficou ainda melhor! Ela ainda conseguia encontrar informações em toda a web, planejar buscas complexas e seguir instruções perfeitamente.
  • As Habilidades Gerais: Esta é a grande vitória. A IA que apenas praticava a busca tinha ficado pior em matemática e lógica. Mas a IA Híbrida? Ela não apenas voltou ao normal; ela teve recuperações e melhorias significativas em muitas áreas.
    • Em testes de Raciocínio Lógico, a IA Híbrida melhorou drasticamente (saltando de uma pontuação de 33,95 para 46,90).
    • Em tarefas de Programação, ela passou de 67,74 para 74,15, superando até o modelo "base" original.
    • Em problemas de Matemática, ela recuperou quase todo o terreno perdido e até superou o modelo original em alguns testes difíceis (como AIME25 e Math IMO AnswerBench). No entanto, em alguns benchmarks extremamente desafiadores como Minerva Math e Frontier Science Olympiad, ela permaneceu ligeiramente abaixo do desempenho do modelo base original.
    • Em benchmarks de Ciência, ela teve ganhos fortes, atingindo a maior precisão no GPQA Diamond.

O artigo mostra que o "Imposto de Alinhamento" não é um preço permanente que você tem que pagar. Ao usar esses Professores Especialistas para guiar a IA enquanto ela aprende a buscar, eles conseguiram "desfazer" a maior parte do dano. A IA não teve que escolher entre ser uma detetive ou ser um gênio; ela se tornou uma detetive que também é muito boa em ser uma estudante, mesmo que não seja perfeita em cada problema matemático do universo.

Por Que Isso Importa

Você pode se perguntar: "E daí? Por que nos importamos se uma IA fica melhor em matemática?". Bem, imagine que você pergunta ao seu assistente de IA: "Vou visitar Paris por três dias. Quero ver a Torre Eiffel e a Disneyland, mas não quero gastar mais de 30 minutos viajando entre os locais".

Se a sua IA tivesse apenas o treinamento de "Apenas Busca", ela poderia encontrar os locais, mas então lhe daria um itinerário terrível que não faz sentido, ou poderia esquecer de calcular o tempo de viagem corretamente porque ficou focada demais apenas em encontrar os nomes dos lugares.

Mas com o treinamento Híbrido, a IA pode:

  1. Buscar pelos locais e tempos de viagem (usando suas habilidades de busca).
  2. Raciocinar sobre a geografia e calcular se o plano se ajusta à sua regra de 30 minutos (usando suas habilidades de lógica e matemática).
  3. Escrever um itinerário claro, amigável e relaxado para você (usando suas habilidades gerais de linguagem).

O artigo sugere que esta abordagem "Híbrida" é a chave para construir agentes de IA que são verdadeiramente úteis no mundo real. Eles precisam ser capazes de encontrar informações, sim, mas também precisam ser inteligentes o suficiente para usar essa informação para resolver problemas, escrever histórias e ajudar em nossas vidas diárias sem perder o juízo no processo.

O Ingrediente Secreto: Como Eles Fizeram

A equipe não apenas jogou tudo em um liquidificador. Eles foram muito cuidadosos sobre como ensinaram os Professores Especialistas. Eles usaram uma estratégia de "Aprendizado por Currículo" (Curriculum Learning). Isso significa que não começaram dando aos professores os problemas matemáticos mais difíceis e impossíveis. Em vez disso, começaram com problemas de dificuldade média para construir uma base sólida e, aos poucos, introduziram as coisas realmente difíceis.

Eles descobriram que, se pulassem essa etapa e apenas jogassem os problemas mais difíceis para os professores, os professores (e a IA estudante) não aprendiam tão bem. O "Currículo" ajudou os professores a se tornarem melhores em explicar as coisas, o que, por sua vez, fez a IA estudante aprender de forma mais rápida e inteligente.

Conclusão

A equipe do Tencent Yuanbao nos mostrou que você não precisa sacrificar a inteligência geral para obter um agente de busca especializado. Ao misturar o Aprendizado por Reforço (para busca) com a Destilação On-Policy (aprendendo com tutores especialistas), eles criaram uma IA que é uma mestre detetive e também uma estudante brilhante e versátil.

Eles provaram que o "Imposto de Alinhamento" pode ser evitado. A IA não apenas parou de piorar; ela na verdade ficou melhor em muitas coisas, recuperando suas habilidades perdidas e até superando seu eu original em áreas como programação e raciocínio lógico. Embora não tenha vencido todos os concursos de matemática, tornou-se uma assistente muito mais capaz e versátil no geral. É um pouco como encontrar uma maneira de treinar um super-herói para voar sem fazê-lo esquecer como caminhar. E em um mundo onde queremos que nossa IA seja útil, inteligente e versátil, isso é algo muito importante.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →