← Ultimi articoli
💬 NLP

Cross-Domain Hybrid OPD for Generalizable Search Agents

Questo articolo introduce un framework di addestramento ibrido per l'agente di ricerca Yuanbao che utilizza la distillazione on-policy di esperti cross-domain per ottenere capacità di ricerca specializzate senza sacrificare, e anzi potenziando, l'intelligenza generalista, mitigando così la tipica tassa di allineamento associata all'ottimizzazione del reinforcement learning.

Autori originali: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Pubblicato 2026-08-04
📖 9 min di lettura🧠 Approfondimento

Autori originali: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina un mondo in cui il tuo assistente AI preferito è come uno studente brillante che ha appena imparato a diventare un maestro detective. Questo studente può setacciare internet, collegare i puntini tra diverse notizie di cronaca e trovare fatti nascosti più velocemente di chiunque altro. Ma c'è un trucco: nel processo di diventare un super-detective, ha iniziato a dimenticare come scrivere una poesia divertente, risolvere un complicato rompicapo matematico o semplicemente fare una normale chiacchierata sulla sua giornata. Questo è il problema della "specializzazione" nel mondo dell'Intelligenza Artificiale. Gli scienziati chiamano il prezzo che paghi per diventare davvero bravo in una cosa specifica "tassa di allineamento" (alignment tax). È come se uno chef diventasse così ossessionato dal perfezionare la sua zuppa da dimenticare come cuocere una torta. La grande domanda per i ricercatori è: possiamo addestrare un'IA a essere un esperto di ricerca di classe mondiale senza farle dimenticare come essere un amico utile e poliedrico?

Questo è esattamente ciò che il team di Tencent Yuanbao si è proposto di risolvere nel loro nuovo rapporto tecnico. Hanno costruito un agente IA intelligente progettato per dare la caccia alle informazioni sul web, ma temevano che addestrarlo a cercare così intensamente lo avrebbe reso "stupido" in tutto il resto. Per risolvere questo problema, hanno inventato un metodo di addestramento intelligente in due fasi. Prima, hanno insegnato all'IA a essere una pro della ricerca usando una tecnica chiamata Reinforcement Learning (apprendimento per rinforzo), che è come lasciare che l'IA giochi a un gioco dove riceve punti per trovare le risposte giuste. Poi, per evitare che l'IA perdesse la sua intelligenza generale, hanno usato un metodo chiamato "Cross-Domain Hybrid On-Policy Distillation". Pensa a questo come ad assumere quattro diversi tutor geniali — uno per la matematica, uno per il coding, uno per la logica e uno per la scienza — per insegnare al l'IA esperta di ricerca come tornare a essere uno studente completo. Il risultato? Un'IA che può trovare informazioni sul web altrettanto bene della versione specializzata e, sebbene non sia diventata un genio della matematica in ogni singolo test, ha recuperato gran parte del terreno perduto ed è persino diventata migliore di prima in diverse aree chiave come il ragionamento logico e il coding. Non si sono limitati a risolvere il problema; hanno reso l'IA più intelligente in molte cose contemporaneamente, senza sacrificare le sue capacità di ricerca.

Il detective che aveva dimenticato come far jongolare

Scendiamo nella storia dell'agente di ricerca di Yuanbao. Immagina di avere un robot chiamato "Search-Bot". Vuoi che Search-Bot sia il migliore nel trovare risposte su internet. Quindi, lo metti in un parco giochi virtuale dove deve risolvere misteri cliccando link, leggendo articoli e facendo domande. Questo si chiama Reinforcement Learning (RL). È come addestrare un cane: ogni volta che Search-Bot trova l'informazione giusta, riceve un premio (una ricompensa). Ogni volta che si perde, riceve un dolce "no".

Dopo un po', Search-Bot diventa incredibile nel trovare le cose. Ma ecco la parte strana: man mano che diventa bravo a cercare, inizia a diventare meno bravo in altre cose. Dimentica come risolvere un semplice problema di matematica o come scrivere una storia creativa. Il documento chiama questo fenomeno Alignment Tax. È come se passassi ogni singolo giorno a praticare i calci di calcio finché le tue gambe non diventano super forti, ma dimenticassi come camminare in linea retta perché non pratichi più il camminare. L'IA è diventata così specializzata nella "ricerca" che ha perso la sua potenza cerebrale "generale".

La missione di salvataggio in due fasi

Il team di Tencent si è reso conto che insegnare a Search-Bot solo a cercare più intensamente non era la soluzione. Avevano bisogno di un modo per mantenere le capacità di ricerca e riportare indietro l'intelligenza generale. Così, hanno ideato un piano di addestramento in due fasi.

Fase 1: Il campo di addestramento per la ricerca
Per prima cosa, hanno preso il loro modello IA di base (un modello intelligente chiamato Hunyuan3) e l'hanno mandato al "Campo di addestramento per la ricerca". Qui, l'IA ha praticato solo la ricerca. Ha imparato a pianificare le sue mosse, usare strumenti come la ricerca web e la ricerca di immagini, e a mettere insieme informazioni provenienti da posti diversi. Come previsto, è diventata bravissima a cercare. Ma, proprio come previsto dal documento, ha iniziato a perdere il tocco con la matematica, la scienza e la logica. La "Tassa di Allineamento" ha colpito duramente.

Fase 2: Il mix del "Super-Tutor"
È qui che avviene la magia. Invece di lasciare che l'IA continuasse a fallire in matematica, il team ha portato in campo quattro Insegnanti Esperti. Questi non erano insegnanti qualunque; erano modelli IA super-specializzati addestrati specificamente su:

  1. Matematica (risolvere equazioni complesse)
  2. Coding (scrivere programmi informatici)
  3. Logica (risolvere enigmi e ragionare)
  4. Scienza (comprendere il mondo naturale)

Il team ha usato una tecnica chiamata On-Policy Distillation (OPD). Questo è un modo elegante per dire: "Facciamo in modo che lo studente (Search-Bot) provi a risolvere un problema, e poi facciamo in modo che l'Insegnante Esperto osservi e dica: 'Ehi, l'hai fatto in questo modo, ma ecco un modo migliore per pensarci'".

La parte interessante è che non hanno insegnato all'IA solo la matematica o la ricerca. Le hanno mescolate! In ogni singola sessione di addestramento, l'IA praticava la ricerca di un fatto e poi, immediatamente, praticava la risoluzione di un problema matematico o la scrittura di codice, il tutto sotto la guida del giusto Insegnante Esperto. Era come uno studente che va alla pratica di calcio la mattina e poi va alle lezioni di pianoforte nel pomeriggio, ma il maestro di pianoforte sta anche guardando la pratica di calcio per assicurarsi che lo studente rimanga concentrato e disciplinato.

I Risultati: Il meglio di entrambi i mondi

Il team ha testato la loro nuova IA "Ibrida" contro le versioni precedenti. Ecco cosa hanno scoperto:

  • Le Capacità di Ricerca: La nuova IA era brava nella ricerca quanto quella che praticava solo la ricerca. In effetti, in alcuni test di ricerca difficili, è diventata persino migliore! Poteva ancora trovare informazioni in tutto il web, pianificare ricerche complesse e seguire le istruzioni perfettamente.
  • Le Capacità Generali: Questa è la grande vittoria. L'IA che aveva solo praticato la ricerca era diventata peggiore in matematica e logica. Ma l'IA Ibrida? Non è solo tornata alla normalità; ha fatto recuperi e miglioramenti significativi in molte aree.
    • Nei test di Ragionamento Logico, l'IA Ibrida è migliorata di un margine enorme (passando da un punteggio di 33.95 a 46.90).
    • Nei compiti di Coding, è passata da 67.74 a 74.15, superando persino il modello "base" originale.
    • Nei problemi di Matematica, ha recuperato quasi tutto il terreno perduto e ha persino superato il modello originale in alcuni test difficili (come AIME25 e Math IMO AnswerBench). Tuttavia, in alcuni benchmark estremamente impegnativi come Minerva Math e Frontier Science Olympiad, è rimasta leggermente al di sotto delle prestazioni del modello base originale.
    • Nei benchmark di Scienza, ha visto forti guadagni, raggiungendo la massima accuratezza su GPQA Diamond.

Il documento dimostra che la "Tassa di Allineamento" non è un prezzo che si deve pagare per sempre. Usando questi Insegnanti Esperti per guidare l'IA mentre impara a cercare, sono riusciti a "annullare" la maggior parte del danno. L'IA non doveva scegliere tra essere un detective o essere un genio; è diventata un detective che è anche molto bravo a essere uno studente, anche se non è perfetta in ogni singolo problema matematico dell'universo.

Perché questo è importante

Potreste chiedervi: "E allora? Perché ci interessa se un'IA diventa più brava in matematica?". Beh, immaginate di chiedere al vostro assistente IA: "Visiterò Parigi per tre giorni. Voglio vedere la Torre Eiffel e Disneyland, ma non voglio passare più di 30 minuti per spostarmi tra i luoghi".

Se l'IA avesse avuto solo l'addestramento "Solo-Ricerca", potrebbe trovare le posizioni ma poi darvi un itinerario terribile che non ha senso, o potrebbe dimenticare come calcolare correttamente il tempo di percorrenza perché si è concentrata troppo sul trovare solo i nomi dei luoghi.

Ma con l'addestramento Ibrido, l'IA può:

  1. Cercare le posizioni e i tempi di percorrenza (usando le sue capacità di ricerca).
  2. Ragionare sulla geografia e calcolare se il piano rispetta la vostra regola dei 30 minuti (usando le sue capacità di logica e matematica).
  3. Scrivere un itinerario chiaro, amichevole e rilassato per voi (usando le sue capacità di linguaggio generale).

Il documento suggerisce che questo approccio "Ibrido" è la chiave per costruire assistenti IA che siano veramente utili nel mondo reale. Devono essere in grado di trovare informazioni, sì, ma devono anche essere abbastanza intelligenti da usare quelle informazioni per risolvere problemi, scrivere storie e aiutarci nella nostra vita quotidaria senza perdere la testa nel processo.

La formula segreta: Come hanno fatto

Il team non ha semplicemente buttato tutto in un frullatore. Sono stati molto attenti a come hanno istruito gli Insegnanti Esperti. Hanno usato una strategia di "Apprendimento Curricolare" (Curriculum Learning). Ciò significa che non hanno iniziato dando agli insegnanti i problemi matematici più difficili e impossibili. Al contrario, hanno iniziato con problemi di media difficoltà per costruire una base solida, e poi hanno introdotto gradualmente quelli davvero difficili.

Hanno scoperto che se saltavano questo passaggio e lanciavano semplicemente i problemi più difficili agli insegnanti, gli insegnanti (e lo studente IA) non imparavano altrettanto bene. Il "Curriculum" ha aiutato gli insegnanti a diventare migliori nel spiegare le cose, il che a sua volta ha permesso allo studente IA di imparare più velocemente e in modo più intelligente.

In sintamente

Il team di Tencent Yuanbao ci ha mostrato che non è necessario sacrificare l'intelligenza generale per ottenere un agente di ricerca specializzato. Mescolando il Reinforcement Learning (per la ricerca) con la On-Policy Distillation (imparare dagli insegnanti esperti), hanno creato un'IA che è sia un maestro detective che un brillante studente a tutto tondo.

Hanno dimostrato che la "Tassa di Allineamento" può essere evitata. L'IA non è solo smessa di peggiorare; è effettivamente migliorata in molte cose, recuperando le sue abilità perdute e superando persino il suo sé originale in aree come il coding e il ragionamento logico. Sebbene non abbia vinto ogni concorso di matematica, è diventata un assistente molto più capace e versatile nel complesso. È un po' come trovare un modo per addestrare un supereroe a volare senza fargli dimenticare come camminare. E in un mondo in cui vogliamo che la nostra IA sia utile, intelligente e versatile, questo è un grande traguardo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →