← Ultimi articoli
🤖 AI

SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

SearchEyes introduce un mondo di ricerca simulato unificato basato su un grafo di conoscenza tipizzato che integra dati, ambiente e segnali di ricompensa attraverso catene Percezione-Conoscenza e l'Ottimizzazione della Policy ancorata ai Salti (Hop-Anchored Policy Optimization), consentendo prestazioni di ragionamento multi-hop allo stato dell'arte in agenti di ricerca multimodali senza fare affidamento su motori esterni o modelli di ricompensa separati.

Autori originali: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu
Pubblicato 2026-07-08
📖 5 min di lettura🧠 Approfondimento

Autori originali: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un robot molto intelligente come risolvere un mistero complesso. Il robot deve guardare un'immagine, leggere alcuni documenti e collegare i puntini per trovare una risposta. Questo è ciò che il documento definisce un "agente di ricerca multimodale".

Tuttamente, gli autori di questo articolo, SearchEyes, hanno scoperto che il modo in cui di solito insegniamo a questi robot è rotto. È come cercare di insegnare a qualcuno a guidare dandogli una mappa, un'auto e un esame di guida, ma assicurandosi che nessuno dei tre corrisponda.

  • La Mappa (Dati di Addestramento): Gli dai un elenco di domande e risposte, ma scarti i passaggi del "come fare".
  • L'Auto (Ambiente): Li lasci guidare su una strada pubblica reale e imprevedibile (l'internet reale) dove i semafori potrebbero cambiare o la strada potrebbe scomparire.
  • Il Test (Ricompense): Dici loro solo "Bravo" o "Sbagliato" alla fine. Se hanno commesso un errore al passaggio 1, ma sono stati fortunati al passaggio 10, riceveranno comunque un "Bravo". Non impareranno mai dove hanno sbagliato.

SearchEyes risolve questo problema costruendo una simulazione perfetta e autocontenuta in cui la mappa, l'auto e il test sono tutti costruiti a partire dallo stesso progetto.

Ecco come ci sono riusciti, usando semplici analogie:

1. Il Progetto: Un "Grafo di Conoscenza Tipizzato"

Inve di usare l'internet disordinato e reale, il team ha costruito una gigantesca e organizzata biblioteca di fatti chiamata Grafo di Conoscenza. Immaginate questo come un enorme albero genealogico delle informazioni del mondo, ma con regole rigide:

  • Ogni persona (entità) ha una foto, una biografia e un elenco di relazioni.
  • Mantengono solo le persone "famose" che possiedono tutte e tre le caratteristiche (foto, biografia e connessioni), in modo che il robot possa esercitarsi a guardare immagini e leggere testo.

2. Il Percorso di Addestramento: "Catene Percezione-Conoscenza" (PKC)

Per addestrare il robot, non hanno scritto semplicemente domande casuali. Hanno usato una ricetta speciale chiamata Catene Percezione-Conoscenza (PKC).

  • L'Analogia: Immaginate una caccia al tesoro in cui dovete alternare il guardare una foto e il leggere un indizio.
    • Passaggio 1 (Percezione): "Guarda questa foto di un uomo. Chi è?" (Il robot deve identificare la persona dall'immagine).
    • Passaggio 2 (Conoscenza): "Ora, cerca per quale squadra ha giocato." (Il robot deve cercare nel testo).
    • Passaggio 3 (Percezione): "Trova una foto dello stadio dove gioca quella squadra."
  • La Magia: Il sistema genera queste domande automaticamente, ma mantiene un "foglio di soluzioni" (il percorso esatto dei fatti) nascosto sullo sfondo. Ciò assicura che il robot debba seguire il percorso lungo e multi-step per risolvere il puzzle, invece di indovinare immediatamente la risposta.

3. Il Simulatore di Guida: Un "Mondo di Ricerca Autocontenuto"

Nel mondo reale, se chiedi a un motore di ricerca qualcosa, i risultati potrebbero cambiare domani. Nel mondo di SearchEyes, il "motore di ricerca" è in realtà solo un enorme database pre-caricato della biblioteca che hanno costruito.

  • Il Vantaggio: È 100% riproducibile. Se il robot cerca "Cristiano Ronaldo", otterrà sempre esattamente gli stessi primi 5 risultati. Questo rimuove il caos dell'internet reale, permettendo al robot di imparare la logica della ricerca senza essere distrattto da link interrotti o siti web che cambiano.

4. L L'Allenatore: Feedback "Ancorato ai Salti" (HaPO)

Questa è l'innovazione più importante. Nell'addestramento normale, l'allenatore dice solo "Hai dato la risposta corretta!" alla fine.

  • Il Probleve: Se il robot ha fatto 10 passaggi per arrivarci, l'allenatore non sa quale passaggio è stato brillante e quale è stato un colpo di fortuna.
  • La Soluzione di SearchEyes: Poiché hanno mantenuto il "foglio di soluzioni" (il percorso esatto dei fatti), possono agire come un allenatore che osserva ogni singolo passaggio.
    • "Ottimo lavoro nel trovare la foto dello stadio al Passaggio 3!"
    • "Ops, hai scelto la squadra sbagliata al Passaggio 2. Proviamoci di nuovo."
  • La Metafora: Invece di dare un unico punteggio all'intero esame, assegnano un voto per ogni singola domanda del test. Questo aiuta il robot a imparare molto più velocemente perché sa esattamente dove migliorare.

I Risultati

Quando hanno testato questo nuovo metodo (chiamato SearchEyes) su sei diversi test difficili che coinvolgevano immagini e testo:

  • Ha battuto tutti gli altri robot open-source che cercano di fare la stessa cosa.
  • Il loro robot più piccolo (27 miliardi di "cellule cerebrali") ha ottenuto prestazioni migliori di robot molto più grandi ed costosi di grandi aziende tecnologiche.
  • Ha dimostrato che fornendo al robot un mondo di addestramento strutturato e passo dopo passo e un feedback preciso, non è necessario un supercomputer massiccio per ottenere ottimi risultati.

In breve: SearchEyes ha smesso di cercare di insegnare ai robot lanciandoli nel caotico internet reale. Al posto di ciò, ha costruito una palestra di addestramento perfetta e controllata dove il robot pratica abilità specifiche, viene valutato su ogni mossa e impara a risolvere complessi misteri visivi con un'efficienza incredibile.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →