← Ultimi articoli
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

Questo articolo presenta InterLV-Search, un benchmark e un quadro di valutazione completi per la ricerca agenziale multimodale intercalata, che evidenzia limitazioni significative attuali nella capacità dei sistemi di integrare dinamicamente prove testuali e visive attraverso scenari di ricerca attiva, offline controllata e ricerca sul web aperto.

Autori originali: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

Pubblicato 2026-05-11
📖 5 min di lettura🧠 Approfondimento

Autori originali: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover risolvere un mistero complesso, come trovare una persona specifica basandoti su una serie di indizi.

Il Vecchio Metodo (Benchmarks Precedenti):
La maggior parte degli attuali "investigatori" AI viene addestrata in questo modo: gli si fornisce una foto di un sospetto e si chiede: "Chi è costui?" oppure "Di che colore è il suo cappello?". L'AI osserva la foto e risponde. Se la foto non è sufficiente, l'AI potrebbe cercare su internet testi riguardanti la persona, ma tratta la foto solo come il punto di partenza o la risposta finale. Raramente utilizza una foto trovata nel mezzo della sua indagine per cambiare direzione. È come un investigatore che guarda una foto della scena del crimine, poi legge semplicemente un articolo di giornale, e non si rende mai conto che una nuova foto trovata a pagina 3 del giornale lo indirizza effettivamente verso una città completamente diversa.

Il Nuovo Metodo (InterLV-Search):
Gli autori di questo articolo, "InterLV-Search", hanno creato un nuovo terreno di addestramento (un benchmark) per testare se l'AI può fare qualcosa di molto più difficile: Ricerca Agente Multimodale Intercalata.

Pensa a questo come a un investigatore che deve costantemente alternare la visione di mappe (testo) e la visione di foto (immagini) per risolvere il caso.

  • La Svolta: L'AI trova una foto, la osserva e realizza: "Oh! Il logo su questo edificio nella foto mi dice che devo cercare un marchio specifico". Quindi cerca quel marchio, trova una nuova foto di un'auto, vede una targa e quella targa le dice di cercare una città specifica.
  • L'Obiettivo: La foto non è solo la risposta; la foto è un volante. Dice all'AI dove guidare dopo.

I Tre Livelli di Difficoltà

L'articolo testa l'AI su tre livelli, come un videogioco con difficoltà crescente:

  1. Livello 1: La Sfida "Trova l'Immagine".

    • Il Compito: All'AI viene data una descrizione testuale come: "Trova il gioco che presenta questa nave pirata". Deve capire di quale nave si tratta, cercarla, trovare l'immagine e poi rispondere a una domanda sull'immagine (ad esempio: "Quale motore usa la nave?").
    • La Metafora: Ti viene data un'enigma su un oggetto nascosto. Devi trovare l'oggetto prima di poter rispondere all'enigma.
  2. Livello 2: La Sfida "Labirinto Controllato".

    • Il Compito: L'AI si trova in una stanza chiusa (un database offline controllato) con una mappa. Inizia con un indizio testuale, trova una foto, la foto fornisce un nuovo indizio, trova un'altra foto, e così via.
    • La Metafora: Immagina una caccia al tesoro in cui trovare una foto di una porta rossa ti porta a un indizio testuale su un'auto blu, che ti porta a una foto di un uccello giallo. L'AI deve usare la foto della porta per decidere di cercare l'auto. Se ignora la foto e continua semplicemente a leggere testo, si perde.
  3. Livello 3: La Sfida "Internet Selvaggio".

    • Il Compito: Ora l'AI è fuori nell'internet reale e disordinato. Deve cercare indizi, trovare foto, rendersi conto che alcune foto sono false o irrilevanti, confrontare percorsi diversi (ad esempio: "Questo film dura 60 minuti o 90 minuti?") e scegliere il percorso giusto per continuare.
    • La Metafora: È come un investigatore che cerca di risolvere un caso utilizzando l'intero internet. Deve setacciare milioni di siti web, alcuni con foto scadenti, altri con date errate, e decidere quale percorso seguire in base a ciò che vede nelle immagini.

Cosa Hanno Scoperto?

Gli autori hanno testato molti dei modelli AI più intelligenti (come GPT-5, Gemini e Claude) su questo nuovo test.

  • Il Risultato: I modelli AI sono attualmente molto bravi in questo. Anche i migliori hanno ottenuto meno del 50% di risposte corrette.
  • Il Problema: I modelli AI sono eccellenti nel leggere testo e nel guardare una singola immagine. Ma faticano a collegare i puntini quando una foto trovata nel mezzo di una ricerca deve cambiare l'intero piano di ricerca. Spesso rimangono bloccati a cercare testo quando dovrebbero guardare una foto, o trattano la foto solo come un "controllo finale" piuttosto che come un "nuovo indizio".

La Cassetta degli Attrezzi (InterLV-Agent)

Per assicurarsi che tutti giocassero secondo le stesse regole, gli autori hanno costruito un "controller di gioco" standard chiamato InterLV-Agent. Questo strumento permette all'AI di utilizzare un browser web, cercare immagini, ritagliare immagini e tenere un "quaderno" (memoria) di ciò che ha trovato finora. Questo garantisce che quando diciamo che un'AI ha fallito, sia perché non è riuscita a risolvere l'enigma, e non perché non aveva gli strumenti giusti.

Riassunto

In termini semplici, questo articolo dice: "Abbiamo costruito un nuovo test più difficile per gli investigatori AI. Abbiamo scoperto che, sebbene l'AI stia diventando più intelligente, non riesce ancora a utilizzare efficacemente le immagini che trova durante una ricerca per cambiare idea e trovare il prossimo indizio. È come un investigatore che può leggere una mappa e guardare una foto, ma non riesce a capire che la foto in realtà gli dice di prendere una strada diversa".

Gli autori hanno rilasciato questo test e gli strumenti affinché altri ricercatori possano provare a costruire un'AI migliore in questo stile di pensiero "intercalato".

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →