← Ultimi articoli
💬 NLP

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

Il documento presenta ToolMerge, un nuovo metodo di recupero dei fotogrammi chiave che sfrutta un LLM per decomporre le query in chiamate a strumenti specifiche e fondere i relativi risultati tramite operatori booleani, dimostrando prestazioni competitive sul nuovo benchmark Molmo-2 Moments.

Autori originali: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

Pubblicato 2026-05-25
📖 5 min di lettura🧠 Approfondimento

Autori originali: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un film della durata di 4 ore e qualcuno ti pone una domanda molto specifica al suo riguardo, come: "Cosa stava facendo l'uomo con la giacca gialla subito prima di attraversare il fiume?"

Se provassi a rispondere guardando l'intero film dall'inizio alla fine, ci vorrebbe un'eternità. Se invece scegliessi a caso alcune fotogrammi (come sfogliare un album fotografico), probabilmente perderesti il momento esatto. Questo è il problema che l'articolo affronta: Come possiamo trovare i pochi secondi esatti di un video lungo che contengono la risposta, senza guardare tutto?

Gli autori propongono un nuovo sistema chiamato ToolMerge. Ecco come funziona, spiegato attraverso semplici analogie.

1. Il problema dei vecchi metodi

I sistemi precedenti cercavano di risolvere il problema in due modi, entrambi difettosi:

  • L'approccio "taglia unica": Trattavano l'intera domanda come un'unica gigantesca stringa di ricerca. È come chiedere a un bibliotecario: "Trovami la pagina con l'uomo in giacca gialla che attraversa il fiume". Il bibliotecario potrebbe trovare una pagina con un fiume, o una pagina con un uomo, ma non necessariamente la giusta combinazione.
  • L'approccio "lista di controllo rigida": Cercavano di scomporre la domanda in una lista fissa di oggetti (ad esempio: "Trova l'uomo", "Trova la giacca", "Trova il fiume"). Ma la vita reale è disordinata. A volte è necessario cercare un'azione, a volte un oggetto e a volte un colore specifico. Una lista di controllo rigida perde le sfumature.

2. La soluzione: ToolMerge (Il detective intelligente)

ToolMerge agisce come un detective intelligente che sa come utilizzare diversi strumenti per risolvere un caso. Invece di cercare di trovare la risposta in un unico balzo, il detective scompone il lavoro.

Passo 1: Il Pianificatore (Il Cervello)
Innanzitutto, un "Pianificatore" (un cervello AI) legge la domanda. Invece di cercare semplicemente l'intera frase, scompone la domanda in compiti più piccoli e specifici.

  • Analogia: Se la domanda è "Cosa ha fatto l'uomo con la giacca gialla?", il Pianificatore non si limita a urlare "Giacca Gialla!" nel vuoto. Dice: "Ok, ho bisogno di tre cose: 1. Trova una scena con un fiume. 2. Trova un uomo vestito di giallo. 3. Trova qualcuno che attraversa l'acqua."

Passo 2: Gli Strumenti (Gli Specialisti)
Il Pianificatore invia questi piccoli compiti a diversi strumenti "specialisti".

  • Strumento A (SigLIP): Questo è lo Specialista di Scena. Guarda l'intera immagine per cogliere le atmosfere generali (ad esempio, "un fiume", "un canyon").
  • Strumento B (T-REN): Questo è lo Specialista di Oggetti. Si ingrandisce per trovare cose specifiche (ad esempio, "un uomo", "una giacca gialla").
  • Strumento C (OCR): Questo è il Lettore di Testo. Legge le parole scritte su cartelli o schermi nel video.

Passo 3: La Fusione (Il Giudice)
Ora, ogni strumento ha classificato ogni singolo fotogramma del video in base a quanto bene corrisponde al suo compito specifico. Il passaggio "Fusione" combina queste classifiche.

  • La regola "E": Se la domanda richiede sia un fiume sia un uomo, il sistema cerca i fotogrammi in cui entrambi gli strumenti hanno dato un punteggio alto. È come un diagramma di Venn; la risposta deve trovarsi al centro, dove i cerchi si sovrappongono.
  • La regola "O": Se la domanda chiede "Ha attraversato il fiume O il ponte?", il sistema cerca i fotogrammi che soddisfano una delle due condizioni.

Infine, il sistema seleziona i primi 3-8 fotogrammi che hanno ottenuto i punteggi migliori secondo tutte queste regole combinate e li consegna a un'AI finale "Risponditore" per fornire la risposta effettiva.

3. Il nuovo test: Molmo-2 Moments (M2M)

Per dimostrare che il loro sistema funziona, gli autori hanno realizzato che i test esistenti erano ingiusti. I vecchi test avevano domande che potevano essere risposte indovinando o guardando parti casuali del video.

Hanno costruito un nuovo test chiamato Molmo-2 Moments (M2M).

  • L'analogia: Immagina un insegnante che scrive un test basato solo su un clip specifico di 10 secondi di un film. L'insegnante sa esattamente cosa succede in quei 10 secondi. Se uno studente risponde correttamente, deve aver guardato quei 10 secondi specifici. Non avrebbe potuto indovinarlo dal resto del film.
  • Questo garantisce che, se il sistema ottiene la risposta corretta, abbia effettivamente trovato i fotogrammi giusti.

4. I risultati

Quando hanno testato ToolMerge:

  • È stato migliore nel trovare i fotogrammi giusti rispetto ai metodi precedenti, specialmente per domande complesse che coinvolgono più oggetti o azioni.
  • Ha funzionato particolarmente bene nel recupero delle didascalie. Se si fornisce al sistema una descrizione lunga e dettagliata di una scena (come una didascalia), ToolMerge è molto più bravo a trovare il clip video esatto che corrisponde a quella descrizione rispetto ai metodi più vecchi.
  • Hanno anche dimostrato che se si "allena" un po' il Pianificatore utilizzando un sistema di ricompensa specifico (GRPO), diventa ancora meglio nel sapere quali strumenti utilizzare.

Riepilogo

ToolMerge è un sistema che non cerca di indovinare la risposta a una domanda su un video lungo tutto in una volta. Invece, agisce come un project manager: scompone la domanda in piccoli compiti specifici, invia questi compiti a diversi strumenti specializzati e poi combina i risultati per trovare i pochi secondi esatti di video che contengono la verità. Hanno dimostrato che funziona creando un nuovo test più rigoroso, in cui la risposta è bloccata a un momento specifico nel tempo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →