Sintesi Tecnica: AVE-Compass e AVE-Agent
1. Definizione del Problema
Sebbene l'editing video basato su istruzioni abbia progredito rapidamente, i sistemi e i benchmark esistenti si concentrano principalmente sulle trasformazioni visive di clip silenziose o sull'editing audio isolato. I video del mondo reale, tuttavia, consistono di segnali audio-visivi strettamente accoppiati, dove la semantica emerge dall'interazione tra dinamiche visive, suoni in primo piano, ambiente sonoro e parlato. Gli attuali modelli faticano a eseguire istruzioni cross-modali complesse che richiedono modifiche sincronizzate (ad esempio, cambiare il suono quando cambia un'azione, o rimuovere tracce acustiche quando viene rimosso un target visivo) preservando al contempo il contenuto non target.
I benchmark esistenti sono insufficienti per valutare queste capacità perché:
- Si concentrano su trasformazioni visive di video silenziosi o sulla generazione audio isolata.
- Mancano di valutazione della coerenza cross-modale e dei vincoli di sincronizzazione impliciti.
- Si affidano a metriche grossolane che non riescono a diagnosticare fallimenti specifici nell'editing audio-visivo, come la distorsione dei suoni di sottofondo o la perdita del lip-sync.
2. Metodologia
A. AVE-Compass: Un Benchmark Completo
Gli autori introducono AVE-Compass, un benchmark progettato per valutare l'editing audio-visivo a formato libero.
- Composizione del Dataset: Comprende 145 video sorgente curati (che spaziano in diversi domini, conteggi di inquadrature e stili) e 196 istruzioni di editing audio-visivamente accoppiate.
- Tipi di Istruzione: Le istruzioni coprono quattro rami: editing congiunto audio-visivo, del parlato, solo video e solo audio. Sono categorizzate in 28 tipi di operazione granulari e annotate con etichette di difficoltà relative alla localizzazione degli oggetti, alla complessità audio e al collegamento cross-modale.
- Protocollo di Valutazione: Il benchmark scinde le prestazioni in quattro dimensioni:
- Instruction Following (IF - Seguire l'Istruzione): Valuta se la modifica richiesta è stata applicata correttamente al target previsto utilizzando domande atomiche di tipo Sì/No.
- Fidelity Preserving (FP - Preservazione della Fedeltà): Valuta se il contenuto non modificato (visivo e uditivo) rimane coerente con la sorgente e se sono stati introdotti contenuti indesiderati.
- Realism (REAL - Realismo): Utilizza una rubrica dedicata MLLM per giudicare la plausibilità percettiva e la coerenza fisica del clip editato.
- Editing Intent (EI - Intento di Editing): Una metrica primaria definita come il prodotto di IF e FP, che premia l'esecuzione completa dell'editing preservando al contempo il contenuto non target.
- Metriche: La valutazione combina l'approccio MLLM-as-Judge (utilizzando 2.688 elementi di controllo granulari) con metriche automatizzate per la sincronizzazione cross-modale (Lip Sync, AV Sync), la qualità del video (Estetica, Coerenza del Soggetto, Fluidità del Movimento) e la qualità dell'audio (Estetica, Qualità del Parlato).
B. AVE-Agent: Un Framework di Editing Modulare
Per affrontare i limiti degli attuali modelli, gli autori propongono AVE-Agent, un framework di agente basato sulla pianificazione.
- Planner Agent (Agente Pianificatore): Converte istruzioni astratte dell'utente in un DAG (Grafo Aciclico Diretto) di sottotask eseguibili e dipendenti dalle priorità. Analizza il clip in input, identifica i requisiti espliciti e le conseguenze cross-modali implicite, e decompone il compito in sottotask specifici per modalità con criteri di valutazione azionabili.
- Executor Agent (Agente Esecutore): Fondamenta i sottotask in operazioni concrete (video, audio o parlato) utilizzando un ciclo di riflessione self-check. Compila gli intenti di alto livello in prompt specifici per lo strumento, esegue il compito e valuta l'output rispetto ai criteri del pianificatore. Se l'output fallisce, un "improver" riscrive la guida per mirare a errori specifici invece di riprovare ciecamente.
- Mixed Evaluator Agent (Agente Valutatore Misto): Ispeziona il clip assemblato per la coerenza globale, il rispetto delle istruzioni e la fedeltà. Determina l'azione correttiva meno costosa (ad esempio, remixare, rigenerare un sottotask o una ri-pianificazione completa) per affrontare i problemi rilevati senza ricalcoli superflui.
3. Contributi Chiave
- Benchmark AVE-Compass: Un dataset completo con 145 video, 196 istruzioni accoppiate e 2.688 elementi di controllo, mirato specificamente a scenari realistici che richiedono un editing cross-modale sincronizzato e una rigorosa preservazione del contenuto non target.
- Protocollo di Valutazione Decoupled: Un framework che copre l'Instruction Following, la Fidelity Preserving, il Realismo e l'Editing Intent, consentendo la diagnosi di edizioni incomplete, deriva di contenuto, basso realismo e disallineamento.
- Framework AVE-Agent: Un agente modulare basato sulla pianificazione che decompone le istruzioni in sottotask e utilizza l'auto-riflessione per migliorare la qualità dell'editing e l'allineamento in scenari di editing congiunto complessi.
4. Risultati Sperimentali
Gli autori hanno valutato sei sistemi (inclusi Wan2.7, HappyHorse, Gemini-Omni, Seedance, LTX2 e AVE-Agent) su AVE-Compass.
- Prestazioni di AVE-Agent: AVE-Agent ha ottenuto i punteggi più alti in Editing Intent (59.8) e Instruction Following (77.3), superando significativamente i baseline. Ha mostrato guadagni particolari nel rispetto delle istruzioni lato audio e nella sincronizzazione audio-visiva.
- Compromessi nei Baseline: Gli attuali modelli faticano a bilanciare l'Instruction Following e la Fidelity Preserving.
- Modelli come LTX2 spesso seguono le istruzioni rigenerando l'intero video, il che risulta in una scarsa Fidelity Preserving.
- Modelli come Gemini-Omni e Seedance a volte restituiscono il video/audio originale per ottenere punteggi di preservazione elevati, fallendo nell'esecuzione dell'istruzione (basso Instruction Following).
- Gap di Realismo: Sebbene alcuni modelli abbiano ottenuto punteggi di qualità automatizzati elevati (ad esempio, Estetica Video/Audio), i loro punteggi di Realismo erano notevolmente inferiori, indicando una difficoltà nella comprensione del mondo fisico e della validità logica nei risultati editati.
- Robustezza: AVE-Agent ha mantenuto prestazioni più stabili attraverso diverse durate dei video sorgente, difficoltà di localizzazione degli oggetti, complessità audio e gradi di collegamento cross-modale rispetto ai baseline.
- Validità delle Metriche: Lo studio ha confermato che le metriche automatizzate e i giudizi soggettivi degli MLLM sono ampiamente ortogonali, catturando aspetti distinti della qualità. L'accordo tra umani e LLM sulle metriche di valutazione è stato mediamente vicino al 90%.
5. Significato
Il paper sostiene che AVE-Compass e AVE-Agent rappresentino un passo avanti nel muovere il campo dalle modifiche isolate a livello di pixel verso un editing multimodale fisicamente e percettivamente coerente. Valutando sistematicamente la preservazione del contenuto non target insieme all'esecuzione dell'istruzione, il benchmark rivela che i modelli allo stato dell'arte mancano ancora di meccanismi espliciti per pianificare operazioni cross-modali e imporre vincoli di sincronizzazione. Il framework agente proposto dimostizza che scomporre istruzioni complesse in sottotask dipendenti con auto-riflessione iterativa può migliorare efficacementamente la qualità dell'editing e l'allineamento nei compiti di editing audio-visivo congiunto.