← Ultimi articoli
💬 NLP

Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings

Questo articolo propone un metodo per mitigare le allucinazioni nei Large Vision-Language Models raffinando gli embedding testuali per ridurre l'eccessiva dipendenza dai prior linguistici e promuovere un'integrazione più equilibrata dei segnali visivi, ottenendo miglioramenti significativi delle prestazioni attraverso molteplici benchmark di allucinazione.

Autori originali: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

Pubblicato 2026-06-09
📖 5 min di lettura🧠 Approfondimento

Autori originali: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il Problema: Lo "Storyteller Autoconsiderato"

Immaginate di avere uno scrittore di storie brillante (il Large Language Model, o LLM) che ha letto ogni libro della biblioteca ma non ha mai visto una foto reale. Mostrate a questo scrittore l'immagine di un bancone della cucina vuoto e chiedete: "Cosa vedi?".

Poiché lo scrittore è abituato a leggere storie su cucine, inizia immediatamente a tirare a indovinare. Potrebbe dire: "Vedo una tazza di caffè fumante e una ciotola di frutta", anche se il bancone è completamente vuoto. Si sta affidando alla sua memoria delle parole piuttosto che al guardare l'immagine.

Nel mondo dell'IA, questo è chiamato allucinazione. Il modello è fluente e sembra intelligente, ma sta inventando cose perché si fida più del suo addestramento testuale che delle prove visive.

La Configurazione Attuale: Il "Treno a Due Binari"

La maggior parte dei modelli di IA attuali che guardano le immagini (chiamati LVLMs) funzionano come un treno con due binari separati che si uniscono solo alla fine:

  1. Binario A (Testo): Le parole dello scrittore.
  2. Binario B (Visione): I dati dell'immagine.

Il problema è che la locomotiva del treno (l'IA) è stata costruita per correre sul Binario A (testo). Quando i due binari si uniscono, la locomotiva preferisce naturalmente il Binario A, più fluido e familiare. Ignora le asperità e i dettagli del Binario B (l'immagine). Tratta l'immagine come un suggerimento secondario piuttosto che come il fatto principale.

La Soluzione: "VisAlign" – La "Mappa Dipinta"

I ricercatori propongono un nuovo metodo chiamato VisAlign. Invece di limitarsi a unire i binari alla fine, decidono di dipingere l'immagine direttamente sulle parole prima ancora che la storia abbia inizio.

Ecco come lo fanno:

  1. Lo Scatto Globale: Per prima cosa, l'IA dà un'occhiata rapida e media all'intera immagine (come socchiudere gli occhi davanti a un dipinto per coglierne l'atmosfera generale).
  2. L'Iniezione: Prendono questa "atmosfera" e la mescolano direttamente nel DNA di ogni singola parola che l'IA sta per pronunciare.
  3. Il Risultato: Ora, quando l'IA pensa alla parola "tazza", quella parola non è più solo una definizione testuale; porta con sé la "trama" dell'immagine reale che sta guardando.

L'Analogia:
Immaginate di dare indicazioni a un amico.

  • Vecchio Metodo: Dite: "Gira a sinistra alla panetteria", ma state guardando una mappa della città dove la panetteria non esiste. State solo recitando un copione.
  • Metodo VisAlign: State tenendo la mappa in mano e, ogni volta che dite "panetteria", state fisicamente indicando il punto sulla mappa. La parola e l'immagine sono fuse insieme. Non potete dire "panetteria" senza vedere la mappa.

Cosa succede quando lo sistemiamo?

I ricercatori hanno testato questo metodo su un modello chiamato Video-LLaVA (che guarda video e risponde a domande). Hanno osservato come è cambiata l' "attenzione" dell'IA (dove concentra la sua potenza cerebrale).

  • Prima di VisAlign: L'IA si concentrava pesantemente sull'inizio e sulla fine della frase (il testo) e quasi non guardava la parte centrale dove risiedono i dati dell'immagine. Era come uno studente che legge la domanda di un test ma ignora il diagramma.
  • Dopo VisAlign: L'IA ha iniziato a prestare attenzione ai dati dell'immagine durante tutta la frase. L' "attenzione" è diventata equilibrata. Ha smesso di indovinare in base a ciò che solitamente accade e ha iniziato a guardare ciò che sta effettivamente accadendo.

I Risultati: Meno Fatti Inventati

Il team ha testato il nuovo metodo su diversi "Hallucination Benchmarks" (test progettati per trarre in inganno l'IA). I risultati sono stati chiari:

  • Migliore Accuratezza: Il modello è diventato significativamente più bravo a individuare le cose che non c'erano (come un cane inesistente) e a descrivere le cose che erano presenti.
  • Guadagni Specifici:
    • Su un test chiamato MMVP-MLLM, l'accuratezza è aumentata del 9,33%.
    • Su POPE (un test per le allucinazioni di oggetti), l'accuratezza è salita di quasi il 3%.
    • Su Merlin (un test per verificare l'esistenza degli oggetti), è migliorata fino al 3,4%.
  • Generalizzazione: Hanno provato questo trucco su altri modelli di IA (come LLaVA 1.5 e Open-Qwen2VL) e ha funzionato anche lì. È una soluzione universale per il problema "testo-prevalente su visione".

Il Compromesso: Un Piccolo Prezzo da Pagare

Il paper nota una piccola limitazione. Poiché l'IA è ora costretta a fare maggiore affidamento sull'immagine e meno sulla sua memoria del mondo, potrebbe diventare leggermente meno brava in domande che richiedono solo conoscenze generali (come "Chi è un attore famoso?"). Tuttavia, per i compiti che richiedono l'osservazione di un'immagine, il miglioramento è enorme.

Riassunto

Il paper sostiene che i modelli di IA allucinano perché sono "ricchi di testo" e "poveri di visione". Mescolando le informazioni visive direttamente nelle parole del testo prima che l'IA inizi a pensare, costringono il modello a guardare l'immagine. Questa semplice modifica agisce come un filo di terra, impedendo all'IA di fluttuare in storie immaginarie e mantenendola ancorata alla realtà visiva.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →