← Ultimi articoli
💻 computer science

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

Questo studio dimostra che i grandi modelli vision-language, in particolare GPT-4o e Gemini Pro, possono approssimare efficacemente i modelli di attenzione visiva umana in ambienti rilevanti per la sicurezza senza richiedere dati di eye-tracking, come dimostrato dai forti parametri di allineamento spaziale tra le mappe di salienza generate dal modello e le mappe di calore dello sguardo umano.

Autori originali: Marta Vallejo, Siwen Wang

Pubblicato 2026-06-16
📖 5 min di lettura🧠 Approfondimento

Autori originali: Marta Vallejo, Siwen Wang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate di camminare per una strada affollata di una città. I vostri occhi si dirigono naturalmente verso lo stridore degli pneumatici di un'auto che ha rischiato un incidente, la chiazza di ghiaccio scivolosa sul marciapiede o la barriera di un cantiere che blocca il passaggio. Non dovete pensarci; il vostro cervello è programmato per individuare prima i potenziali pericoli. Questo si chiama bias di negatività — siamo biologicamente predisposti a prestare attenzione alle minacce.

Ora, immaginate di voler insegnare a un computer super intelligente (un'IA) a fare lo stesso. Volete che guardi un'immagine e dica: "Ehi, guarda qui! Questo è il punto in cui un essere umano noterebbe un rischio."

Questo articolo pone una domanda semplice: un'IA moderna può "vedere" il pericolo nello stesso modo in cui lo fa un essere umano, senza essere mai stata istruita osservando gli occhi umani?

L'esperimento: Un gioco di "Dove stai guardando?"

I ricercatori hanno organizzato un gioco con due squadre: Gli Umani e L'IA.

Squadra Umana (I tracciatori oculari):
Hanno portato 10 studenti universitari in una stanza e hanno dato loro occhiali speciali (chiamati Pupil Invisible) che fungono da minuscole telecamere per gli occhi. Questi occhiali non si limitano a osservare gli studenti; osservano dove stanno guardando gli studenti.

  • Gli studenti hanno guardato 33 diverse immagini di scene quotidiane (come una strada allagata, un incrocio trafficato o un parco tranquillo).
  • Alcune immagini presentavano rischi evidenti (come un incidente d'auto o una tempesta), mentre altre erano sicure.
  • Gli occhiali hanno registrato esattamente dove si sono posati gli occhi di ogni studente, creando una "mappa di calore". Pensate a questa mappa di calore come a una foto termica: più il punto è caldo (luminoso), più persone hanno guardato in quel punto.

Squadra IA (Il Modello Visione-Linguaggio):
I ricercatori hanno poi preso le stesse 33 immagini e le hanno mostrate a un'IA potente chiamata GPT-4o.

  • Non hanno addestrato l'IA sui dati del tracciamento oculare. Non hanno detto: "Ecco dove hanno guardato gli umani".
  • Inveve, hanno semplicemente chiesto all'IA: "Guarda questa immagine. Se un essere umano la guardasse per 10 secondi, dove andrebbero i suoi occhi? Per favore, indica le coordinate dei punti più importanti."
  • L'IA ha generato la propria "mappa di calore" basandosi su ciò che riteneva importante.

Lo scontro: Confronto tra le mappe

I ricercatori hanno poi sovrapposto la Mappa di Calore Umana e la Mappa di Calore dell'IA per vedere quanto bene corrispondessero. Hanno usato quattro diversi "righelli" (test matematici) per misurare la sovrapposizione:

  1. Il test "Sono simili?" (Correlazione di Pearson): L'IA ha evidenziato le stesse aree generali degli umani?
    • Risultato: Sì, discretamente bene. L'IA e gli umani sono stati d'accordo circa il 51% delle volte sulla disposizione generale.
  2. Il test "Hai guardato lì?" (NSS): Quando gli umani hanno guardato un punto specifico, l'IA ha pensato che quel punto fosse importante?
    • Risultato: Sì. L'IA ha assegnato punteggi elevati proprio ai punti in cui gli umani fissavano lo sguardo.
  3. Il test "Corrispondenza della forma" (Divergenza KL): La distribuzione dell'attenzione dell'IA era simile a quella umana?
    • Risultato: GPT-4o è stato in realtà il migliore nel corrispondere alla forma dell'attenzione umana, anche se altri modelli sono stati leggermente migliori nel individuare l'esatta posizione.
  4. Il test "Individua il pericolo" (AUC-Judd): Se dovessi indovinare quali parti dell'immagine fossero rischiose, l'IA riuscirebbe a farlo meglio del caso?
    • Risultato: Assolutamente sì. L'IA ha ottenuto un punteggio di 0,80 su 1,0, mentre un tentativo casuale avrebbe ottenuto solo 0,5.

Il verdetto

Lo studio ha scoperto che GPT-4o può "vedere" i rischi per la sicurezza quasi esattamente dove li vedono gli esseri umani, anche se non ha mai indossato occhiali per il tracciamento oculare.

  • La connessione con il "Bias di Negatività": L'IA sembra aver appreso dai suoi enormi dati di addestramento (tutti i testi e le immagini che ha letto online) che gli esseri umani tendono a concentrarsi su cose spaventose o pericolose. Essa imita naturalmente il nostro "bias di negatività".
  • Non è solo un modello: I ricercatori hanno testato anche altre IA (come Gemini Pro e Claude). Tutte hanno fatto meglio del caso, ma GPT-4o è stata la migliore nel corrispondere al modello dell'attenzione umana, mentre Gemini Pro è stata leggermente migliore nell'individuare l'esatta posizione dei rischi.

Perché questo è importante (secondo l'articolo)

L'articolo conclude che potremmo non aver bisogno di costosi occhiali per il tracciamento oculare per costruire sistemi di sicurezza per robot o auto a guida autonoma. Se un grande modello di IA può prevedere dove un essere umano guarderebbe per il pericolo semplicemente "pensando" all'immagine, possiamo usare quell'IA per aiutare le macchine a navigare in sicurezza.

In breve: L'IA non ha avuto bisogno di imparare come guardare; le è bastato che le venisse chiesto, e ha capito che, proprio come noi, deve prestare attenzione alle cose spaventose.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →