← Ultimi articoli
🤖 AI

Probing Perceptual Constancy in Large Vision-Language Models

Questo studio valuta 155 modelli visione-linguaggio attraverso 236 esperimenti sulla costanza di colore, dimensione e forma, rivelando una significativa variabilità delle prestazioni e una netta dissociazione tra le capacità di costanza di forma e quelle di colore e dimensione.

Autori originali: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Ho
Pubblicato 2026-02-09
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di guardare una mela rossa. Se ti allontani, sembra più piccola. Se punti una torcia blu su di essa, sembra viola. Se la guardi di lato, sembra un ovale invece di un cerchio.

Il cervello umano è straordinario perché sa che la mela è ancora una mela grande, rossa e rotonda, indipendentemente da questi cambiamenti. Non si lascia ingannare dalla distanza, dalla luce strana o dall'angolazione. Questo superpotere si chiama Costanza Percettiva.

Questo articolo è come un grande pagella per 155 diversi "cervelli artificiali" (chiamati Modelli Vision-Language) per vedere se possiedono questo stesso superpotere. I ricercatori hanno costruito un test speciale chiamato ConstancyBench per controllare tre abilità specifiche:

1. Le tre abilità testate

Pensa a queste abilità come a tre diversi livelli di un videogioco:

  • Costanza del Colore (Il livello "Illuminazione"): L'IA è in grado di capire che un muro bianco è bianco, anche se la stanza è illuminata da una lampada gialla o da un'insegna al neon blu?
    • Il Test: L'IA guarda un cubo di Rubik sotto luci strane e deve indovinare il colore reale del quadratino centrale.
  • Costanza delle Dimensioni (Il livello "Distanza"): L'IA può capire che un'auto lontana è della stessa dimensione di un'auto proprio accanto a lei, anche se quella distante sembra minuscola sullo schermo?
    • Il Test: L'IA guarda due missili, uno molto indietro e uno vicino, e deve decidere se sono effettivamente di dimensioni diverse o se sembrano diverse solo a causa della prospettiva.
  • Costanza della Forma (Il livello "Angolazione"): L'IA può sapere che un piatto rotondo è ancora un cerchio, anche se è inclinato in modo da sembrare un ovale?
    • Il Test: L'IA guarda una porta leggermente aperta e inclinata, che la fa sembrare un trapezio, e deve capire che in realtà è un rettangolo.

2. I Risultati: Chi ha superato la prova?

I ricercatori hanno testato 155 diversi modelli di IA, che vanno da quelli piccoli e leggeri a quelli massicci e super intelligenti (come GPT-4o). Ecco cosa hanno scoperto:

  • L'abilità della "Forma" è facile: I modelli di IA sono sorprendentemente bravi nella Costanza della Forma. È come se fossero molto capaci di riconoscere il "profilo" delle cose. Anche i modelli più piccoli riuscivano a capire che un rettangolo inclinato è comunque un rettangolo.
  • Le abilità "Colore" e "Dimensioni" sono difficili: I modelli hanno avuto molte più difficoltà con Colore e Dimensioni. Sono stati spesso ingannati dall'illuminazione o dalla distanza. È come se guardassero un'immagine piatta e dimenticassero che il mondo è tridimensionale e soggetto a cambiamenti di luce.
  • Cervelli più grandi funzionano meglio: C'era una regola chiara: più il modello di IA è grande, meglio riesce in questi test.
    • I modelli piccoli spesso fallivano, confondendosi con semplici trucchi.
    • I modelli massicci (i "giganti" del mondo dell'IA) facevano molto meglio, specialmente nel comprendere le dimensioni e la distanza. Sembra che, fornendo all'IA più "potenza cerebrale" (parametri), questa diventi più brava a comprendere il mondo 3D.

3. La grande conclusione

L'articolo conclude che l'IA non possiede ancora una visione singola e perfetta "simile a quella umana". Invece, ha una visione stratificata (a strati):

  • È brava nella geometria semplice (Forma).
  • Sta migliorando nella comprensione della scala e dell'illuminazione del mondo (Dimensioni e Colore), ma solo se il modello è enorme.

Gli autori suggeriscono che, sebbene questi modelli di IA stiano diventando più intelligenti, potrebbero non "vedere" il mondo come fanno gli esseri umani. Potrebbero semplicemente essere molto bravi a indovinare basandosi sui pattern visti durante il loro addestramento, piuttosto che comprendere davvero la fisica.

In breve: Se chiedi a un'IA di identificare una forma, di solito è intelligente. Se le chiedi di capire quanto sia grande o di che colore sia realmente qualcosa quando l'illuminazione o la distanza sono complicate, sta ancora imparando. E più l'IA è grande, meno probabilità ha di farsi ingannare.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →