← Ultimi articoli
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

Il documento presenta Gemini Embedding 2, un modello di embedding multimodale nativo che unifica video, audio, immagini e testo in un unico spazio di rappresentazione, ottenendo prestazioni all'avanguardia in una vasta gamma di compiti di recupero unimodale, cross-modale e multimodale, dimostrando al contempo capacità zero-shot robuste in domini specializzati.

Autori originali: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Sam
Pubblicato 2026-05-27
📖 5 min di lettura🧠 Approfondimento

Autori originali: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere una biblioteca immensa contenente libri, film, registrazioni musicali e fotografie. Al momento, se vuoi trovare una canzone specifica che assomiglia a una scena di un film, o una ricetta che corrisponde a una foto di un piatto, di solito devi prima tradurre tutto in testo. Dovresti scrivere una descrizione della foto, trascrivere l'audio in parole e poi cercare. È come cercare di trovare un colore specifico guardando solo un elenco di nomi di vernici; perdi la vera "sensazione" del colore.

Gemini Embedding 2 è il nuovo strumento di Google che cambia le regole del gioco. Invece di costringere tutto in testo, crea un'unica "lingua" universale in cui immagini, suoni, video e parole parlano tutti lo stesso dialetto.

Ecco una spiegazione di come funziona e perché è importante, utilizzando analogie semplici:

1. Il Traduttore Universale (L'Idea di Base)

Pensa al vecchio modo di fare le cose come avere dizionari diversi per lingue diverse. Se volevi confrontare un libro francese con un film tedesco, dovevi tradurre entrambi in inglese prima, il che spesso faceva perdere le sfumature.

Gemini Embedding 2 è come un traduttore universale che parla "Significato".

  • Prende un video, una canzone, una foto o un paragrafo di testo e li converte tutti in un unico tipo di "tessera d'identità" (un vettore matematico).
  • Poiché sono tutti nella stessa "lingua", il modello può vedere istantaneamente che un video di un cane che abbaia e un testo che dice "un cane rumoroso" sono correlati, anche se uno è suono e l'altro sono parole. Non ha bisogno di convertire il suono in parole prima; comprende il suono direttamente.

2. Il Cuoco "Tutto-in-Uno"

I modelli precedenti erano come cuochi che potevano cucinare bene solo un tipo di cibo. Un cuoco era bravo con il testo, un altro con le immagini e un altro con i video. Se volevi un pasto con tutti e tre, dovevi assumere tre cuochi diversi e sperare che fossero d'accordo sul sapore.

Gemini Embedding 2 è uno chef maestro che può gestire qualsiasi ingrediente.

  • È stato addestrato su un enorme mix di compiti: leggere codice, comprendere film, ascoltare audio e analizzare documenti.
  • Poiché ha appreso da questa enorme varietà, non si confonde quando mescoli gli ingredienti. Puoi chiedergli di trovare un clip video usando un mix di una foto e una frase, e comprende la combinazione perfettamente.

3. Il Superpotere "Zero-Shot"

Di solito, se vuoi che un computer comprenda un argomento molto specifico (come l'astronomia o la cucina), devi insegnarglielo specificamente per quell'argomento. È come assumere un tutor per insegnare a uno studente solo sul sistema solare.

Gemini Embedding 2 è come uno studente che è già un esperto di tutto.

  • Il documento mostra che questo modello funziona incredibilmente bene su argomenti specializzati come la microscopia (biologia), l'astronomia, le arti visive e la cucina senza bisogno di alcun addestramento aggiuntivo.
  • È pronto "fuori dalla scatola". Se gli mostri una foto di una carta stellare o una ricetta complessa, comprende immediatamente il contesto meglio di modelli specializzati che sono stati addestrati solo su una di quelle cose.

4. La Svolta nell'Audio (Niente più Trascrizione)

Uno dei problemi più grandi nella ricerca audio è che i computer devono solitamente "leggere" prima l'audio (trascrivendo il parlato in testo) prima di poterlo cercare. È come cercare di trovare una canzone leggendo il testo, ma se il cantante mormora o l'accento è forte, il computer sbaglia il testo e non trovi mai la canzone.

Gemini Embedding 2 salta l'intermediario.

  • Ascolta direttamente il suono grezzo. Comprende il tono, l'altezza e l'emozione della voce, non solo le parole.
  • Il documento ha rilevato che la ricerca con audio grezzo è molto più accurata della ricerca con testo trascritto. È come riconoscere la voce di un amico in una folla senza bisogno di sentire cosa sta dicendo.

5. Come è stato Costruito (La Ricetta di Addestramento)

Per costruire questo "traduttore universale", il team non ha insegnato al modello una cosa alla volta. Hanno usato un processo di cottura in tre fasi:

  1. Pre-Fine-Tuning: Hanno dato al modello un enorme e disordinato mucchio di dati (testo, codice, immagini) per abituarlo all'idea di "codificare" le informazioni.
  2. Fine-Tuning: Gli hanno dato esempi molto specifici e di alta qualità su come abbinare le cose (come abbinare una domanda a una risposta, o un video a una descrizione).
  3. Model Souping: Questo è un trucco intelligente in cui hanno preso diverse versioni del modello addestrato e le hanno "mescolate" insieme, come mescolare diversi lotti di zuppa per ottenere il sapore perfetto. Questo ha reso il modello finale più stabile e migliore nel gestire diversi tipi di compiti contemporaneamente.

La Conclusione

Gemini Embedding 2 è un potente nuovo motore che permette ai computer di comprendere il mondo come fanno gli esseri umani: vedendo, ascoltando e leggendo tutto come un tutto connesso. Che tu stia cercando un momento specifico in un video usando una descrizione testuale, trovando una canzone basata su un fischio, o cercando un documento che contiene grafici e testo, questo modello fa tutto in uno spazio unificato, spesso meglio di strumenti specializzati progettati per solo uno di quei lavori.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →