← Últimos artigos
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

O artigo apresenta o Gemini Embedding 2, um modelo de incorporação multimodal nativo que unifica vídeo, áudio, imagem e texto em um único espaço de representação, alcançando desempenho de última geração em diversas tarefas de recuperação unimodal, cruzada entre modalidades e multimodal, ao mesmo tempo que demonstra capacidades robustas de zero-shot em domínios especializados.

Autores originais: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Sam
Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca massiva contendo livros, filmes, gravações de música e fotografias. Atualmente, se você quiser encontrar uma música específica que soe como uma cena de filme, ou uma receita que corresponda a uma foto de um prato, geralmente precisa traduzir tudo para texto primeiro. Você teria que escrever uma descrição da foto, transcrever o áudio em palavras e, em seguida, pesquisar. É como tentar encontrar uma cor específica olhando apenas para uma lista de nomes de tintas; você perde a "sensação" real da cor.

Gemini Embedding 2 é a nova ferramenta do Google que muda o jogo. Em vez de forçar tudo para o texto, ela cria uma única "língua" universal onde imagens, sons, vídeos e palavras falam todos o mesmo dialeto.

Aqui está uma explicação de como funciona e por que isso importa, usando analogias simples:

1. O Tradutor Universal (A Ideia Central)

Pense na maneira antiga de fazer as coisas como ter dicionários diferentes para idiomas diferentes. Se você quisesse comparar um livro em francês com um filme em alemão, teria que traduzir ambos para inglês primeiro, o que frequentemente perdia a nuance.

Gemini Embedding 2 é como um tradutor universal que fala "Significado".

  • Ele pega um vídeo, uma música, uma foto ou um parágrafo de texto e converte todos em um único tipo de "cartão de identificação" (um vetor matemático).
  • Como todos estão na mesma "língua", o modelo pode ver instantaneamente que um vídeo de um cachorro latindo e um texto dizendo "um cachorro alto" estão relacionados, mesmo que um seja som e o outro palavras. Ele não precisa converter o som em palavras primeiro; ele entende o som diretamente.

2. O Chef "Tudo-em-Um"

Modelos anteriores eram como chefs que só conseguiam cozinhar bem um tipo de alimento. Um chef era ótimo com texto, outro com imagens e outro com vídeo. Se você quisesse uma refeição com os três, teria que contratar três chefs diferentes e torcer para que concordassem sobre o sabor.

Gemini Embedding 2 é um chef mestre que consegue lidar com qualquer ingrediente.

  • Ele foi treinado em uma mistura massiva de tarefas: lendo código, entendendo filmes, ouvindo áudio e analisando documentos.
  • Como aprendeu com essa enorme variedade, ele não fica confuso quando você mistura ingredientes. Você pode pedir para ele encontrar um clipe de vídeo usando uma mistura de uma foto e uma frase, e ele entende a combinação perfeitamente.

3. O Superpoder "Zero-Shot"

Normalmente, se você quiser que um computador entenda um tópico muito específico (como astronomia ou culinária), você precisa ensiná-lo especificamente para esse tópico. É como contratar um tutor para ensinar a um aluno apenas sobre o sistema solar.

Gemini Embedding 2 é como um aluno que já é especialista em tudo.

  • O artigo mostra que este modelo funciona incrivelmente bem em tópicos especializados como microscopia (biologia), astronomia, arte fina e culinária sem precisar de nenhum treinamento extra.
  • Ele está pronto "direto da caixa". Se você mostrar a ele uma foto de um mapa estelar ou uma receita complexa, ele imediatamente entende o contexto melhor do que modelos especializados que foram treinados apenas em uma dessas coisas.

4. O Avanço no Áudio (Fim da Transcrição)

Um dos maiores problemas ao pesquisar áudio é que os computadores geralmente precisam "ler" o áudio primeiro (transcrevendo a fala para texto) antes de poder pesquisá-lo. Isso é como tentar encontrar uma música lendo a letra, mas se o cantor murmurar ou o sotaque for forte, o computador erra a letra e você nunca encontra a música.

Gemini Embedding 2 pula o intermediário.

  • Ele ouve o som bruto diretamente. Ele entende o tom, a altura e a emoção da voz, não apenas as palavras.
  • O artigo descobriu que pesquisar com áudio bruto é muito mais preciso do que pesquisar com texto transcrito. É como reconhecer a voz de um amigo em uma multidão sem precisar ouvir o que eles estão dizendo.

5. Como Foi Construído (A Receita de Treinamento)

Para construir este "tradutor universal", a equipe não ensinou apenas uma coisa de cada vez. Eles usaram um processo de cozimento em três etapas:

  1. Pré-Ajuste Fino: Eles deram ao modelo uma pilha enorme e bagunçada de dados (texto, código, imagens) para acostumar a ideia de "codificar" informações.
  2. Ajuste Fino: Eles deram exemplos muito específicos e de alta qualidade de como combinar coisas (como combinar uma pergunta com uma resposta, ou um vídeo com uma descrição).
  3. Sopa de Modelos: Este é um truque inteligente onde eles pegaram várias versões diferentes do modelo treinado e "misturaram" elas, como misturar diferentes lotes de sopa para obter o sabor perfeito. Isso tornou o modelo final mais estável e melhor em lidar com diferentes tipos de tarefas ao mesmo tempo.

A Conclusão

Gemini Embedding 2 é um novo motor poderoso que permite que os computadores entendam o mundo da maneira como os humanos o fazem: vendo, ouvindo e lendo tudo como um todo conectado. Se você estiver procurando um momento específico em um vídeo usando uma descrição em texto, encontrando uma música baseada em uma melodia assobiada, ou procurando um documento que contenha gráficos e texto, este modelo faz tudo isso em um espaço unificado, muitas vezes melhor do que ferramentas especializadas projetadas para apenas uma dessas tarefas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →