Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval
Este estudio demuestra que los LLM de vanguardia como GPT-4.1 y Claude Sonnet 4.6 logran un rendimiento de recuperación a la par con el modelo multimodal nativo de Google, Gemini Embedding 2, en Flickr30k, aunque este último sigue siendo superior para aplicaciones de baja latencia debido a la capacidad de precomputar los embeddings.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de encontrar una aguja específica en un pajar enorme y caótico. Pero aquí está el giro: la aguja no es solo un trozo de metal; es una imagen, y tú la estás describiendo usando palabras. Este es el mundo de la recuperación multimodal, una rama de la informática donde las máquinas aprenden a conectar lo que ven (imágenes) con lo que leen (texto). Durante años, la forma estándar de hacer esto era construir dos "cerebros" separados: uno que lee texto y lo convierte en un código secreto, y otro que mira imágenes y las convierte en un código secreto diferente. La computadora luego intenta emparejar estos dos códigos, como intentar encajar una pieza cuadrada en un agujero redondo entrecerrando los ojos con mucha fuerza.
Recientemente, dos nuevas súper-herramientas han entrado en la arena. Primero, existen los Modelos de Lenguaje Extensos (LLMs) de Frontera. Piensa en ellos como bibliotecarios increíblemente inteligentes y omniscientes que pueden mirar un montón de 25 fotos y una sola oración, luego leer instantáneamente cada foto, compararlas entre sí y elegir la mejor coincidencia. Segundo, existen los Embeddings Multimodales Nativos. Estos son como un traductor universal que habla tanto "Imagen" como "Texto" con fluidez desde el principio, convirtiendo todo en un único y unificado código secreto sin necesidad de que dos cerebros separados se comuniquen entre sí. La gran pregunta que todos se hacen es: ¿Necesitamos al bibliotecario súper inteligente para leer cada foto y compararlas, o el traductor universal es lo suficientemente rápido y preciso como para hacer el trabajo por sí solo? Esto importa porque si el bibliotecario es demasiado lento, no podrás usarlo para aplicaciones en tiempo real como buscar en tu galería de fotos mientras caminas por la calle.
Este artículo establece una carrera de alto riesgo entre estos dos enfoques utilizando un conjunto de datos llamado Flickr30k, que contiene 31,000 imágenes con descripciones escritas por humanos. Para que la carrera sea verdaderamente justa y difícil, los investigadores no solo lanzaron fotos aleatorias a los modelos. Crearon "negativos difíciles" —fotos que se ven muy similares a la respuesta correcta pero que no son del todo acertadas, diseñadas para engañar incluso a los sistemas más inteligentes. Probaron cuatro pesos pesados: Gemini Embedding 2 y Amazon Nova 2 (los traductores universales) contra GPT-4.1 y Claude Sonnet 4.6 (los bibliotecarios súper inteligentes).
Los resultados fueron una sorpresa para los velocistas pero un alivio para los entusiastas de la precisión. Cuando se trató de obtener la respuesta correcta, los traductores universales y los bibliotecarios súper inteligentes estuvieron codo a codo. El estudio encontró que Gemini Embedding 2, GPT-4.1 y Claude Sonnet 4.6 se desempeñaron estadísticamente igual. Estaban tan cerca que no podías distinguirlos basándote solo en la precisión; todos lograron elegir la imagen correcta aproximadamente el 80% de las veces en estos escenarios complicados. El artículo descarta explícitamente la idea de que los bibliotecarios sean vastamente superiores en precisión, demostrando que los nuevos modelos de embedding son igual de agudos para encontrar la aguja correcta en el pajar. Sin embargo, un modelo, Amazon Nova 2, se quedó atrás, obteniendo la respuesta correcta un 13 por ciento menos de las veces, probablemente porque fue configurado para tareas generales en lugar de este tipo específico de búsqueda de imágenes.
Pero la verdadera historia no es solo quién gana la carrera de precisión; es sobre quién termina el maratón. Aquí es donde los dos enfoques divergen drásticamente. Los bibliotecarios súper inteligentes (LLMs) tienen que mirar cada una de las fotos del grupo para cada una de las preguntas. El artículo midió esto y encontró que clasificar 1,000 consultas tomó a los bibliotecarios más de 6,100 segundos (para GPT-4.1) y 9,415 segundos (para Claude Sonnet 4.6). Eso son horas de espera. En contraste, los traductores universales (modelos de embedding) trabajan de manera diferente. Pueden pre-calcular los códigos secretos para todas las fotos una vez, como si estuvieran sellando cada libro de una biblioteca con un código de barras antes de que siquiera entres. Una vez que se realiza esa "pre-computación", encontrar la foto correcta para 1,000 consultas le tomó a los modelos de embedding menos de 2 segundos.
Los autores concluyen que, si bien los bibliotecarios súper inteligentes son brillantes en razonar y comparar imágenes lado a lado, los traductores universales son los claros ganadores para cualquier cosa que necesite suceder instantáneamente. Si estás construyendo una aplicación donde un usuario necesita buscar en una gran colección de imágenes en un abrir y cerrar de ojos, los modelos de embedding son la mejor opción. Los bibliotecarios siguen siendo útiles si tu colección de fotos cambia cada segundo o es muy pequeña, haciendo que el paso de pre-computación sea inútil, pero para velocidad y escala, los nuevos modelos de embedding han demostrado que pueden igualar la precisión de los gigantes mientras corren mil veces más rápido.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.