← Últimos artículos
🤖 AI

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

LeVLJEPA introduce el primer método de preentrenamiento de visión y lenguaje de extremo a extremo totalmente no contrastivo que utiliza la predicción transmodal sin negativos, demostrando un rendimiento superior en la generación de características semánticas densas para tareas de seguimiento como la respuesta a preguntas visuales y la segmentación semántica, mientras mantiene la competitividad en las lecturas globales.

Autores originales: Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

Publicado 2026-07-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a entender el mundo mostrándole imágenes y leyéndole historias sobre esas imágenes. Durante mucho tiempo, la mejor manera de hacer esto era como jugar a un juego de alto riesgo de "encuentra las diferencias" con una multitud enorme.

La vieja forma: El juego de "Encuentra las diferencias" (Aprendizaje contrastivo)

Piensa en los métodos tradicionales (como CLIP) como un profesor que sostiene la foto de un gato y una historia que dice "Este es un gato". Para asegurarse de que el robot aprenda, el profesor también le muestra 10,000 otras fotos e historias que no coinciden. El robot tiene que aprender: "Vale, esta foto específica coincide con esta historia, pero definitivamente no coincide con esas otras 10,000 cosas".

Esto funciona bien para tareas sencillas, como mirar una foto y adivinar: "¿Es esto un gato o un perro?" (Clasificación zero-shot). Pero tiene un fallo: el robot aprende a centrarse en la imagen general para ganar el juego de "coincidencia vs. no coincidencia", ignorando a menudo las partes diminutas y detalladas de la imagen. Es como estudiar para un examen memorizando solo la portada del libro, ignorando los capítulos de su interior.

La nueva forma: El "Traductor con los ojos vendados" (LeVLJEPA)

Los autores de este artículo, LeVLJEPA, se hicieron una pregunta audaz: ¿Podemos enseñar al robot sin mostrarle nunca las respuestas "incorrectas" (los negativos)?

Construyeron un nuevo sistema que funciona como un juego de Traductor con los ojos vendados:

  1. La configuración: Tienes a dos expertos. Uno ve la imagen, el otro lee la historia.
  2. El juego: El "Experto en Imágenes" intenta adivinar qué está pensando el "Experto en Historias", y viceversa.
  3. El giro: La persona a la que se está intentando adivinar está "congelada" (no puede cambiar de opinión ni dar retroalimentación). El que adivina tiene que descubrirlo por su cuenta.
  4. La red de seguridad: Para asegurarse de que el que adivina no se rinda simplemente y diga "no lo sé" para todo (lo que se llama "colapso"), debe seguir una regla: sus suposiciones deben estar distribuidas uniformemente, como una repartición justa de cartas, en lugar de amontonarse.

Este método no utiliza ejemplos negativos, ni configuraciones de temperatura complejas, ni multitudes masivas de respuestas "incorrectas". Simplemente se basa en la predicción y en una regla sencilla para mantener el equilibrio.

La gran sorpresa: El "Detalle" vs. El "Resumen"

Los investigadores probaron este nuevo método contra los antiguos métodos de "Encuentra las diferencias". Esto es lo que descubrieron:

  • La prueba del resumen (Características globales): Si le preguntas al robot "¿Qué es lo principal en esta imagen?" (como una clasificación sencilla), los métodos antiguos y el nuevo método funcionan casi exactamente igual. Ambos son buenos con la "imagen general".
  • La prueba del detalle (Características densas): Aquí es donde ocurre la magia. Los sistemas de IA modernos no solo miran "lo principal"; miran cada parche de la imagen para entender escenas complejas, como encontrar una herramienta específica en un garaje desordenado o seguir el brazo de un robot.
    • Los métodos antiguos de "Encuentra las diferencias" son como un turista que solo recuerda el horizonte de una ciudad.
    • El nuevo método LeVLJEPA es como un guía local que conoce cada calle, callejón y tienda.

Cuando los investigadores usaron este nuevo método como el "cerebro" para modelos de visión y lenguaje complejos (como robots que siguen instrucciones o responden preguntas detalladas), aplastó a la competencia. Fue significativamente mejor en:

  • Segmentación semántica: Identificar exactamente qué píxeles pertenecen a qué objeto (como dibujar un contorno perfecto alrededor de un coche).
  • Preguntas y respuestas visuales (VQA): Responder preguntas complicadas como "¿Qué objeto rojo está sentado sobre la mesa azul?".

La conclusión

El artículo concluye que la vieja forma de entrenar (usando negativos) es genial para juegos sencillos de "coincidencia o no coincidencia", pero en realidad está frenando el desarrollo de una IA que necesita ver los detalles finos.

Al cambiar a este nuevo enfoque de "predicción sin negativos", crearon un codificador visual que es mucho mejor viendo el mundo en alta definición, píxel a píxel, que es exactamente lo que los sistemas de IA modernos necesitan para funcionar en el mundo real.

En resumen: El método antiguo enseñó a la IA a reconocer la portada del libro. El nuevo método enseñó a la IA a leer la historia completa, página por página.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →