← Últimos artículos
💻 computer science

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

El paper presenta InternVideo-Next, un modelo de fundación de video general que supera las limitaciones de los métodos supervisados por texto y el aprendizaje previo de modelado de video enmascarado mediante un nuevo marco de codificador-predictor-decodificador y un esquema de preentrenamiento en dos etapas que aprende conocimiento del mundo sin supervisión textual.

Autores originales: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

Publicado 2026-03-31
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres enseñarle a un robot a entender el mundo real, no solo leyendo libros (texto), sino viendo películas enteras (video). Hasta ahora, los robots eran como estudiantes que solo aprendían leyendo resúmenes de películas escritos por humanos. Esos resúmenes a veces eran confusos, incompletos o simplemente no capturaban la magia de cómo se mueven las cosas, la profundidad de las habitaciones o las leyes de la física.

Los autores de este paper, InternVideo-Next, han creado un nuevo método para que el robot aprenda viendo el video "crudo", sin depender de esos resúmenes imperfectos.

Aquí tienes la explicación sencilla, usando analogías:

1. El Problema: Dos formas de aprender que fallan

Antes de su solución, había dos formas principales de entrenar a estos robots:

  • El método del "Resumen" (Texto): El robot ve un video y trata de adivinar qué dice el título o la descripción.
    • El fallo: Es como intentar aprender a conducir solo leyendo el manual. Sabes las reglas, pero no sabes cómo se siente el coche girando en una curva o cómo reacciona el motor. Le falta "sentir" el movimiento y la física.
  • El método del "Puzzle" (Reconstrucción de píxeles): El robot ve un video con partes tapadas y trata de "dibujar" los píxeles que faltan.
    • El fallo: Es como intentar armar un rompecabezas mirando solo los colores. El robot aprende a copiar colores y formas simples, pero no entiende por qué el coche se mueve hacia la izquierda o qué hay detrás de la pared. Se queda en la superficie.

2. La Solución: InternVideo-Next (El Método de los Dos Pasos)

Los autores dicen: "¿Por qué no hacemos las dos cosas, pero de una manera inteligente?" Han creado un sistema de dos etapas llamado EPD (Codificador-Predictor-Decodificador).

Imagina que estás aprendiendo a tocar el piano:

Etapa 1: El Entrenador Semántico (Aprendiendo el "Qué" y el "Cómo")

En esta fase, el robot mira el video y trata de reconstruir las partes que faltan, pero con un truco especial:

  • El Decodificador Difusivo: En lugar de intentar dibujar píxeles perfectos (que es difícil y aburrido), el robot usa un "pintor mágico" (un modelo de difusión) que entiende el espíritu de la imagen.
  • La Analogía: Imagina que el robot ve una foto de un gato saltando. En lugar de intentar copiar cada pelo del gato (píxeles), el robot aprende la idea de "gato saltando" y usa un pintor experto para rellenar los huecos. Además, le dan un "libro de instrucciones" (conocimiento de imágenes) para asegurar que el gato se vea real y tenga sentido.
  • Resultado: El robot ahora tiene una "memoria interna" que guarda tanto los detalles finos (el pelo del gato) como el significado (es un gato saltando).

Etapa 2: El Maestro del Mundo (Aprendiendo la "Lógica")

Ahora que el robot tiene esa memoria rica y detallada, pasamos a la segunda fase:

  • Predicción Latente: El robot ya no intenta "dibujar" el video. Ahora intenta predecir lo que pasará después basándose en lo que ya vio, usando su memoria interna.
  • El Truco del "Maestro Congelado": Tienen dos robots. Uno es el "Estudiante" y el otro es el "Maestro" (que es una copia congelada del Estudiante de la Etapa 1). El Estudiante intenta adivinar lo que el Maestro ve en las partes ocultas del video.
  • La Analogía: Es como un juego de "adivina la película". Si el robot ve a una pelota rodando hacia un borde, el "Maestro" sabe que la pelota caerá. El "Estudiante" debe aprender a predecir eso sin mirar la caída. Si solo adivina al azar, pierde. Pero como el "Maestro" ya entiende la física y el movimiento, el Estudiante se ve obligado a aprender las leyes del mundo real (gravedad, colisiones, tiempo) para ganar.

3. ¿Por qué es tan genial?

Gracias a este método, el robot InternVideo-Next logra cosas que antes eran imposibles sin leer millones de textos:

  1. Entiende la Física: Puede estimar la profundidad de una habitación (¿qué tan lejos está el sofá?) solo viendo el video, como si tuviera ojos 3D.
  2. Rastrea Objetos: Si un coche se esconde detrás de un árbol, el robot sabe que sigue ahí y puede predecir dónde aparecerá.
  3. Habla el idioma de los humanos: Aunque nunca se le enseñó a hablar durante el entrenamiento, cuando se le conecta a un cerebro que habla (un modelo de lenguaje), puede entender preguntas sobre videos y responder con precisión increíble.

En resumen

InternVideo-Next es como un estudiante que deja de memorizar resúmenes de películas y empieza a vivir la película.

  1. Primero, aprende a ver los detalles y entender la historia (Etapa 1).
  2. Luego, practica predecir el futuro basándose en la lógica del mundo real (Etapa 2).

El resultado es un modelo que no solo "ve" píxeles, sino que entiende el mundo, desde cómo se mueve un objeto hasta cómo se siente el espacio 3D, todo aprendiendo solo de videos sin necesidad de etiquetas humanas. ¡Es un paso gigante hacia robots que realmente entienden nuestra realidad!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →