← Últimos artículos
💬 NLP

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE es un marco de trabajo maestro-alumno que acelera el entrenamiento de modelos de lenguaje grandes multimodales mediante la poda adaptativa de tokens redundantes utilizando funciones de pérdida de guía y estimaciones de dificultad, logrando una convergencia más rápida y un rendimiento superior mientras reduce significativamente el consumo total de tokens.

Autores originales: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

Publicado 2026-04-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot muy inteligente a entender videos. En este momento, la forma estándar de hacerlo es como obligar al robot a leer cada palabra individual en un guion, incluso las aburridas como "el", "es" o "y", mientras ve una película. Esto es increíblemente lento, costoso y desperdicia mucha energía porque el robot está realizando trabajo innecesario.

El artículo introduce un nuevo método llamado REGATE (Elisión Adaptativa de Tokens Guiada por Referencia). Piensa en REGATE como un entrenador de estudio super eficiente que ayuda al robot a aprender más rápido indicándole exactamente en qué palabras enfocarse y cuáles saltarse.

Así es como funciona, usando analogías simples:

1. El Problema: Leer todo el guion

En la vieja forma (Entrenamiento Estándar), el robot procesa cada "token" (un fragmento de texto) en una descripción de video.

  • La Analogía: Imagina que estás intentando aprender un nuevo idioma leyendo un libro donde cada palabra individual está resaltada en neón brillante. Pasas horas mirando palabras comunes como "el" y "un", que en realidad no te enseñan mucho sobre la historia. Te cansas y aprendes lentamente.

2. La Solución: El "Profesor" y el "Estudiante"

REGATE utiliza un equipo de dos personas:

  • El Estudiante: Este es el modelo principal del robot que estamos intentando entrenar. Mira tanto el video como el texto.
  • El Profesor: Esta es una versión "congelada" (inmutable) del robot que solo ve el texto. No puede ver el video.

Cómo trabajan juntos:
El Profesor mira una oración y pregunta: "¿Puedo adivinar qué significa esta palabra solo leyendo el texto, sin ver el video?"

  • Si la palabra es "el" o "es", el Profesor dice: "¡Fácil! Yo sé esto".
  • Si la palabra es "rojo", "girando" o "mezclando", el Profesor dice: "¡Vaya, no puedo adivinar esto sin ver la imagen! Esta palabra necesita el video".

3. La "Puntuación de Dificultad"

REGATE combina la suposición del Profesor con el propio historial del Estudiante.

  • La Analogía: Imagina que el Estudiante está tomando un examen de práctica. REGATE mantiene un registro de qué preguntas el Estudiante sigue respondiendo mal.
  • Si el Profesor dice: "Necesitas el video para esta palabra", Y el Estudiante ha estado luchando con palabras similares antes, REGATE marca esa palabra como "Alta Prioridad".
  • Si el Profesor dice: "Yo conozco esta palabra", y el Estudiante ya la ha dominado, REGATE la marca como "Saltar".

4. El Resultado: El "Salto Inteligente"

Durante el entrenamiento, REGATE crea una máscara. Le dice al robot: "Lee estas palabras importantes, pero salta las aburridas".

  • La Analogía: En lugar de leer todo el libro página por página, el robot ahora solo lee las oraciones resaltadas que realmente hacen avanzar la historia. Ignora las palabras de relleno.
  • El Beneficio: El robot realiza 40% menos trabajo (procesa menos tokens) pero aprende igualmente bien, o incluso mejor, porque no está desperdiciando energía en cosas que ya sabe.

Lo que afirma el artículo (Los Resultados)

Los autores probaron esto en tres tipos diferentes de robots de aprendizaje de video:

  1. VideoChat2
  2. VideoLLaMA2
  3. InternVL3.5

Descubrieron que:

  • Velocidad: Los robots alcanzaron su máximo rendimiento el doble de rápido de lo habitual.
  • Eficiencia: Solo utilizaron el 38% de los tokens (palabras/fragmentos) en comparación con el método estándar.
  • Precisión: En muchos casos, los robots entrenados con REGATE se volvieron más inteligentes que los entrenados de la manera antigua, especialmente en preguntas complejas sobre video.
  • Sin Costo Extra: Este método no requiere construir un robot nuevo ni agregar partes adicionales; solo cambia cómo el robot lee durante el entrenamiento.

Resumen

REGATE es como un filtro inteligente para entrenar IA. En lugar de hacer que la IA lea cada palabra individual en un guion, utiliza a un experto "solo texto" para identificar qué palabras realmente necesitan el contexto del video para ser entendidas. Al saltarse las palabras fáciles y redundantes, la IA aprende más rápido, usa menos electricidad y a menudo termina siendo más inteligente que si hubiera leído todo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →