← Últimos artículos
💻 computer science

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

Este artículo presenta OraRL, un marco de aprendizaje por refuerzo escalable para MLLM de video que trata las anotaciones como ejecuciones de oráculo dentro de un mecanismo de estimación de ventaja desacoplado para superar la inversión de la ventaja, logrando así un rendimiento superior en evaluaciones temporales y espaciales con una eficiencia de entrenamiento significativamente mayor e inferencia más rápida en comparación con los métodos existentes.

Autores originales: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

Publicado 2026-08-24
📖 1 min de lectura☕ Lectura para el café

Autores originales: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Anotaciones como Rollouts (OraRL)

Planteamiento del Problema

La percepción de video unificada requiere que los Modelos de Lenguaje de Gran Escala Multimodales (MLLMs) realicen tareas de grano fino como la localización temporal, el anclaje espacial (grounding), el seguimiento de objetos y la segmentación. Si bien los MLLMs generalistas recientes integran estas capacidades, a menudo rinden por debajo de los especialistas en tareas específicas, lo que sugiere que la escala del modelo por sí sola es insuficiente y que el alineamiento post-entrenamiento es el cuello de botella crítico.

Los paradigmas actuales de post-entrenamiento enfrentan dos limitaciones primarias:

  1. Ajuste Fino Supervisado (SFT): El SFT trata las anotaciones como objetivos de máxima verosimilitud, imponiendo formatos de salida pero fallando al distinguir entre predicciones casi correctas y claramente incorrectas. Carece de supervisión a nivel de tarea para guiar al modelo hacia intervalos o máscaras precisas.
  2. Aprendizaje por Refuerzo (RL) con Optimización de Política Relativa de Grupo (GRPO): Los métodos de RL para video existentes (por ejemplo, GRPO) muestrean múltiples rollouts on-policy por prompt y comparan sus recompensas. Sin embargo, estos métodos dependen únicamente de la calidad del grupo de muestras on-policy. Dado que los rollouts on-policy rara vez recuperan los intervalos, cajas o máscaras precisas especificadas por las anotaciones de la verdad de terreno (GT), muchos grupos de entrenamiento carecen de un ancla positiva confiable.
  3. Limitaciones de la Cadena de Pensamiento (CoT): Aunque se utiliza la generación de CoT para mejorar el razonamiento, esto alarga los rollouts, aumentando los costos de entrenamiento e inferencia sin garantizar mejoras en el rendimiento de las tareas de percepción de grano fino.

Un intento directo de incorporar las anotaciones de la verdad de terreno en el grupo de rollout de RL como rollouts "oráculo" falla debido a la inversión de la ventaja (advantage inversion). Cuando un oráculo de alta recompensa se incluye en la normalización del grupo, este eleva la recompensa base. En consecuencia, los rollouts on-policy que son mejores que la política original (pero peores que el oráculo) reciben ventajas negativas, suprimiendo la exploración útil y colapsando el aprendizaje hacia la imitación simple.

Metodología: OraRL

El artículo presenta OraRL (Aprendizaje por Refuerzo de Anotación como Rollout), un paradigma que trata cada anotación como un objetivo positivo confiable (un "rollout oráculo") mientras evita el desplazamiento de la base que causa la inversión de la ventaja.

Mecanismos Centrales

  1. Construcción de Anotación-como-Rollout:
    En lugar de usar las anotaciones meramente como referencias de puntuación, OraRL serializa cada anotación yy en el formato de respuesta del modelo para crear un rollout oráculo ogto_{gt}. Este oráculo se añade al grupo de nn rollouts on-policy, creando un grupo aumentado de tamaño n+1n+1. Esto proporciona un objetivo positivo confiable para cada consulta sin reducir la exploración on-policy.

  2. Estimación de Ventaja Desacoplada:
    Para resolver el problema de la inversión de la ventaja, OraRL desacopla el cálculo de la ventaja:

    • Línea Base de la Política: La media μop\mu_{op} y la desviación estándar se calculan únicamente a partir de las recompensas on-policy, excluyendo al oráculo. Esto asegura que cualquier rollout on-policy que supere a la política actual reciba una ventaja no negativa.
    • Ganancia Direccional: La brecha entre la recompensa del oráculo y la distribución on-policy se codifica como una ganancia direccional gqg_q. Esta ganancia escala las ventajas de los rollouts on-policy que están por encima de la media on-policy, amplificando la señal cuando el oráculo es significativamente mejor que la política actual.
    • Ventaja del Oráculo Desacoplada: Se calcula un término de ventaja separado y acotado AgtA_{gt} para el propio rollout del oráculo. Su escala es calibrada por un peso wqw_q (basado en la brecha restante entre la política y el oráculo) y limitada por la señal on-policy más fuerte para evitar que el oráculo domine la actualización.
  3. Poda de Equilibrio de Signos (Sign-Balanced Pruning):
    Para mejorar la eficiencia, OraRL realiza una poda del grupo de rollouts antes de la retropropagación. A diferencia de la poda basada solo en magnitud (que podría retener solo muestras positivas o solo negativas), OraRL emplea una poda de equilibrio de signos:

    • El oráculo siempre se retiene.
    • Los espacios restantes se llenan reteniendo los rollouts on-policy positivos y negativos más fuertes, asegurando que la actualización del gradiente preserve tanto las señales de refuerzo como las de supresión.
    • Se aplica una corrección de momento post-selección para recentrar las ventajas y reescalarlas para que coincidan con las estadísticas previas a la poda, evitando el sesgo en la magnitud de la actualización.
  4. Eficiencia:
    Al podar el grupo (por ejemplo, reteniendo 4 de 9 rollouts) y evitar la generación de CoT, OraRL logra un tiempo de paso de solo 2.2×2.2\times el de SFT, comparado con el 4.9×4.9\times de GRPO con CoT.

Contribuciones Clave

  1. Anotación-como-Rollout: Un mecanismo independiente de la tarea que convierte las anotaciones en rollouts oráculo, proporcionando supervisión positiva confiable sin requerir CoT ni sacrificar la exploración on-policy.
  2. Análisis de Inversión de la Ventaja: Identificación del fenómeno de "inversión de la ventaja" en la mezcla de oráculos ingenua y una solución mediante la estimación de ventaja desacoplada que separa las ventajas de la política de la guía del oráculo.
  3. Poda de Equilibrio de Signos: Una estrategia de poda que retiene tanto los signos de la ventaja como el oráculo, junto con la corrección de momentos, logrando una aceleración de 1.48×1.48\times sobre la optimización de grupo completo.
  4. Video-ORA: Un modelo de percepción de video unificado entrenado con OraRL, que demuestra mejoras consistentes en todas las escalas de modelos (0.8B a 9B) y presupuestos de datos.

Resultados Experimentales

Los autores entrenaron Video-ORA (basado en backbones Qwen3.5) y lo evaluaron en siete familias de tareas: anclaje temporal, anclaje espacial, segmentación, seguimiento visual, anclaje espacio-temporal, video QA y la inteligencia espacial.

  • Ganancias de Rendimiento:

    • Anclaje Temporal: Video-ORA-9B alcanzó un mIoU de 61.8, 63.6 y 72.5 en los tres benchmarks de TimeLens, superando al especialista temporal TimeLens2-8B y a modelos propietarios como GPT-5 y Gemini-3-Pro.
    • Seguimiento Visual: En GOT-10k, Video-ORA-9B logró un Solapamiento Promedio (AO) de 78.2, superando al mejor modelo de código abierto anterior (OneThinker-8B) por 5.2 puntos.
    • Segmentación: Logró puntuaciones líderes en RefCOCO (cIoU 79.4) y MeViS (J&F 61.3).
    • Inteligencia Espacial: En VSI-Bench, Video-ORA-9B obtuvo 73.1, superando a GPT-5 (55.0) y Gemini-3-Pro (55.1).
    • Video QA: Ocupó el primer lugar entre los modelos de código abierto en cinco de los siete benchmarks de Video QA.
  • Escalabilidad y Eficiencia:

    • Escalado del Modelo: Video-ORA mejora respecto a su backbone en todas las escalas (0.8B, 2B, 4B, 9B), con ganancias promedio macro que aumentan con el tamaño del modelo.
    • Escalado de Datos: OraRL superó a GRPO y SFT en presupuestos de datos de hasta 100k prompts.
    • Latencia de Inferencia: Sin CoT, la latencia de extremo a extremo mediana de Video-ORA-9B en videos de 10 minutos se redujo de 29.0s (backbone con CoT) a 24.3s.

Significancia y Reclamaciones

El artículo afirma que OraRL establece la "anotación-como-rollout" como un principio de aprendizaje por refuerzo eficiente y escalable para la percepción de video unificada. Los autores argumentan que:

  • La precisión de grano fino en la percepción de video está determinada principalmente por el post-entrenamiento alineado con la tarea y no solo por la escala del modelo.
  • La integración directa del oráculo, cuando se maneja correctamente (mediante ventajas desacopladas), proporciona un objetivo positivo confiable que supera la escasez de rollouts on-policy de alta calidad.
  • El razonamiento CoT no es necesario para estas tareas; la supervisión directa del oráculo produce mayor precisión y eficiencia.
  • El método es generalizable a través de diferentes familias de backbones (Qwen3-VL, Qwen3.5) y tipos de tareas (localización, seguimiento, QA, razonamiento espacial).

Los autores señalan limitaciones, específicamente que la formulación actual asume que las anotaciones pueden ser serializadas como rollouts oráculo válidos y evaluadas por recompensas escalares, y que no se ha evaluado el comportamiento bajo supervisión ambigua o ruidosa. También reconocen que, si bien Video-ORA lidera en muchas comparaciones de código abierto, algunas tareas complejas de razonamiento espacial aún están por detrás de los modelos propietarios más fuertes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →