← Últimos artículos
💬 NLP

Video-Based Reward Modeling for Computer-Use Agents

Este trabajo presenta ExeVRM, un modelo de recompensa basado en videos de ejecución que, gracias a un nuevo dataset de 53k triplets y técnicas de poda de tokens, evalúa con mayor precisión y escalabilidad si los agentes informáticos cumplen las instrucciones del usuario en comparación con modelos propietarios avanzados.

Autores originales: Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

Publicado 2026-03-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot muy inteligente a usar una computadora por ti. Le dices: "Abre mi correo, busca el mensaje de mi jefe y guárdalo en una carpeta". El robot intenta hacerlo, hace clic, escribe, abre ventanas... pero a veces se equivoca.

El problema es: ¿Cómo le dices al robot si lo hizo bien o mal?

Hasta ahora, los expertos tenían que revisar cada paso que daba el robot, como un profesor corrigiendo un examen hoja por hoja. Esto es lento, aburrido y no se puede hacer con miles de robots a la vez.

Este paper presenta una solución brillante: En lugar de leer el "diario de pensamientos" del robot, simplemente le mostramos un video de lo que hizo en la pantalla.

Aquí tienes la explicación sencilla, con analogías:

1. El Problema: El "Examen" es muy difícil

Imagina que el robot es un estudiante. Antes, para calificarlo, los profesores tenían que leer sus apuntes internos (qué pensó, qué código escribió). Pero cada robot piensa de forma distinta.

  • La solución de este paper: Olvidemos lo que pensó. Solo miremos la pantalla. Si el robot abrió el correo y guardó el archivo, ¡está bien! No importa si pensó "¿Dónde está el botón?" o "¡Uy, casi me equivoco!". Lo único que importa es el resultado visual.

2. El Video: Una película de 1 segundo por fotograma

El equipo creó una base de datos gigante (llamada ExeVR-53k) con 53,000 videos.

  • La analogía: Imagina que tomas una foto de la pantalla del ordenador cada vez que el robot hace algo importante. Luego, pones esas fotos en una película rápida.
  • El reto: Estas películas son muy largas y aburridas. La mayoría de la pantalla (la barra de tareas, el fondo de escritorio) nunca cambia. Es como ver una película donde el fondo es estático durante 2 horas y solo pasa algo interesante en una esquina durante 5 segundos.

3. El Truco Mágico: "Podar" el video (Spatiotemporal Token Pruning)

Para que la computadora no se maree viendo estas películas largas, los autores inventaron un método para recortar el video automáticamente.

  • Analogía del Podador de Jardín (Espacial): Imagina que tienes un jardín (la pantalla). Hay muchas plantas que son idénticas y no importan (el césped, los árboles de fondo). El podador STP corta todo lo que es igual y aburrido, dejando solo las flores que cambian de color (los botones que se presionan, el cursor que se mueve).
  • Analogía del Cronómetro (Temporal): Ahora imagina que la película muestra el mismo botón durante 10 segundos sin que nadie lo toque. El podador TTP dice: "¡Basta! No necesitamos ver ese botón estático 10 veces". Lo elimina y solo deja los momentos donde algo cambia.
  • Resultado: De una película de 1 hora, pasamos a un resumen de 5 minutos que solo muestra los momentos cruciales. ¡Y todo sigue siendo claro!

4. Crear "Malos Ejemplos" (Traducción Adversaria)

Para enseñar al robot a detectar errores, necesitas ejemplos de cosas que salieron mal. Pero en internet, casi todos los videos son de robots haciendo las cosas bien.

  • La analogía: Es como enseñar a un niño a conducir mostrándole solo videos de conductores perfectos. Nunca aprenderá a frenar ante un peligro.
  • La solución: Usaron una IA muy inteligente para inventar instrucciones falsas.
    • Ejemplo: El robot hizo un video perfecto abriendo un archivo de Excel. La IA inventa una instrucción que dice: "Por favor, abre un archivo de PDF".
    • ¡Boom! Ahora tenemos un "falso positivo". El video es real, pero la instrucción no coincide. Esto le enseña al modelo a decir: "¡Espera! Este video no cumple con esa orden específica".

5. El Resultado: El "Juez de Video"

Crearon un modelo llamado ExeVRM. Es como un juez muy experto que solo ve el video y la orden.

  • Su superpoder: No solo dice "Bien" o "Mal". Puede decirte exactamente en qué segundo el robot se equivocó.
    • Ejemplo: "El robot hizo todo bien hasta el segundo 15, donde hizo clic en el botón 'Cancelar' en lugar de 'Guardar'. Ahí falló".
  • Rendimiento: Este modelo es tan bueno que supera a gigantes como GPT-5 o Gemini en tareas de evaluar si un robot de computadora hizo su trabajo correctamente.

En resumen

Este trabajo es como crear un entrenador deportivo que no necesita hablar con el atleta. Solo mira el video del partido, ignora los momentos aburridos donde nadie hace nada, se enfoca en las jugadas clave y te dice exactamente dónde se cometió el error y si el equipo ganó o perdió.

Gracias a esto, podemos entrenar y evaluar a miles de robots de computadora de forma rápida, barata y sin necesidad de que los humanos revisen cada detalle manualmente. ¡Es un gran paso para que los robots nos ayuden de verdad en el trabajo!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →