← Últimos artículos
🤖 machine learning

SERUM: State Extraction and Refinement for User Modeling

El artículo presenta SERUM, un marco de múltiples pasadas que aprovecha la anotación jerárquica de VLM y el refinamiento iterativo para extraer automáticamente modelos de comportamiento de usuario estructurados e interpretables a partir de videos de pantalla egocéntricos no estructurados, mejorando significamente la precisión predictiva y la coherencia de las etiquetas en comparación con los métodos de una sola pasada.

Autores originales: Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang

Publicado 2026-08-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un robot cómo ser un compañero útil. Para lograrlo, el robot necesita entender no solo qué estás haciendo en este momento, sino por qué lo haces y qué es probable que hagas después. Este es el mundo del "modelado de usuario", una rama de la inteligencia artificial donde las computadoras intentan construir un mapa mental del comportamiento humano. Por lo general, para construir estos mapas, los científicos tienen que observar manualmente horas de video y anotar cada una de las acciones, como un juego de "Veo, Veo" muy lento y muy costoso. Pero, ¿qué pasaría si pudiéramos simplemente entregarle al robot un video bruto de la jornada de alguien y dejar que descubra los patrones por sí mismo? Esa es la gran pregunta que aborda este artículo: ¿Podemos convertir metraje de video desordenado y no organizado en una historia clara y estructurada de la intención humana sin que un humano tenga que escribir una sola etiqueta?

El artículo presenta un nuevo sistema llamado SERUM (Extracción y Refinamiento de Estados para el Modelado de Usuario). Piensa en SERUM como un detective muy paciente y superinteligente que observa un video no solo una vez, sino muchas veces, mejorando su trabajo con cada visualización.

Al principio, si le pides a una IA estándar que describa un video, podría decir: "La persona sostiene un taladro", luego "La persona mira una caja", luego "La persona presiona un botón". Ve las acciones, pero pierde de vista el panorama general. No sabe que todas esas pequeñas acciones son en realidad parte de un gran objetivo: "Reparar el aire acondicionado". Peor aún, si la IA observa el video fotograma a fotograma sin recordar lo que sucedió hace cinco segundos, podría confundirse, llamando a la misma acción "limpiar vegetales" en un segundo y "enjuagar productos" en el siguiente. Esto se llama "alucinación" y "conflación temporal": básicamente, la IA está inventando cosas o mezclando la línea de tiempo porque carece de contexto.

SERUM soluciona esto utilizando una ingeniosa estrategia de "pasadas múltiples". Imagina que estás tratando de resolver un rompecabezas complejo. En tu primer intento, podrías simplemente colocar las piezas de los bordes y adivinar qué es la imagen. En el segundo intento, miras la imagen que has comenzado a construir y te das cuenta de: "¡Ah, esa pieza no es una nube del cielo; es parte de una montaña!". Ajustas tu suposición. SERUM hace exactamente esto con el video. Ejecuta el video varias veces.

  1. Paso 1: Observa los fotogramas y da una descripción aproximada de las acciones (por ejemplo, "escribiendo en el teclado").
  2. Paso 2: Observa esas acciones e intenta adivinar la intención o el objetivo (por ejemplo, "escribir código").
  3. Paso 3: Regresa a las acciones, pero esta vez, utiliza la nueva suposición de "intención" para refinar la descripción de la acción. Tal vez "escribir en el teclado" no era solo escribir; era "depurar código".
  4. Paso 4: Refina la intención nuevamente basándose en las etiquetas de acción más nítidas.

El sistema sigue recorriendo el video, alternando entre adivinar acciones y adivinar objetivos, utilizando la "memoria" de la ronda anterior para corregir errores. Los autores descubrieron que después de aproximadamente 8 rondas de este vaivén, el sistema deja de cambiar de opinión. Ellos llaman esto "equilibrio esquemático". Es como si el rompecabezas finalmente encajara en su lugar, y la IA se hubiera asentado en un vocabulario estable y consistente para describir lo que está sucediendo.

Pero hay un paso más. Debido a que la IA es creativa, podría usar diferentes palabras para la misma cosa, como "reparar el AC" y "reparar el HVAC". SERUM tiene una fase final de "limpieza" donde utiliza una herramienta matemática para darse cuenta de que estas son la misma cosa y las fusiona en una etiqueta clara. Esto reduce la lista de estados posibles y hace que el modelo final sea mucho más preciso.

El equipo probó esto en 61 videos que cubrían cuatro mundos diferentes: programación, cocina, actividades físicas y vida cotidiana. Descubrieron que los modelos finales de SERUM eran mucho mejores para predecir qué haría una persona a continuación en comparación con las estrategias simples de adivinación. Por ejemplo, en los videos de programación, el sistema acertó la siguiente acción el 76.4% de las veces después de la normalización, mientras que una estrategia simple de "adivinar la cosa más común" solo lo acertó aproximadamente el 47%.

Expertos humanos también revisaron los resultados. Ellos coincidieron en que las etiquetas de la ronda final de SERUM fueron correctas el 88.3% de las veces, y prefirieron estas etiquetas refinadas sobre las primeras suposiciones desordenadas el 82.8% de las veces. Esto sugiere que el proceso de "bucle" realmente ayuda a la IA a entender la historia detrás del video, no solo los fotogramas individuales.

En resumen, SERUM demuestra que no necesitamos que los humanos etiqueten manualmente cada segundo de un video para entender el comportamiento humano. Al permitir que una IA vuelva a ver y repiense el metraje una y otra vez, podemos construir un mapa estructurado y confiable de lo que las personas están haciendo y por qué, abriendo la puerta a futuros asistentes de IA que puedan comprender verdaderamente nuestros flujos de trabajo y ayudarnos de manera proactiva.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →