← Últimos artículos
🤖 AI

Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining

Este artículo presenta un estudio diagnóstico que demuestra que, si bien la minería de trayectorias de interacción puede generar bibliotecas de habilidades legibles y de alta pureza para agentes de uso de computadoras, el enfoque actual no logra traducir estos conocimientos en mejoras de políticas transdominios fiables debido a limitaciones en la detección de límites, la representación de segmentos y el modelado de recompensa fuera de línea.

Autores originales: Yuexing Hao, Xiaomin Li

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yuexing Hao, Xiaomin Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robot que puede usar una computadora igual que un humano: haciendo clic, escribiendo, desplazándose y copiando. Para hacer a este robot más inteligente, a menudo le damos una "hoja de trucos" llamada SKILL.md. Piensa en esta hoja de trucos como un libro de recetas. En lugar de decirle al robot "haz clic aquí, luego escribe allá", el libro dice: "Aquí se explica cómo 'Enviar un correo electrónico' o 'Guardar un archivo'". Estas son habilidades preempaquetadas que facilitan la comprensión y la corrección del trabajo del robot.

Normalmente, los humanos tienen que escribir estos libros de recetas a mano. Pero, ¿qué pasaría si pudiéramos enseñar al robot a escribir su propio libro de recetas simplemente observando cómo las personas usan las computadoras? Eso es exactamente lo que este artículo intenta hacer.

El Experimento: Enseñando a un Robot a Escribir su Propio Libro de Cocina

Los investigadores construyeron una máquina de tres pasos para convertir los datos brutos de uso de la computadora en un libro de recetas:

  1. Cortar el Video: Imagina observar un video largo de alguien trabajando. La máquina intenta encontrar los "cambios de escena". Si la persona deja de escribir repentinamente y comienza a desplazarse, la máquina corta el video ahí, pensando: "Bien, eso fue una tarea; ahora están comenzando una nueva".
  2. Agrupar las Escenas: La máquina toma todos estos pequeños clips de video e intenta agrupar los similares. Si 50 clips involucran "copiar y pegar", los pone en un cubo etiquetado como "Transferencia de Datos". Luego crea una "huella digital" digital para cada cubo para que el robot pueda reconocerlos más tarde.
  3. Entrenar al Robot: Finalmente, le enseñan al robot una nueva política (un conjunto de reglas) utilizando estos cubos. El objetivo es ver si el robot puede mirar una nueva tarea y decir: "Primero, necesito realizar la habilidad de 'Buscar', luego la habilidad de 'Copiar'", y realmente hacerlo mejor que antes.

Los Resultados: Un Mix de Éxitos y Fracasos

Los resultados fueron un poco como encontrar un mapa del tesoro que conduce a una isla hermosa, pero el bote que construiste para llegar allí no navega muy bien.

La Buena Noticia: El Mapa es Legible
En el conjunto de datos específico que utilizaron para construir el mapa (llamado "IW"), la máquina hizo un gran trabajo organizando los datos. Cinco de los ocho "cubos" eran muy puros. Por ejemplo, un cubo estaba compuesto casi en su totalidad por acciones de "Edición de Documentos", y otro era puramente de "Envío de Mensajes".

  • Analogía: Es como si le pidieras a un robot que clasificara una pila de ropa mezclada, y él lograra poner todos los calcetines en una cesta y todas las camisas en otra. La clasificación fue clara y fácil de leer para los humanos.

La Mala Noticia: El Bote No Navega
Aquí está la parte difícil: el hecho de que el robot haya clasificado bien la ropa no significa que sepa cómo usarla.

  • El Problema de la Transferencia: Cuando intentaron usar estas habilidades clasificadas en nuevas tareas (diferentes sitios web o diferentes tipos de trabajo), el robot no mejoró. De hecho, a veces se volvió ligeramente peor.
  • La Sorpresa de la "Frecuencia": Los investigadores probaron al robot contra una base de referencia muy simple y tonta: un "Prior de Frecuencia". Esto es solo una regla que dice: "Lo que sea que se haya usado con más frecuencia antes, haz eso de nuevo". Sorprendentemente, esta regla tonta venció a las complejas habilidades aprendidas por el robot.
    • Analogía: Imagina que estás tratando de aprender un nuevo idioma. Estudias un complejo libro de gramática (las habilidades del robot), pero sigues cometiendo errores. Mientras tanto, tu amigo simplemente repite la palabra más común que escuchó ayer ("Hola"), y en este test específico, él se comunica mejor que tú.

¿Por qué falló?
El artículo sugiere algunas razones por las cuales el "libro de recetas" del robot no ayudó a cocinar mejor:

  1. Perdió el Orden: La máquina agrupó las acciones basándose en qué eran (clics, escritura), pero olvidó el orden. Sabía que "clic" y "pegar" estaban en el mismo cubo, pero no recordó que debes hacer "clic" antes de pegar. Es como tener una bolsa de ingredientes para un pastel pero olvidar el orden en el que se deben mezclar.
  2. Cortes Erróneos: La máquina a veces cortaba el "video" en los lugares equivocados. Podría pensar que una pausa larga en la escritura era una nueva habilidad, cuando era solo la misma habilidad continuando.
  3. El Sistema de Recompensa: El sistema utilizado para entrenar al robot (llamado GRPO) no era lo suficientemente bueno para dar retroalimentación. Era como un entrenador que da elogios vagos en lugar de correcciones específicas.

La Conclusión Final

Este artículo es un estudio diagnóstico, lo que significa que trata más sobre descubrir por qué algo no funcionó perfectamente que sobre reclamar una gran victoria.

  • Lo que funcionó: Podemos extraer automáticamente datos de uso de computadora para crear una lista de habilidades organizada y legible que los humanos puedan entender.
  • Lo que no funcionó: Convertir esa lista en un robot que realmente pueda usar esas habilidades para resolver nuevos problemas es mucho más difícil. El método actual no superó a una estrategia simple de "adivinar la acción más común".

Los autores concluyen que, si bien tenemos una buena forma de ver la estructura de cómo trabajan las personas, aún no hemos descubierto cómo convertir esa estructura en un conjunto de habilidades confiable y transferible para los robots. El "libro de recetas" existe, pero el robot aún necesita más práctica antes de poder cocinar una comida por su cuenta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →