← Últimos artículos
🤖 AI

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

El artículo presenta SeekJudge, un marco de recompensa práctico basado en modelos que utiliza cuatro agentes especializados por roles y un modelo base de 9B destilado que iguala o supera la supervisión basada en reglas en el entrenamiento de agentes de uso de computadoras, ofreciendo al mismo tiempo juicios a nivel de paso, menores costos y escalabilidad para tareas de largo horizonte.

Autores originales: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

Publicado 2026-07-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a navegar por el mundo de un videojuego, pero en lugar de presionar botones en un mando, el robot tiene que hacer clic, escribir y desplazarse en una pantalla de ordenador real tal como lo haría un humano. Este es el mundo de los "agentes de uso de computadora". Durante mucho tiempo, los científicos han intentado enseñar a estos robots mostrándoles un objetivo —como "reservar un hotel"— y luego comprobando si tuvieron éxito. La forma antigua de comprobarlo era como usar una lista de verificación rígida: si el robot hacía clic en el botón correcto en el momento adecuado, recibía un punto; si hacía clic en el incorrecto, recibía cero. Pero las computadoras son desordenadas y cambian todo el tiempo. Una lista de verificación podría decir "fallaste" porque el robot hizo clic en un botón que se veía ligeramente diferente al de la lista, aunque el robot en realidad había terminado el trabajo perfectamente. Es como si un profesor reprobara a un estudiante por escribir la palabra "color" en lugar de "colour", aunque el ensayo fuera brillante.

Para solucionar esto, los investigadores comenzaron a utilizar modelos de IA para actuar como jueces, con la esperanza de que pudieran entender el espí spirit de la tarea en lugar de solo las reglas estrictas. Sin embargo, estos jueces de IA a menudo se confunden cuando tienen que mirar una película completa de las acciones del robot a la vez. Es como intentar encontrar un error tipográfico específico en una novela de 500 páginas leyendo todo el libro en un segundo; los detalles importantes se pierden en el ruido. La gran pregunta era: ¿Cómo construimos un juez que sea lo suficientemente inteligente para entender los objetivos humanos, lo suficientemente barato para ejecutarse miles de veces mientras el robot aprende, y lo suficientemente rápido para manejar historias largas y complicadas sin que le dé un dolor de cabeza?


Entra SeekJudge, un nuevo marco de trabajo que actúa como un equipo de cuatro detectives especializados trabajando juntos para resolver un misterio, en lugar de un solo detective sobrecargado intentando hacerlo todo a la vez. Los investigadores descubrieron que cuando obligas a una IA a mirar demasiadas capturas de pantalla de una pantalla de ordenador al mismo tiempo, esta comienza a tener alucinaciones o a perder los detalles más importantes. Es como si le pidieras a alguien que identifique a un sospechoso en una multitud de 100 personas; podrían distraerse con el sombrero brillante de un extraño y perder de vista al criminal real. Pero si les mostraras solo una foto del sospechoso, lo detectarían al instante.

SeekJudge resuelve esto dividiendo el trabajo. Primero, dos "exploradores" (llamados los agentes Condense y Ground) revisan rápidamente el largo viaje del robot y escriben un resumen corto y fácil de leer de lo que sucedió, paso a paso. Luego, un "detective" (el agente Seek) lee este resumen y decide: "Hmm, necesito ver la foto del paso 42 para estar seguro". Entonces llama a un cuarto agente, el agente Analyze, para que mire solo esa captura de pantalla específica y responda una pregunta precisa sobre ella. Este ciclo de ida y vuelta continúa hasta que el detective está lo suficientemente seguro como para dar un veredicto final.

El artículo muestra que este enfoque de "buscar y analizar" cambia las reglas del juego. Cuando lo probaron, SeekJudge fue el primer juez basado en IA que se desempeñó tan bien como, o incluso mejor que, los antiguos verificadores de reglas rígidas al ayudar a los robots a aprender nuevas tareas. De hecho, cuando se utilizó para entrenar a un robot, los robots aprendieron más rápido y tuvieron más éxito con SeekJudge que con los métodos tradicionales.

Lo que es realmente genial es cuán eficiente es esto. Debido a que la IA solo mira una imagen a la vez en lugar de una pila entera, no necesita una computadora masiva y súper costosa para funcionar. Los investigadores descubrieron que su sistema cuesta una fracción mínima de lo que cuestan otros jueces de IA—cientos de veces más barato que usar un modelo gigante de código cerrado. Es como la diferencia entre contratar a un equipo de expertos locales que cada uno mira un indicio por unos pocos dólares, frente a contratar a un detective celebridad que cobra una fortuna por leer todo el expediente del caso a la vez.

El equipo también construyó un nuevo "campo de entrenamiento" llamado CUAStepBench, que es una colección de 278 tareas de computadora diferentes donde los humanos han etiquetado cuidadosamente cada uno de los pasos del viaje del robot. Esto ayudó a entrenar a su equipo de "detectives" para que fuera increíblemente agudo. Demostraron que al descomponer el problema en encontrar el momento adecuado (localización) y luego leer los detalles (extracción), podían manejar tareas mucho más largas y complejas que los métodos anteriores.

En resumen, SeekJudge no intenta ser un ojo superinteligente que todo lo ve; en su lugar, actúa como un equipo inteligente y eficiente que sabe exactamente cuándo hacer zoom en la pista más importante. Esto hace posible entrenar a robots que usan computadoras en el mundo real, donde las tareas son largas, las pantallas cambian y los libros de reglas estrictos simplemente no funcionan. El artículo sugiere que este enfoque podría ser la clave para crear asistentes de IA que realmente puedan ayudarnos con nuestras tareas informáticas diarias, desde reservar vuelos hasta organizar archivos, sin necesidad de una supercomputadora para calificar sus tareas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →