← Últimos artículos
🤖 AI

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile es un marco de código abierto que sintetiza instrucciones de tareas y trayectorias de agentes móviles de alta calidad mediante un pipeline escalable y una estrategia de cambio de políticas, logrando un rendimiento competitivo en AndroidWorld y superando a los enfoques existentes con datos abiertos.

Autores originales: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

Publicado 2026-04-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres enseñarle a un robot a usar tu teléfono móvil para ti. No es tan fácil como darle una lista de comandos; el robot tiene que entender la pantalla, saber qué botón tocar y, lo más difícil, saber qué hacer cuando se equivoca y se queda "atascado".

Hasta ahora, las empresas más grandes (como Google o Apple) tenían los "secretos" de cómo entrenar a estos robots: usaban millones de ejemplos de personas reales usando sus teléfonos. Pero como esos datos eran secretos, la comunidad científica no podía aprender de ellos ni mejorar sus propios robots.

Aquí es donde entra OpenMobile. Es como si un grupo de científicos decidiera: "¡Vamos a crear nuestra propia escuela de entrenamiento para robots, pero de forma abierta y transparente!".

Aquí te explico cómo funciona, usando analogías sencillas:

1. El Problema: El Robot que solo sabe seguir el camino perfecto

La mayoría de los robots actuales se entrenan viendo a un "experto" (un humano o un modelo muy inteligente) hacer las tareas perfectamente.

  • La analogía: Imagina que enseñas a un niño a andar en bicicleta mostrándole solo a un ciclista olímpico. El niño aprende a pedalear perfecto, pero si el niño se cae o choca con una piedra, no sabe cómo levantarse ni cómo recuperar el equilibrio. Solo sabe lo que es "perfecto". Cuando se enfrenta a un camino real lleno de baches, se rinde.

2. La Solución de OpenMobile: Dos Grandes Innovaciones

OpenMobile soluciona esto con dos trucos inteligentes:

A. El "Mapa Mental" Global (Síntesis de Tareas)

En lugar de darle al robot una sola tarea a la vez (como "abre la app de fotos"), OpenMobile le permite al robot explorar todo el teléfono primero, como un turista que recorre una ciudad nueva.

  • La analogía: Imagina que quieres que un guía turístico cree un itinerario para un viaje.
    • El método viejo: Le das una foto de una calle y le dices "inventa un tour basado en esta foto". El guía solo ve lo que hay en esa foto.
    • El método OpenMobile: Primero, el guía recorre toda la ciudad, toma notas de todos los parques, museos y restaurantes, y crea un mapa mental gigante. Luego, cuando necesita inventar un tour, mira su mapa mental completo, combina cosas que están lejos entre sí (ej. "un café cerca del museo") y crea instrucciones complejas y creativas que nadie había pensado antes.
    • Resultado: El robot aprende a entender todo lo que el teléfono puede hacer, no solo lo que vio en un solo momento.

B. El Entrenador que Interviene (Estrategia de Cambio de Política)

Esta es la parte más genial para enseñar a no equivocarse. OpenMobile no deja que el robot practique solo, ni que solo vea al experto.

  • La analogía: Imagina un partido de fútbol donde un jugador novato (el robot) juega contra un entrenador experto.
    • El método viejo: El entrenador hace todo el partido. El novato solo mira.
    • El método OpenMobile: El novato juega. De repente, el novato va a hacer un pase que va a fallar (se equivoca). En ese momento exacto, el entrenador interviene, le quita el balón, le muestra cómo hacer el pase correcto, y luego le devuelve el balón al novato para que continúe.
    • Resultado: El robot aprende dos cosas vitales: 1) Cómo hacer las cosas bien, y 2) Cómo levantarse cuando se cae. Aprende a corregir sus propios errores, algo que los robots anteriores no sabían hacer.

3. Los Resultados: ¿Funciona de verdad?

Los científicos probaron sus robots en tres "campeonatos" (pruebas) muy difíciles donde el teléfono tiene que hacer cosas reales.

  • Antes: Los robots de código abierto (gratuitos) ganaban solo el 30% de las veces.
  • Ahora: Con OpenMobile, sus robots ganan entre el 51% y el 64% de las veces.
  • La comparación: ¡Se han puesto a la altura de los robots secretos de las grandes empresas! Y lo mejor es que no "hacen trampa" memorizando las preguntas del examen; han aprendido a entender el teléfono en general.

En resumen

OpenMobile es como abrir una academia de entrenamiento gratuita para robots móviles. En lugar de solo mostrarles el camino perfecto, les permite explorar el mundo, crear mapas mentales complejos y, lo más importante, les enseña a levantarse y arreglar sus propios errores cuando se equivocan. Gracias a esto, los robots móviles son ahora mucho más inteligentes, útiles y capaces de ayudarnos en nuestra vida diaria.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →