← Últimos artículos
💬 NLP

iOSWorld: A Benchmark for Personally Intelligent Phone Agents

Este artículo presenta iOSWorld, el primer benchmark de simulador nativo de iOS interactivo que cuenta con 26 aplicaciones interconectadas y una identidad de usuario persistente para evaluar agentes telefónicos personalmente inteligentes, revelando que si bien el acceso privilegiado a visión+XML mejora significativamente el rendimiento de los modelos de frontera, los agentes actuales aún tienen dificultades con las tareas complejas de múltiples aplicaciones y personalización.

Autores originales: Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente digital que vive dentro de tu teléfono. En este momento, la mayoría de estos asistentes son como turistas con amnesia. Pueden seguir una instrucción única perfectamente —como "enciende la linterna"— pero si les pides que "planifiquen mi semana basándose en mis hábitos habituales, mi saldo bancario y mis mensajes de texto", se pierden. No saben quién eres, no recuerdan tu historial y no pueden conectar los puntos entre tus diferentes aplicaciones.

El artículo "iOSWorld" presenta una nueva forma de probar si el asistente de un teléfono es realmente lo suficientemente inteligente como para ser tu ayudante personal. Aquí está el desglose en términos sencillos:

1. El Problema: El "Lienzo en Blanco" vs. La "Vida Real"

Las pruebas actuales para los asistentes de teléfonos son como darle a alguien un cuaderno en blanco y pedirle que escriba una historia. Pueden escribir una frase, pero no tienen un trasfondo.

  • La Realidad: Tu teléfono está lleno de una vida entera de datos: tus transacciones bancarias, tus planes de viaje, los nombres de tus amigos y tus restaurantes favoritos. Un asistente verdaderamente útil necesita conocer todo esto.
  • La Brecha: Nadie tenía una forma de probar si una IA podía navegar realmente en esta vida real, desordenada y conectada. La mayoría de las pruebas solo analizaban tareas aisladas en teléfonos Android, ignorando la forma única en que funcionan los iPhones (iOS).

2. La Solución: Construyendo "iOSWorld"

Los investigadores construyeron un videojuego gigante e interactivo que imita a un iPhone real.

  • El Personaje: Crearon a una persona ficticia llamada Jordan Avery, de 31 años, que vive en San Francisco.
  • El Mundo: Construyeron 26 aplicaciones personalizadas para Jordan (como un Uber falso, un banco falso, un correo electrónico falso y una aplicación de entrega de comida falsa).
  • La Magia: Estas aplicaciones están conectadas entre sí. Si Jordan pide un burrito en la aplicación "QuickBite", la aplicación "MyBank" muestra automáticamente un cargo, y la aplicación "Mail" recibe un recibo. Si Jordan reserva un vuelo en "SkyTrip", la aplicación "Notes" tiene un recordatorio al respecto.
  • El Objetivo: Les dieron a la IA 133 misiones diferentes. Algunas eran simples (pedir un café), pero muchas eran complejas (revisar tu saldo bancario, encontrar el recibo de ese café y decirle a tu jefe que llegarás tarde basándote en tu calendario).

3. La Prueba: Dos Formas de Mirar el Teléfono

Para ver qué tan inteligente es la IA, la probaron en dos "modos" diferentes, como si le dieras a un humano un examen con o sin una hoja de trucos:

  • Modo A: Solo Visión (La prueba "Ciega")
    La IA solo ve capturas de pantalla de la pantalla, tal como lo hace un humano. Tiene que adivinar dónde están los botones y entender qué está pasando mirando las imágenes.

    • Analogía: Como intentar resolver un rompecabezas mirando solo una foto borrosa de este.
  • Modo B: Visión + XML (La prueba de "Súper Vista")
    La IA ve las captoras de pantalla más una lista de texto oculta (llamada árbol de accesibilidad) que le dice exactamente qué es cada botón y dónde está.

    • Analogía: Como mirar el rompecabezas con un resaltador brillante que señala cada pieza y dice: "Esta es la pieza del cielo, esta es la pieza del árbol".

4. Los Resultados: ¿Quién Pasó la Prueba?

Probaron los modelos de IA más inteligentes disponibles (los modelos "frontera") y un modelo de código abierto.

  • Las Buenas Noticias: Cuando la IA tenía "Súper Vista" (Visión + XML), los modelos más inteligentes mejoraron mucho. Finalmente podían navegar por las aplicaciones correctamente. Un modelo (Opus) pasó de completar correctamente el 26% de las tareas al 52%.
  • Las Malas Noticias: Incluso con la mejor configuración, la IA todavía tuvo dificultades con las tareas más difíciles.
    • Tareas de una sola aplicación: Lo hicieron muy bien (82% de éxito).
    • Tareas de múltiples aplicaciones: Tuvieron dificultades (37% de éxito). Conectar los puntos entre 3 o 4 aplicaciones diferentes era demasiado difícil.
    • Tareas de memoria: Estuvieron bien (54% de éxito), pero a menudo olvidaban los detalles.
  • El "Problema de los Modelos Pequeños": Los modelos de IA más pequeños y económicos en realidad empeoraron cuando se les dio la información de "Súper Vista". Fue como darle a un estudiante demasiada información; se abrumaron y se confundieron.

5. ¿Por qué Fallaron?

Los investigadores encontraron tres razones principales por las que la IA se quedó estancada:

  1. Quedarse sin Tiempo: Se le dieron a la IA 50 pasos para completar una tarea. En trabajos complejos, usaba todos los 50 pasos solo intentando averiguar dónde hacer clic, dejando sin tiempo para terminar el trabajo.
  2. Perderse: La IA abría la aplicación incorrecta o se quedaba atrapada en un bucle, haciendo clic en el mismo botón una y otra vez.
  3. El Problema de las "Coordenadas": En el modo "Solo Visión", la IA a menudo adivinaba el lugar equivero en la pantalla para tocar, como intentar atrapar una pelota en la oscuridad.

La Conclusión

iOSWorld es la primera vez que probamos los asistentes de teléfonos en un entorno realista y conectado que imita la vida digital de un humano real.

El artículo concluye que, si bien la IA está mejorando en su capacidad de mirar una pantalla y hacer clic en botones, aún no es lo suficientemente inteligente como para ser un asistente verdaderamente "personalmente inteligente" que comprenda tu historia, tu dinero y tus relaciones a través de diferentes aplicaciones. Necesita mejorar en planificación, memoria y conexión de puntos antes de que realmente pueda reemplazar a un asistente humano.

¿La buena noticia? Los investigadores han publicado todo su código y el "juego" de forma gratuita, para que otros científicos puedan intentar construir mejores asistentes utilizando este nuevo patio de juegos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →