← Últimos artículos
💬 NLP

MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

Autores originales: Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Publicado 2026-06-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un asistente personal para que te ayude a gestionar tu vida. No le darías un escritorio nuevo y vacío, sin archivos, sin fotos y sin memoria de quién eres, ¿verdad? Esperarías que supiera cuál es tu cafetería favorita, el saldo de tu cuenta bancaria, tus próximas vacaciones y el cumpleaños de tu amigo.

El Problema: La prueba del "Escritorio Vacío"
Actualmente, las pruebas que utilizamos para ver si las computadoras de IA son lo suficientemente inteligentes como para ser asistentes personales son como darle ese escritorio vacío. Se le pide a la IA que realice tareas en una computadora que no tiene historial, ni cuentas iniciadas, ni datos personales. Es como pedirle a alguien que "pida tu cena habitual" cuando no tiene idea de quién eres o qué es lo que sueles pedir.

El artículo argumenta que esto es una brecha enorme. Los verdaderos asistentes personales necesitan navegar por una vida digital que es desordenada, interconectada y llena de historia personal.

La Solución: MYPCBENCH (La simulación de "Michael Scott")
Para solucionar esto, los investigadores construyeron una nueva prueba llamada MYPCBENCH. En lugar de un escritorio vacío, crearon una vida digital totalmente poblada para un personaje específico: Michael Scott de la serie de televisión The Office.

Piensa en esto como construir un mundo de videojuego masivo e interactivo donde:

  • El Personaje: Michael Scott es el "usuario".
  • Los Datos: La computadora está precargada con 1,812 transacciones bancarias, 2,398 correos electrónicos, 679 eventos de calendario y miles de mensajes de chat.
  • Las Aplicaciones: Hay 17 sitios web "falsos" (como un banco falso, una aerolínea falsa, una aplicación de entrega de comida falsa, etc.) que están todos conectados. Si Michael reserva un vuelo en la aerolínea falsa, un cargo aparece automáticamente en su estado de cuenta bancario falso y un correo de confirmación llega a su bandeja de entrada falsa.
  • El Objetivo: La IA tiene que actuar como el asistente de Michael, navegando estas aplicaciones para resolver problemas de la vida real usando su historial específico.

La Prueba: 184 Desafíos del Mundo Real
Los investigadores crearon 184 tareas específicas basadas en peticiones que la gente hace realmente a los asistentes de IA. Estas tareas varían desde lo simple hasta lo increíblemente complejo:

  • Simple: "Envía $100 a Pam vía Zelle". (La IA tiene que verificar primero si Pam está en los contactos).
  • Complejo: "Tengo viajes programados a Jamaica y Barbados. ¿Puedo permitirme ambos basándome en mi saldo actual de la tarjeta de crédito?". (La IA tiene que mirar la aplicación del banco, la aplicación de viajes y hacer matemáticas).
  • Búsqueda de Patrones: "¿Qué suelo dejar de propina en las entregas de comida?". (La IA tiene que escanear cientos de pedidos pasados para encontrar un patrón).

Los Resultados: La IA lucha con la "Vida Real"
Los investigadores probaron seis de los modelos de IA más inteligentes disponibles (de empresas como Anthropic, OpenAI y otras) en esta prueba. Esto es lo que sucedió:

  1. El Mejor Ejecutor: El modelo superior (Claude Opus 4.6) logró resolver aproximadamente el 55% de las tareas perfectamente. Eso suena bien, pero recuerda, esta es la mejor IA disponible. Aun así, falló casi la mitad de las veces.
  2. El Problema de las "Multi-Aplicaciones": La IA se volvió significativamente peor a medida que las tareas requerían el uso de más de una aplicación. Cuando una tarea requería que la IA saltara entre 7 o más aplicaciones diferentes (como revisar el correo electrónico, luego un calendario, luego un banco, luego un sitio de viajes), la tasa de éxito para la mayoría de los modelos cayó al 0%.
  3. El Problema de la "Memoria Larga": La IA tuvo dificultades para mantener el rastro de cadenas largas de acciones. Si una tarea requería 50 pasos, la IA a menudo se perdía o se rendía.
  4. Diferentes Estilos de Fallo:
    • Algunas IA (como GPT) tendían a rendirse demasiado pronto, diciendo "he terminado" antes de haber completado realmente el trabajo.
    • Algunas IA (como Qwen) empezaron a inventar cosas, creando hechos sobre Michael Scott que no estaban en los datos.
    • La mejor IA (Claude) a veces tomaba atajos usando la línea de comandos de la computadora (como un hacker) en lugar de hacer clic a través de los menús como una persona normal.

La Conclusión
El artículo concluye que, si bien la IA está mejorando en el uso de computadoras, todavía no está lista para ser un verdadero asistente "personal". Puede manejar una tarea limpia y simple, pero se desmorona cuando tiene que navegar por una vida digital del mundo real, desordenada, interconectada y con historia personal.

Los investigadores han puesto su entorno de prueba (la computadora de "Michael Scott") a disposición del público para que otros científicos puedan intentar construir mejores asistentes que realmente puedan manejar la complejidad de la vida digital de un ser humano real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →