← Últimos artículos
🤖 AI

Understanding User Experiences of Computer Use Agents: Design Space and Opportunities for Building Agent UX Prototypes

Este artículo aborda la experiencia de usuario poco estudiada de los agentes de uso de computadoras mediante el desarrollo de una taxonomía de diseño, la identificación de requisitos de prototipado a través de estudios de expertos y la introducción de "AgentUXlab", una herramienta que permite a los desarrolladores diseñar y evaluar diversos enfoques de interacción de agentes.

Autores originales: Jenny T. Liang, Titus Barik, Jeffrey Nichols, Eldon Schoop, Ruijia Cheng

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jenny T. Liang, Titus Barik, Jeffrey Nichols, Eldon Schoop, Ruijia Cheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente digital superinteligente que no solo responde preguntas, sino que realmente hace cosas por ti. Puede hacer clic en botones, desplazarse por sitios web, rellenar formularios e incluso comprarte un café, todo ello observando tu pantalla y comprendiendo lo que quieres. Esto no es magia; es un nuevo tipo de programa informático llamado "agente de uso de computadora". Piensa en ello como un mayordomo robot que vive dentro de tu navegador. Durante mucho tiempo, los científicos han estado enseñando a estos robots cómo ser más inteligentes y rápidos, centrándose en sus cerebros (el código y los modelos). Pero la mayoría ha olvidado preguntarse: "¿Cómo se siente tener un mayordomo robot?". Al igual que no querrías un asistente humano que nunca te dice lo que está haciendo, o uno que agarra tu billetera sin preguntar, necesitas un asistente robot que sea fácil de confiar, fácil de detener y fácil de entender. Este artículo profundiza en la "personalidad" y el "comportamiento" de estos ayudantes digitales, determinando cómo diseñarlos para que no nos asusten o cometan errores que no podamos corregir.

Los investigadores detrás de este estudio, liderados por Jenny T. Liang y su equipo, se dieron cuenta de que, si bien estamos construyendo estos agentes poderosos, no tenemos realmente un libro de reglas sobre cómo deberían actuar frente a nosotros. Para solucionar esto, emprendieron una aventura de tres partes para mapear el "espacio de diseño" (todas las formas posibles en que un agente puede comportarse) y para construir una herramienta especial que ayude a los diseñadores a probar esos comportamientos.

Primero, actuaron como detectives, analizando 11 agentes informáticos diferentes que ya existen en el mundo. Entrevistaron a 8 expertos que construyen estos agentes y luego probaron un agente falso con 20 personas comunes. A partir de esto, construyeron un "menú" gigante de 21 cosas diferentes en las que los diseñadores deben pensar. Los agruparon en cuatro categorías principales:

  1. La consulta del usuario: Cómo le hablas al agente. ¿Le das un gran comando, o mantienes una charla de ida y vuelta? ¿Usas tu voz, texto o imágenes?
  2. Explicabilidad: Cómo el agente muestra su trabajo. ¿Te dice en qué está haciendo clic? ¿Te muestra sus "pensamientos" antes de actuar?
  3. Control del usuario: Cómo puedes detener o cambiar al agente. ¿Puedes pausarlo? ¿Puedes tomar el control y realizar la tarea tú mismo si se queda atascado?
  4. Modelo mental: Lo que tú crees que el agente puede hacer. ¿Hace el agente que quede claro cuáles son sus límites para que no esperes que haga cosas imposibles?

Una vez que tuvieron este menú, se hicieron una segunda pregunta: "¿Cómo construimos y probamos realmente estas ideas?". Diseñar un agente es difícil porque normalmente necesitas ser un programador de computadoras para hacer que haga algo. Así que, el equipo entrevistó a 12 personas más (incluyendo expertos y usuarios comunes) para determinar qué tipo de herramienta facilitaría esto. Descubrieron que los diseñadores necesitan cinco actividades principales: definir lo que el agente puede hacer, decidir qué información mostrar, diseñar cómo te habla, ejecutar el agente para ver qué sucede y arreglarlo cuando se rompe.

Para resolver esto, construyeron una herramienta genial llamada AgentUXlab. Imagina un nivel de un videojuego donde tú eres el diseñador. En lugar de escribir código complejo, arrastras y sueltas bloques (como "Hacer clic aquí", "Esperar al usuario" o "Mostrar un plan") para crear un diagrama de flujo de cómo debería comportarse tu agente. Luego puedes presionar "Play" y ver a tu agente intentar pedir un café en un sitio web real, directamente en tu navegador. Si el agente intenta comprar algo que no querías, puedes presionar "Pausa", tomar el control y arreglarlo. Esta herramienta permite a los diseñadores experimentar con diferentes "personalidades" para sus agentes, como hacer uno que sea muy hablador y pida permiso, frente a uno que sea súper rápido y haga todo silenciosamente.

Finalmente, probaron esta herramienta con 14 personas que tenían diferentes niveles de experiencia, desde ingenieros de software hasta personas que nunca habían usado un agente. Descubrieron que la herramienta funcionaba bien, pero también reveló algunas partes complicadas. Por ejemplo, los "diagramas de flujo" visuales (los bloques) eran geniales para ver el panorama general, pero algunas personas los encontraron confusos de escribir. Por otro lado, simplemente escribir instrucciones en lenguaje natural era flexible pero a veces demasiado vago. La mayor sorpresa fue que las personas que diseñan el agente necesitaban ver mucha más información (como los pensamientos internos del agente y los detalles de la pantalla) para depurarlo, mientras que los usuarios del agente probablemente no querrían ver todo ese ruido.

El artículo sugiere que, para que estos agentes sean seguros y útiles, necesitamos herramientas que permitan a los diseñadores cambiar fácilmente entre estos diferentes estilos de interacción. No pretende haberlo resuelto todo —todavía hay grandes preguntas sobre cómo asegurar que los usuarios comprendan realmente de qué es capaz el agente— pero proporciona un mapa sólido y un nuevo patio de juegos para cualquiera que intente construir la próxima generación de asistentes de IA útiles y amigables para los humanos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →