← Últimos artículos
🤖 machine learning

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

Este artículo presenta OSWorld-Human, un conjunto de datos de referencia anotado manualmente que revela que los agentes actuales de uso informático sufren de latencia e ineficiencia prohibitivas, principalmente debido a llamadas excesivas al modelo para la planificación y la reflexión, lo que resulta en que realicen entre 2,7 y 4,3 veces más pasos que los humanos para completar tareas.

Autores originales: Reyna Abhyankar, Qi Qi, Yiying Zhang

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Reyna Abhyankar, Qi Qi, Yiying Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un asistente personal muy inteligente, pero increíblemente lento, para realizar una tarea sencilla en tu computadora, como cambiar el tamaño de la fuente en un documento. Esperas que tome 30 segundos. En cambio, tu asistente tarda 12 minutos. ¿Por qué?

Este artículo, OSWorld-Human, investiga exactamente ese problema. Examina a los "Agentes de Uso de Computadora" (programas de IA que controlan tu mouse y teclado) y se pregunta: "¿Por qué son tan lentos y cómo podemos hacerlos más rápidos?"

Aquí tienes el desglose de sus hallazgos utilizando analogías simples.

1. El Problema: El Asistente "Que Piensa Demasiado"

Los investigadores descubrieron que, aunque estos agentes de IA están mejorando en hacer el trabajo (precisión), son terribles en qué tan rápido lo hacen (eficiencia).

  • El Humano vs. El Robot: Un experto humano puede cambiar el espaciado de líneas en un documento en menos de 30 segundos. El agente de IA tarda 12 minutos.
  • El Cuello de Botella: El retraso no se debe a que la IA haga clic en el mouse lentamente. Se debe a que la IA se detiene a pensar constantemente.
    • La Analogía: Imagina que conduces hacia la tienda de comestibles. Un conductor humano simplemente conduce. Este conductor de IA se detiene en cada intersección para llamar a un consultor superinteligente por teléfono y preguntar: "¿Es este el giro correcto? ¿Debería girar a la izquierda? ¿Giré correctamente a la izquierda? ¿Qué pasa con la siguiente curva?"
    • La Realidad: La IA llama a un "cerebro" masivo (un Modelo de Lenguaje Grande) para planificar el siguiente movimiento, juzgar si el movimiento funcionó y reflexionar sobre lo sucedido. Estas llamadas telefónicas son lo que más tiempo consume. De hecho, solo los pasos de "planificación" y "juicio" ocupan aproximadamente el 75% al 96% del tiempo total.

2. La Investigación: Desglosando los Pasos

Los investigadores observaron a dos agentes de IA populares (Agente S2 y GTA1) intentando resolver 39 tareas informáticas diferentes. Desglosaron cada segundo del proceso.

  • El Impuesto del "Pensamiento": Cada vez que la IA da un paso, debe enviar un mensaje enorme a su cerebro. A medida que la tarea se vuelve más larga, el mensaje se hace más grande porque debe incluir el historial de todo lo que hizo antes.
    • Analogía: Es como escribir una entrada de diario. El día 1, escribes una oración. El día 50, tienes que reescribir todo el libro desde el día 1 solo para agregar una nueva oración. Esto hace que los pasos posteriores tomen 3 veces más tiempo que los pasos iniciales.
  • El Bucle del "Giro Incorrecto": A veces, la IA sabe qué hacer (por ejemplo, "Haz clic en el botón Abrir"), pero no puede encontrar dónde hacer clic en la pantalla. Hace clic en el lugar equivocado, se da cuenta de que está mal y lo intenta de nuevo.
    • El Costo: Este "atascarse" ocurre con frecuencia. En un caso, una IA intentó abrir una carpeta y quedó atrapada en un bucle durante 27 minutos, desperdiciando 8,47 dólares en costos de computación, solo porque no pudo encontrar el lugar correcto en la pantalla.

3. La Solución: La "Referencia Humana" (OSWorld-Human)

Para demostrar lo ineficientes que son estos robots, los investigadores crearon una nueva referencia llamada OSWorld-Human.

  • ¿Qué es? Revisaron manualmente las 369 tareas y anotaron la ruta más corta y lógica que un humano tomaría para terminarlas.
  • El Truco de "Agrupar": Notaron que los humanos a menudo hacen varias cosas de una sola vez sin detenerse a pensar.
    • Analogía: Un humano ve una caja de texto, escribe un nombre y presiona "Enter" en un movimiento fluido. La IA, sin embargo, se detiene después de ver la caja, llama a su cerebro para planificar la escritura, se detiene de nuevo para planificar presionar "Enter" y llama a su cerebro nuevamente.
    • El Hallazgo: Los investigadores descubrieron que muchas acciones podrían "agruparse" juntas. Si la IA pudiera hacer tres clics en un solo "pensamiento", ahorraría cantidades masivas de tiempo.

4. El Veredicto: Los Robots Están Desperdiciando Pasos

Los investigadores probaron 16 agentes de IA diferentes contra su nueva "Referencia Humana".

  • El Resultado: Incluso los agentes de IA mejores tomaron de 2,7 a 4,3 veces más pasos que los necesarios para un humano para terminar la misma tarea.
  • La Puntuación: Crearon una nueva puntuación llamada Puntuación de Eficiencia Ponderada (WES).
    • Si una IA hace el trabajo pero tarda 4 veces más de lo necesario, su puntuación cae drásticamente.
    • La IA superior en la tabla de clasificación, que parecía excelente en las pruebas antiguas, solo obtuvo 15,6% en esta nueva prueba de eficiencia. Esto significa que está haciendo mucha labor innecesaria.

Resumen

El artículo concluye que los agentes informáticos actuales de IA son como estudiantes brillantes pero torpes. Saben la respuesta, pero pasan tanto tiempo levantando la mano, esperando al profesor y releyendo sus notas que nunca terminan el examen a tiempo.

Para solucionar esto, el artículo sugiere tres cosas principales:

  1. Dejar de pensar demasiado: Reducir la cantidad de veces que la IA llama a su "cerebro" para planificar y juzgar.
  2. Agrupar acciones: Permitir que la IA realice múltiples pasos (como escribir y presionar enter) en un solo pensamiento.
  3. Mejorar en encontrar cosas: Mejorar la capacidad de la IA para ver exactamente dónde hacer clic para que no se quede atrapada en bucles.

El objetivo no es solo hacer a la IA más inteligente, sino hacerla más rápida y práctica para el uso en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →