OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
Este artículo presenta OmegaUse-OfficeVal, un nuevo referente que comprende 100 tareas de largo horizonte de suites de oficina con fundamentación económica (tiempo de trabajo humano y precio de la tarea) para evaluar agentes de LLM, revelando que, si bien los modelos actuales son significativamente más baratos y rápidos que los humanos, todavía no logran alcanzar la calidad de nivel humano en la completitud de las tareas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde tu computadora no solo espera a que hagas clic en los botones, sino que realmente hace el trabajo por ti. Este es el sueño de los "agentes de IA": programas inteligentes que pueden leer tus instrucciones, abrir tus archivos y terminar un trabajo, de forma muy similar a un pasante digital. Durante un tiempo, estos agentes han sido excelentes para trucos cortos y simples, como escribir un único correo electrónico o resumir un artículo corto. Pero la verdadera prueba de su poder es si pueden manejar toda una jornada de trabajo de oficina: tomar un informe desordenado, reformatearlo, añadir gráficos y guardarlo perfectamente, todo sin confundirse o romper el archivo. La gran pregunta que se hacen los investigadores es: ¿Pueden estos trabajadores digitales hacer realmente el trabajo, y vale la pena el dinero en comparación con contratar a un humano real?
Presentamos OmegaUse-OfficeVal, una nueva "boleta de calificaciones" diseñada por investigadores de Baidu para probar exactamente esto. No se limitaron a inventar tareas falsas y fáciles; construyeron un banco de pruebas utilizando 100 desafíos de la oficina del mundo real, como arreglar una hoja de cálculo rota o convertir un borrador tosco en una presentación pulida. Lo que hace especial a esta prueba es que le adjuntaron un "precio" a cada una de las tareas. Midieron exactamente cuánto tiempo le tomó a un humano hacerlo y estimaron cuánto costaría pagarle a alguien para hacerlo. Luego, dejaron que varios de los modelos de IA más inteligentes del mundo intentaran resolver estos mismos acertijos. ¿Los resultados? Los agentes de IA son increíblemente rápidos y baratos —a menudo terminando en minutos por centavos— pero todavía cometen demasiados errores como para ser confiables para el producto final. Aunque están mejorando, aún no han alcanzado el nivel de un trabajador junior humano confiable.
La Configuración: Un Circuito de Obstáculos Digitales
Para entender lo que hicieron los investigadores, piensa en la oficina como un taller gigante y desordenado. En el pasado, probar la IA era como pedirle que apilara unos pocos bloques. Si uno se caía, fallaba. Pero el trabajo de oficina real es más parecido a hornear un pastel complejo desde cero: tienes que reunir los ingredientes (archivos), seguir una receta (instrucciones) y, si quemas el glaseado, todo el pastel se arruina.
Los investigadores crearon un conjunto de datos llamado OmegaUse-OfficeVal que contiene 100 de estas tareas de "hornear pasteles". Estas no eran simples solicitudes de "escribe un poema". Eran trabajos largos y de múltiples pasos que involucraban documentos de Word, diapositivas de PowerPoint y hojas de cálculo de Excel. Algunas tareas tomaron a los humanos un promedio de 2.32 horas completarlas. ¡Eso es mucho tiempo para que una computadora mantenga su enfoque!
Lo que hace que este banco de pruebas sea único es su "fundamentación económica". Los investigadores no solo preguntaron: "¿Terminó la IA la tarea?". Preguntaron: "¿Cuánto valor creó?". Para hacer esto, rastrearon dos cosas para cada tarea:
- Tiempo de Trabajo Humano: Cuánto tiempo le tomó a una persona real hacerlo.
- Proxi de Precio de la Tarea: Una estimación aproximada de cuánto costaría esa tarea si contrataras a un profesional independiente para hacerla (oscilando entre aproximadamente 29.22 por tarea).
Esto les permitió comparar a la IA no solo en velocidad, sino en si realmente estaba ahorrando dinero o solo cometiendo errores baratos.
La Prueba: IA contra el Pasante Humano
Los investigadores enfrentaron a varios modelos de IA de primer nivel contra una "línea base humana". Esta línea base no era un CEO o un genio; era un trabajador junior o pasante calificado. Los humanos recibieron las mismas instrucciones y archivos que la IA y se les pidió que realizaran el trabajo.
Para calificar los resultados, los investigadores no se limitaron a que un humano mirara el archivo final y dijera: "¡Se ve bien!". Eso es demasiado lento y subjetivo. En su lugar, escribieron verificadores basados en código. Imagina un robot inspector que revisa automáticamente el archivo final. Abre el documento, verifica si la página de portada está ahí, cuenta si los gráficos tienen el tamaño correcto y se asegura de que no se haya borrado texto accidentalmente. Si el archivo está roto o le falta una parte clave, el robot le otorga un cero. Esto hizo que la prueba fuera justa, rápida y repetible.
Los Resultados: Rápidos y Baratos, Pero No Perfectos
Cuando el polvo se asentó, los resultados contaron una historia clara.
La Línea Base Humana:
Los trabajadores humanos obtuvieron un promedio de 27.79 de una puntuación perfecta posible. Eran confiables. Rara vez rompían los archivos y lograban la mayoría de los detalles correctamente. Sin embargo, tomaban tiempo y dinero. En promedio, una tarea humana costó alrededor de $6.86 y tomó 2.32 horas.
Los Agentes de IA:
Los modelos de IA fueron otra historia. Eran increíblemente rápidos y baratos.
- Velocidad: La IA más rápida (DeepSeek-V4-Pro) terminó una tarea en solo 0.184 horas (unos 11 minutos).
- Costo: La IA más barata (Qwen3.7-Plus) costó solo $0.2152 por tarea. ¡Eso es menos que una taza de café!
Pero aquí está el truco: No eran muy buenos en el trabajo.
El mejor modelo de IA (GLM-5.2) solo obtuvo 17.91. Eso es significativamente menor que la puntuación humana de 27.79. Aunque la IA era más rápida y barata, cometía más errores. A menudo olvidaba añadir un índice, arruinaba el formato o creaba un archivo que no se podía abrir.
Los investigadores descubrieron que la IA tenía más dificultades con las tareas más difíciles y largas. Cuando una tarea requería que un humano trabajara durante mucho tiempo (más de 2 horas), el rendimiento de la IA caía aún más. Parece que, si bien la IA es buena para trabajos rápidos y simples, se pierde cuando la planificación de "largo alcance" se vuelve complicada.
El Veredicto: No Están Listos para el Uso Principal (Todavía)
El estudio sugiere que estamos en un "valle" del trabajo de oficina con IA. La tecnología es innegablemente útil porque es tan barata y rápida. Si necesitas un borrador aproximado o un resumen rápido, una IA es una herramienta fantástica. Pero si necesitas un documento profesional y pulido listo para enviar a un cliente, la IA aún no está a la altura.
Los autores descartaron explícitamente la idea de que la IA ya haya resuelto el trabajo de oficina. Demostraron que, si bien la IA es "sustancialmente más barata y rápida", "aún no se ha acercado a la calidad de entrega de nivel humano". La brecha entre un trabajador humano y un agente de IA sigue siendo amplia cuando se trata de la calidad final del producto.
Sin embargo, el artículo es optimista sobre el futuro. Al crear esta prueba rigurosa con datos económicos reales, los investigadores han construido una hoja de ruta. Saben exactamente dónde está fallando la IA (tareas largas, formato complejo) y ahora pueden trabajar para solucionar esos problemas específicos. Por ahora, la mejor estrategia parece ser una asociación: dejar que la IA haga el trabajo pesado y los borradores rápidos, pero mantener a un humano en el proceso para revisar el producto final y corregir los errores. El sueño del "trabajo por vibra" (vibe working), donde la IA simplemente se encarga de todo el trabajo, es todavía un trabajo en progreso, pero el viaje ha comenzado oficialmente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.