← Últimos artículos
💬 NLP

APEX-Agents

Este artículo presenta APEX-Agents, un benchmark de código abierto que evalúa la capacidad de ocho agentes de IA para ejecutar tareas complejas y de largo alcance en entornos laborales realistas, donde el modelo Gemini 3 Flash (Thinking=High) obtuvo el mejor resultado con un 24,0% de éxito.

Autores originales: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Rob
Publicado 2026-02-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que acabamos de construir el "Olimpo de las Pruebas de Trabajo" para la Inteligencia Artificial. Este es el resumen de ese documento, explicado como si estuviéramos tomando un café.

🌍 ¿Qué es APEX–Agents? (El Gran Simulador)

Piensa en APEX–Agents como un videojuego de simulación de vida real, pero en lugar de que juegues tú, juegan los robots (agentes de IA).

Hasta ahora, probábamos a las IAs con preguntas de examen tipo "¿Cuál es la capital de Francia?" o "Resuelve esta ecuación matemática". Eso es como probar a un piloto de Fórmula 1 en una pista de karting de plástico. No nos dice si realmente pueden manejar un camión de carga en una tormenta.

APEX–Agents es diferente. Es como poner a los robots en una oficina virtual real durante 5 a 10 días.

  • El escenario: Tienen que trabajar como analistas de bancos, consultores de negocios o abogados corporativos.
  • La misión: No es solo responder una pregunta. Tienen que investigar, leer cientos de documentos, abrir hojas de cálculo, enviar correos, editar presentaciones y entregar un proyecto completo listo para el cliente.
  • El entorno: Tienen acceso a las mismas herramientas que tú y yo (correo, archivos, calendario, internet simulado), pero sin poder salir a buscar información nueva en la web real (para que la prueba sea justa y repetible).

🏆 Los Participantes (Los Robots en la Arena)

El equipo de investigadores (un grupo de expertos de Mercor) creó 480 misiones diferentes. Luego, invitaron a 8 robots (modelos de IA famosos como Gemini, GPT, Claude, etc.) a intentar resolverlas.

La prueba fue dura. Imagina que le pides a un robot: "Analiza estos 50 documentos financieros, encuentra el error en la tabla, calcula el nuevo valor y envíame un correo explicándolo".

📊 Los Resultados (¿Quién ganó?)

Aquí viene la parte sorprendente. Aunque estas IAs parecen geniales en las redes sociales, en el trabajo real todavía tienen mucho que aprender.

  1. El Campeón: El robot Gemini 3 Flash fue el mejor, pero solo logró completar el 24% de las misiones perfectamente a la primera.
    • La analogía: Imagina que le das 100 tareas a un becario muy inteligente. Él hace 24 perfectamente. Las otras 76 o se le olvida algo, o hace el cálculo mal, o se pierde en el camino.
  2. El Subcampeón: GPT-5.2 estuvo muy cerca, con un 23%.
  3. El resto: Los otros robots (Claude, otros modelos de código abierto) rindieron mucho peor, muchos por debajo del 5%.

La lección: Incluso los robots más avanzados fallan en la mayoría de las tareas complejas del mundo real. No son "magos" todavía; son más bien "becarios muy rápidos pero propensos a errores".

🚧 ¿Por qué fallan? (Los Tropiezos)

Los investigadores miraron por qué los robots fallaron y encontraron tres problemas principales:

  • El bucle infinito (El "Doom Loop"): A veces, el robot se queda atascado. Imagina a un perro persiguiendo su propia cola. El robot intenta hacer algo, falla, lo intenta de nuevo, falla otra vez... y se queda así hasta que se agota el tiempo. Algunos robots (como Kimi K2) se quedaron atascados casi el 30% de las veces.
  • La falta de constancia: Si le das al robot 8 oportunidades para hacer la misma tarea, a veces lo logra en la 8ª vez (40% de éxito), pero si solo le das 1 oportunidad, falla la mayoría de las veces. Es como un arquero que a veces acierta al blanco, pero no puede repetir el tiro.
  • El coste de la energía: El robot ganador (Gemini 3 Flash) usó 5 veces más "cerebro" (tokens) que otros para lograr lo mismo. Es como si un coche de carreras consumiera 5 tanques de gasolina para llegar a la meta donde otro coche llegó con uno. Son efectivos, pero ineficientes.

💡 ¿Qué significa esto para el futuro?

El mensaje del paper es optimista pero realista:

  1. El potencial es enorme: Si logramos que estos robots sean tan fiables como un humano experto, podríamos tener un equipo de abogados, consultores y banqueros disponibles 24/7 para cualquiera. Eso cambiaría la economía mundial.
  2. Aún no estamos listos: Hoy en día, si le das a un robot una tarea compleja de oficina, es probable que necesite supervisión humana constante. No puedes simplemente decirle "hazlo" y esperar que salga perfecto.
  3. La transparencia: Lo genial de este estudio es que todo es público. Los investigadores liberaron los datos, las tareas y el código. Es como si dijeran: "Aquí están los planos del examen, aquí están las respuestas correctas y aquí está el simulador. ¡Que todos los científicos del mundo prueben sus robots!".

En resumen

APEX–Agents es como un examen de conducir en condiciones reales de tráfico, lluvia y semáforos rotos. Hasta ahora, nuestros robots de IA han aprobado el examen de "teoría" (preguntas triviales), pero en la prueba de "conducción real" (trabajo de oficina complejo), apenas la mitad de ellos logra llegar a la meta sin chocar.

¡Pero el motor se está calentando! Con cada prueba, aprenden a conducir mejor.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →