← Últimos artículos
🤖 AI

EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks

Este artículo presenta EuroExec, un referente de 413 tareas ejecutivas europeas del mundo real evaluadas por expertos humanos, revelando que incluso los modelos de lenguaje extensos de frontera más fuertes quedan significativamente por debajo de los estándares profesionales humanos, resolviendo solo el 56,9% de las tareas y siendo superados consistentemente por las referencias escritas por expertos.

Autores originales: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

Publicado 2026-08-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un nuevo asistente para ayudar a dirigir una empresa masiva y compleja. No solo necesitas a alguien que pueda recitar datos de un libro de texto; necesitas a un estratega que pueda observar un problema real y desordenado, comprender las reglas locales y redactar un plan brillante que realmente funcione. Este es el mundo de los "Modelos de Lenguaje de Gran Escala" (LLM, por sus siglas en inglés): programas informáticos superinteligentes entrenados con vastas cantidades de texto que pueden escribir historias, responder preguntas y resolver acertijos. Durante un tiempo, hemos estado probando estos asistentes de IA con cuestionarios sencillos de opción múltiple, como pedirles que elijan la respuesta correcta de una lista de cuatro. Pero en el mundo real, los problemas rara vez vienen con una lista de opciones. Son abiertos, desordenados y requieren un juicio profundo. La gran pregunta que todos se hacen es: ¿Pueden estos "genios" de la IA manejar realmente las decisiones de alto nivel y abiertas que los ejecutivos reales toman cada día, o son simplemente muy buenos tomando exámenes?

Un equipo de investigadores de Sovrano AI decidió averiguarlo creando un desafío nuevo y ultra difícil llamado EuroExec. En lugar de un simple cuestionario, construyeron un examen masivo compuesto por 413 preguntas complejas y de formato largo basadas en escenarios empresariales reales en Europa. No se limitaron a pedirle a la IA que adivinara; contrataron a 47 expertos humanos —personas con décadas de experiencia en finanzas, marketing, negocios y gestión de productos— para redactar las preguntas y calificar las respuestas. Estos expertos crearon una lista de requisitos estrictos para cada respuesta, actuando como un jefe riguroso que revisa el trabajo de un empleado junior. Luego, pidieron a seis de los modelos de IA más avanzados del mundo que resolvieran estos problemas y compararon el desempeño de la IA frente a los expertos humanos.

Los resultados fueron un golpe de realidad. Incluso los modelos de IA más inteligentes del mundo tuvieron dificultades para seguir el ritmo de los profesionales. El mejor modelo de IA logró "resolver" solo alrededor del 56.9% de las tareas, lo que significa que no cumplió con el estándar profesional en casi la mitad de las preguntas. En contraste, los expertos humanos, cuando se les pidió que escribieran sus propias respuestas ideales, resolvieron los problemas con una tasa casi perfecta del 92.4%. Cuando los investigadores pidieron a los expertos humanos que clasificaran las respuestas a ciegas, prefirieron las respuestas escritas por humanos sobre las respuestas de la IA el 74% de las veces.

El estudio también analizó cómo falló la IA. Si bien los modelos fueron decentes al redactar textos bien estructurados y comunicarse con claridad, fracasaron cuando se trató de razonamiento y lógica reales. A menudo pasaban por alto las reglas locales específicas de los mercados europeos o no lograban crear planes realistas y accionables. Curiosamente, los investigadores intentaron utilizar otros programas de IA para calificar las respuestas automáticamente, con la esperanza de ahorrar tiempo y dinero. Sin embargo, estos "jueces de IA" fueron poco fiables; tendían a sobreestimar el desempeño de los mejores modelos y pasaban por alto los matices sutiles que los expertos humanos detectaban.

Al final, el artículo sugiere que, si bien la IA se está volviendo increíblemente buena generando texto, aún no está lista para reemplazar a los expertos humanos en la toma de decisiones de alto nivel. La "Tasa de Resolución" del mejor modelo de IA apenas superó el 50% en las preguntas más fáciles, e incluso los modelos más capaces estaban lejos del estándar profesional requerido para el trabajo ejecutivo. Los investigadores concluyen que, para este tipo de tareas complejas y del mundo real, el juicio humano sigue siendo el estándar de oro, y que aún no podemos confiar en mediciones automáticas o jueces de IA para decirnos si una computadora realmente está "pensando" como un experto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →