← Últimos artículos
🤖 AI

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

Este artículo presenta PROBE, un nuevo referente que descompone la proactividad en la búsqueda, identificación y resolución de problemas no especificados para evaluar agentes de LLM, revelando que incluso los modelos de vanguardia como GPT-5 y Claude Opus-4.1 tienen dificultades para lograr un alto rendimiento autónomo con una puntuación máxima de solo el 40%.

Autores originales: Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: De "Esperar Órdenes" a "Anticipar Necesidades"

Imagina que tienes un asistente personal muy inteligente y superrápido. Actualmente, la mayoría de estos asistentes son como tomadores de pedidos en un restaurante. Tienes que mirar el menú, decidir qué quieres y decir: "Quiero la hamburguesa". El asistente entonces va y trae la hamburguesa. Son reactivos; solo se mueven cuando tú se lo dices.

Los autores de este artículo quieren ver si podemos construir asistentes que sean más como un mayordomo atento. Un buen mayordomo te observa, nota que estás mirando tu reloj y suspirando, y dice: "Veo que su reunión es en 10 minutos y aún no ha preparado su presentación. Ya la he puesto en su maleta y he pedido un coche". Este es un comportamiento proactivo.

El artículo plantea la pregunta: ¿Pueden los agentes de IA actuales hacer esto realmente? ¿Pueden mirar una pila desordenada de tus correos electrónicos, calendario y documentos, determinar qué está saliendo mal sin que se lo digas, y arreglarlo?

El Problema: La Prueba de la "Aguja en un Pajar"

Para probar esto, los investigadores se dieron cuenta de que las pruebas existentes eran demasiado fáciles. Eran como pedirle al asistente que encuentre un calcetín rojo en un cajón pequeño. La vida real es más difícil; es como encontrar un calcetín rojo en un almacén lleno de ropa, donde el calcetín podría estar mencionado en una nota de hace tres semanas, mezclado entre mil otras notas sobre planes para el almuerzo y el clima.

Para resolver esto, construyeron una nueva prueba llamada PROBE (Resolución Proactiva de Cuellos de Botella).

Cómo funciona PROBE:

  1. La Configuración: Crearon 1,000 "jornadas laborales" falsas para 235 personas diferentes (como un contador sénior o un gerente de proyectos). Cada persona falsa tiene un enorme "almacén de datos" digital que contiene cientos de correos electrónicos, invitaciones de calendario y archivos de texto.
  2. El Problema Oculto: En cada escenario, ocultaron un problema específico (un "cuello de botella"). Por ejemplo, a un informe crítico le falta una firma, o se incumplió un plazo porque un archivo estaba en el formato incorrecto.
  3. La Trampa: El problema no es obvio. La evidencia está dispersa en 5 o 6 correos electrónicos y eventos de calendario diferentes. También hay cientos de documentos "distractores" (como correos sobre el almuerzo o el clima) diseñados para confundir a la IA.
  4. El Objetivo: El agente de IA debe:
    • Buscar: Escudriñar el pajar para encontrar las pistas relevantes.
    • Identificar: Determinar exactamente cuál es el problema (por ejemplo, "el formato del archivo es incorrecto, no el plazo").
    • Actuar: Elegir la única acción correcta para solucionarlo de una lista de 25 posibles acciones (por ejemplo, "Enviar un correo electrónico al equipo de TI" frente a "Reprogramar la reunión").

Los Resultados: El "Techo del 40%"

Los investigadores probaron los modelos de IA más inteligentes disponibles (como GPT-5 y Claude Opus) y varios "marcos de agentes" (diferentes formas de programar la forma de pensar de la IA).

El resultado impactante: Incluso los mejores modelos de IA tuvieron éxito solo el 40% de las veces.

Piénsalo como un examen médico. Si los médicos más inteligentes del mundo solo respondieran correctamente el 40% de las preguntas en un examen diseñado para ver si pueden diagnosticar a un paciente sin que se les diga qué es lo que está mal, sabemos que nos queda un largo camino por recorrer.

¿Dónde fallaron?

  • La Búsqueda: A menudo pasaban por alto las pistas. Miraban los correos equivocados o ignoraban el calendario.
  • El Diagnóstico: Incluso cuando encontraban las pistas, a menudo adivinaban el problema equivocado. Podían pensar que el problema era "demasiado trabajo" cuando en realidad era "un archivo faltante".
  • La Solución: A veces conocían el problema pero elegían la solución incorrecta (como llamar a la policía cuando solo necesitabas a un fontanero).

La Comparación Humana

Los investigadores también pidieron a humanos que realizaran la prueba.

  • El Engaño: ¡La prueba era demasiado larga para que un humano la leyera de una sola vez (tenía 100,000 palabras!)!
  • La Solución: Entregaron a los humanos una "versión corta" donde resumían las partes importantes.
  • El Resultado: Los humanos lo hicieron mucho mejor en la versión corta (alrededor del 70-80% de éxito). Esto demostró que la dificultad principal no era la lógica en sí, sino la longitud y complejidad de la información. La IA tiene dificultades para mantener el rastro de todo en una pila masiva de datos.

La Conclusión: Seguimos siendo "Reactivos"

El artículo concluye que, si bien la IA está mejorando en el seguimiento de instrucciones, todavía es pésima en anticipar problemas por sí misma.

  • La Brecha: Existe una gran brecha entre "hacer lo que se te ordena" y "descubrir qué es lo que hay que hacer".
  • El Futuro: Para llegar al nivel de "mayordomo", la IA necesita mejorar mucho en la lectura de documentos largos, la conexión de puntos a través del tiempo y la comprensión de las relaciones humanas (como saber a quién enviar un correo y a quién ignorar).

En resumen: Hemos construido motores muy inteligentes, pero todavía necesitan a un humano que los dirija y les diga hacia dónde mirar. Todavía no están listos para conducir el coche por su cuenta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →