← Últimos artículos
💻 computer science

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

Este artículo presenta una evaluación rigurosa para evaluar agentes de investigación profunda en tareas de consultoría experta mediante prompts redactados por expertos con trampas cognitivas, revelando que los modelos de vanguardia actuales (Claude, o3 y Gemini) alcanzan tasas de aceptación uniformemente bajas debido a modos de fallo distintos como alucinaciones, errores aritméticos y razonamiento inconsistente.

Autores originales: Tanmay Asthana, Aman Saksena, Divyansh Sahu

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tanmay Asthana, Aman Saksena, Divyansh Sahu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando un equipo de asistentes de investigación superinteligentes para realizar un trabajo complejo: deben leer una pila desordenada de documentos, encontrar números específicos, realizar algunos cálculos matemáticos y redactar un informe profesional para un director ejecutivo. Si cometen incluso un error en un número, el director ejecutivo podría cometer un error de mil millones de dólares.

Este artículo es como una entrevista de trabajo rigurosa para tres de los asistentes de investigación de IA más avanzados disponibles hoy en día (Claude, o3 y Gemini). Los autores, de Deccan AI Research, querían ver si estas IAs podían realmente realizar el tipo de trabajo detallado y de alto riesgo que hacen los consultores de gestión humanos, o si solo eran buenas respondiendo preguntas triviales simples.

Aquí está el desglose de su experimento, utilizando analogías simples:

1. La Prueba: Un "Camino de Obstáculos Lleno de Trampas"

La mayoría de las pruebas anteriores para la IA eran como preguntar: "¿Cuál es la capital de Francia?" (Recuerdo factual). Esta prueba fue diferente. Los autores crearon 42 escenarios complejos basados en trabajo de consultoría real.

Piensa en estos escenarios como un curso de supervivencia diseñado para engañar a las IAs. Los documentos entregados a las IAs contenían "trampas cognitivas", tales como:

  • La Trampa de la "Cebada Roja": Un archivo lleno de 100 páginas de texto, pero la respuesta está oculta en una pequeña nota al pie en la página 98.
  • La Trampa de la "Contradicción": Un documento dice que el precio es 50 dólares, pero una nota al pie dice: "A menos que sea martes, entonces es 60 dólares".
  • La Trampa de la "Matemática": Pedir un promedio, pero el método correcto requiere un promedio ponderado (como calcular tu calificación basándote en cuánto vale cada examen).

Si una IA solo repasaba la superficie o adivinaba, fallaría.

2. Los Jueces: Dos Capas de Calificación

El artículo no dejó que una IA calificara a la IA. Utilizaron un sistema de puntuación de dos capas:

  • Capa 1: Los Verificadores Robot: Son verificaciones automáticas estrictas. ¿La IA produjo el archivo? ¿Usó los números correctos? ¿Citó las fuentes correctas? Si la IA cometió un solo error en un paso matemático, esta capa la marcó como un fracaso.
  • Capa 2: El Experto Humano (El Especialista): Un consultor humano real (con más de 15 años de experiencia) leyó el informe de la IA. Lo calificó en cinco aspectos:
    • Integridad de los Datos: ¿Inventaste hechos?
    • Rigor Analítico: ¿Es tu lógica sólida?
    • Relevancia: ¿Respondiste la pregunta o solo divagaste?
    • Ejecución: ¿Realizaste los cálculos matemáticos correctamente?
    • Formato: ¿Es el informe profesional y utilizable?

La puntuación final combinó estas dos capas. Para "aprobar" la prueba, una IA tuvo que superar tanto a los verificadores robot como impresionar al experto humano.

3. Los Resultados: La "Tasa de Aprobación" Fue Sorprendentemente Baja

De un total de 126 intentos (42 tareas × 3 IAs), casi nadie aprobó.

  • Gemini aprobó aproximadamente el 21% de las veces.
  • Claude y o3 aprobaron solo el 9.5% de las veces.

En otras palabras, si contratas a una de estas IAs para un proyecto de consultoría de un millón de dólares, hay una probabilidad del 79% al 90% de que fallen al entregar un informe utilizable y preciso.

4. Cómo Falló Cada IA (Las "Personalidades" del Fracaso)

El artículo encontró que cada IA falló de una manera única, como tres estudiantes diferentes tomando un examen difícil:

  • Claude (El Fabricante Confiado):

    • Fortaleza: Fue el mejor creando realmente los archivos finales (como documentos de Word o hojas de Excel). Rara vez olvidó entregar la tarea.
    • Debilidad: Fue el más propenso a mentir. Cuando no podía encontrar una respuesta en los documentos, inventaba con confianza un número o una fuente para llenar el vacío. Fue como un estudiante que escribió un ensayo hermoso pero inventó todos los hechos.
  • o3 (El Matemático Cuidadoso pero Torpe):

    • Fortaleza: Cuando razonaba, su lógica a menudo era la más limpia.
    • Debilidad: Frecuentemente omitía secciones requeridas del informe o cometía errores matemáticos en cascada. Si fallaba en el paso uno, el resto de las matemáticas era incorrecto. También a veces ignoraba las instrucciones para crear un archivo y simplemente daba una respuesta de texto en su lugar.
  • Gemini (La Montaña Rusa):

    • Fortaleza: Cuando funcionaba, a menudo era la mejor. Tuvo el mayor número de puntuaciones "perfectas".
    • Debilidad: Fue poco fiable. Tuvo el mayor número de puntuaciones "cero". A veces se bloqueaba, se negaba a responder o producía un archivo con código roto. Fue como un estudiante que o bien aprobaba el examen con nota máxima o fallaba tan mal que ni siquiera se presentaba.

5. La Gran Conclusión

El artículo concluye que, aunque estos agentes de IA son impresionantes, aún no están listos para trabajo de alto riesgo y nivel de toma de decisiones.

Si un consultor humano comete un error, usualmente es un pequeño desliz. Si estas IAs cometen un error, a menudo es un fracaso catastrófico: podrían inventar una fuente falsa, bloquear el software o pasar por alto una nota al pie crítica que cambia toda la decisión empresarial.

Los autores están preparando actualmente una segunda versión, más grande, de esta prueba, pero por ahora, el mensaje es claro: No confíes en estas IAs con las decisiones de mil millones de dólares de tu empresa todavía. Aún están aprendiendo a ser investigadores confiables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →