← Últimos artículos
🤖 AI

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

Este artículo introduce un marco de evaluación de múltiples turnos para agentes de investigación profunda utilizando un novedoso método de retroalimentación a nivel de proceso llamado Inferencia de Brechas de Investigación, revelando que si bien una sola ronda de retroalimentación dirigida mejora significamente la calidad del informe, los turnos subsiguientes no logran acumular las ganancias debido a que los agentes regresan en criterios previamente satisfechos, lo que indica que la mejora fiable de múltiples turnos sigue fuera del alcance de las arquitecturas actuales.

Autores originales: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has contratado a un equipo de asistentes de investigación superinteligentes (llamados Agentes de Investigación Profunda) para escribir un informe detallado sobre un tema complejo, como "La historia de la tecnología deepfake" o "La salud financiera de una empresa específica".

Normalmente, probamos a estos asistentes dándoles una pregunta, dejándoles escribir un borrador y luego calificando ese único borrador. Pero en la vida real, si recibes un borrador de un investigador humano, rara vez te limitas a aceptarlo. Le das retroalimentación como: "Omitiste algunas leyes clave" o "Tus fuentes son demasiado vagas" y le pides que lo vuelva a escribir.

Este artículo plantea la siguiente pregunta: ¿Pueden estos asistentes de IA realmente mejorar cuando se les da retroalimentación, o simplemente hacen un desastre cuando intentan corregir su propio trabajo?

Los investigadores realizaron pruebas utilizando dos formas diferentes de dar retroalimentación:

1. La prueba de "Autorreflexión" (El Editor con los ojos vendados)

En este escenario, se le dice a la IA: "Mira tu informe, encuentra tus propios errores y corrígelos". No se ofrece ayuda externa.

  • El Resultado: Fue como pedirle a un estudiante que califique su propio ensayo sin tener la hoja de respuestas del profesor. La IA se esforzó mucho, buscando más en la web y leyendo más fuentes, pero no pudo identificar qué era lo que estaba mal realmente.
  • La Analogía: Imagina que estás intentando reparar un bote con una fuga mientras llevas una venda en los ojos. Puede que golpees la madera y añadas más tablones (haciendo más trabajo), pero como no puedes ver el agujero, podrías accidentalmente golpear un agujero en un lugar diferente. ¿El resultado? El bote sigue teniendo una fuga, o tal vez tiene más fugas. La puntuación de la IA apenas cambió, o a veces empeoró.

2. La prueba de "Retroalimentación a Nivel de Proceso" (El Entrenador Estratégico)

Aquí, los investigadores no se limitaron a decir "corrige esto". Utilizaron una herramienta especial llamada RGI (Inferencia de Brechas de Investigación). Esta herramienta analizó el informe de la IA y la rúbrica de calificación para determinar cómo había fallado la IA.

En lugar de decir "Añade un dato sobre X", la retroalimentación fue más parecida a la de un entrenador diciendo: "Estás consultando el tipo de fuentes equivocado", o "Estás tratando este tema de forma demasiado general y necesitas profundizar en detalles específicos", o "Omitiste los documentos legales más importantes".

  • El Resultado: Esto funcionó de maravilla para las primeras rondas de correcciones. La IA comprendió la estrategia, volvió a la biblioteca, encontró los libros adecuados y escribió un informe mucho mejor. Sus puntuaciones subieron significamente (entre 8 y 15 puntos).
  • La Analogía: Esto es como un entrenador diciéndole a un corredor: "No te falta energía; tus zapatos son de la talla incorrecta". Una vez que la IA tuvo los zapatos adecuados (la estrategia de investigación correcta), corrió mucho más rápido y mejor.

El Problema: El problema de la "Reescritura"

Los investigadores luego le pidieron a la IA que lo hiciera de nuevo (un tercer turno). Esperaban que las puntuaciones siguieran mejorando.

  • El Resultado: Para la mayoría de los modelos de IA, la mejora se detuvo. De hecho, cuando intentaron corregir los pequeños problemas restantes, accidentalmente rompieron las partes que ya funcionaban.
  • La Analogía: Imagina a un chef que hace una sopa excelente. El entrenador dice: "Añade una pizca de sal". El chef añade la sal y queda perfecta. Pero luego el entrenador dice: "Ahora, arregla la guarnición". El chef, intentando ser perfecto, decide tirar toda la olla y empezar de cero. En el proceso de hacer una nueva olla, olvida añadir la sal que acababa de poner, o arruina las verduras que ya había logrado bien la primera vez.
  • ¿Por qué? Los modelos de IA utilizados en este estudio trabajan "reescribiendo todo el informe desde cero" cada vez. No tienen memoria de "qué estuvo bien la última vez". Por lo tanto, cuando intentan arreglar una cosa, a menudo pierden las cosas que ya habían arreglado.

La Única Excepción: El Modelo "Cuidadoso"

Un modelo de IA específico (DeepSeek-V4-Flash) se comportó de manera diferente. No tiró toda la sopa. Mantuvo la mayor parte de la buena sopa y solo añadió los nuevos ingredientes. Mejoró su puntuación nuevamente en la tercera ronda.

  • El Costo: Sin embargo, este modelo "cuidadoso" era increíblemente caro y lento. Utilizó aproximadamente 4 veces más potencia de cómputo y tardó mucho más en pensar que los demás. Fue como un chef que se niega a tirar nada y revisa meticulosamente cada ingrediente, lo que toma una eternidad y cuesta una fortuna.

La Conclusión

  1. La IA no puede arreglarse a sí misma: Si le dices a una IA "corrige tus propios errores", generalmente solo empeora las cosas o se mantiene igual porque no puede ver el panorama general.
  2. La retroalimentación estratégica funciona: Si le dices a la IA cómo investigar (por ejemplo, "busca documentos oficiales, no publicaciones de blogs"), puede escribir un informe mucho mejor.
  3. El fallo de la "Reescritura Total": Las herramientas de investigación de IA actuales son como artistas que borran todo su lienzo cada vez que quieren añadir una nueva pincelada. Esto hace que sea muy difícil mejorar un informe paso a paso sin borrar accidentalmente las partes buenas. Para lograr mejoras verdaderamente fiables y de múltiples pasos, necesitamos una IA que pueda recordar qué hizo bien y solo cambie lo que necesita ser corregido, en lugar de empezar de cero cada vez.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →