← Últimos artículos
💻 computer science

DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute

Este artículo presenta DRACULA, el primer conjunto de datos que captura la retroalimentación de usuarios expertos sobre acciones intermedias para agentes de investigación científica profunda, revelando que aprovechar el historial de selección de un usuario mejora significativamente la predicción de las acciones preferidas y destacando el desafío crítico de decidir qué acciones ejecutar en lugar de simplemente cómo ejecutarlas.

Autores originales: Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

Publicado 2026-04-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente de investigación súper inteligente (un agente de IA) que puede leer miles de artículos científicos y redactar para ti un informe largo y detallado. En el pasado, si no te gustaba el informe final, solo podías decir: «Esto está mal» o «Esto está bien». Pero eso es como decirle a un chef: «La sopa sabe mal», sin decirle si usaron demasiada sal, olvidaron las cebollas o quemaron el ajo. No sabes qué paso salió mal, así que el chef no puede realmente aprender a arreglarlo la próxima vez.

Este artículo, DRACULA, presenta una nueva forma de hablar con estos asistentes de investigación. En lugar de solo juzgar la sopa final, los investigadores pidieron a los usuarios que probaran los ingredientes y los pasos antes de que la sopa fuera siquiera preparada.

Aquí tienes el desglose de lo que hicieron y descubrieron, usando analogías sencillas:

1. El problema: El informe de «caja negra»

Por lo general, cuando una IA escribe un informe de investigación, toma cientos de decisiones diminutas a lo largo del camino: ¿Qué artículos debería leer? ¿Debería añadir un gráfico? ¿Debería explicar este concepto con una analogía?
Anteriormente, los usuarios solo veían el resultado final. Si el informe era aburrido, la IA no sabía si era porque eligió los artículos equivocados o porque el estilo de escritura era demasiado rígido. Era una «caja negra».

2. La solución: El enfoque de la «tarjeta de receta»

Los investigadores construyeron un sistema donde, antes de que la IA escriba el informe, presenta al usuario un menú de acciones posibles (como una tarjeta de receta).

  • El menú: «Podría añadir una sección sobre conjuntos de datos», «Podría explicar esto con un ejemplo del mundo real» o «Podría centrarme solo en los últimos cinco años de investigación».
  • El trabajo del usuario: El usuario elige las acciones que desea (como marcar casillas en una receta) y explica por qué.
  • El resultado: La IA luego escribe el informe utilizando solo esas acciones seleccionadas. Finalmente, el usuario juzga: «¿Realmente hiciste lo que te pedí?»

Recopilaron más de 8.000 de estas «elecciones de acción» y 5.000 «verificaciones de ejecución» de 19 investigadores expertos en informática.

3. El gran descubrimiento: «Saber lo que quieres» es más difícil que «hacerlo»

Los investigadores encontraron dos cosas sorprendentes:

  • La IA es en realidad bastante buena siguiendo órdenes. Una vez que un usuario dice: «Añade un gráfico», la IA generalmente puede dibujar un buen gráfico.
  • La IA es terrible adivinando lo que quieres en primer lugar. La IA a menudo sugiere las acciones incorrectas. Podría sugerir añadir un gráfico cuando el usuario solo quería un resumen sencillo.

La analogía: Imagina a un camarero que es increíble cocinando el filete exactamente como lo pediste (al punto, con mantequilla de ajo). Pero el camarero es terrible adivinando que en realidad querías una ensalada en su lugar. El problema no es la cocina; es la adivinanza.

4. El experimento de «lectura de mentes»

El equipo se preguntó: ¿Podemos entrenar a una computadora para adivinar qué elegirá un humano?
Intentaron enseñar a modelos de IA a predecir las elecciones de un usuario observando diferentes pistas:

  • Pista A: ¿Qué artículos ha leído el usuario antes? (No muy útil).
  • Pista B: ¿Qué dijo el usuario que le gustaba? (por ejemplo, «Me gustan los informes cortos»). (No muy útil).
  • Pista C: ¿Qué acciones realmente eligió el usuario en el pasado? (Esta fue la ganadora).

La lección: Las acciones de las personas hablan más fuerte que sus palabras. Si le dices a un amigo: «Me encanta la comida picante», pero siempre pides sopa suave, tu amigo debería escuchar lo que pides, no lo que dices. La IA aprendió que observar las «marcas de verificación» pasadas de un usuario era la mejor manera de adivinar qué elegiría a continuación.

5. El problema del «cambio de opinión»

Los investigadores también descubrieron que las preferencias humanas son complicadas. A veces, un usuario elige una acción hoy, pero si se le pregunta de nuevo en unos meses, podría elegir algo diferente porque sus objetivos cambiaron.

  • Ejemplo: Un usuario podría querer «pasos técnicos detallados» hoy porque está construyendo un proyecto. El próximo mes, podría querer «resúmenes de alto nivel» porque solo está tratando de entender lo básico.
  • La conclusión: No puedes predecir perfectamente lo que un humano quiere para siempre. A veces, simplemente tienes que preguntarle (como el menú de la «tarjeta de receta») porque sus objetivos cambian como el viento.

6. El resultado final: Una «receta» mejor

Como aprendieron que observar las acciones pasadas ayuda, construyeron un sistema que utiliza el historial de un usuario para sugerir automáticamente mejores «ítems del menú».

  • Cuando un usuario con un historial de elegir «tablas de comparación» hace una nueva pregunta, es más probable que el sistema sugiera: «¿Debería añadir una tabla de comparación?»
  • Esto hizo que los usuarios estuvieran mucho más satisfechos con las sugerencias, incluso si el sistema no sabía todo sobre ellos perfectamente.

Resumen

DRACULA es un conjunto de datos y un estudio que muestra que, para los agentes de investigación de IA, la parte más difícil no es escribir el informe; es averiguar qué pasos dar para hacer que el informe sea útil. Al permitir que los usuarios elijan los pasos (acciones) antes de que comience el trabajo, y al estudiar esas elecciones, podemos construir una IA que nos entienda mejor.

El artículo concluye que, aunque la IA está mejorando en hacer el trabajo, el verdadero desafío es decidir qué trabajo hacer en primer lugar. La mejor manera de resolver esto es escuchar lo que los usuarios realmente hacen, no solo lo que dicen que quieren.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →