STAMP: Provenance-Guided Credit Assignment for Deep Search Agents
STAMP aborda el desajuste entre recompensa y crédito en agentes de búsqueda profunda mediante la introducción de un mecanismo de asignación de crédito guiado por procedencia que rastrea los documentos de apoyo hasta sus acciones de exposición y redistribuye la ventaja mediante modulación de preservación de signo, mejorando así significativamente el rendimiento sobre las líneas base de GRPO a través de múltiples evaluaciones.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás entrenando a un detective digital superinteligente para resolver misterios complicados en internet. Este detective, llamado un "agente de búsqueda profunda" (deep-search agent), no solo adivina; busca pistas, lee páginas web y une la evidencia para responder a una pregunta. Durante mucho tiempo, la forma en que enseñábamos a estos detectives era un poco como calificar una película entera basándose solo en la escena final. Si el detective obtenía la respuesta correcta al final, toda la película recibía una estrella de oro. Si obtenía la respuesta incorrecta, toda la película recibía una "F" roja.
Pero aquí está el problema: a veces el detective encuentra una pista brillante en medio de la película pero aun así obtiene la respuesta final incorrecta porque se confunde después. Otras veces, llega a la respuesta correcta por suerte sin haber encontrado nunca la evidencia real. El método antiguo no podía distinguir la diferencia. Le daba el mismo crédito (o culpa) a cada uno de los movimientos del detective, incluso a los movimientos aburridos que no hacían nada. Los autores de este artículo llaman a esto el "desajuste de crédito de recompensa" (reward-credit mismatch). Es como un profesor que le pone una nota de reprobado a un estudiante por todo un ensayo solo porque la conclusión es incorrecta, incluso si el estudiante escribió tres párrafos de investigación perfectos en medio.
La Gran Idea: STAMP
Los investigadores proponen un nuevo método de entrenamiento llamado STAMP (Modulación de Ventaja Guiada por Trazas a Nivel de Paso con Proveniencia). Piensa en STAMP como un crítico de cine superobservador que ve la película del detective fotograma a fotograma.
En lugar de mirar solo la respuesta final, STAMP hace dos preguntas específicas:
- ¿Encontró realmente el detective la evidencia correcta? (¿Encontraron a la persona o el dato específico que buscaban?)
- ¿Qué movimiento específico reveló esa evidencia por primera vez? (¿La encontraron cuando escribieron una consulta de búsqueda o cuando hicieron clic en un enlace?)
STAMP utiliza un "verificador basado en referencias" —básicamente un comprobador inteligente que observa los documentos que el detective encontró y pregunta: "¿Este documento realmente prueba el hecho que necesitamos?" Si lo hace, STAMP rastrea ese documento hasta el momento exacto en que el detective lo vio por primera vez. Ese momento específico recibe un "impulso de crédito".
Cómo funciona sin romper la película
Esta es la parte ingeniosa: STAMP no cambia la calificación final de la película. Si el detective todavía obtuvo la respuesta final incorrecta, la película sigue siendo un fracaso. Pero, STAMP utiliza una "modulación de ventaja de preservación de signo" especial para ajustar el entrenamiento.
Imagina que el detective está en una montaña rusa. Si el viaje fue un éxito (ventaja positiva), STAMP le da un pequeño impulso extra a los momentos específicos donde encontraron buenas pistas, haciendo que esos movimientos se sientan aún más gratificantes. Si el viaje fue un choque (ventaja negativa), STAMP no castiga los movimientos buenos con tanta dureza. Dice: "Está bien, fallaste la misión, pero esa consulta de búsqueda que hiciste fue en realidad brillante; no borremos esa lección". Esto asegura que el detective aprenda exactamente qué movimientos de búsqueda funcionan, sin confundir la lección con el resultado final.
Lo que el artículo dice que NO es
Los autores son muy claros sobre lo que este método NO es. Argumentan contra la idea de que necesitamos inventar sistemas de recompensa complejos para cada paso de la búsqueda. También descartan la idea de que necesitamos adivinar qué movimientos fueron buenos sin pruebas. STAMP se basa en evidencia probada: si el documento no está ahí, o si el verificador dice que no respalda el hecho, no se otorga crédito. Afirman explícitamente que simplemente añadir bonificaciones aleatorias a los pasos no funciona porque los sistemas antiguos de todos modos las promedian.
Los Resultados: ¿Funciona?
El equipo probó STAMP en tres conjuntos de desafíos: BrowseComp, BrowseComp-ZH (una versión en chino) y xbench-DS. Compararon STAMP contra un método de entrenamiento estándar llamado GRPO utilizando exactamente el mismo modelo inicial, los mismos datos de entrenamiento y las mismas herramientas de búsqueda.
Los resultados mostraron que STAMP mejoró consistentemente el desempeño del detective:
- En BrowseComp, la precisión aumentó +2.0 puntos.
- En BrowseComp-ZH, saltó +5.5 puntos.
- En xbench-DS, mejoró +3.0 puntos.
El artículo sugiere que estas ganancias ocurren porque STAMP captura "gemas ocultas": pasos que encontraron evidencia útil incluso en intentos fallidos, los cuales el método antiguo ignoraba. De hecho, descubrieron que en los intentos correctos, el 83.5% de los pasos en realidad no produjeron ninguna evidencia útil, mientras que en los intentos incorrectos, el 7.0% de los pasos sí encontraron pistas útiles. STAMP corrige esto recompensando los pasos útiles independientemente del resultado final.
¿Qué tan seguros están?
Los autores están seguros de estas cifras porque realizaron experimentos controlados donde todo era idéntico excepto por el método de entrenamiento. También realizaron "estudios de ablación" (que son como desarmar la máquina para ver qué pieza hace qué) y descubrieron que cada parte de STAMP —el verificador, el rastreo de la primera exposición y la modulación especial— contribuyó al éxito.
Sin embargo, señalan una limitación: solo probaron esto en un tamaño de modelo específico (Qwen3-30B). Sugieren que, aunque funciona bien allí, aún no se ha demostrado si este método funciona igual de bien en modelos mucho más grandes (como 70B+). Por lo tanto, aunque los resultados son sólidos para las pruebas que realizaron, el pleno potencial para cerebros más grandes sigue siendo una pregunta abierta.
En resumen, STAMP enseña a los detectives de IA a apreciar el viaje, no solo el destino, al dar crédito a los movimientos específicos que realmente descubrieron la verdad.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.