← Últimos artículos
💬 NLP

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1 es un método de autoevolución que mejora los agentes de razonamiento aumentados por búsqueda utilizando únicamente GRPO estándar y auto-distilación offline para lograr un rendimiento de vanguardia en benchmarks de preguntas y respuestas sin depender de supervisión externa compleja ni módulos auxiliares.

Autores originales: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

Publicado 2026-05-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un estudiante muy inteligente pero ligeramente torpe (la IA) que está intentando responder preguntas de cultura general difíciles. Para obtener la respuesta correcta, a este estudiante se le permite usar una biblioteca (un motor de búsqueda) para consultar hechos, pero debe decidir cuándo buscar y qué preguntar.

La mayoría de los métodos actuales enseñan a este estudiante esperando hasta que termine todo el ensayo. Si la respuesta final es correcta, el maestro le da una estrella dorada. Si es incorrecta, le da una X roja. ¿El problema? El estudiante no sabe qué paso específico fue el error. ¿Hizo la pregunta equivocada? ¿Leyó el párrafo incorrecto? ¿Se distrajo? Solo sabe que todo el intento falló.

Search-E1 es una nueva y más sencilla forma de enseñar a este estudiante. No necesita un maestro humano superinteligente, un robot extra sofisticado ni un sistema de recompensas especial. En su lugar, utiliza una técnica llamada "Autoevolución" a través de una danza de dos pasos:

Paso 1: La fase "Prueba todo" (GRPO)

Primero, se le hace la misma pregunta al estudiante cinco veces.

  • En un intento, podría deambular por la biblioteca, hacer preguntas tontas y fallar.
  • En otro intento, podría hacer las preguntas perfectas, encontrar el libro correcto y obtener la respuesta correcta rápidamente.

El sistema observa estos cinco intentos y dice: "Vale, el que obtuvo la respuesta correcta es el 'Estándar de Oro' para esta ronda". Pero, como antes, esto solo le dice al estudiante: "Buen trabajo en ese ensayo completo", no "Buen trabajo al hacer esa pregunta específica".

Paso 2: La fase "Rebobinar y aprender" (Auto-distilación fuera de línea)

Aquí es donde ocurre la magia. El sistema toma el intento fallido (el "Estudiante") y el intento exitoso (el "Maestro").

Aquí está el truco inteligente:

  1. El sistema le da al Estudiante la pregunta original.
  2. El sistema le da al Maestro la misma pregunta, pero también le entrega una hoja de trucos: toda la ruta exitosa que el estudiante siguió en el otro intento.
  3. El Maestro lee la hoja de trucos y dice: "Si estuviera respondiendo esta pregunta ahora, sabiendo la ruta correcta, esto es exactamente lo que diría a continuación".
  4. Luego, el Estudiante se ve obligado a escuchar al Maestro e intentar coincidir con sus palabras, paso a paso.

Al Estudiante no solo se le dice "Tuviste razón/estuviste equivocado". Se le muestra, token por token (palabra por palabra), exactamente cómo pensar mejor. "¡Ah, lo veo! Cuando pregunté '¿Quién es el presidente?', el Maestro preguntó '¿Quién era el presidente en 1990?' ¡Esa es la diferencia!".

¿Por qué es esto especial?

  • Sin Maestros Externos: Por lo general, para obtener este nivel de detalle, necesitas una IA superinteligente (como un modelo de 72 mil millones de parámetros) para calificar cada paso individual. Search-E1 utiliza los propios intentos exitosos del estudiante como maestro. Es como un estudiante que estudia su propio examen después de obtener un A, en lugar de esperar a que un profesor lo califique.
  • Sin Maquinaria Extra: Otros métodos añaden herramientas complejas para averiguar qué pasos fueron buenos. Search-E1 simplemente utiliza el bucle estándar de "intentar y reintentar" y añade este paso de "estudia tu propio éxito" en medio.
  • Los Resultados: Cuando lo probaron en siete desafíos de cultura general diferentes, el estudiante que usaba Search-E1 obtuvo puntuaciones significativamente mejores que otros estudiantes que usaban métodos más complicados. Fue especialmente bueno en preguntas de "múltiples saltos" (donde tienes que conectar varios puntos), porque esas preguntas tienen muchos pasos donde puedes equivocarte, y este método repara los pasos específicos que estaban rotos.

En resumen: Search-E1 enseña a una IA a volverse más inteligente permitiéndole fallar, y luego haciéndole estudiar sus propios intentos exitosos como si fueran un libro de texto perfecto, aprendiendo exactamente qué decir en cada momento sin necesitar ayuda externa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →