← Últimos artículos
💻 computer science

OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

El artículo presenta OpenResearcher, una pipeline totalmente abierta y reproducible que genera más de 97.000 trayectorias de investigación profunda en un entorno offline para entrenar agentes de IA, logrando una mejora significativa del 34,0 puntos en precisión en tareas de búsqueda complejas.

Autores originales: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

Publicado 2026-03-24
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres enseñarle a un estudiante a ser un detective investigador de élite. Su trabajo no es solo buscar una respuesta rápida en Google, sino resolver misterios complejos que requieren leer docenas de libros, cruzar pistas, verificar fechas y conectar puntos que parecen no tener relación.

El problema es que, hasta ahora, entrenar a estos "detectives" (que son Inteligencias Artificiales) era como intentar enseñarles a pescar en un océano real, pero con tres grandes problemas:

  1. Es carísimo: Cada vez que el detective busca algo, hay que pagar una tarifa a los dueños del océano (las empresas de búsqueda como Google).
  2. Es inestable: El océano cambia cada día. Lo que funcionó ayer, hoy puede no estar ahí.
  3. Es imposible de repetir: Si otro detective intenta aprender lo mismo, encontrará un océano diferente y no podrá practicar lo mismo que tú.

OpenResearcher es la solución genial que proponen los autores de este paper. Es como construir un "Océano en una Caja".

¿Cómo funciona? (La Analogía del Laboratorio de Simulación)

En lugar de enviar al detective al internet real (que es caótico y costoso), los investigadores crearon un mundo virtual perfecto y congelado en el tiempo:

  1. El "Océano" (La Biblioteca): Recopilaron 15 millones de documentos (como una biblioteca gigante) y la guardaron en un servidor local. Es un "océano" estático que nunca cambia.
  2. La "Lluvia de Oro" (El Bootstrap): Antes de empezar, hicieron una búsqueda rápida y cara una sola vez para encontrar los documentos exactos que contenían las respuestas correctas. Esos documentos "dorados" se mezclaron con la biblioteca gigante para asegurar que las respuestas estuvieran ahí.
  3. Los "Herramientas de Detective" (Primitivas): En lugar de darles un navegador web completo y confuso, les dieron tres herramientas simples y claras, como si fueran herramientas de un mago:
    • Buscar (Search): Para lanzar una red y ver qué peces (páginas web) salen a la superficie.
    • Abrir (Open): Para meterse dentro de la página y leer todo el texto, no solo el resumen.
    • Encontrar (Find): Para usar un "lupa" y buscar una palabra exacta dentro del texto abierto.

El Proceso de Entrenamiento

  1. El Maestro (Teacher): Usaron un modelo de IA muy inteligente (GPT-OSS-120B) para que actuara como el "Maestro Detective".
  2. La Simulación: El Maestro resolvió más de 97,000 casos dentro de este "Océano en una Caja". Como el océano es local, no costó ni un centavo en tarifas de búsqueda y funcionó a una velocidad increíble.
  3. El Aprendiz (Student): Luego, tomaron un modelo más pequeño y barato (como un estudiante de secundaria) y le enseñaron a imitar al Maestro. Le dijeron: "Mira cómo el Maestro buscó, abrió y encontró la respuesta. Ahora tú hazlo".

¿Qué descubrieron? (Las Lecciones del Laboratorio)

Al tener este control total, pudieron hacer experimentos que serían imposibles en el mundo real:

  • No basta con buscar: Descubrieron que muchos detectives fallan no porque no encuentren el documento, sino porque no saben leerlo bien. Si solo usaban la herramienta "Buscar", fallaban mucho. Pero cuando les enseñaron a "Abrir" y "Encontrar" (usar la lupa), sus resultados mejoraron drásticamente. Es como tener un mapa, pero no saber leer las coordenadas.
  • Más no siempre es mejor: A veces, el detective da demasiadas vueltas (más de 100 búsquedas) y se pierde. Aprendieron que hay un punto de equilibrio donde el detective debe saber cuándo parar y dar la respuesta.
  • El costo es ridículo: Hacer todo esto en el "Océano en una Caja" costó cero dólares en búsquedas, mientras que hacerlo en internet real habría costado miles de dólares.

El Resultado Final

El resultado es un modelo de IA (el "Estudiante") que, aunque es más pequeño y barato que los gigantes comerciales, aprendió a investigar tan bien como ellos.

  • En pruebas de investigación profunda, superó a modelos propietarios muy caros.
  • Lo más impresionante es que, aunque se entrenó en un "mundo falso" (offline), funciona perfectamente en el mundo real (online). Es como si un piloto de avión entrenara en un simulador de vuelo y luego pudiera aterrizar un avión real sin problemas.

En resumen

OpenResearcher es como un gimnasio de entrenamiento gratuito y perfecto para Inteligencias Artificiales. En lugar de dejar que aprendan a investigar en la calle (donde es caro y peligroso), les dan un simulador de alta tecnología donde pueden practicar miles de veces, cometer errores, aprender de ellos y convertirse en expertos detectives, todo sin gastar una fortuna y con la garantía de que todos pueden repetir el entrenamiento exactamente igual.

Es un paso gigante para que la investigación profunda no sea un lujo solo para las grandes empresas, sino una herramienta accesible para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →