← Últimos artículos
💬 NLP

Cross-Domain Hybrid OPD for Generalizable Search Agents

Este artículo presenta un marco de entrenamiento híbrido para el agente de búsqueda Yuanbao que utiliza la Destilación On-Policy de expertos transdominio para lograr capacidades de búsqueda especializadas sin sacrificar, e incluso mejorando, la inteligencia de propósito general, mitigando así el típico impuesto de alineación asociado con la optimización del Aprendizaje por Refuerzo.

Autores originales: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Publicado 2026-08-04
📖 9 min de lectura🧠 Análisis profundo

Autores originales: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde tu asistente de IA favorito es como un estudiante brillante que acaba de aprender a ser un maestro detective. Este estudiante puede recorrer internet, conectar puntos entre diferentes noticias y encontrar hechos ocultos más rápido que nadie. Pero hay un truco: en el proceso de convertirse en un súper detective, empezó a olvidar cómo escribir un poema divertido, resolver un acertijo matemático complicado o simplemente tener una charla normal sobre su día. Este es el problema de la "especialización" en el mundo de la Inteligencia Artificial. Los científicos llaman el precio que pagas por volverte muy bueno en una cosa específica el "impuesto de alineación" (alignment tax). Es como si un chef se obsesionara tanto con perfeccionar su sopa que olvidara cómo hornear un pastel. La gran pregunta para los investigadores es: ¿Podemos entrenar a una IA para que sea una experta mundial en búsquedas sin hacer que olvide cómo ser un amigo útil y versátil?

Esto es exactamente lo que el equipo de Tencent Yuanbao se propuso resolver en su nuevo informe técnico. Construyeron un agente de IA inteligente diseñado para cazar información en la web, pero les preocupaba que entrenarla para buscar tan intensamente la hiciera "tonta" en todo lo demás. Para solucionar esto, inventaron un ingenioso método de entrenamiento de dos pasos. Primero, enseñaron a la IA a ser una profesional de la búsqueda utilizando una técnica llamada Aprendizaje por Refuerzo (Reinforcement Learning), que es como dejar que la IA juegue un juego donde recibe puntos por encontrar las respuestas correctas. Luego, para evitar que la IA perdiera su inteligencia general, utilizaron un método llamado "Destilación Híbrida On-Policy entre Dominios" (Cross-Domain Hybrid On-Policy Distillation). Piensa en esto como contratar a cuatro tutores genios —uno para matemáticas, uno para programación, uno para lógica y uno para ciencias— para enseñar al experto en búsquedas de la IA a ser un estudiante bien formado de nuevo. ¿El resultado? Una IA que puede encontrar información en la web tan bien como la versión especializada y, aunque no se convirtió en un genio de las matemáticas en cada prueba individual, recuperó la mayor parte de terreno perdido y, de hecho, mejoró en varias áreas clave como el razonamiento lógico y la programación. No solo arreglaron el problema; hicieron a la IA más inteligente en muchas cosas al mismo tiempo, sin sacrificar sus habilidades de búsqueda.

El detective que olvidó cómo hacer malabares

Sumerjámonos en la historia del agente de búsqueda de Yuanbao. Imagina que tienes un robot llamado "Search-Bot". Quieres que Search-Bot sea el mejor encontrando respuestas en internet. Así que, lo pones en un patio de juegos virtual donde tiene que resolver misterios haciendo clic en enlaces, leyendo artículos y haciendo preguntas. Esto se llama Aprendizaje por Refuerzo (RL). Es como entrenar a un perro: cada vez que Search-Bot encuentra la pieza de información correcta, recibe un premio (una recompensa). Cada vez que se pierde, recibe un suave "no".

Después de un tiempo, Search-Bot se vuelve increíble encontrando cosas. Pero aquí está la parte extraña: a medida que mejora en la búsqueda, empieza a empeorar en otras cosas. Olvida cómo resolver un problema matemático simple o escribir una historia creativa. El artículo llama a esto el Impuesto de Alineación (Alignment Tax). Es como si pasaras cada santo día practicando tus patadas de fútbol hasta que tus piernas fueran súper fuertes, pero olvidaras cómo caminar en línea recta porque ya nunca practicabas caminar. La IA se volvió tan especializada en "buscar" que perdió su potencia cerebral "general".

La misión de rescate de dos etapas

El equipo de Tencent se dio cuenta de que solo enseñarle a Search-Bot a buscar más fuerte no era la solución. Necesitaban una forma de mantener las habilidades de búsqueda y recuperar la inteligencia general. Así que idearon un plan de entrenamiento de dos etapas.

Etapa 1: El campamento de entrenamiento de búsqueda
Primero, tomaron su modelo de IA base (un modelo inteligente llamado Hunyuan3) y lo enviaron al "Campamento de Entrenamiento de Búsqueda". Aquí, la IA solo practicaba la búsqueda. Aprendió a planificar sus movimientos, usar herramientas como la búsqueda web y la búsqueda de imágenes, y unir información de diferentes lugares. Como era de esperar, se volvió muy buena buscando. Pero, tal como predijo el artículo, empezó a perder su toque con las matemáticas, las ciencias y la lógica. El "Impuesto de Alineación" golpeó con fuerza.

Etapa 2: La mezcla del "Súper-Tutor"
Aquí es donde ocurre la magia. En lugar de dejar que la IA siguiera fallando en matemáticas, el equipo trajo a cuatro Maestros Expertos. Estos no eran unos maestros cualquiera; eran modelos de IA súper especializados entrenados específicamente en:

  1. Matemáticas (resolviendo ecuaciones complejas)
  2. Programación (escribiendo programas de computadora)
  3. Lógica (resolviendo acertijos y razonamiento)
  4. Ciencias (entendiendo el mundo natural)

El equipo utilizó una técnica llamada Destilación On-Policy (OPD). Esta es una forma elegante de decir: "Dejemos que el estudiante (Search-Bot) intente resolver un problema, y luego hagamos que el Maestro Experto observe y diga: 'Oye, lo hiciste de esta manera, pero aquí hay una mejor forma de pensar sobre ello'".

Lo genial es que no solo le enseñaron matemáticas o búsqueda. ¡Los mezclaron! En cada sesión de entrenamiento, la IA practicaba buscar un dato y luego inmediatamente practicaba resolver un problema matemático o escribir código, todo mientras era guiada por el Maestro Experto correspondiente. Era como un estudiante que va a práctica de fútbol por la mañana y luego va a clases de piano por la tarde, pero el profesor de piano también está observando la práctica de fútbol para asegurarse de que el estudiante se mantenga enfocado y disciplinado.

Los resultados: Lo mejor de ambos mundos

El equipo probó su nueva IA "Híbrida" contra las versiones antiguas. Esto es lo que encontraron:

  • Las habilidades de búsqueda: La nueva IA era tan buena buscando como la que solo practicaba la búsqueda. De hecho, en algunas pruebas de búsqueda complicadas, ¡fue incluso mejor! Podía seguir encontrando información en la web, planificar búsquedas complejas y seguir instrucciones perfectamente.
  • Las habilidades generales: Esta es la gran victoria. La IA que solo practicaba la búsqueda se había vuelto peor en matemáticas y lógica. ¿Pero la IA Híbrida? No solo volvió a la normalidad, sino que logró recuperaciones e mejoras significativas en muchas áreas.
    • En las pruebas de Razonamiento Lógico, la IA Híbrida mejoró por un margen enorme (saltando de una puntuación de 33.95 a 46.90).
    • En tareas de Programación, pasó de 67.74 a 74.15, superando incluso al modelo "base" original.
    • En problemas de Matemáticas, recuperó casi todo el terreno perdido e incluso superó al modelo original en algunas pruebas difíciles (como AIME25 y Math IMO AnswerBench). Sin embargo, en algunos benchmarks extremadamente desafiantes como Minerva Math y Frontier Science Olympiad, se mantuvo ligeramente por debajo del rendimiento del modelo base original.
    • En los benchmarks de Ciencias, vio fuertes avances, alcanzando la mayor precisión en GPQA Diamond.

El artículo muestra que el "Impuesto de Alineación" no es un precio permanente que tengas que pagar. Al usar estos Maestros Expertos para guiar a la IA mientras aprende a buscar, lograron "deshacer" la mayor parte del daño. La IA no tuvo que elegir entre ser una detective o ser una genio; se convirtió en una detective que también es muy buena siendo una estudiante, aunque no sea perfecta en cada problema matemático del universo.

Por qué esto importa

Podrías preguntarte: "¿Y qué? ¿Por qué nos importa si una IA mejora en matemáticas?". Bueno, imagina que le preguntas a tu asistente de IA: "Voy a visitar París durante tres días. Quiero ver la Torre Eiffel y Disneyland, pero no quiero pasar más de 30 minutos viajando entre los lugares".

Si la IA solo tuviera el entrenamiento de "Solo Búsqueda", podría encontrar las ubicaciones pero luego darte un itinerario terrible que no tiene sentido, o podría olvidar calcular correctamente el tiempo de viaje porque se enfocó demasiado en encontrar los nombres de los lugares.

Pero con el entrenamiento Híbrido, la IA puede:

  1. Buscar las ubicaciones y los tiempos de viaje (usando sus habilidades de búsqueda).
  2. Razonar sobre la geografía y calcular si el plan se ajusta a tu regla de 30 minutos (usando sus habilidades de lógica y matemáticas).
  3. Escribir un itinerario claro, amable y relajado para ti (usando sus habilidades de lenguaje general).

El artículo sugiere que este enfoque "Híbrido" es la clave para construir asistentes de IA que sean verdaderamente útiles en el mundo real. Deben ser capaces de encontrar información, sí, pero también deben ser lo suficientemente inteligentes para usar esa información para resolver problemas, escribir historias y ayudarnos en nuestra vida diaria sin perder la cabeza en el proceso.

La receta secreta: Cómo lo hicieron

El equipo no solo lanzó todo en una licuadora. Fueron muy cuidadosos con cómo enseñaron a los Maestros Expertos. Utilizaron una estrategia de Aprendizaje por Currículo (Curriculum Learning). Esto significa que no empezaron dándole a los maestros los problemas matemáticos más difíciles e imposibles. En su lugar, comenzaron con problemas de dificultad media para construir una base sólida, y luego introdujeron lentamente lo más difícil.

Descubrieron que si se saltaban este paso y simplemente lanzaban los problemas más difíciles a los maestros, los maestros (y la IA estudiante) no aprendían tan bien. El "Currículo" ayudó a los maestros a ser mejores explicando las cosas, lo que a su vez hizo que la IA estudiante aprendiera más rápido y de forma más inteligente.

Conclusión

El equipo de Tencent Yuanbao nos demostró que no tienes que sacrificar la inteligencia general para obtener un agente de búsqueda especializado. Al mezclar el Aprendizaje por Refuerzo (para la búsqueda) con la Destilación On-Policy (aprender de tutores expertos), crearon una IA que es una maestra detective y también una brillante estudiante integral.

Demostraron que el "Impuesto de Alineación" se puede evitar. La IA no solo dejó de empeorar; de hecho, mejoró en la mayoría de las cosas, recuperando sus habilidades perdidas e incluso superando a su yo original en áreas como la programación y el razonamiento lógico. Aunque no ganó todos los concursos de matemáticas, se convirtió en una asistente mucho más capaz y versátil en general. Es un poco como encontrar la manera de entrenar a un superhéroe para volar sin hacer que olvide cómo caminar. Y en un mundo donde queremos que nuestra IA sea útil, inteligente y versátil, eso es algo muy importante.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →