← Últimos artículos
🤖 AI

SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

SearchEyes introduce un mundo de búsqueda simulado y unificado construido sobre un grafo de conocimiento tipado que integra datos, entorno y señales de recompensa a través de Cadenas de Percepción-Conocimiento y Optimización de Política Anclada en Saltos, permitiendo un rendimiento de razonamiento multi-salto de vanguardia en agentes de búsqueda multimodales sin depender de motores externos o modelos de recompensa separados.

Autores originales: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu
Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot muy inteligente cómo resolver un misterio complejo. El robot necesita mirar una imagen, leer algunos documentos y conectar los puntos para encontrar una respuesta. Esto es lo que el artículo llama un "agente de búsqueda multimodal".

Sin embargo, los autores de este artículo, SearchEyes, descubrieron que la forma en que solemos enseñar a estos robots está rota. Es como intentar enseñar a alguien a conducir dándole un mapa, un coche y un examen de conducir, pero asegurándose de que ninguno de ellos coincida.

  • El Mapa (Datos de entrenamiento): Les das una lista de preguntas y respuestas, pero desechas los pasos del "cómo hacerlo".
  • El Coche (Entorno): Los dejas conducir en una carretera pública real e impredecible (el internet real) donde los semáforos pueden cambiar o la carretera puede desaparecer.
  • La Prueba (Recompensas): Solo les dices "Buen trabajo" o "Mal trabajo" al final. Si cometieron un error en el paso 1, pero tuvieron suerte en el paso 10, aun así reciben un "Buen trabajo". Nunca aprenden dónde se equivocaron.

SearchEyes soluciona esto construyendo una simulación perfecta y autocontenida donde el mapa, el coche y la prueba se construyen a partir del mismo plano.

Así es como lo hicieron, usando analogías sencillas:

1. El Plano: Un "Grafo de Conocimiento Tipado"

En lugar de usar el internet real y desordenado, el equipo construyó una biblioteca gigante y organizada de hechos llamada Grafo de Conocimiento. Piensa en esto como un enorme árbol genealógico de la información del mundo, pero con reglas estrictas:

  • Cada persona (entidad) tiene una foto, una biografía y una lista de relaciones.
  • Solo mantienen a las personas "famosas" que tienen las tres cosas (foto, biografía y conexiones) para que el robot pueda practicar mirando imágenes y leyendo texto.

2. El Curso de Entrenamiento: "Cadenas de Percepción-Conocimiento" (PKC)

Para entrenar al robot, no escribieron preguntas aleatorias. Utilizaron una receta especial llamada Cadenas de Percepción-Conocimiento (PKC).

  • La Analogía: Imagina una búsqueda del tesoro donde debes alternar entre mirar una foto y leer una pista.
    • Paso 1 (Percepción): "Mira esta foto de un hombre. ¿Quién es él?" (El robot debe identificar a la persona a partir de la imagen).
    • Paso 2 (Conocimiento): "Ahora, busca para qué equipo jugó". (El robot debe buscar texto).
    • Paso 3 (Percepción): "Busca una foto del estadio donde juega ese equipo".
  • La Magia: El sistema genera estas preguntas automáticamente pero mantiene una "hoja de trucos" (la ruta exacta de los hechos) oculta en segundo plano. Esto asegura que el robot deba tomar la ruta larga y de múltiples pasos para resolver el rompecabezas, en lugar de adivinar la respuesta inmediatamente.

3. El Simulador de Conducción: Un "Mundo de Búsqueda Autocontenido"

En el mundo real, si le pides algo a un motor de búsqueda, los resultados pueden cambiar mañana. En el mundo de SearchEyes, el "motor de búsqueda" es en realidad una base de datos gigante y precargada de la biblioteca que construyeron.

  • El Beneficio: Es 100% reproducible. Si el robot busca "Cristiano Ronaldo", siempre obtendrá exactamente los mismos 5 resultados principales. Esto elimina el caos del internet real, permitiendo que el robot aprenda la lógica de la búsqueda sin distraerse con enlaces rotos o sitios web que cambian.

4. El Entrenador: Retroalimentación "Anclada a Saltos" (HaPO)

Esta es la innovación más importante. En el entrenamiento normal, el entrenador solo dice "¡Lograste la respuesta correcta!" al final.

  • El Problema: Si el robot tomó 10 pasos para llegar allí, el entrenador no sabe qué paso fue brillante y cuál fue un golpe de suerte.
  • La Solución de SearchEyes: Debido a que conservaron la "hoja de trucos" (la ruta exacta de los hechos), pueden actuar como un entrenador que observa cada paso.
    • "¡Buen trabajo encontrando la foto del estadio en el Paso 3!"
    • "Vaya, elegiste el equipo equivocado en el Paso 2. Intentémoslo de nuevo".
  • La Metáfora: En lugar de calificar todo el examen con una sola puntuación, dan una calificación para cada una de las preguntas del examen. Esto ayuda al robot a aprender mucho más rápido porque sabe exactamente dónde mejorar.

Los Resultados

Cuando probaron este nuevo método (llamado SearchEyes) en seis pruebas diferentes y difíciles que involucraban imágenes y texto:

  • Superó a todos los otros robots de código abierto que intentan hacer lo mismo.
  • Su robot más pequeño (27 mil millones de "células cerebrales") tuvo un mejor desempeño que robots mucho más grandes y costosos de las grandes empresas tecnológicas.
  • Demostró que, al darle al robot un mundo de entrenamiento estructurado y paso a paso junto con una retroalimentación precisa, no necesitas una supercomputadora masiva para obtener grandes resultados.

En resumen: SearchEyes dejó de intentar enseñar a los robots lanzándolos al caótico internet real. En su lugar, construyeron un gimnasio de entrenamiento perfecto y controlado donde el robot practica habilidades específicas, es calificado en cada movimiento y aprende a resolver misterios visuales complejos con una eficiencia increíble.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →