UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp
El artículo presenta UNIBROWSE, un novedoso marco de datos-a-agente que genera datos de entrenamiento exhaustivos que cubren los tres patrones de flujo de información de navegación multimodal y emplea aprendizaje por refuerzo consciente de la exploración para entrenar un agente de escala 35B que logra un rendimiento de vanguardia en los benchmarks de BrowseComp multimodales, superando significativamente tanto a su modelo base como a los agentes de código cerrado líderes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un detective intentando resolver un misterio, pero en lugar de solo leer unos pocos indicios en una libreta, tienes que saltar entre una biblioteca, un álbum de fotos y una transmisión de noticias en vivo para encontrar la respuesta. Eso es lo que es una tarea de "Multimodal BrowseComp": un rompecabezas súper difícil donde un agente de IA tiene que leer texto, mirar imágenes y usar herramientas de búsqueda para armar una solución que no está sentada en una sola página web.
Durante mucho tiempo, los detectives de IA que estábamos entrenando eran un poco unilaterales. Eran buenos leyendo pistas de texto o mirando una imagen y luego leyendo texto para encontrar una respuesta (como ver la foto de un perro y buscar "qué raza es esta?"), pero eran terribles en lo inverso: leer texto para descubrir qué buscar en una imagen (como leer la descripción de un edificio extraño y luego buscar una foto para confirmar su forma).
El Gran Descubrimiento: El Detective "UniBrowse"
Los investigadores detrás de este artículo, un equipo de la Universidad de Pekín, construyeron un nuevo sistema de entrenamiento llamado UNIBROWSE. Piensa en esto como un campamento de entrenamiento súper inteligente que finalmente enseña a los agentes de IA a manejar los tres tipos de pistas:
- Solo texto: Solo leer y conectar hechos.
- Imagen a texto: Comenzar con una foto y encontrar la historia.
- Texto a imagen: Leer una historia primero, y luego cazar la foto que coincida para probarla.
Antes de esto, la mayoría de los campamentos de entrenamiento solo cubrían los dos primeros tipos. Los autores argumentan que ignorar el tercer tipo (Texto a Imagen) deja a la IA "subentrenada" para escenarios del mundo real donde necesitas verificar un hecho visualmente después de haber leído sobre él. También notaron que los métodos anteriores eran como intentar aprender deambulando aleatoriamente por una ciudad (lo que conduce a mucho ruido y giros erróneos) o mirando solo un mapa perfecto y falso (que no coincide con el mundo real desordenado). UNIBROWSE soluciona esto comenzando con un "mapa" sólido (un grafo de conocimiento) pero luego enviando a la IA a recolectar evidencia viva y en tiempo real del internet real para asegurarse de que las pistas sean reales.
El Filtro de "Exploración": Cortando la Paja
Aquí está la parte ingeniosa: los investigadores se dieron cuenta de que no todos los problemas de práctica son iguales. Algunos problemas tienen solo una forma aburrida de resolverse, mientras que otros obligan al agente a probar diferentes caminos, retroceder y volver a intentarlo.
Para solucionar esto, inventaron una nueva métrica llamada "grado de exploración". Imagina que estás calificando la tarea de un estudiante. Si todos los estudiantes resuelven el problema matemático exactamente de la misma manera fácil, no se aprende mucho. Pero si algunos estudiantes intentan un atajo, otros se quedan estancados y retroceden, y algunos encuentran un camino nuevo y astuto, ahí es donde ocurre el verdadero aprendizaje.
El equipo utilizó este "grado de exploración" para filtrar sus datos. Desecharon los problemas aburridos de un solo camino y conservaron solo el 30% de las preguntas más "exploratorias". Esto hizo que su Aprendizaje por Refuerzo (la parte donde la IA aprende mediante ensayo y error) fuera mucho más eficiente, enfocándose solo en los rompecabezas que realmente enseñan al agente a pensar profundamente.
Los Resultados: Un Nuevo Campeón
Usando este flujo de trabajo, construyeron un agente de IA de 35 mil millones de parámetros (un cerebro muy grande). No solo adivinaron que funcionaría; lo midieron contra cinco benchmarks difíciles.
Los resultados fueron impresioniosos. Su nuevo agente, UniBrowse, obtuvo una precisión promedio de 54.4 en estas pruebas.
- Esto es un salto de 10.5 puntos sobre su modelo base (Qwen3.5-35B-A3B), que comenzó en 43.9.
- Superó a varios gigantes "de código cerrado" famosos (como GPT-5 y Gemini-2.5 Pro) que puntuaron alrededor de 42.9 y 44.8 respectivamente.
- Incluso superó a otros modelos de código abierto como Kimi K2.5 (50.8).
Lo Que No Reclaman
Es importante saber lo que este artículo no dice. Los autores son cuidadosos al notar que, aunque UniBrowse es el mejor agente de código abierto que han visto, todavía no ha vencido a los sistemas propietarios más fuertes (como Gemini-3.1 Pro, que alcanzó 63.2). También admiten que su agente está limitado a la navegación web pública con texto e imágenes; aún no puede manejar sitios web interactivos, videos o mapas. Sugieren que se podrían necesitar modelos más grandes y mejores herramientas para cerrar esa brecha restante, pero no pretenden haber resuelto todo el problema de la navegación de la IA.
La Conclusión
Al construir un sistema de entrenamiento que cubre los tres tipos de pistas (texto, imagen a texto y texto a imagen) y filtrar los problemas de práctica aburridos, el equipo de UNIBROWSE ha creado un agente de IA que es significativamente mejor para resolver misterios complejos de varios pasos en internet. Es un paso sólido hacia adelante, demostrando que cómo entrenas a un agente importa tanto como el tamaño de su cerebro.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.