← Últimos artículos
💬 NLP

BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

BrowserForge es un marco de trabajo que escala la generación de datos de interacción web de alta calidad mediante la ejecución de sandboxes de navegadores en paralelo a través de la web abierta para crear un corpus diverso de 203.238 trayectorias, lo que mejora significativamente el rendimiento de los agentes web basados en píxeles en evaluaciones estáticas y en vivo.

Autores originales: Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

Publicado 2026-08-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un programa informático diseñado para ayudarte a navegar por internet, muy parecido a un asistente digital que puede hacer clic en botones, escribir texto y desplazarse por las páginas para completar una tarea por ti. Para que estos programas aprendan a hacer esto, necesitan practicar en sitios web reales, observando cómo un humano se movería desde un punto de partida hasta un objetivo finalizado. Hasta ahora, los datos utilizados para enseñar a estos programas han sido limitados. La mayoría de los conjuntos de entrenamiento se construyeron grabando acciones humanas en una lista pequeña y fija de sitios web populares, o generando escenarios falsos basados en un conjunto estrecho de tutoriales. Esto significaba que los programas aprendían a navegar solo en una fracción minúscula de internet, teniendo dificultades cuando encontraban un sitio nuevo o desconocido. Eran como estudiantes que solo habían estudiado un único libro de texto; cuando se les entregaba un libro diferente, no sabían cómo leerlo.

Un equipo de investigadores ha construido ahora un sistema llamado BrowserForge para resolver este problema. En lugar de depender de una lista pequeña y preseleccionada de sitios web, convirtieron todo el internet abierto en un campo de entrenamiento. Crearon una red masiva de cientos de computadoras virtuales, cada una ejecutando un navegador web independiente. Estos navegadores fueron enviados a visitar cientos de miles de sitios web diferentes y reales encontrados en la web pública. El sistema no solo visitaba estas páginas; intentaba activamente realizar tareas en ellas. Un primer agente de inteligencia artificial observaba una página e inventaba una tarea plausible, como encontrar un artículo específico o consultar un precio. Un segundo agente intentaba completar esa tarea haciendo clic y escribiendo, registrando cada movimiento que realizaba. Si la tarea se completaba con éxito, el registro de esos movimientos se guardaba como una lección. Si el agente se quedaba atascado o fallaba, ese intento se descartaba. Este proceso se repitió una y otra vez, generando más de 200,000 ejemplos de aprendizaje únicos, cada uno extraído de un sitio web completamente diferente.

Los investigadores descubrieron que este enfoque produjo un conjunto de datos mucho más grande y diverso que cualquier otro disponible anteriormente. Mientras que los conjuntos de datos antiguos contenían solo unos pocos miles de ejemplos de unos pocos cientos de sitios, esta nueva colección cubría casi 200,000 sitios web distintos. Cuando utilizaron este nuevo dato para entrenar un modelo informático compacto y eficiente, los resultados fueron inmediatos y significativos. La capacidad del modelo para completar tareas con éxito en sitios web en vivo saltó de aproximadamente un 25 por ciento a más del 33 por ciento. Esta mejora no fue solo un pequeño aumento; permitió que un modelo relativamente pequeño superara a sistemas mucho más grandes y complejos que habían sido entrenados con datos más antiguos y estrechos. El estudio mostró que la clave de la mejora no fue un nuevo truco en cómo se enseñaba al modelo, sino simplemente la gran variedad de los sitios web que había visto. Al exponer el sistema al caos y la imprevisibilidad de la realidad de la web abierta, los investigadores le enseñaron a ser mucho más adaptable.

El éxito de este método dependió de un cuidadoso proceso de limpieza. Debido a que el sistema estaba generando tareas e intentándolas sin supervisión humana, muchos intentos fallaban o producían registros desordenados. Los investigadores construyeron un filtro para eliminar estos malos ejemplos. Primero, utilizaron reglas simples para descartar intentos que claramente salieron mal, como aquellos que nunca terminaron. Luego, utilizaron otro sistema inteligente para revisar los intentos restantes y confirmar si la tarea se había completado realmente. Finalmente, reescribieron los intentos exitosos en un formato claro y consistente para que el modelo de aprendizaje pudiera entender la lógica detrás de las acciones. Esto aseguró que el modelo aprendiera de ejemplos de alta calidad en lugar de ruido. El estudio confirmó que la diversidad de los sitios web fue el principal motor del éxito. Cuando los investigadores probaron el modelo en diferentes tipos de sitios web y tareas, la mejora se mantuvo constante, lo que sugiere que el modelo realmente había aprendido habilidades generales en lugar de solo memorizar páginas específicas.

Este trabajo demuestra que la mejor manera de enseñar a una computadora a navegar por la web es dejar que explore la web misma. Al automatizar el proceso de visitar sitios reales e intentar tareas reales, los investigadores crearon un conjunto de entrenamiento que refleja la verdadera complejidad de internet. El resultado es un asistente digital más capaz y confiable, uno que puede manejar los diseños inesperados y las características únicas de los millones de sitios web que existen hoy en día. Los hallazgos sugieren que, a medida que la cantidad de estos datos de la web abierta crezca, el rendimiento de estos agentes continuará mejorando, acercándolos al objetivo de un asistente web verdaderamente universal.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →