← Últimos artículos
💬 NLP

OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

El artículo presenta OpenVisTool, un marco que sintetiza trayectorias instructivas de uso de herramientas visuales mediante el filtrado tanto de la corrección de la respuesta como de la contribución causal de las observaciones de las herramientas, lo que resulta en un conjunto de datos y un punto de referencia que mejoran significativamente el rendimiento de los agentes multimodales al enseñar a los modelos a fundamentar el uso de herramientas en la evidencia en lugar de simplemente imitar patrones de llamada.

Autores originales: Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu

Publicado 2026-08-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot cómo resolver un misterio. Tienes una biblioteca gigante de pistas (imágenes) y un conjunto de lupas especiales (herramientas) que pueden hacer zoom, recortar o resaltar partes específicas de la imagen. En el mundo de la inteligencia artificial, estos "agentes multimodales" se están volviendo más inteligentes, pero a menudo chocan con un muro: solo pueden ver lo que hay en la instantánea inicial. Si una pista está oculta en un texto diminuto o en una esquina borrosa, el robot la pasa por alto. Para solucionar esto, los científicos están enseñando a los robots a usar activamente sus lupas para reunir nuevas evidencias antes de responder. Pero aquí está la parte complicada: el hecho de que un robot use una herramienta y obtenga la respuesta correcta, no significa que la herramienta haya ayudado realmente. Tal vez el robot ya sabía la respuesta de memoria y simplemente fingió usar la lupa porque se le ordenó hacerlo. Este artículo plantea una pregunta vital: ¿Cómo enseñamos a un robot a usar herramientas solo cuando son verdaderamente necesarias, en lugar de simplemente imitar el hábito de usarlas?

Los investigadores detrás de este estudio, llamado OpenVisTool, argumentan que la forma actual de entrenar a estos robots es defectuosa. Dicen que mostrarle a un robot una historia "exitosa" donde usó una herramienta y obtuvo la respuesta correcta es como mostrarle a un estudiante un examen de matemáticas donde adivinó la respuesta correcta pero aun así escribió todos los pasos de una fórmula complicada. El estudiante aprende que "escribir fórmulas conduce a buenas notas", pero no aprende por qué era necesaria la fórmula. Los autores proponen una receta de datos de entrenamiento nueva y más estricta. Insisten en que un ejemplo de entrenamiento solo es útil si ocurren dos cosas: primero, el robot obtiene la respuesta correcta (Validez de Resultado), y segundo, el robot realmente necesitó la herramienta para llegar allí (Utilidad Causal). Si el robot podría haber resuelto el rompecabezas sin la herramienta, ese ejemplo se descarta.

Para demostrar esto, el equipo construyó un nuevo dataset masivo llamado OpenVisTool-42K, que contiene 42,000 ejemplos cuidadosamente filtrados a través de cinco mundos visuales diferentes: leer gráficos, analizar tablas, navegar por pantallas de ordenador, buscar detalles visuales y convertir páginas web en código. Utilizaron un proceso de tres pasos para crear este dataset. Primero, filtraron preguntas "difíciles" que un robot no podría resolver sin herramientas. Segundo, un robot "maestro" superinteligente resolvió estos problemas utilizando estrategias específicas para cada tipo de rompecabezas. Finalmente, realizaron una estricta "verificación de supervisión": tomaron la solución del maestro y le pidieron a un robot "estudiante" más débil que resolviera el mismo problema. Si el robot estudiante fallaba sin las notas de la herramienta del maestro pero tenía éxito con ellas, el ejemplo se conservaba. Si el robot estudiante podía resolverlo de cualquier manera, el ejemplo se descartaba como "redundante".

Los resultados fueron impresionantes. Cuando los investigadores ajustaron cuatro modelos de robot diferentes (que van desde modelos pequeños de 4 mil millones de parámetros hasta modelos grandes de 27 mil millones de parámetros) con este nuevo dataset, los robots mejoraron significamente en el uso de herramientas. En su banco de pruebas personalizado, OpenVisTool-Bench, los modelos mejoraron en un promedio de 10.7 puntos. El salto más grande fue en la búsqueda visual, donde los modelos ganaron 23.8 puntos. Aún más emocionante, los modelos de código abierto más pequeños entrenados con estos datos funcionaron casi tan bien como los gigantes modelos de código cerrado (como GPT-5.5) que suelen dominar el campo. Por ejemplo, un modelo Qwen3.5-9B entrenado con OpenVisTool-42K obtuvo un promedio de 45.8, superando al GPT-5.5 no entrenado (que obtuvo 41.9 sin herramientas) y acercándose mucho al GPT-5.5 con herramientas (49.0).

El estudio también descubrió que este nuevo método de entrenamiento enseña una "meta-habilidad" que funciona a través de diferentes tipos de rompecabezas. Cuando probaron los robots entrenados en problemas que nunca habían visto (tareas fuera de distribución), siguieron funcionando mejor que los robots entrenados con datos más antiguos y menos estrictos. Sin embargo, los autores también descubrieron que entrenar en un solo tipo de rompecabezas (como solo gráficos) a veces podía perjudicar el rendimiento en otros tipos (como páginas web), lo que sugiere que una mezcla de diferentes desafíos es lo mejor. En última instancia, el artículo sugiere que el secreto para enseñar a los robots a usar herramientas no es solo mostrarles historias de éxito, sino mostrarles historias donde las herramientas fueron los verdaderos héroes. Al filtrar el uso de herramientas "falso", OpenVisTool ayuda a los robots a aprender no solo cómo usar una lupa, sino cuándo realmente necesitan levantarla.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →