MidTool: Mid-training Data Synthesis for Agentic Tool Use
Este artículo presenta MidTool, un flujo de trabajo de construcción de corpus abierto que sintetiza datos diversos para permitir un entrenamiento intermedio dedicado para modelos de lenguaje de gran tamaño, demostrando que este enfoque mejora significativamente las capacidades generales de uso de herramientas de agentes en comparación con el depender únicamente del postentrenamiento.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los modelos de lenguaje de gran tamaño son los motores detrás de una nueva generación de asistentes digitales, capaces de leer, escribir y razonar con una fluidez similar a la humana. Para que estos sistemas sean verdaderamente útiles, deben hacer más que simplemente responder preguntas; deben ser capaces de actuar. Esto significa saber cuándo recurrir a una herramienta, como una calculadora, un motor de búsqueda o una interfaz de software, y luego usarla correctamente para resolver un problema. En el panorama actual de la inteligencia artificial, los investigadores han tratado mayoritariamente esta capacidad de usar herramientas como un paso final en el entrenamiento. Toman un modelo potente, preentrenado, y luego le enseñan específicamente cómo llamar a funciones o interactuar con software a través de un proceso de ajuste fino (fine-tuning). Sin embargo, este enfoque impone una pesada carga a esa etapa final, obligando al modelo a aprender comportamientos complejos como planificar una secuencia de acciones o recuperarse de la falta de información, todo a la vez, a menudo sin una base profunda de cómo funcionan realmente esas herramientas en el mundo real.
Un equipo de investigadores de la Universidad de Washington y Snowflake ha propuesto un camino diferente. Sugieren que la capacidad de usar herramientas debería cultivarse antes en la vida del modelo, durante una etapa intermedia de entrenamiento que se sitúa entre el aprendizaje inicial amplio y la instrucción especializada final. Llaman a este proceso "mid-training" (entrenamiento intermedio). Para probar esta idea, construyeron un conjunto de datos masivo y personalizado diseñado específicamente para enseñar a los modelos cómo interactuar con herramientas. Llamaron a su proyecto MidTool. Al alimentar sus modelos con estos datos especializados antes de los pasos finales de entrenamiento, descubrieron que los modelos aprendían a usar las herramientas de manera más efectiva, con una mejor comprensión de cómo planificar acciones y manejar errores, que los modelos que solo recibían el entrenamiento final estándar.
Los investigadores comenzaron reuniendo una colección diversa de materiales que contienen el conocimiento bruto de cómo funcionan las herramientas. No se limitaron a buscar ejemplos de uso de herramientas; recolectaron los manuales, el código, la documentación y las especificaciones técnicas que describen cómo se supone que deben funcionar dichas herramientas. Esto incluyó millones de páginas web, miles de documentos técnicos en formato PDF, vastos reposarios de código informático y definiciones estructuradas de interfaces de programación de aplicaciones (API) del mundo real. Trataron estas fuentes como los "libros de texto" para sus estudiantes de IA. A partir de este material bruto, crearon una mezcla de entrenamiento que contenía 20.3 mil millones de tokens, una medida de la cantidad de texto procesado. Esta mezcla fue cuidadosamente equilibrada, extrayendo aproximadamente un 42 por ciento de documentos web, un 26 por ciento de código, un 23 por ciento de PDF y un 9 por ciento de ejemplos directos y sintetizados de agentes utilizando herramientas.
Para convertir esta colección estática de documentos en una experiencia de aprendizaje dinámica, los investigadores utilizaron un enfoque de dos vertientes para generar ejemplos de entrenamiento. El primer método se centró en la fundamentación (grounding). Tomaron documentos técnicos y código y pidieron al modelo que imaginara escenarios donde un usuario necesitaría usar las herramientas descritas en esos textos. El modelo tenía que aprender a leer un manual desordenado o un fragmento de código complejo, identificar qué herramientas estaban disponibles y determinar qué información era necesaria para usarlas. Esto enseñó al modelo a reconocer las "afordancias" (affordances) de una herramienta —lo que es capaz de hacer— basándose en el contexto. El segundo método se centró en la ejecución. Aquí, los investigadores utilizaron definiciones de herramientas reales para generar historias paso a paso de un agente resolviendo un problema. Estas historias incluían al agente realizando un plan, llamando a una herramienta, recibiendo una respuesta y luego decidiendo qué hacer a continuación. Crucialmente, estos ejemplos también incluían escenarios donde la información era insuficiente o la herramienta fallaba, enseñando al modelo cómo recuperarse y pedir aclaraciones en lugar de rendirse o adivinar.
El equipo probó este enfoque utilizando dos versiones de un modelo de lenguaje base, uno con 4 mil millones de parámetros y otro de 8 mil millones. Entrenaron estos modelos con su nuevo conjunto de datos MidTool y luego aplicaron los pasos de entrenamiento final estándar utilizados por otros investigadores. Posteriormente, sometieron a los modelos a la prueba en tres benchmarks diferentes diseñados para medir qué tan bien puede un IA usar herramientas. Estas pruebas variaban desde comandos simples de un solo paso hasta tareas compleas de múltiples pasos que requerían que el modelo interactuara con entornos de software reales. Los resultados mostraron un patrón claro: los modelos que recibieron el entrenamiento intermedio superaron consistentemente a aquellos que no lo recibieron. La mejora fue más notable en las tareas más difíciles, particularmente aquellas que requerían múltiples pasos o la capacidad de manejar herramientas desconocidas. Por ejemplo, en una prueba que medía la capacidad de usar herramientas en una conversación de múltiples turnos, el modelo de 4 mil millones de parámetros vio su puntuación aumentar en más de 10 puntos en comparación con un modelo que solo recibió el entrenamiento final.
El estudio también reveló los límites de este enfoque. Si bien los modelos con entrenamiento intermedio se volvieron significativamente mejores en el uso general de herramientas, no se convirtieron en expertos en cada tipo de tarea. Al ser probados en un benchmark específico que involucraba una búsqueda web profunda e iterativa, los modelos no mostraron el mismo nivel de mejora. Esto sugiere que, si bien una base general ayuda con la comprensión de cómo usar herramientas y seguir instrucciones, los comportamientos altamente especializados como la investigación profunda o la exploración compleja pueden requerir sus propios datos de entrenamiento dedicados. Los investigadores encontraron que el entrenamiento intermedio proporcionaba una base sólida y estable que hacía que el entrenamiento final posterior fuera más eficiente. Los modelos aprendieron a converger más rápido y alcanzaron niveles de rendimiento más altos, lo que indica que la etapa de entrenamiento intermedio ayudó a construir una mejor comprensión interna de cómo encajan las herramientas.
Este trabajo desafía la suposición prevalente de que el uso de herramientas es simplemente una habilidad que se añade al final del desarrollo de un modelo. En cambio, sugiere que la capacidad de interactuar con el mundo a través de herramientas es una capacidad fundamental que se beneficia de ser tejida en el conocimiento central del modelo. Al exponer a los modelos a la estructura de la documentación de las herramientas y a la lógica de los flujos de trabajo de las mismas desde etapas tempranas, los investigadores crearon un sistema que es más robusto y adaptable. Los hallazgos implican que, para que la próxima generación de agentes de IA sea verdaderamente efectiva, su entrenamiento debe incluir una fase dedicada donde aprendan no solo qué herramientas existen, sino cómo reconocerlas, planificar con ellas y recuperarse cuando las cosas salen mal. Esta etapa intermedia de entrenamiento parece ser la clave para desbloquear una forma más natural y confiable de agencia en la inteligencia artificial.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.