← Últimos artículos
🤖 AI

GOAT: A Training Framework for Goal-Oriented Agent with Tools

El artículo presenta GOAT, un nuevo marco de entrenamiento que permite el ajuste fino de agentes de modelos de lenguaje grandes (LLM) de código abierto para el uso complejo de herramientas sin anotación humana, mediante la síntesis automática de datos de ejecución de API orientados a objetivos a partir de la documentación, logrando un rendimiento de vanguardia en los puntos de referencia existentes y en un nuevo GOATBench propuesto.

Autores originales: Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

Publicado 2026-05-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una bibliotecaria muy inteligente y bien leída (la IA) que sabe leer libros y escribir historias. Sin embargo, si le pides a esta bibliotecaria que vaya a la sala trasera de la biblioteca, encuentre una caja específica de mapas antiguos, saque una página concreta y luego use esa página para encontrar una receta específica en un libro de cocina, la bibliotecaria a menudo se pierde. Podría adivinar la caja equivocada, abrir el libro incorrecto o olvidar llevar la página del mapa a la cocina.

Este es el problema con los agentes de IA actuales cuando intentan usar "herramientas" (como las API, que son conexiones digitales a bases de datos, servicios meteorológicos o listas de películas). Son excelentes para chatear, pero terribles para planificar una misión de múltiples pasos donde un paso depende enteramente del resultado del anterior.

El artículo presenta GOAT (Agente Orientado a Objetivos con Herramientas), un nuevo método de entrenamiento diseñado para transformar a esa bibliotecaria confundida en un detective maestro. Así es como funciona, utilizando analogías sencillas:

El Problema: El "Juego de Adivinanzas"

Por lo general, para enseñar a una IA a usar herramientas, los investigadores tienen que contratar personas para escribir miles de ejemplos como: "Primero, pide al API del clima información sobre la lluvia. Luego, toma esa respuesta de 'lluvia' y pide al API de la ropa un impermeable".
Esto es costoso y lento. Sin estos ejemplos escritos por humanos, los modelos de IA simplemente adivinan. A menudo fallan en tareas complejas que requieren encadenar múltiples pasos.

La Solución: La Cocina de "Ingeniería Inversa"

Los autores de GOAT se dieron cuenta de que no necesitaban que humanos escribieran las instrucciones. Ya tenían el "libro de cocina" (la documentación de la API). En lugar de pedirle a la IA que adivine la receta a partir de un plato terminado, decidieron preparar el plato primero y luego describir la receta.

Utilizan una estrategia de "Llamada Primero":

  1. Mapear la Cocina: Primero, el sistema lee todos los manuales de API y dibuja un mapa de cómo se conectan las herramientas. (Por ejemplo: "La salida de la herramienta 'Clima' encaja perfectamente en la entrada de la herramienta 'Paraguas'").
  2. Cocinar la Comida (El Paso de Llamada Primero): El sistema elige un camino en este mapa y ejecuta realmente las herramientas. Pide datos a la herramienta del clima, obtiene el resultado y luego usa inmediatamente ese resultado para pedirle al herramienta del paraguas. No adivina; ejecuta pasos reales y obtiene respuestas reales.
  3. Escribir la Receta (El Paso de Abstracción): Después de que las herramientas han hecho el trabajo, la IA examina la cadena final de eventos y escribe una consulta de usuario que coincide con ella. Esencialmente dice: "Oh, acabo de hacer todos estos pasos para encontrar un impermeable. Por lo tanto, un usuario que pregunta '¿Qué debería llevar si está lloviendo?' es lo que acabo de resolver".

Al hacer esto al revés (Acción \rightarrow Pregunta), la IA aprende la lógica correcta de cómo se conectan las herramientas sin necesidad de que un humano escriba las instrucciones. Aprende haciendo el trabajo primero y luego explicando lo que hizo.

El Resultado: Un Súper Ayudante

El artículo probó estos nuevos agentes entrenados con "GOAT" en varios desafíos:

  • RestBench & API-Bank: Son como exámenes donde la IA debe encontrar reseñas de películas o recomendaciones musicales utilizando una cadena de herramientas.
  • GOAT-Bench: Los autores crearon un nuevo examen, más grande, específicamente para este tipo de tareas complejas de múltiples pasos.

Los hallazgos fueron claros:

  • Modelos de Código Abierto: Antes de GOAT, los modelos de IA de código abierto más pequeños (que son gratuitos y disponibles para todos) eran casi inútiles en estas tareas complejas. Fallaban casi el 100% de las veces.
  • Después de GOAT: Una vez entrenados con este nuevo método, estos mismos modelos de código abierto se volvieron increíblemente buenos en las tareas. En algunos casos, rindieron mejor que modelos costosos de código cerrado (como GPT-4) que usualmente dominan estas pruebas.
  • Sin Humanos Necesarios: Todo el conjunto de datos de entrenamiento fue construido automáticamente por el sistema utilizando los manuales de API. Ningún humano tuvo que sentarse a escribir las instrucciones paso a paso.

La Conclusión

GOAT es una forma de enseñar a los agentes de IA a planificar y usar herramientas permitiéndoles practicar el trabajo real primero y luego enseñándoles a describir el objetivo. Convierte a los modelos de IA de código abierto de "adivinadores sin rumbo" en "planificadores confiables" sin requerir costosos maestros humanos. Los autores han puesto su código y su nueva suite de pruebas (GOAT-Bench) a disposición de otros para su uso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →