← Últimos artículos
🤖 machine learning

On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

Este artículo investiga la efectividad y eficiencia del llamado de herramientas agéntico al revelar cómo pequeñas elecciones de implementación sesgan significativamente los resultados de la evaluación e introduciendo técnicas para acelerar el entrenamiento de aprendizaje por refuerzo sin comprometer el rendimiento.

Autores originales: Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico muy inteligente (un Modelo de Lenguaje Grande) que conoce muchos datos de su entrenamiento. Pero para hacer cosas en el mundo real, necesita usar herramientas, como llamar a una API del clima, buscar en la web o revisar un calendario. Este artículo trata sobre dos grandes preguntas: ¿Qué tan bien sabemos si el robot es realmente bueno usando estas herramientas? y ¿Cómo podemos enseñarle a usarlas sin desperdiciar una fortuna en electricidad y tiempo de computación?

Aquí está el desglose utilizando analogías simples:

Parte 1: El problema de la "Efectividad" (¿Es justa la prueba?)

Los autores descubrieron que medir qué tan bueno es un robot usando herramientas es sorprendentemente frágil. Es como juzgar las habilidades culinarias de un chef, pero la puntuación cambia drásticamente dependiendo de detalles diminutos, a menudo no declarados, en la cocina.

  • La ruleta de la "Semilla Aleatoria" (Random Seed): Imagina lanzar una moneda para decidir el orden de los ingredientes. El artículo encontró que si cambias este punto de partida aleatorio (la "semilla"), la puntuación del robot puede saltar significamente, especialmente en tareas largas de múltiples pasos. Es como si un estudiante recibiera una nota diferente en el mismo examen solo porque se sentó en un asiento distinto.
  • El formato de "Narración" (Storytelling): Cómo le cuentas al robot sobre el pasado importa. El artículo comparó dos formas de mostrarle al robot el historial de una conversación:
    • Método A (Nativo): Mostrar el historial como un chat natural de ida y vuelta.
    • Método B (Contexto): Verter todo el historial en un bloque gigante de texto.
    • El Resultado: El robot funcionó entre un 6 y un 8% mejor con el Método A. Resulta que el robot entiende mucho mejor un flujo de conversación natural que un muro gigante de texto, incluso si la información es la misma.
  • El "Historial de Pensamiento": ¿Debería el robot ver sus propios pensamientos previos (como "primero necesito revisar el clima")? El artículo encontró que mantener los rastros de pensamiento visibles ayuda al robot a mantenerse en el camino, mejorando las puntuaciones en aproximadamente un 3-5%.
  • La "Nota del Profesor" (System Prompt): A veces, solo añadir una pequeña frase a las instrucciones del robot (por ejemplo, "Recuerda actuar como un usuario en chats de varios turnos") aumentó el rendimiento tanto como meses de entrenamiento adicional. Esto sugiere que muchos "mejoras" vistas en otros artículos podrían ser simplemente porque el profesor dio mejores instrucciones, no porque el estudiante aprendió mejor.

La Gran Conclusión: Si no estandarizas estos detalles diminutos (cómo formatear el chat, qué semilla aleatoria usas, qué instrucciones das), comparar diferentes robots es como comparar manzanas con naranjas. Las clasificaciones en las tablas de clasificación podrían ser engañosas.

Parte 2: El problema de la "Eficiencia" (Deja de perder el tiempo)

Una vez que sabemos cómo probar de manera justa, los autores analizaron cómo entrenamos a estos robots usando Aprendizaje por Refuerzo (RL). Descubrieron que el proceso de entrenamiento actual es increíblemente wasteful (desperdiciado), como un estudiante estudiando para un examen releyendo páginas que ya conoce perfectamente.

Identificaron dos fuentes principales de desperdicio:

1. El problema de la "Tarea Aburrida" (Prompts de Varianza Cero)

  • El Problema: Durante el entrenamiento, se le dan al robot muchos problemas de práctica. En aproximadamente el 80% de ellos, el robot o bien los acierta al 100% inmediatamente o falla completamente de una manera que no enseña nada. Estos son "prompts de varianza cero": no proporcionan ninguna señal de aprendizaje. Es como un profesor haciendo que un estudiante resuelva 1+1=2 mil veces; eso no le ayuda a aprender.
  • La Solución: Los autores crearon una "lista de salto" (skip list). Si el robot acierta un problema específico tres veces seguidas, el sistema deja de perder tiempo generando nuevos intentos para él y pasa a un problema más difícil. Esto ahorra una cantidad masiva de tiempo de computación.

2. El problema del "Sobre-diseño" (Costos de Actualización Altos)

  • El Probleño: Para aprender, el robot suele intentar un problema varias veces (digamos, 8 veces) para ver cuál es la mejor respuesta. Luego, la computadora gasta una enorme cantidad de energía actualizando el cerebro del robot basándose en esos 8 intentos. El artículo encontró que la parte de "actualización del cerebro" toma de 3 a 5 veces más tiempo que la parte de "intentarlo" propiamente dicha.
  • La Solución: En lugar de usar los 8 intentos para actualizar el cerebro, el sistema elige solo los más útiles —específicamente, la mejor respuesta y la peor respuesta. Esto crea el mayor contraste para el aprendizaje. Al ignorar los intentos "intermedios", redujeron significamente el tiempo de actualización sin perjudicar el aprendizaje del robot.

El Resultado Final

Al corregir el "desperdicio" en el proceso de entrenamiento, los autores hicieron que el robot aprendiera de 1.7 a 2.6 veces más rápido (en términos de tiempo real del reloj) sin que el robot se volviera más tonto. De hecho, el robot mejoró en el uso de herramientas en conversaciones de múltiples pasos, superando a varios modelos famosos.

En resumen: El artículo argumenta que debemos dejar de tratar los benchmarks de los robots como un juego casual y empezar a tratarlos como un experimento científico riguroso (corrigiendo la "Efectividad"). Simultáneamente, debemos dejar de entrenar a los robots como si estuvieran pagando por cada segundo de su pensamiento y empezar a ser más inteligentes sobre lo que realmente aprendemos de ellos (corrigiendo la "Eficiencia").

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →