← Últimos artículos
💻 computer science

How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

Este artículo presenta una métrica corregida por azar denominada Bits-over-Random (BoR) para optimizar dinámicamente la cantidad de herramientas presentadas a los agentes de modelos de lenguaje grandes, demostrando mediante aprendizaje por refuerzo que las listas cortas adaptativas mejoran significativamente la precisión y la cobertura de la selección de herramientas en comparación con los enfoques de tamaño fijo en diversos puntos de referencia.

Autores originales: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

Publicado 2026-05-26
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef (el agente de IA) intentando cocinar un plato específico (responder a una pregunta de un usuario). Tienes una despensa masiva (el registro de herramientas) con miles de ingredientes (herramientas). Antes de poder empezar a cocinar, un ayudante de chef (el sistema de recuperación) tiene que decidir qué ingredientes entregarte.

La gran pregunta que plantea este artículo es: ¿Cuántos ingredientes debería poner el ayudante de chef en tu encimera?

  • Si te entregan demasiados: Te sientes abrumado, confundido y podrías agarrar la especia equivocada.
  • Si te entregan muy pocos: Podrías no tener el ingrediente específico que realmente necesitas, y el plato fracasa.

La mayoría de las cocinas hoy en día usan una regla fija: "Entrega al chef exactamente 5 ingredientes", sin importar si la receta es fácil o difícil. Este artículo argumenta que esta es una mala idea y propone un sistema más inteligente y autoajustable.

Aquí está el desglose de su solución usando analogías simples:

1. El problema de las "reglas fijas"

Imagina una biblioteca donde necesitas encontrar un libro específico.

  • La regla fija: El bibliotecario siempre te entrega una pila de 5 libros.
    • Consulta fácil: Necesitabas un libro sobre "Manzanas". El bibliotecario te entrega 5 libros, y el primero es sobre Manzanas. ¡Genial! Pero perdiste tiempo leyendo los otros 4.
    • Consulta difícil: Necesitabas un libro sobre "Hongos raros del siglo XVIII". El bibliotecario te entrega 5 libros, pero el correcto es el duodécimo libro de la biblioteca. Obtienes 0 libros correctos.

El artículo dice que necesitamos una forma de medir si el bibliotecario está haciendo un buen trabajo, no solo por la cantidad de libros que te entrega, sino por cuánto mejor lo hace en comparación con si simplemente agarrara libros al azar.

2. La solución: "Bits sobre Aleatorio" (BoR)

Los autores introducen una métrica llamada Bits sobre Aleatorio (BoR). Piensa en esto como una "puntuación de suerte".

  • La línea base aleatoria: Si el bibliotecario simplemente agarrara libros a ciegas de la estantería, ¿cuáles son las probabilidades de que obtenga el correcto?
  • La puntuación BoR: Esto mide cuánto mejor lo está haciendo el bibliotecario en comparación con esa suerte ciega.
    • Si el bibliotecario te entrega 1 libro y es el correcto, eso es una gran victoria (porque la suerte aleatoria rara vez acertaría con solo 1 intento).
    • Si el bibliotecario te entrega 100 libros y el correcto está entre ellos, eso es una victoria menor (porque la suerte aleatoria probablemente lo habría encontrado de todos modos con 100 intentos).

El truco mágico: El artículo utiliza esta "puntuación de suerte" como recompensa para un robot de aprendizaje (un agente de RL).

  • Si el robot se detiene temprano y encuentra la herramienta, obtiene una gran recompensa (porque venció a las probabilidades fácilmente).
  • Si el robot sigue agregando más herramientas a la lista, la recompensa disminuye naturalmente (porque encontrar la herramienta en una pila enorme es menos impresionante; es más fácil tener suerte).

Esto significa que el robot aprende a dejar de agregar herramientas tan pronto como está seguro de tener la correcta, sin necesidad de que un humano le diga: "¡Detente en 5!".

3. Los resultados: El ayudante de chef inteligente

Los investigadores probaron a este "Ayudante de Chef Inteligente" contra la "Regla Fija" (siempre 5 herramientas) en tres cocinas de prueba diferentes:

  • La cocina pequeña (BFCL - 370 herramientas):

    • Regla fija: Siempre muestra 50 herramientas por seguridad. Encuentra la herramienta correcta el 90,8 % de las veces.
    • Chef inteligente: Muestra solo 7 herramientas en promedio. Aún encuentra la herramienta correcta el 90,3 % de las veces.
    • Resultado: El Chef inteligente ahorra una cantidad masiva de "espacio en la encimera" (tokens) con casi ninguna pérdida en el éxito.
  • El almacén gigante (ToolBench - 3.251 herramientas):

    • Regla fija: Siempre muestra 5 herramientas. Encuentra la herramienta correcta el 64,7 % de las veces.
    • Chef inteligente: Muestra aproximadamente 4,4 herramientas en promedio. Encuentra la herramienta el 61,9 % de las veces.
    • El giro: En las preguntas realmente difíciles (donde la herramienta correcta está enterrada profundamente en el almacén), la Regla Fija encuentra el 0 % de ellas. El Chef inteligente, al darse cuenta de que las primeras pocas herramientas no funcionan, cava un poco más profundo (mostrando 5,7 herramientas) y encuentra el 16,7 % de esas difíciles. La Regla Fija se rinde demasiado pronto.

4. Por qué menos es más (El efecto "desorden")

El artículo también probó qué sucede cuando la IA intenta realmente seleccionar la herramienta.

  • El hallazgo: Cuando se le muestra a la IA una lista enorme de herramientas (como 50), se confunde y elige la incorrecta con más frecuencia.
  • La analogía: Si le preguntas a un amigo: "¿Cuál de estas 50 fotos es mi perro?", podría adivinar mal porque hay demasiadas opciones. Si le muestras solo 2 fotos, es mucho más probable que elija la correcta.
  • La prueba: Cuando el Chef inteligente mostró menos herramientas, la IA seleccionó la herramienta correcta el 93,1 % de las veces. Cuando se la obligó a mirar 5 herramientas (la Regla Fija), solo seleccionó correctamente el 87,1 % de las veces.

Resumen

Este artículo demuestra que no necesitamos un número "talla única" para cuántas herramientas mostrarle a una IA.

  • Antigua forma: "Muestra 5 herramientas". (Demasiadas pocas para tareas difíciles, demasiadas para las fáciles).
  • Nueva forma: Usa una "Puntuación de Suerte" (BoR) para enseñar al sistema a dejar de agregar herramientas en el momento en que tiene una buena probabilidad de éxito.
  • Beneficio: Ahorra potencia de cálculo, reduce la confusión para la IA y realmente ayuda a la IA a encontrar la respuesta correcta en preguntas difíciles que las reglas fijas pasan por alto.

Los autores construyeron un robot "sonda" simple para probar esta idea, no un sistema de producción completo, pero los resultados sugieren que dejar que la IA decida cuánto mirar es mucho más inteligente que obligarla a mirar una cantidad fija.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →