← Últimos artículos
💻 computer science

Tunable Tool-Call Rates in LLM Agents via Representation Steering

Este artículo demuestra que las tasas de llamada a herramientas en agentes de LLM pueden controlarse con precisión en el momento de la inferencia sin reentrenamiento mediante la aplicación de una única dirección de guía lineal libre de entrenamiento extraída de la corriente residual del modelo, la cual ajusta de forma monótona la propensión de la llamada para optimizar la relación entre precisión y costo a través de diversas arquitecturas y tipos de herramientas.

Autores originales: Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

Publicado 2026-08-27
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son potentes motores de texto, capaces de responder preguntas, escribir historias y resolver problemas. Sin embargo, estos sistemas operan con una limitación fundamental: dependen enteramente de la información almacenada en su memoria interna. Cuando una pregunta requiere hechos que son demasiado oscuros, demasiado recientes o demasiado complejos para ser memorizados, el modelo a menudo adivina con una confianza peligrosa, produciendo respuestas que suenan plausibles pero que son completamente erróneas. Para solucionar esto, los desarrolladores han enseñado a estos modelos a utilizar herramientas externas, como motores de búsqueda web o calculadoras, para buscar información antes de responder. Sin embargo, enseñar a un modelo cuándo detenerse y recurrir a una herramienta es sorprendentemente difícil. Si el modelo llama a una herramienta con demasiada frecuencia, pierde tiempo y dinero, y corre el riesgo de activar acciones no deseadas. Si llama a una herramienta con demasiada poca frecuencia, pierde la oportunidad de encontrar la respuesta correcta y permanece erróneamente confiado.

Los investigadores han buscado durante mucho tiempo formas de hacer que estas decisiones sean más fiables, generalmente reentrenando al modelo con nuevos ejemplos o reescribiendo cuidadosamente las instrucciones que se le dan. Estos métodos son costosos y rígidos; una vez que un modelo ha sido entrenado o instruido de cierta manera, cambiar su comportamiento requiere reiniciar el proceso. Un nuevo estudio de investigadores de la UC Santa Cruz y la UC Berkeley sugiere un enfoque diferente. Descubrieron que la decisión de usar una herramienta no es un proceso complejo y oculto que requiera un reentrenamiento para cambiar. En cambio, está controlada por una señal única y simple dentro del funcionamiento interno del modelo que puede ajustarse en tiempo real, como girar un dial, sin alterar el entrenamiento del modelo ni sus instrucciones.

Los investigadores comenzaron observando cómo se comporta un modelo de lenguaje cuando se le presenta una lista de herramientas disponibles, como un motor de búsqueda, una calculadora y un intérprete de código. Notaron que, antes de que el modelo realmente hable o escriba una respuesta, genera una señal interna específica que indica si tiene la intención de usar alguna herramienta en absoluto. Al comparar el estado interno del modelo cuando decide usar una herramienta frente a cuando decide responder desde la memoria, el equipo identificó una dirección específica en el espacio matemático del modelo que representa el "impulso" de llamar a una herramienta. Esta dirección no está ligada a una herramienta específica como una calculadora o un motor de búsqueda; más bien, es una señal general que simplemente significa "usar una herramienta".

Para probar este descubrimiento, los investigadores no reentrenaron el modelo ni cambiaron sus instrucciones. En su lugar, tomaron esta dirección identificada y la añadieron al procesamiento interno del modelo durante la generación de una respuesta. Al añadir una pequeña cantidad de esta señal, pudieron fomentar que el modelo usara herramientas con más frecuencia. Al restarla, pudieron suprimir el impulso de usar herramientas por completo. Descubrieron que este ajuste funcionaba con una precisión notable. A medida que aumentaban la fuerza de la señal, la tasa de llamadas a herramientas del modelo aumentaba suavemente de casi cero a casi el cien por ciento. Crucialmente, el modelo no empezó a llamar a las herramientas de forma aleatoria. Cuando los investigadores impulsaron al modelo a llamar a herramientas con más frecuencia, este se dirigió específicamente a las preguntas que no podía responder por sí mismo, como hechos históricos oscuros o cálculos complejos, mientras ignoraba las preguntas que ya sabía responder.

El estudio también reveló que este mecanismo de control es altamente adaptable. Los investigadores extrajeron la señal de "uso de herramientas" de una configuración con tres herramientas específicas y luego la aplicaron a un conjunto de herramientas completamente diferente, que incluía pronósticos meteorológicos, consultas del mercado de valores y envío de correos electrónicos. La misma señal indujo con éxito al modelo a usar estas nuevas herramientas con la misma eficacia que si hubiera sido entrenado específicamente para ellas. Además, este método funcionó en una amplia variedad de arquitecturas de modelos diferentes, desde modelos pequeños y estándar hasta sistemas masivos y complejos utilizados en la industria. En cada caso, la señal única permitió a los investigadores subir o bajar el comportamiento de llamada de herramientas sin romper la capacidad del modelo para formar frases correctas o seleccionar la herramienta apropiada una vez realizada la llamada.

Cuando los investigadores probaron este método en un entorno real donde el modelo podía realizar búsquedas web, los resultados fueron impactantes. En un conjunto de preguntas fácticas difíciles, el modelo sin ajustar respondió correctamente solo alrededor del 29 por ciento de las veces, adivinando a menudo cuando debería haber buscado. Al aplicar la señal de dirección para fomentar el uso de herramientas, la precisión saltó al 56 por ciento, casi duplicando el rendimiento del modelo. Este aumento vino acompañado de un costo manejable, ya que el modelo realizó aproximadamente una llamada de búsqueda por pregunta. Los investigadores pudieron trazar un camino claro entre el costo de usar herramientas y la precisión de las respuestas, mostrando que los operadores podrían elegir un equilibrio específico que se adapte a sus necesidades.

Este trabajo desafía la suposición de que controlar el comportamiento de una IA requiere un reentrenamiento pesado o una ingeniería de prompts compleja. Demuestra que un proceso de toma de decisiones crítico —saber cuándo recurrir a la ayuda externa— está codificado en una dirección simple y lineal dentro del estado interno del modelo. Al encontrar y ajustar esta dirección, los investigadores pueden hacer que los agentes de IA sean más fiables y eficientes sin cambiar su entrenamiento fundamental. El método ofrece una forma ligera de ajustar el costo y la precisión de los sistemas de IA, asegurando que utilicen sus herramientas solo cuando sea necesario y eviten los peligros tanto de la dependencia excesiva como de las conjeturas peligrosas. Si bien la técnica no corrige los errores en la forma en que se ejecuta una herramienta, proporciona una nueva y poderosa palanca para gestionar la elección más básica y costosa que hace un agente de IA: si actuar por su cuenta o buscar ayuda.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →