← Últimos artículos
💻 computer science

Uncertainty Quantification for LLM Function-Calling

Este trabajo presenta la primera evaluación de los métodos de cuantificación de la incertidumbre en la llamada a funciones de los LLM, descubriendo que las técnicas de múltiples muestras no superan significativamente a las de una sola muestra, pero que ambas pueden mejorarse aprovechando las particularidades estructurales y semánticas de las salidas de dichas funciones.

Autores originales: Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

Publicado 2026-04-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Dilema del Robot con la Tarjeta de Crédito: ¿Cómo saber si una IA está "adivinando"?

Imagina que tienes un robot asistente en casa. No solo te dice el clima, sino que tiene permiso para usar tu tarjeta de crédito para comprar comida o para borrar archivos de tu computadora si se lo pides.

El problema es que, a veces, los modelos de lenguaje (como ChatGPT) pueden cometer errores. Si le pides: "Compra 10 kilos de manzanas" y el robot entiende "Compra 100 kilos de manzanas", el error es costoso y difícil de revertir.

Este estudio trata sobre cómo medir la "incertidumbre" de la IA. Es decir, cómo lograr que el robot nos diga: "Oye, no estoy muy seguro de haber entendido bien la orden, ¿podrías confirmarme antes de que presione el botón de comprar?".

1. El problema: El "Efecto de la Respuesta Automática"

Los investigadores se dieron cuenta de algo curioso. En tareas normales (como escribir un poema), si le pides a la IA que genere varias opciones, puedes comparar las respuestas para ver si todas dicen lo mismo. Si todas dicen "Hola", la IA está segura; si una dice "Hola" y otra "Adiós", la IA está confundida. A esto se le llama Entropía Semántica.

Sin embargo, cuando la IA tiene que usar "funciones" (como llamar a una aplicación o ejecutar un código), las reglas cambian. La IA es tan precisa con el código que, aunque se equivoque, sus respuestas suelen parecerse mucho entre sí en la superficie, lo que engaña a los métodos tradicionales de medición de confianza. Es como si un estudiante te diera tres respuestas casi idénticas, pero todas con un error matemático sutil; si solo comparas si las respuestas "se parecen", pensarás que el estudiante sabe mucho, cuando en realidad está equivocado en lo importante.

2. El gran descubrimiento: "Menos es más"

Los científicos probaron métodos muy complejos y costosos (que requieren que la IA piense muchas veces la misma respuesta) y descubrieron que no funcionaban mejor que los métodos simples.

Es como si para saber si un chef está seguro de un plato, intentaras hacerle 10 exámenes distintos (método complejo) en lugar de simplemente mirar qué tan seguro se ve cuando pone la sal (método simple). El estudio demostró que mirar la "probabilidad" de las palabras que la IA elige en su primer intento (un método llamado G-NLL) es, sorprendentemente, una de las mejores formas de saber si va a meter la pata.

3. La solución: "Filtrar el ruido"

Aquí es donde la investigación se pone brillante. Los autores descubrieron que la IA gasta mucha "energía de duda" en cosas que no importan.

Imagina que estás dictando una dirección. Si la IA duda entre escribir un paréntesis ( o un corchete [, es una duda técnica de escritura, pero no cambia el destino del paquete. Pero si duda entre el número de la calle o el nombre de la ciudad, ¡eso es vital!

Los investigadores crearon un método llamado SMT (Tokens Semánticamente Significativos). Básicamente, le enseñaron al sistema de seguridad a ignorar las dudas sobre la gramática o los símbolos y a enfocarse solo en las dudas sobre los datos importantes (nombres, cantidades, fechas).

En resumen:

El estudio nos dice que para que los robots y la IA sean seguros en el mundo real:

  1. No necesitamos complicarnos la vida con simulaciones infinitas; a veces, observar la confianza inicial es suficiente.
  2. Debemos enseñar a la IA a distinguir entre "dudar de la ortografía" y "dudar de la información".

Si logramos que la IA sepa cuándo está "adivinando" los datos importantes, podremos usarla para tareas reales (como mover dinero o gestionar bases de datos) con mucha más tranquilidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →