← Últimos artículos
🤖 machine learning

Improved Confidence Estimates for Black-Box Large Language Models

Este artículo propone un método de baja sobrecarga que mejora la cuantificación de la incertidumbre para modelos de lenguaje de gran tamaño de caja negra mediante el entrenamiento de clasificadores simples para predecir la corrección de las respuestas utilizando puntuaciones de confianza existentes y la corrección de consultas similares de un conjunto de datos objetivo.

Autores originales: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

Publicado 2026-08-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje de gran tamaño se han convertido en herramientas poderosas para la escritura, la programación y la resolución de preguntas, pero conllevan un riesgo oculto: a veces inventan hechos con absoluta certeza. Este fenómeno, a menudo llamado alucinación, crea una barrera significativa para el uso de estos sistemas en campos de alto riesgo como la atención médica o la investigación científica, donde una respuesta errónea puede tener consecuencias graves. Para resolver esto, los investigadores han intentado durante mucho tiempo construir sistemas que puedan decirnos cuánto confiar en una respuesta específica. El objetivo es asignar una puntuación a cada respuesta que indique su fiabilidad. Actualmente, existen muchos métodos para generar estas puntuaciones, que van desde pedir al modelo que califique su propia confianza hasta analizar cuánto varían sus respuestas cuando se le hace la misma pregunta de diferentes maneras. Sin embargo, estas puntuaciones existentes suelen operar de forma aislada, tratando cada nueva pregunta como si fuera la primera vez que el modelo la ve, sin observar cómo se ha desempeñado el modelo en preguntas similares en el pasado.

Un equipo de investigadores de Layer 6 AI y TD Insurance ha propuesto un enfoque diferente que trata la confianza no como una propiedad fija del modelo, sino como un patrón que puede aprenderse. Argumentan que, si bien los métodos existentes generan puntuaciones de incertidumbre brutas sin necesidad de datos previos, las aplicaciones del mundo real casi siempre involucran un conjunto de datos de preguntas y respuestas que ya han sido verificadas en cuanto a su corrección. Los investigadores se dieron cuenta de que estos datos etiquetados son un recurso vasto y desaprovechado. En lugar de intentar inventar una nueva forma de medir la incertidumbre desde cero, construyeron un sistema simple que toma las puntuaciones existentes y las combina con información sobre cómo respondió el modelo a preguntas similares en el pasado. Al entrenar un programa informático estándar para reconocer la relación entre estos inputs y la corrección real de las respuestas, crearon un nuevo método que supera consistentemente a las puntuaciones originales por sí solas.

El núcleo de su trabajo consiste en un proceso de dos pasos que imita cómo un experto humano podría verificar una nueva afirmación. Primero, el sistema toma una nueva pregunta y la respuesta que proporciona el modelo de lenguaje de gran tamaño. Luego, calcula las puntuaciones de incertidumbre estándar que el modelo u otras herramientas producirían normalmente. A continuación, el sistema busca en una biblioteca de referencia de preguntas respondidas anteriormente para encontrar aquellas que son más similares a la nueva pregunta. Comprueba si el modelo acertó o falló en esas preguntas similares en el pasado y mide qué tan cerca están de la pregunta actual. Estos detalles —las puntuaciones estándar, el historial de preguntas similares y el desempeño pasado del modelo en ellas— se introducen en un clasificador simple. Este clasificador aprende a predecir si la nueva respuesta es correcta, traduciendo efectivamente las señales de incertididad bruta en una probabilidad calibrada de verdad.

Los investigadores probaron este método en varios conjuntos de datos diferentes, incluyendo evaluaciones de razonamiento de sentido común, hechos científicos y preguntas de conocimiento general, utilizando varios tamaños de modelos de lenguaje. Compararon su nuevo sistema contra los mejores métodos existentes, incluyendo aquellos que piden al modelo que exprese su confianza y aquellos que generan muchas variaciones de una respuesta para comprobar la consistencia. Los resultados mostraron que su enfoque proporcionaba consistentemente predicciones más precisas de corrección. En casi todas las pruebas, el nuevo método fue mejor para distinguir entre respuestas correctas e incorrectas que las puntuaciones originales por sí solas. Además, el sistema produjo probabilidades bien calibradas, lo que significa que cuando predecía que una respuesta tenía un 80 por ciento de probabilidad de ser correcta, era correcta aproximadamente el 80 por ciento de las veces. Esta calibración es crucial para la toma de decisiones, ya que permite a los usuarios confiar en los números que el sistema proporciona.

Uno de los hallazgos más significativos fue que el método funcionó bien incluso cuando dependía de muy poca información adicional. En algunas pruebas, el sistema utilizó solo una única respuesta del modelo y un historial de preguntas similares, sin necesidad de que el modelo generara múltiples variaciones de la respuesta. Esto mantuvo el costo computacional bajo, haciendo que el método fuera práctico para el uso en el mundo real donde la velocidad y la eficiencia importan. Los investigadores también descubrieron que la mejor manera de combinar estas señales dependía de la tarea específica, lo que sugiere que un enfoque flexible que pueda adaptarse a diferentes tipos de preguntas es superior a una solución de talla única. Al tratar la estimación de la confianza como un problema de aprendizaje en lugar de un cálculo fijo, el equipo demostró que se puede utilizar los datos existentes para mejorar significativamente la seguridad y la fiabilidad de los modelos de lenguaje de gran tamaño sin requerir acceso a su funcionamiento interno o un reentrenamiento costoso.

El estudio concluye que, si bien las puntuaciones de incertidumbre iniciales generadas por las herramientas actuales son útiles, no son la última palabra sobre la fiabilidad. Al aprovechar el hecho simple de que los modelos tienden a desempeñarse de manera consistente en tipos de preguntas similares, un marco de aprendizaje supervisado puede refinar estas puntuaciones para convertirlas en estimaciones mucho más confiables. Esto no reemplaza la necesidad de buenas métricas de incertidumbre, sino que las mejora, convirtiendo los datos brutos en información accionable. El trabajo sugiere que el camino hacia una inteligencia artificial más segura no reside solo en construir mejores modelos, sino en construir mejores formas de entender e interpretar las respuestas que esos modelos dan.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →