← Últimos artículos
🤖 AI

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

Este artículo presenta C3RL, un algoritmo de aprendizaje por refuerzo que mejora tanto la precisión como la calibración de los modelos de lenguaje de gran tamaño, y aprovecha estas puntuaciones de confianza bien calibradas para impulsar CAS, una estrategia de escalado adaptativo en tiempo de inferencia que reduce significativamente los costos de inferencia al tiempo que supera a los métodos existentes.

Autores originales: Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

Publicado 2026-07-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un estudiante brillante pero excesivamente confiado tomando un examen muy difícil. Este estudiante, una IA, es excelente resolviendo problemas, pero tiene un mal hábito: cuando no está seguro de la respuesta, adivina de todos modos y dice: "¡Estoy 100% seguro!" con cara de póker. En el mundo de la IA, esto se llama una "alucinación". Es como si el estudiante escribiera con total seguridad "La capital de Francia es Londres" y se equivocara.

El artículo que compartiste presenta un sistema de dos pasos para corregir el comportamiento de este estudiante y hacer que su tiempo de estudio sea más eficiente.

Paso 1: El "Entrenador de la Honestidad" (C3RL)

La primera parte de la solución es un nuevo método de entrenamiento llamado C3RL (Aprendizaje por Refuerzo de Calibración de Corrección y Confianza). Piensa en esto como un entrenador estricto pero justo que le enseña al estudiante dos cosas a la vez:

  1. Obtener la respuesta correcta. (No te limites a adivinar).
  2. Ser honesto sobre qué tan seguro estás. (Si estás adivinando, admítelo).

Normalmente, cuando entrenamos a una IA, solo la premiamos por obtener la respuesta correcta. Esto hace que tengan desesperación por acertar, por lo que mienten sobre su confianza. C3RL cambia las reglas. Le da al estudiante una "estrella de oro" si obtiene la respuesta correcta y dice estar seguro. También le da una "estrella de oro" si se equivoca pero admite que no está seguro.

Sin embargo, le pone una "gran F roja" si se equivoca pero afirma estar 100% seguro. También le pone una "gran F roja" si acierta pero afirma estar totalmente perdido.

El resultado es que la IA aprende a decir: "No estoy seguro de esto", cuando en realidad está adivinando, y "Tengo mucha confianza", cuando realmente sabe la respuesta. Deja de realizar el "engaño confiado".

Paso 2: El "Gestor de Presupuesto Inteligente" (CAS)

Una vez que el estudiante ha aprendido a ser honesto, la segunda parte del sistema entra en acción. Esto se llama CAS (Escalamiento de Tiempo de Prueba Adaptativo basado en la Confianza).

Imagina que tú eres el profesor calificando este examen, pero tienes un presupuesto limitado de tiempo y energía. No puedes dedicar 10 horas a cada pregunta.

  • La forma antigua (Votación por Mayoría): Le pides al estudiante que responda cada pregunta 64 veces y tomas la respuesta más común. Esto es preciso pero increíblemente derrochador. Es como pedirle a un estudiante que resuelva un problema de matemáticas 64 veces solo para estar seguro.
  • La nueva forma (CAS): Le pides al estudiante que responda una pregunta una sola vez.
    • Si el estudiante dice: "Estoy 90% seguro de que es la A", confías en él inmediatamente, anotas la respuesta y sigues adelante. ¡Ahorraste tiempo!
    • Si el estudiante dice: "Solo estoy un 40% seguro", sabes que está teniendo dificultades. Así que le pides que lo intente de nuevo, y de nuevo, y de nuevo, hasta que tenga confianza o hayas intentado suficientes veces.

Debido a que el estudiante (la IA) ahora es honesto sobre su confianza gracias al Paso 1, puedes confiar en sus señales de "estoy seguro". Esto te permite dejar de perder tiempo en preguntas fáciles y concentrar tu energía solo en las difíciles.

El Gran Resultado

El artículo muestra que esta combinación funciona de maravilla:

  1. Mejor Honestidad: La IA se volvió mucho mejor en saber cuándo no sabe la respuesta, sin empeorar en la resolución de los problemas en sí.
  2. Ahorros Masivos: Al usar el "Gestor de Presupuesto Inteligente", el sistema ahorró una cantidad masiva de potencia de cómputo. En algunas pruebas, utilizó 12 veces menos recursos informáticos que el método antiguo, obteniendo los mismos (o mejores) resultados.

En resumen, el artículo enseña a la IA a dejar de farolear sobre lo que sabe, y luego utiliza esa honestidad para ahorrar tiempo y dinero al trabajar duro solo cuando es realmente necesario.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →