Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation
Este artículo introduce y evalúa cinco métodos verbalizados para extraer la confianza por token de los modelos de lenguaje de gran tamaño en la traducción automática, encontrando que funcionan de manera comparable a las señales internas en la detección de errores y la calibración a pesar de mostrar poca correlación con ellas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un robot traductor multilingüe muy inteligente. Le pides que traduzca una frase y lo hace al instante. Pero, ¿cómo sabes si lo ha hecho bien? ¿Sabe el robot si ha cometido un error?
Este artículo investiga una pregunta específica: ¿Podemos preguntarle al robot: "¿Qué tan seguro estás de esta palabra específica?" y confiar en su respuesta?
Los investigadores compararon dos formas de obtener el "nivel de confianza" del robot:
- La forma "Interna": Observar la matemática secreta del robot (sus probabilidades internas). Es como echar un vistazo al cerebro del robot para ver cuántas opciones estaba considerando antes de elegir una palabra.
- La forma "Verbalizada": Simplemente preguntarle al robot: "En una escala de 0 a 1, ¿qué tan seguro estás de esta palabra?" y hacer que escriba la respuesta.
Aquí hay un desglose de sus hallazgos utilizando analogías sencillas:
1. El problema de "Echar un vistazo al cerebro"
Normalmente, cuando queremos saber si una traducción es buena, observamos la matemática interna del robot. Si el robot estaba un 99% seguro de haber elegido la palabra correcta, asumimos que es correcta.
Sin embargo, el artículo señala un fallo en este método llamado "Competencia de Forma Superficial" (Surface Form Competition).
- La analogía: Imagina que estás traduciendo "The cat sat on the mat". También podrías decir "The feline sat on the rug". Ambas son traducciones perfectas.
- El problema: Si el robot está dividido entre "cat" y "feline", su matemática interna podría mostrar que solo está un 50% seguro de "cat" porque también está pensando en "feline". Pero "cat" es en realidad una traducción correcta.
- El resultado: La matemática interna del robot dice: "No estoy seguro", pero el resultado es en realidad perfecto. La señal interna es engañosa porque mide la confusión entre opciones, no la corrección.
2. La nueva idea: Solo pregúntale
Dado que el robot puede hablar, los investigadores probaron un enfoque diferente: Confianza Verbalizada. En lugar de observar la matemática, los incitaron a decir: "Estoy un 90% seguro de que esta palabra es correcta".
Probaron cinco formas de preguntar:
- La Lista: "Dime qué partes de la oración están mal".
- Números de Palabras: "Dale a cada palabra una puntuación de 0 a 1".
- Palabras de Palabras: "Dale a cada palabra una etiqueta como 'Muy Seguro' o 'No Estoy Seguro'".
- Números/Palabras de Tokens: Hacer lo mismo pero para piezas diminutas de palabras (tokens) en lugar de palabras completas.
3. La gran sorpresa: No están de acuerdo
Los investigadores esperaban que si la matemática interna del robot decía "No estoy seguro", y le preguntábamos al robot "¿Estás inseguro?", este diría "Sí".
Se equivocaron.
- La analogía: Es como un pronosticador del tiempo que mira sus complejos datos de radar (Interno) y dice: "Hay un 50% de probabilidad de lluvia", pero cuando le preguntas directamente: "¿Crees que lloverá?", él dice: "Estoy 90% seguro de que no lloverá".
- El hallazgo: Casi no hubo correlación entre la matemática interna del robot y lo que decía en voz alta. Eran esencialmente dos estrategias diferentes que no se comunicaban realmente entre sí.
4. ¿Ayudó el preguntar?
Entonces, si no están de acuerdo, ¿cuál de los dos es mejor para detectar errores de traducción reales?
- Los resultados: Sorprendentemente, preguntar al robot (Verbalizado) funcionó tan bien como, y a veces mejor que, echar un vistazo a la matemática (Interno).
- El matiz: Depende de qué robot uses.
- Para un modelo (Llama3), pedirle que diera una puntuación "Likert" (por ejemplo, "Muy Seguro") funcionó mejor.
- Para otro modelo (Aya23), observar la matemática interna (Entropía) funcionó mejor.
- La dosis de realidad: Incluso el mejor método no era perfecto. Los robots seguían siendo solo moderadamente buenos detectando sus propios errores. Es como un estudiante tomando un examen que es bastante bueno sabiendo qué respuestas están mal, pero aun así comete algunos errores de los que no se da cuenta.
5. Por qué esto es importante (según el artículo)
El artículo concluye que no necesitamos ser "hackers" mirando dentro del código del robot para obtener una puntuación de confianza. Podemos simplemente preguntarle.
- Accesibilidad: No necesitas acceso a la "mente" interna del robot (que suele estar oculta en modelos de código cerrado). Solo necesitas poder chatear con él.
- Granularidad: Los investigadores descubrieron que incluso cuando pedían un número preciso (como 0.83), los robots tendían a redondear sus respuestas a pasos simples (como 0.8 o 0.9), actuando más como si estuvieran usando una lista de verificación simple que una calculadora de alta precisión.
Resumen
El artículo es una prueba de si podemos confiar en las propias palabras de un Modelo de Lenguaje Grande (LLM) sobre su confianza.
- Forma antigua: Mirar la matemática (Interno).
- Nueva forma: Preguntar al modelo (Verbalizado).
- Veredicto: Son cosas totalmente diferentes, pero preguntar al modelo funciona tan bien como mirar la matemática para encontrar errores de traducción. Es una forma más simple y accesible de comprobar si una traducción es probablemente mala, sin necesidad de ver el código secreto del modelo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.