The Effect of Scripts and Formats on LLM Numeracy
Este artículo revela que los modelos de lenguaje de gran tamaño sufren caídas significativas de precisión al procesar expresiones numéricas en escrituras o formatos subrepresentados, pero demuestra que las estrategias de prompting dirigidas pueden mitigar eficazmente esta disparidad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un estudiante brillante que ha leído casi todos los libros del mundo. Este estudiante es un maestro de las matemáticas, capaz de resolver problemas complejos de suma y multiplicación instantáneamente. Pero hay un inconveniente: este estudiante solo ha visto números escritos de la forma estándar que usamos en inglés (como 1, 2, 3).
Este artículo trata sobre lo que sucede cuando le pides a este estudiante superinteligente que haga matemáticas usando diferentes "lenguajes" o "estilos" que no ha visto mucho antes.
El descubrimiento principal: El "Impuesto del Script"
Los investigadores descubrieron que cuando cambiaban los números estándar por otros sistemas de escritura —como १, २, ३ (Devanagari) o ۱, ۲, ۳ (Perso-árabe)— las habilidades matemáticas del estudiante caían drásticamente.
Piénsalo de esta manera: Si le pides a un chef que cocine un filete perfecto, puede hacerlo fácilmente. Pero si le entregas una receta escrita en un idioma que no lee, o si le dices que pique las cebollas con una cuchara en lugar de un cuchillo, podría dejar caer los ingredientes o quemar el filete. El chef sigue sabiendo cómo cocinar, pero el formato de las instrucciones lo confundió.
El artículo llama a esto el "Impuesto del Script" (Script Tax). Es una penalización que la IA paga solo por ver números en una forma diferente. Aunque el problema matemático es exactamente el mismo (por ejemplo, "5 + 5"), la IA se equivoca entre un 66% y un 87% más a menudo si los números no están en el estilo estándar del inglés.
¿Por qué sucede esto?
El artículo señala a dos principales culpables:
- La "Dieta de Entrenamiento": La IA fue entrenada con una dieta masiva de texto de internet. La mayor parte de ese texto utiliza números estándar en inglés. Es como si el estudiante solo hubiera comido manzanas; cuando de repente le das una pera, no sabe cómo masticarla correctamente.
- El problema de los "Tokens": La IA no lee las palabras como los humanos; las divide en trozos diminutos llamados "tokens".
- Los números estándar (como 123) pueden ser uno o dos trozos.
- Algunos otros sistemas de escritura dividen el mismo número en muchos trozos diminutos y confusos.
- El artículo encontró que cuanto más se divide un número en "trozos", más difícil le resulta a la IA hacer la matemática. Es como intentar resolver un rompecabezas donde alguien ha cortado la imagen en 100 piezas diminutas en lugar de 10 grandes.
La buena noticia: Podemos arreglarlo con "pistas"
Los investigadores no solo encontraron un problema; encontraron una forma de ayudar al estudiante. Probaron diferentes formas de hacer la pregunta (llamadas "prompting"):
- Solo pedirlo amablemente: "Por favor, resuelve esto". -> Sigue fallando.
- Decirle el idioma: "Esto está escrito en tailandés". -> Sigue fallando.
- Darle una hoja de trucos (Mapeo): Mostrarle a la IA una lista como "Este símbolo significa 1, este otro significa 2". -> Mejor, pero no perfecto.
- El truco de magia (Few-Shot Prompting): Este fue el ganador. Los investigadores le dieron a la IA algunos ejemplos primero.
- Ejemplo 1: "Aquí hay un problema en tailandés: 1 + 1 = 2. Aquí está la respuesta".
- Ejemplo 2: "Aquí hay otro..."
- Ahora: "Resuelve este".
Al mostrarle a la IA algunos ejemplos de cómo manejar estos estilos de números extraños, su rendimiento se disparó. Es como mostrarle al estudiante algunos problemas de práctica en el nuevo idioma antes del examen real. De repente, podía hacer las matemáticas perfectamente.
El giro del formato
El artículo también analizó cómo se agrupan los números. En los EE. UU., escribimos números grandes como 1,000,000 (comas cada tres dígitos). En Europa, podrían escribir 1.000.000 (puntos) o 1 000 000 (espacios).
La IA también se confundió con estos estilos. Manejó perfectamente el estilo de EE. UU., pero tuvo dificultades con los estilos europeos. Curiosamente, la IA a menudo confundía estos formatos numéricos con cosas como direcciones IP (por ejemplo, 192.168.1.1), que son comunes en sus datos de entrenamiento pero no son problemas matemáticos.
La conclusión fundamental
El artículo concluye que estos modelos de IA no son "malos en matemáticas". En realidad, son bastante buenos en la lógica. El problema es que son frágiles. Dependen mucho de ver los números en la forma específica y familiar con la que fueron enseñados.
Si quieres que una IA haga matemáticas por ti en un idioma diferente o con diferentes estilos de números, no puedes simplemente pedírselo directamente. Tienes que darle un pequeño empujón: muéstrale algunos ejemplos primero, o explícale exactamente cómo funcionan los símbolos. Una vez que haces eso, el "Impuesto del Script" desaparece y las matemáticas vuelven a ser fáciles.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.