Neural Diversity Regularizes Hallucinations in Language Models
Este artículo introduce la "diversidad neural" como un tercer eje de escalado para los modelos de lenguaje, proponiendo el método ND-LoRA para reducir las alucinaciones hasta en un 25,6% mediante representaciones paralelas decorrelacionadas y la regularización de Barlow Twins, estableciendo al mismo tiempo límites formales que vinculan una menor correlación neural con una mayor fiabilidad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando resolver un acertijo difícil, pero en lugar de preguntarle a una sola persona, le preguntas a todo un equipo. Si todos los miembros del equipo piensan exactamente igual, es posible que todos cometan el mismo error tonto y te den la respuesta incorrecta al mismo tiempo. Este es el problema central con los "modelos de lenguaje" modernos —esos programas informáticos superinteligentes que escriben historias, responden preguntas y charlan con nosotros—. Aunque estos programas se están volviendo más grandes y más inteligentes, a veces todavía inventan cosas, un fallo llamado "alucinación". Pueden afirmar con total confianza un dato falso o inventar una historia que nunca ocurrió.
Para solucionar esto, los científicos suelen intentar hacer que los modelos sean más grandes o alimentarlos con más datos, como intentar resolver un rompecabezas comprando una caja más grande. Pero este artículo sugiere un enfoque diferente: en lugar de hacer al equipo más grande, haz que los miembros del equipo sean diferentes. Los autores toman prestada una idea de las finanzas llamada "diversificación". Así como un inversor no pone todo su dinero en una sola acción porque si esa falla, lo pierde todo, distribuye su dinero en muchas acciones diferentes. Si una acción cae, las otras podrían mantenerse estables, manteniendo la cartera segura. El artículo se pregunta: ¿Podemos hacer lo mismo con los cerebros de las computadoras? Si obligamos a las diferentes partes del modelo a pensar de formas ligeramente distintas y no correlacionadas, ¿podemos evitar que todas cometan el mismo error al mismo tiempo?
Esto es exactamente lo que los investigadores se propusieron probar. Proponen un nuevo método llamado Diversidad Neuronal (Neural Diversity), que actúa como un "entrenador de diversidad" para el cerebro de la computadora. En lugar de permitir que todas las vías internas del modelo colapsen para pensar de la misma manera, obligan a estas vías a permanecer distintas e independientes. Construyeron una herramienta llamada ND-LoRA para hacer esto. Piensa en ello como darle a un solo modelo de computadora cuatro "sombreros" diferentes para usar a la vez. Cada sombrero representa una forma ligeramente distinta de procesar la misma oración. El modelo luego combina las respuestas de los cuatro sombreros.
Los resultados son bastante prometedores. Al usar este enfoque de "cuatro sombreros" y un truco matemático especial para evitar que los sombreros se vuelvan demasiado similares, los investigadores descubrieron que podían reducir el número de hechos inventados hasta en un 25.6% en pruebas específicas, con una mejora promedio del 14.6%. Esto sucedió sin necesidad de hacer el modelo de computadora más grande o entrenarlo con más datos. De hecho, solo costó un poco más de potencia de cómputo —aproximadamente un 0.008% más de tiempo de entrenamiento— y solo 1.1 veces la velocidad de ejecución.
Sin embargo, el artículo también descubrió un giro: más diversidad no siempre es mejor. Es como un coro; si cada uno canta una nota diferente, suena a ruido. Si todos cantan exactamente la misma nota, es aburrido y propenso a errores. Existe un "punto ideal" donde las voces son lo suficientemente diferentes para detectar errores, pero lo suficientemente similares como para estar de acuerdo en la verdad. Los investigadores encontraron que este punto ideal cambia dependiendo de lo que la computadora esté haciendo. Para tareas que involucran la creación de historias creativas o la verificación de hechos, tener más voces "diferentes" (específicamente, de 4 a 8 flujos paralelos) funcionó mejor. Pero para tareas de memoria simples, como recordar un nombre específico, tener solo una voz era en realidad lo más confiable.
Los autores advierten que, si bien su matemática demuestra que esto debería funcionar y sus experimentos en un modelo pequeño muestran que funciona, esta es una solución específica para un tipo específico de error. Argumentan que las alucinaciones son a menudo causadas por el hecho de que las partes internas del modelo se quedan atrapadas en un bucle de ideas similares y erróneas, en lugar de ser simplemente una falta de conocimiento. Al romper ese bucle con la diversidad, pueden hacer que el modelo sea más confiable sin necesidad de construir una supercomputadora gigante y costosa. Es una forma inteligente y de bajo costo de hacer que la IA sea un poco menos propensa a mentir, demostando que, a veces, la mejor manera de obtener una mejor respuesta es hacer algunas preguntas diferentes a la vez.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.