Quantifying non deterministic drift in large language models
Este artículo cuantifica empíricamente la deriva conductual base en los modelos de lenguaje extensos al demostrar que la variabilidad de la salida persiste incluso con temperatura cero a través de diferentes modelos y tipos de prompts, estableciendo un punto de referencia sistemático para evaluar futuras estrategias de mitigación.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un asistente robot muy inteligente y creativo. Le haces exactamente la misma pregunta, "¿Cómo está el clima?", y le dices: "Sé lo más preciso y aburrido posible". Esperarías que te diera la misma respuesta exacta cada vez, ¿verdad?
Este artículo, escrito por Claire Nicholson, investiga qué sucede cuando realmente intentas hacer eso con los robots de IA modernos (llamados Modelos de Lenguaje Extensos o LLM). El sorprendente hallazgo es: incluso cuando le dices al robot que sea perfectamente consistente, a menudo no lo es.
Aquí hay un desgón de sencillo de lo que encontró el estudio, utilizando analogías cotidianas:
1. El "Fantasma en la Máquina" (No determinismo)
Los investigadores trataron a dos modelos de IA como si fueran gemelos idénticos:
- El Robot en la Nube: Un modelo llamado
gpt-4o-minique vive en una granja de servidores (como una cocina de un restaurante que no puedes ver). - El Robot Local: Un modelo llamado
llama3.1-8bque se ejecuta en una sola computadora en un laboratorio (como un chef cocinando en tu propia cocina).
Le hicieron las mismas preguntas a estos robots repetidamente, con los ajustes configurados en "máxima consistencia" (Temperatura 0.0).
- El Resultado: El Robot en la Nube dio una respuesta diferente aproximadamente 1 de cada 4 veces. El Robot Local fue más consistente, pero aun así cambió su respuesta aproximadamente 1 de cada 10 veces.
La Analogía: Imagina pedirle a un panadero que haga un pastel de chocolate usando exactamente la misma receta e ingredientes. Esperarías que el pastel se vea idéntico cada vez. Pero en este estudio, el panadero (la IA) a veces añade una pizca más de sal, o coloca las chispas de colores de forma diferente, incluso aunque le dijiste que siguiera la receta perfectamente.
2. ¿Por qué sucede esto?
El artículo sugiere dos razones principales para este "desplazamiento":
- El Modelo en sí mismo: Los modelos más grandes y complejos parecen ser más "nerviosos" y menos consistentes que los más pequeños.
- La Cocina (Infraestructura): Para el Robot en la Nube, la forma en que la solicitud viaja a través de internet, cómo la computadora procesa los datos, o incluso cómo se organiza el servidor puede cambiar el resultado. Es como si el horno del panadero tuviera una ligera fluctuación de temperatura o si el tazón de mezcla fuera ligeramente de un tamaño diferente cada vez, incluso si la receta era la misma.
3. La perilla de "Temperatura"
Los investigadores también probaron qué sucede cuando suben la "Temperatura" (un ajuste que hace que la IA sea más creativa y aleatoria).
- Temperatura Baja (0.0): El robot intenta ser aburrido y consistente, pero aun así comete errores ocasionalmente.
- Temperatura Alta (0.7): El robot se descontrola. En este modo, cada respuesta fue diferente. Fue como pedirle al panadero que hiciera un pastel, pero decirle: "ponte creativo". De repente, cada pastel se veía completamente distinto.
4. El control de "Conteo de Palabras" y "Similitud"
¿Cómo midieron esto? No solo leyeron las respuestas; usaron matemáticas para compararlas.
- Fracción Única: Contaron cuántas veces el robot dio una respuesta totalmente nueva.
- Similitud de Jaccard: Esta es una forma elegante de preguntar: "¿Cuántas palabras son iguales?"
- Cuando el robot estaba en modo "aburrido" (0.0), las respuestas eran aproximadamente un 90% similares.
- Cuando el robot estaba en modo "creativo" (0.7), las respuestas eran menos del 50% similares.
5. Qué significa esto para ti (El "Presupuesto de Varianza")
El artículo no te dice cómo arreglar este problema. En su lugar, dice: "Necesitas saber que esto está sucediendo antes de intentar arreglarlo".
Piensa en esto como un "Presupuesto de Varianza".
- Si estás construyendo un sistema que genera números financieros, podrías decir: "Solo puedo tolerar una diferencia del 5% en el resultado".
- Si la IA se desplaza más de eso, sabrás que necesitas intervenir.
- Pero primero, necesitas saber cómo es el desplazamiento "normal" sin ninguna ayuda. Este artículo proporciona ese mapa de referencia.
Resumen
Este estudio es un "informe de medición". No inventó una nueva forma de evitar que los robots cambien de opinión. En su lugar, midió exactamente cuánto cambian de opinión cuando se les deja solos.
La conclusión principal: Incluso cuando crees que tienes a un robot controlado para que sea 100% predecible, en realidad se está moviendo un poco. Si confías en una sola respuesta de una IA, podrías estar ignorando el hecho de que podría haber dicho algo ligeramente diferente la próxima vez que preguntaras. Para obtener el panorama completo, es posible que necesites hacer la misma pregunta algunas veces y observar el promedio.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.