← Últimos artículos
💬 NLP

Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

Este artículo sostiene que la homogeneidad de los resultados en los modelos de lenguaje de gran tamaño no es causada primordialmente por el proceso de alineación, sino que es aprendida durante el preentrenamiento y simplemente revelada o amplificada por las etapas posteriores de ajuste de instrucciones y alineación.

Autores originales: Alexandrine Fortier, Hazel Chen, Peter West

Publicado 2026-08-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Alexandrine Fortier, Hazel Chen, Peter West

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás entrando en una biblioteca gigante y bulliciosa donde se están escribiendo millones de libros cada segundo. Esta no es una biblioteca de papel y tinta, sino un reino digital donde las computadoras llamadas "Modelos de Lenguaje Extensos" (LLM, por sus siglas en inglés) aprenden a hablar, escribir y crear leyendo casi todo lo que se ha puesto en internet. Piensa en estos modelos como estudiantes increíblemente rápidos y superobsesivos que leen toda la biblioteca solo para aprender a terminar una oración. Pero últimamente, la gente ha notado algo extraño: sin importar qué pregunta les hagas a estos estudiantes digitales, sus respuestas empiezan a sonar igual. Todos eligen las mismas metáforas, usan las mismas frases corteses y evitan las ideas extrañas, salvajes o creativas. Es como si le pidieras a diez chefs diferentes que hicieran un sándwich, y todos decidieran usar exactamente el mismo pan, el mismo jamón y la misma mostaza, hasta el número exacto de rebanadas.

Los científicos llaman a esto "homogeneidad de salida" o "convergencia semántica". Es una gran preocupación porque, si todos nuestros asistentes de IA empiezan a pensar y hablar de la misma manera estrecha y exacta, podríamos perder la chispa de la creatividad humana. Durante mucho tiempo, la gente pensó que este comportamiento aburrido y repetitivo ocurría debido al "entrenamiento" que reciben los modelos después de leer la biblioteca. Esta segunda etapa, llamada "alineación", es como un maestro estricto que interviene para decirle al estudiante: "No digas esa cosa rara; di esta cosa educada en su lugar". La creencia común era que el estudiante era originalmente un genio salvaje y creativo, y que las reglas del maestro aplastaron esa creatividad. Pero, ¿y si el estudiante ya era aburrante antes de que el maestro siquiera entrara? ¿Y si el "maestro" solo hizo que el aburrimiento fuera más fuerte?

Este artículo, titulado "¿Es la convergencia inevitable?", se embarca en una búsqueda detectivesca para descubrir dónde comienza realmente esta similitud. Los autores, investigadores de la Universidad de Columbia Británica, se propusieron probar dos grandes ideas. Primero, querían ver si el proceso de "alineación" (las reglas del maestro) es el villano que mata la creatividad. Segundo, querían ver si la fase de "preentrenamiento" (el estudiante leyendo la biblioteca) ya había horneado el aburrimiento en el cerebro del modelo desde el principio. Para resolver este misterio, no solo hicieron preguntas a los modelos; realizaron una serie de experimentos ingeniosos usando metáforas como sujeto de prueba. Trataron a los modelos como ratas de laboratorio científicas, alimentándolos con instrucciones específicas para ver si podían ser engañados para ser creativos o si estaban atrapados en un bucle.

Aquí está lo que encontraron, y es un giro en la trama.

Primero, observaron los modelos en diferentes etapas de su "escolarización". Revisaron los modelos justo después de terminar de leer la biblioteca (el "modelo base"), luego después de aprender a seguir instrucciones (la etapa "SFT"), y finalmente después de ser alineados para ser útiles y seguros (las etapas "DPO" y "RL"). Los resultados fueron impactantes. Incluso después del primer paso de aprender a seguir instrucciones —antes de que se añadieran cualquier regla de seguridad estricta o filtros de "utilidad"— los modelos ya estaban escupiendo respuestas casi idénticas. Al pedirles que escribieran una metáfora sobre el "tiempo", los modelos no solo sonaban similares; sonaban como si estuvieran leyendo del mismo guion. Los autores sugieren que el proceso de "alineación" no es el que aplasta la diversidad; es un aumento de volumen que revela un patrón que ya estaba allí, escondido a plena vista.

Para probar esto, los investigadores jugaron un juego de "encuentra las diferencias" con los datos de entrenamiento. Tomaron un modelo e intentaron enseñarle una nueva forma de pensar. Crearon un conjunto especial de instrucciones donde le dijeron al modelo que usara una metáfora específica y extraña para el "tiempo" (como "El tiempo es un sándwich") que el modelo nunca había visto antes. Esperaban que, al forzar al modelo a memorizar esta nueva idea, pudieran romper el patrón. Pero el modelo se negó a ceder. Ignoró la nueva idea del "sándwich" y siguió aferrándose a la vieja y aburrida metáfora del "río" que parecía amar desde el principio. Los investigadores descubrieron que el modelo podía ser amplificado —haciendo que dijera lo mismo incluso con más fuerza— pero no podía ser introducido a una nueva forma de pensar si esa idea no estaba ya acechando en su memoria. Es como intentar enseñarle a un perro a maullar; no importa cuánto lo elogies, simplemente no lo hará porque el maullido no está en su ADN.

Finalmente, volvieron al mismísimo principio: los "modelos base" que nunca habían sido enseñados a seguir instrucciones o a ser corteses. Pensaron que estos modelos puros serían salvajes y diversos. Pero cuando usaron un truco especial —fingiendo ser un asistente útil o dándole al modelo algunos ejemplos de cómo responder— vieron emerger los mismos patrones aburridos. Incluso sin un maestro, el modelo base, cuando era dirigido en la dirección correcta, colapsaba naturalmente en la misma metáfora del "río". Esto sugiere que la tendencia a converger en las mismas respuestas no es un error cometido por los maestros; es un hábito natural que los modelos aprendieron mientras solo leían la biblioteca.

Entonces, ¿qué significa todo esto? El artículo sugiere que la similitud que vemos en la IA no es solo un efecto secundario de hacerlos seguros o corteses. En cambio, parece ser una parte fundamental de cómo estos modelos aprenden a predecir la siguiente palabra en una oración. Cuando entrenas a un modelo con una cantidad masiva de texto humano, aprende que la respuesta más "probable" es a menudo la más común. El proceso de "alineación" solo sube el volumen de esta tendencia natural. Los autores concluyen que arreglar este problema no será fácil. No puedes simplemente ajustar las reglas del "maestro" final para hacer que la IA sea más creativa, porque la creatividad nunca estuvo realmente allí desde el principio. El "aburrimiento" está horneado en la receta, no solo añadido al final. Aunque esto pueda sonar un poco sombrío, es un descubrimiento crucial. Nos dice que si queremos una IA verdaderamente diversa y creativa, es posible que debamos repensar cómo los enseñamos en primer lugar, en lugar de simplemente intentar corregir su comportamiento después del hecho.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →