Are LLMs becoming similarly creative? Evidence from three years of models
Este artículo analiza tres años de lanzamientos de modelos de lenguaje de gran tamaño y encuentra una disminución estadísticamente significativa en la diversidad de los resultados en tareas creativas de naturaleza abierta, lo que sugiere una tendencia hacia la homogeneización que podría disminuir la agencia humana en el trabajo cocreativo entre humanos e IA.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: "¿Se están volviendo los LLM igualmente creativos? Evidencia de tres años de modelos"
Planteamiento del problema
Si bien numerosos bancos de pruebas rastrean el rendimiento de los Modelos de Lenguaje de Gran Escala (LLM) en tareas con respuestas verificables, existe una falta de datos longitudinales respecto al rendimiento de los LLM en tareas abiertas donde la creatividad, la originalidad y la diversidad son primordiales. La investigación existente sugiere que, aunque los LLM pueden parecer creativos individualmente, a menudo exhiben una homogeneidad colectiva, produciendo resultados que son similares entre sí a través de diferentes modelos y del tiempo. Sin embargo, no está claro si esta homogeneidad es un artefacto temporal de la tecnología en desarrollo o una característica inevitable de los modelos de lenguaje estadísticos. Los bancos de pruebas actuales (por ejemplo, MMLU, HELM) se centran en criterios explícitos con respuestas verificables y no logran capturar las tendencias en la diversidad o la originalidad de los resultados creativos a lo largo del tiempo.
Metodología
Los autores realizaron un análisis temporal preliminar de la diversidad de los resultados de los LLM mediante un proceso de cuatro pasos:
- Selección de prompts: Se seleccionaron dos conjuntos complementarios de prompts abiertos para provocar el comportamiento creativo:
- Tarea de Usos Alternativos (AUT): Una evaluación psicométrica estandarizada del pensamiento divergente donde los modelos generan usos no convencionales para objetos comunes.
- Infinity-Chat100: Una colección de 100 consultas de usuarios del mundo real que abarcan seis categorías, incluyendo la generación de contenido creativo, la lluvia de ideas y la ideación.
- Recolección de datos: Los prompts se ejecutaron contra 68 modelos lanzados entre marzo de 2023 y julio de 2026, que representan a 12 de los principales proveedores de modelos (33 de pesos cerrados y 34 de pesos abiertos). Todas las generaciones utilizaron una temperatura y un top-p de 1.0 para mantener el muestreo estocástico.
- Incrustación semántica (Embedding): Las respuestas se incrustaron utilizando el modelo de sentence-transformer
all-MiniLM-L6-v2. Para la tarea AUT, todos los usos para un solo objeto se incrustaron como un único vector; para Infinity-Chat, cada respuesta se incrustó individualmente. - Análisis de regresión: El estudio computó las distancias de coseno entre las incrustaciones de pares de familias de modelos (modelos de diferentes proveedores) para medir la divergencia semántica. Estos pares se agruparon en nueve contenedores temporales basados en las fechas de lanzamiento. Se realizó una regresión de Mínimos Cuadrados Ordinarios (OLS) sobre la distancia de coseno media frente al índice del contenedor. Para mitigar el sesgo de la representación desigual de las familias, los autores realizaron 1,000 iteraciones de remuestreo equilibrado por familias para generar una distribución de estimaciones de la pendiente.
Contribuciones clave
- Marco Longitudinal: Este artículo proporciona el primer marco para rastrear la evolución de los resultados creativos de los LLM a lo largo del tiempo, yendo más allá de las instantáneas estáticas del comportamiento de los modelos.
- Análisis de Doble Tarea: Al combinar una tarea psicométrica controlada (AUT) con consultas de usuarios del mundo real (Infinity-Chat100), el estudio evalúa la creatividad tanto en contextos estructurados como no estructurados.
- Evidencia Cuantitativa de Convergencia: El estudio ofrece evidencia empírica de que los resultados de los LLM se están volviendo cada vez más similares con el tiempo, desafiando la suposición de que los modelos más nuevos ofrecen inherentemente una mayor diversidad creativa.
Resultados
El análisis revela una disminución estadísticamente significativa en la diversidad de los resultados de los modelos durante el período de observación de tres años:
- Tendencia: Tanto el conjunto de datos AUT como el de Infinity-Chat muestran una pendiente negativa constante en la distancia de coseno entre familias a lo largo del tiempo, lo que indica una creciente similitud semántica (homogeneidad).
- Magnitud: El declive es más pronunciado en la Tarea de Usos Alternativos, donde la distancia media entre familias cayó de aproximadamente 0.50 en el primer contenedor de lanzamientos a menos de 0.40 en el más reciente. El conjunto de datos Infinity-Chat mostró un declive más suave pero constante de ~0.34 a ~0.32.
- Robustez: Las 1,000 iteraciones de remuestreo produjeron pendientes negativas para ambos conjuntos de datos, confirmando que la tendencia es robusta a través de diferentes combinaciones de modelos de cada familia.
Significancia y Reivindicaciones
El artículo postula que los LLM se están volviendo menos creativos en tareas que requieren respuestas abiertas, sugiriendo una convergencia en la sustancia creativa entre los modelos. Los autores argumentan que si esta tendencia persiste, "la homogeneización impulsada por los LLM puede disminuir progresivamente la agencia humana en el trabajo co-creativo humano-IA".
El estudio enmarca estos hallazgos como un análisis preliminar que exige una consideración cuidadosa del papel de los LLM en el proceso creativo humano. Destaca una potencial "paradoja de la creatividad de la IA": aunque los modelos puedan parecer creativos individualmente, sus resultados agregados se están volviendo menos diversos, lo que potencialmente limita el rango de ideas que los usuarios encuentran e impacta negativamente en la creatividad humana descendente. Los autores declaran explícitamente que su trabajo es preliminar y hacen un llamado a futuras investigaciones para examinar los mecanismos subyacentes (como los datos de entrenamiento compartidos o la destilación) y los factores específicos que impulsan esta convergencia.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.