← Últimos artículos
💬 NLP

CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity

Este artículo presenta CreativityPrism, un marco de evaluación escalable y transdominio que evalúa a los modelos de lenguaje de gran tamaño a través de ocho tareas en pensamiento divergente, escritura creativa y razonamiento lógico utilizando tres dimensiones (calidad, novedad y diversidad), revelando que si bien los modelos de vanguardia sobresalen en la escritura y el razonamiento, no muestran una ventaja significativa en el pensamiento divergente y que el rendimiento rara vez se generaliza a través de las diferentes dimensiones creativas.

Autores originales: Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

Publicado 2026-07-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca mágica gigante de generadores de texto (Modelos de Lenguaje Extensos, o LLM). Todo el mundo pregunta: "¿Son estas máquinas realmente creativas?".

El problema es que la "creatividad" es un concepto escurridizo. A veces significa escribir una historia divertida, otras veces significa resolver un problema matemático de una forma extraña, y otras veces significa pensar en un nuevo uso para un clip. Antes de este artículo, los investigadores intentaban medir la creatividad con diferentes reglas para cada trabajo, o pedían a humanos que calificaran cada respuesta, lo cual es lento y costoso.

Entra en escena "CreativityPrism".

Piensa en CreativityPrism como un nuevo prisma de alta tecnología a través del cual haces pasar un haz de luz (la producción de la IA). En lugar de ver solo una mancha blanca, el prisma divide la luz en tres colores distintos, revelando la verdadera naturaleza de la creatividad de la máquina.

Los Tres Colores de la Creatividad

Los autores argumentan que, para entender realmente si una máquina es creativa, hay que medirla de tres maneras específicas:

  1. Calidad (El color "¿Funciona?"): Esta es la base. Si una máquina escribe una historia que no tiene sentido o resuelve un problema matemático incorrectamente, no importa qué tan "nueva" sea la idea. Es solo ruido. La calidad mide si el resultado realmente cumple con la tarea.
  2. Novedad (El color "¿Qué tan raro es?"): Esto mide qué tanto se aleja la respuesta de lo ordinario. ¿Logró la máquina una solución que ningún humano ha visto antes? ¿O simplemente copió lo que hay en sus datos de entrenamiento?
  3. Diversidad (El color "¿Cuántas opciones hay?"): Esto mide la amplitud. Si le pides a la máquina 10 ideas, ¿son 10 ideas totalmente diferentes o son solo 10 versiones ligeramente distintas de la misma idea?

La Analogía: Imagina a un chef.

  • Calidad: La comida sabe bien y no está quemada.
  • Novedad: El chef inventa una combinación de sabores que nadie ha probado antes (por ejemplo, chocolate y pepinillos).
  • Diversidad: El chef puede hacer 10 tipos diferentes de postres, no solo 10 variaciones de pastel de chocolate.
  • CreativityPrism comprueba las tres cosas. Un chef que hace 100 versiones diferentes de un pastel de chocolate quemado tiene alta diversidad, pero baja calidad y baja novedad.

La Gran Prueba: 17 Chefs en la Cocina

Los autores tomaron 17 de los modelos de IA más inteligentes disponibles actualmente (de empresas como OpenAI, Google, Anthropic y DeepSeek) y los sometieron a 8 desafíos diferentes en tres áreas:

  • Pensamiento Divergente: Como la "Prueba de Usos Alternativos" (por ejemplo, "¿Qué puedes hacer con un ladrillo además de construir una pared?").
  • Escritura Creativa: Escribir historias o poemas basados en instrucciones (prompts).
  • Razonamiento Lógico: Resolver problemas matemáticos o escribir código bajo restricciones estrictas y extrañas.

Lo que Encontraron (El Giro de la Trama)

1. La brecha "Grande vs. Pequeño"
Los modelos de IA masivos y costosos (los modelos "Frontier") son generalmente mejores en Escritura Creativa y Razonamiento Lógico. Son como maestros chefs que pueden seguir recetas complejas y escribir menús hermosos. Sin embargo, cuando se trata de Pensamiento Divergente (proponer ideas salvajes y no relacionadas), la brecha entre los modelos supercostosos y los modelos más pequeños de código abierto casi desaparece. Los modelos grandes no son necesariamente mejores en "pensar fuera de la caja" que los más pequeños.

2. El problema del "Especialista"
Aquí está el hallazgo más sorprendente: Ser bueno en un tipo de creatividad no significa que seas bueno en otro.

  • Un modelo puede ser increíble escribiendo una novela (Alta Calidad) pero terrible proponiendo usos nuevos y extraños para una cuchara (Baja Novedad).
  • Un modelo puede generar 1,000 respuestas diferentes (Alta Diversidad) pero ninguna de ellas es nueva o útil (Baja Novedad).

Los autores descubrieron que la "Novedad" es la dimensión más caótica. El hecho de que un modelo sea bueno siendo "nuevo" en un problema matemático no significa que lo sea en una historia. Son habilidades totalmente diferentes.

3. La solución del "Juez"
Dado que los humanos son demasiado lentos para calificar todas estas pruebas, los autores usaron un truco ingenioso: usaron otras IA para calificar las respuestas. Pero no confiaron en ellas ciegamente; hicieron que expertos humanos calificaran una pequeña muestra primero para asegurarse de que los "Jueces de IA" estuvían de acuerdo con los humanos. Es como tener a un chef principal probar algunos platos para asegurarse de que los subchefs están calificando la comida correctamente antes de que califiquen toda la cocina.

La Conclusión

CreativityPrism es una nueva herramienta que evita que digamos "Esta IA es creativa" como una afirmación única y vaga. En su lugar, nos dice: "Esta IA es excelente escribiendo buenas historias, aceptable resolviendo matemáticas de forma creativa, pero no es muy buena proponiendo ideas salvajes y no relacionadas".

Esto demuestra que la creatividad no es un único superpoder; es una colección de diferentes habilidades que no siempre viajan juntas. Para construir máquinas verdaderamente creativas, necesitamos entrenarlas específicamente para estos diferentes "colores" de la creatividad, no solo esperar que lo logren todo por accidente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →