← Últimos artículos
💬 NLP

Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models

Este artículo critica las limitaciones de la Tarea de Asociación Divergente (DAT) al evaluar modelos de lenguaje de gran tamaño al ignorar la idoneidad, propone la novedosa Tarea de Asociación Divergente Condicional (CDAT) fundamentada en la teoría de la creatividad humana para distinguir mejor la creatividad genuina del ruido, y revela que los modelos avanzados a menudo sacrifican la novedad en favor de la idoneidad debido al entrenamiento y el alineamiento.

Autores originales: Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

Publicado 2026-01-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de juzgar qué tan creativas son un grupo de personas (o en este caso, programas informáticos). Les planteas un desafío sencillo: "Nombra 10 palabras que sean lo más diferentes posible entre sí".

Esta es la Tarea de Asociación Divergente (DAT). Si dices "Manzana", "Coche", "Nube" y "Zapato", obtienes una puntuación alta porque esas palabras están muy alejadas en significado. Si dices "Manzana", "Plátano", "Cereza" y "Uva", obtienes una puntuación baja porque todas son simplemente frutas.

Los investigadores en este artículo se preguntaron: ¿Es esta una prueba justa para la Inteligencia Artificial (IA)?

El Problema: La trampa del "Ruido Aleatorio"

Los autores descubrieron un fallo importante en cómo probamos actualmente la creatividad de la IA. Descubrieron que si simplemente le pides a una IA que sea "diferente", puede hacer trampa siendo aleatoria.

Piensa en esto como un juego de "Simón dice". Si la regla es solo "sé diferente", una persona que cierra los ojos y señala palabras al azar en una página podría obtener una puntuación más alta que un brillante poeta. La IA puede simplemente escupir palabras sin sentido que resultan ser distintas entre sí, pero que no tienen sentido juntas.

En el experimento de los autores, probaron dos "tramposos":

  1. El Tramposo Aleatorio: Un programa informático que simplemente elige 10 palabras al azar de un diccionario.
  2. El Tramposo "Optimizador de Juego": Una IA a la que se le dijo específicamente: "Ignora el significado; solo elige palabras que te den la puntuación más alta en esta prueba".

El Resultado Impactante: Ambos "tramposos" obtuvieron puntuaciones más altas que los modelos de IA más avanzados y listos. Esto significa que la vieja prueba (DAT) no está midiendo la creatividad; solo está midiendo qué tan buena es una IA siendo aleatoria o qué tan buena es manipulando el sistema.

La Solución: La Prueba "Contextual" (CDAT)

Para solucionar esto, los investigadores inventaron una nueva prueba llamada CDAT (Tarea de Asociación Divergente Condicional).

La Analogía:
Imagina que la vieja prueba era como pedirle a alguien que "Nombre 10 cosas aleatorias".
La nueva prueba es como pedir: "Nombra 10 cosas diferentes que estén todas relacionadas con un 'Gato'".

Ahora, la IA tiene que hacer dos cosas a la vez:

  1. Ser Apropiada: Las palabras deben relacionarse realmente con la clave (por ejemplo, "Bigotes", "Pata", "Puntero láser"). Si dice "Tostadora" o "Volcán", falla.
  2. Ser Diversa: Las palabras deben seguir siendo diferentes entre sí. "Gato", "Gatito" y "Felino" están todos relacionados, pero son demasiado similares. "Gato", "Pez" y "Perro" son mejores.

Esta nueva prueba separa la creatividad real (ser único pero que siga teniendo sentido) del ruido aleatorio (ser único pero sin sentido).

Lo que Encontraron

Cuando realizaron esta nueva prueba, los resultados cambiaron por completo:

  • Las IA "Inteligentes" fueron demasiado cautelosas: Los modelos de IA más grandes y avanzados (aquellos entrenados para ser útiles y seguir reglas perfectamente) tendieron a ir a lo seguro. Daban respuestas muy apropiadas, pero eran un poco aburridas y no muy creativas. Eran como un estudiante que conoce el libro de texto perfectamente pero tiene miedo de pensar fuera de la caja.
  • Las IA "Más Pequeñas" fueron más creativas: Sorprendentemente, los modelos más pequeños y menos "avanzados" a menudo obtuvieron puntuaciones más altas en creatividad. Estaban dispuestos a tomar riesgos y proponer ideas más únicas y diversas, manteniéndose al mismo tiempo dentro del tema.

Los autores sugieren que a medida que los modelos de IA se vuelven más grandes y se entrenan para ser más "seguros" y útiles, pierden un poco de su chispa creativa. Se enfocan demasiado en ser correctos y no tanto en ser interesantes.

La Conclusión

El artículo concluye que no podemos simplemente pedirle a la IA que "sea diferente" para medir la creatividad. Tenemos que pedirle que sea diferente dentro de un contexto específico.

  • Forma Antigua: "¡Sé aleatorio!" (La IA hace trampa siendo un sinsentido).
  • Nueva Forma: "¡Sé creativo, pero que tenga sentido!" (La IA tiene que equilibrar ser única con ser útil).

Este nuevo método nos da una imagen mucho más clara de qué modelos de IA son realmente creativos y cuáles son simplemente buenos siguiendo instrucciones o adivinando al azar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →