← Últimos artículos
💬 NLP

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

Este estudio demuestra que los modelos de lenguaje de gran tamaño multimodales pueden evaluar eficazmente la creatividad visual en un entorno de aprendizaje de cero disparos (zero-shot) con una alineación sustancial con las calificaciones humanas, mientras que su razonamiento paso a paso proporciona información interpretable sobre el proceso de evaluación a pesar de no mejorar la precisión de la puntuación.

Autores originales: William Orwig, Roger E. Beaty

Publicado 2026-06-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: William Orwig, Roger E. Beaty

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un crítico de arte gigante y súper inteligente que nunca ha tomado una clase de arte, nunca ha visto a un humano calificar un dibujo y nunca se le ha dicho cómo se ve la "creatividad". Simplemente le entregas una imagen y le preguntas: "En una escala del 1 al 5, ¿qué tan creativa es esta?".

Eso es esencialmente lo que hace este artículo. Los investigadores pidieron a seis modelos de IA diferentes (piensa en ellos como diferentes "jueces digitales") que hicieran exactamente eso. Querían ver si estas IA podían adivinar cómo los humanos calificarían la creatividad de las imágenes, sin ningún entrenamiento o práctica especial.

Aquí está la historia de lo que encontraron, desglosada en partes simples:

1. El truco de magia del "Zero-Shot"

Normalmente, para enseñar a una IA a calificar el arte, tienes que mostrarle miles de ejemplos de dibujos "buenos" y "malos" junto con las puntuaciones humanas. Es como enseñarle a un estudiante mostrándole una pila de exámenes calificados.

Pero estos investigadores intentaron algo diferente: Zero-Shot (aprendizaje de disparo cero). Le dieron a la IA solo la imagen y una instrucción simple: "Califica esto del 1 al 5". Sin ejemplos, sin entrenamiento. Fue como pedirle a un extraño en la calle que calificara una pintura que nunca ha visto antes.

El Resultado: Sorprendentemente, los jueces de IA fueron bastante buenos en ello. Sus calificaciones coincidieron muy bien con las calificaciones humanas.

  • Para las imágenes generadas por IA (imágenes pulidas hechas por computadoras), los jueces de IA y los humanos estuvieron muy de acuerdo.
  • Para los bocetos hechos a mano (dibujos toscos y desordenados hechos por personas), el acuerdo seguía ahí, pero era un poco más débil.

2. El sesgo de "Pulido vs. Tosco"

Los investigadores notaron que los jueces de IA tenían un rasgo de personalidad divertido, como un crítico que ama las fotos de alta definición pero odia los bocetos a lápiz.

  • El Sesgo de lo "Pulido": Al mirar imágenes fluidas y generadas por computadora, los jueces de IA fueron demasiado generosos. Dieron puntuaciones más altas de las que los humanos dieron.
  • El Sesgo de lo "Tosco": Al mirar bocetos simples hechos a mano, los jueces de IA fueron demasiado severos. Dieron puntuaciones más bajas de las que los humanos dieron.

Parece que los modelos de IA secretamente aman las imágenes "elaboradas" y "complejas". Si un dibujo tiene muchas líneas y detalles, la IA piensa que es creativo, incluso si el juez humano piensa que es simplemente "recargado". Los modelos de IA parecían confundir "detallado" con "creativo".

3. El "Proceso de Pensamiento" (La Cadena de Pensamiento)

Algunos de estos modelos de IA tienen una característica especial: antes de dar una puntuación final, escriben su "proceso de pensamiento". Es como un estudiante que muestra su procedimiento en un examen de matemáticas.

Los investigadores espiaron dentro de estos procesos de pensamiento para ver cómo la IA decidía una puntuación. Encontraron que la IA sigue una receta constante de cuatro pasos:

  1. Percepción: "Veo un gato y un árbol". (Describiendo lo que hay allí).
  2. Originalidad: "¡Esto es raro y nuevo!" (Juzgando si es único).
  3. Calidad: "Las líneas son suaves y bonitas". (Juzgando qué tan bien está dibujado).
  4. Justificación: "Así que, le doy un 4". (Eligiendo el número).

La Gran Sorpresa: Los investigadores pensaron que si la IA se tomaba el tiempo para "pensar" y escribir estos pasos, sería mejor igualando las puntuaciones humanas. No fue así. El "pensar" no hizo que las puntuaciones fueran más precisas. Sin embargo, le dio a los investigadores una ventana para entender por qué la IA dio la puntuación que dio. Mostró que la IA estaba prestando atención a la "calidad" (qué tan bonito es) en lugar de solo a la "originalidad" (qué tan raro es), lo que explica por qué le gustaron tanto las imágenes pulidas de la IA.

4. ¿Necesita la IA saber qué es lo que está mirando?

Los investigadores se preguntaron: "Si la IA se confunde y piensa que un dibujo de un perro es un gato, ¿su puntuación de creatividad baja?".

La Respuesta: No realmente.
Incluso cuando la IA identificó erróneamente lo que era el dibujo, o cuando el dibujo era tan abstracto que los humanos no podían ponerse de acuerdo en qué era, la puntuación de creatividad de la IA todavía coincidía bien con las puntuaciones humanas. Esto sugiere que la IA no solo está revisando una lista de verificación de "¿Es esto un perro? Sí/No". Está mirando la vibra, la composición y lo extraño de la imagen, incluso si no sabe exactamente qué es el objeto.

La Conclusión

Este artículo muestra que podemos usar estos grandes modelos de IA generales como "jueces de creatividad" sin necesidad de entrenarlos primero. Son sorprendentemente buenos en ello, pero tienen un sesgo: aman las imágenes complejas y detalladas y les desagradan los bocetos simples y toscos.

Al observar sus "procesos de pensamiento", podemos ver exactamente dónde están acertando y dónde se están equivocando. Es como tener un crítico que puede explicar su razonamiento, incluso si su gusto es un poco diferente al nuestro. Los investigadores incluso construyeron una aplicación gratuita para que cualquiera pueda probar este "juez de IA" con sus propias imágenes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →