← Últimos artículos
💬 NLP

Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity

Este artículo revela que, si bien los modelos de lenguaje de gran tamaño (LLM) se alinean con las evaluaciones humanas de la creatividad en cuanto a cualidades intrínsecas como la novedad, divergen significativamente debido a su dependencia de estándares más estrechos y específicos del modelo y a su insensibilidad a la información contextual, lo que convierte la elección de un LLM evaluador específico en una decisión trascendental para la evaluación de la creatividad.

Autores originales: Pengzhao Lyu, Yeun Joon Kim, Hanlin Xiao, Yingyue Luna Luan

Publicado 2026-07-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Pengzhao Lyu, Yeun Joon Kim, Hanlin Xiao, Yingyue Luna Luan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que te encuentras en una galería de arte gigante y ruidosa donde todo el mundo intenta adivinar qué pinturas son "creativas". Algunos miran solo la pintura y las pinceladas. Otros miran quién la pintó, cuánto cuesta o si es tendencia en este momento. Durante mucho tiempo, los humanos han sido los únicos jueces en esta galería. Pero ahora, un nuevo tipo de juez ha llegado: el Modelo de Lenguaje Extenso, o LLM. Piensa en un LLM como un robot superinteligente que ha leído casi todos los libros, artículos y sitios web jamás escritos. Como sabe tanto sobre lo que dicen los humanos, esperábamos que pudiera juzgar la creatividad tal como lo hace un humano. Pero aquí está el misterio: a veces el robot está de acuerdo con nosotros y otras veces parece que está mirando una pintura completamente diferente. Los científicos quieren saber: ¿cuándo piensa el robot como nosotros y cuándo se pierde en su propia cabeza? Este artículo profundiza en esa cuestión para ver si podemos confiar en estos jueces digitales para elegir a los ganadores en nuestros concursos de creatividad.

Los investigadores se propusieron averiguar exactamente qué reglas siguen estos jueces robóticos. No se limitaron a preguntar: "¿Es esto creativo?". En su lugar, pidieron a los robots que clasificaran la importancia de 26 cosas diferentes que los humanos solemos buscar, como "¿es nuevo?", "¿es útil?" o "¿es famoso?". Probaron seis de los LLM más populares (GPT, Grok, DeepSeek, ERNIE, Claude y Gemini) y compararon sus respuestas con lo que dicen los humanos reales.

Aquí está la gran sorpresa que encontraron: los robots no piensan todos de la misma manera, y tampoco piensan exactamente como nosotros. Mientras que los humanos usan una red amplia para capturar ideas creativas —mirando tanto la idea en sí como el mundo que la rodea (como su reputación o las tendencias del mercado)—, los robots mayormente solo miran la idea en sí. Específicamente, los robots están obsesionados con la novedad. Si una idea es nueva, extraña o inesperada, a los robots les encanta. También les gusta si es divertida o artística. Pero cuando se trata de pistas "contextuales" —como si un producto es de una marca famosa, si es un éxito de masas o si está de moda—, los robots básicamente las ignoran. Para un humano, una marca famosa puede hacer que una idea parezca más creativa; para un robot, eso es simplemente ruido.

El estudio también descubrió que no todos los robots están construidos de la misma manera. Algunos modelos, como GPT y Grok, tienen una "red más amplia". Miran más de los 26 estándares humanos, por lo que sus juicios coinciden bastante bien con las opiniones humanas. Otros, como Claude y Gemini, tienen una "red más estrecha". Se ciñen estrictamente a la idea central e ignoran casi todo lo demás. Esto significa que si le pides a un robot de red estrecha que juzgue una idea creativa, podría no dar en el clavo en comparación con lo que pensaría un humano, simplemente porque está ignorando el contexto social o de mercado que a los humanos les importa.

Para demostrar esto, los investigadores realizaron dos pruebas más. En la primera, hicieron que humanos y robots juzgaran más de 1,100 ideas. Descubrieron que los robots con las "redes más amplias" coincidían mucho mejor con las puntuaciones humanas que aquellos con "redes más estrechas". En la segunda prueba, mostraron a humanos y robots exactamente las mismas descripciones de productos, pero para algunas, añadieron una frase sobre la marca o el éxito de mercado del producto. Las calificaciones de los humanos subieron cuando vieron ese contexto adicional; pensaron que el producto era más creativo debido a ello. ¿Los robots? Sus calificaciones apenas cambiaron. Eran completamente ciegos a las pistas sociales que influyeron en los humanos.

Entonces, ¿qué significa esto para el futuro? Sugiere que no podemos tratar a todos los jueces de IA como si fueran iguales. Si quieres saber si una idea es verdaderamente original y fresca, un robot podría ser un gran ayudante. Pero si necesitas saber si una idea tendrá éxito en el mundo real, encajará con una marca o hará que la gente hable de ella, un robot podría perderse el punto por completo. El artículo sugiere que elegir al juez de IA adecuado es algo muy importante: diferentes modelos aplican diferentes reglas, por lo que elegirán diferentes ganadores. Debemos tener cuidado de no asumir que el robot ve el panorama completo, porque a menudo está mirando a través de un lente muy específico y estrecho.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →