← Últimos artículos
💬 NLP

Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations

Este artículo analiza críticamente cuatro métricas comunes de evaluación de la creatividad a través de diversos dominios, revelando sus significativas inconsistencias, limitaciones específicas de cada dominio y falta de alineación con los juicios humanos, subrayando así la necesidad urgente de marcos más robustos y generalizables.

Autores originales: Li-Chun Lu, Miri Liu, Pin-Chun Lu, Yufei Tian, Shao-Hua Sun, Nanyun Peng

Publicado 2026-01-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Li-Chun Lu, Miri Liu, Pin-Chun Lu, Yufei Tian, Shao-Hua Sun, Nanyun Peng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un cazatalentos intentando encontrar a los escritores, resolutores de problemas y científicos más creativos del mundo. Tienes una pila gigante de entradas, pero necesitas una forma de clasificar rápidamente las que son "geniales" de las que son "aburridas". Como hay demasiadas entradas para leerlas a mano, decides usar cuatro herramientas automatizadas (métricas) para que hagan la clasificación por ti.

Este documento es esencialmente un informe de calificaciones sobre esas cuatro herramientas. Los autores las probaron para ver si realmente funcionan, y las malas noticias son: todas son bastante poco fiables.

Aquí tienes un desgón de las cuatro herramientas que probaron y por qué fallaron, utilizando analogías sencillas:

Las cuatro herramientas probadas

1. El detector de "Copiar y Pegar" (Índice de Creatividad)

  • Cómo funciona: Esta herramienta escanea internet para ver si una frase ha sido escrita antes. Si una frase es única y no ha aparecido en su enorme base de datos, otorga una puntuación de "creatividad" alta.
  • El problema: Es como juzgar la creatividad de un chef basándose únicamente en cuántos ingredientes utilizó que nadie más haya comprado jamás.
    • En la Escritura Creativa, funcionó bien porque las palabras únicas suelen significar una historia fresca.
    • En la Resolución de Problemas y la Ciencia, falló estrepitosamente. Una idea científica brillante y nueva podría utilizar palabras muy comunes y estándar (como "experimento" o "datos"), por lo que esta herramienta la considera aburrida. Por el contrario, un escritor podría usar palabras extrañas u oscuras solo para sonar sofisticado, y esta herramienta lo considera genial. Mide la variedad del vocabulario, no la novedad de la idea.

2. El "Medidor de Sorpresa" (Perplejidad)

  • Cómo funciona: Esta herramienta adivina qué tan "sorprendida" estaría una computadora por la siguiente palabra en una oración. Si el texto es muy predecible, la puntuación es baja. Si el texto es raro e inesperado, la puntuación es alta. La idea es que creatividad = sorpresa.
  • El problema: Es como juzgar a un comediante por cuántas veces hace que la audiencia se asombre por la confusión.
    • A veces, un texto tiene una puntuación alta (muy sorprendente) solo porque es gramaticalmente desordenado o sin sentido, no porque sea creativo.
    • A veces, una idea verdaderamente brillante y clara es muy fluida y fácil de leer, por lo que la herramienta le da una puntuación baja.
    • Los autores descubrieron que los textos "creativos" y "no creativos" a menudo obtenían exactamente las mismas puntuaciones, lo que hace que la herramienta sea inútil para distinguirlos.

3. El "Escáner de Estructura de Oraciones" (Plantillas Sintácticas)

  • Cómo funciona: Esta herramienta examina el esqueleto de las oraciones (por ejemplo, "El [Sustantivo] [Verbo] el [Adjetivo] [Sustantivo]"). Comprueba si el escritor está utilizando los mismos patrones de oraciones una y otra vez.
  • El problema: Es como juzgar a un pintor solo por la forma de sus pinceladas, ignorando el cuadro que está pintando.
    • En la Escritura Creativa, detectó que la IA suele utilizar estructuras de oraciones repetitivas y formulaicas (como "El viaje del héroe comenzó cuando...").
    • Sin embargo, en la Ciencia y la Resolución de Problemas, los expertos a menudo necesitan utilizar un lenguaje estándar y formulaico para ser claros y precisos. Esta herramienta los penalizó por ser claros, pensando que no eran creativos porque seguían las reglas de la gramática.

4. El "Juez de IA" (LLM como Juez)

  • Cómo funciona: Esto utiliza otra IA para leer el trabajo y darle una calificación, tal como lo haría un profesor humano.
  • El problema: Es como contratar a un estudiante para calificar la tarea de otro estudiante. Son inconsistentes y fáciles de engañar.
    • Manipulable: Si cambias ligeramente la pregunta (por ejemplo, preguntar "¿Es esto creativo?" frente a "¿Es esto poco creativo?"), la IA cambia de opinión por completo.
    • Sesgado: Tiende a elegir un lado (por ejemplo, decir siempre "No, esto no es creativo") independientemente de la calidad real.
    • Poco fiable: Cuando se le pide que califique el mismo ensayo tres veces, solo coincidió consigo misma el 40% de las veces. Básicamente, está adivinando.

El panorama general

Los autores probaron estas herramientas en tres tipos diferentes de creatividad:

  1. Escritura Creativa (Historias, poemas).
  2. Resolución de Problemas (Encontrar formas extrañas de usar objetos cotidianos).
  3. Ideación de Investigación (Plantear nuevas teorías científicas).

El resultado: Ninguna herramienta funcionó para los tres casos. Una herramienta que era buena para detectar una historia creativa era terrible para detectar una idea científica creativa. A veces, las herramientas incluso discrepaban entre sí sobre el mismo texto exacto.

La conclusión

El artículo concluye que actualmente no tenemos una forma fiable de medir la verdadera creatividad de forma automática.

  • Las herramientas actuales miden principalmente aspectos superficiales como la elección de palabras, la longitud de las oraciones o qué tan "extraño" parece el texto.
  • Fallan al medir la idea o el concepto real detrás del texto.
  • Que una computadora diga que algo es "creativo" basándose en estos números no significa que un humano esté de acuerdo.

Los autores están diciendo esencialmente: "Debemos dejar de confiar en estos simples trucos matemáticos. Necesitamos construir mejores sistemas que realmente entiendan las ideas, no solo las palabras, antes de que podamos confiar en ellos para juzgar la creatividad humana (o de las máquinas)".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →