← Últimos artículos
💬 NLP

Evaluating the Creativity of LLMs in Persian Literary Text Generation

Este artículo evalúa la capacidad de los modelos de lenguaje grandes para generar textos literarios en persa, analizando su creatividad y el uso de recursos retóricos mediante un conjunto de datos diversificado y una evaluación automatizada validada por humanos.

Autores originales: Armin Tourajmehr, Mohammad Reza Modarres, Yadollah Yaghoobzadeh

Publicado 2026-02-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Armin Tourajmehr, Mohammad Reza Modarres, Yadollah Yaghoobzadeh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que las Inteligencias Artificiales (IA) son como cocineros robóticos que han aprendido a cocinar millones de recetas en inglés. Ahora, los investigadores se preguntan: "¿Pueden estos robots cocinar un plato tradicional persa con la misma pasión, sazón y creatividad que un chef humano?"

Este artículo es el informe de un grupo de expertos que decidieron poner a prueba a estos "cocineros digitales" en la cocina de la literatura persa. Aquí te explico cómo lo hicieron, usando analogías sencillas:

1. El Reto: ¿Puede un robot tener "alma"?

Hasta ahora, casi todos los estudios sobre creatividad de la IA se hacían en inglés. Pero el persa es como un jardín lleno de flores específicas, metáforas antiguas y emociones profundas que no existen en otros idiomas. Los autores querían saber: ¿Puede una IA escribir un poema o una frase literaria en persa que realmente haga sentir algo a un nativo, o solo está repitiendo frases hechas como un loro?

2. La Herramienta: El "Examen de Creatividad"

Para medir la creatividad, no basta con decir "esto es bonito". Usaron una regla de oro llamada TTCT (las pruebas de Torrance), que es como un examen de gimnasia mental para la creatividad. Lo adaptaron al persa y lo dividieron en cuatro músculos:

  • Originalidad: ¿Es la frase tan única como un diamante raro, o es tan común como un zapato viejo?
  • Fluidez: ¿Suena natural y suave, como un río, o es rígida y robótica?
  • Flexibilidad: ¿Puede la frase ver el tema desde varios ángulos, como una cámara girando?
  • Elaboración: ¿La frase tiene tantos detalles que puedes "ver" la imagen en tu mente, como un cuadro pintado con pinceladas finas?

3. El Laboratorio: La "Biblioteca de Frases" (CPers)

Como no existía un libro de frases persas hechas por humanos para comparar, los autores crearon su propia biblioteca llamada CPers.

  • Recopilaron 4,371 frases escritas por personas normales (no poetas famosos, sino gente común) sobre temas como el amor, la esperanza, el padre, o el Año Nuevo Persa (Nowruz).
  • Imagina que esto es como tener una caja de 4,000 cartas de amor escritas a mano para compararlas con las cartas que escribe un robot.

4. El Juez: ¿Quién califica?

Calificar arte es subjetivo (es como decir cuál es el mejor sabor de helado). Para evitar errores, usaron dos métodos:

  1. Humanos: Dos personas leyeron las frases y las calificaron.
  2. Un Juez IA: Usaron una IA muy avanzada (Claude 3.7 Sonnet) para que calificara a las otras IAs.
  • Resultado: La IA juez fue tan buena como los humanos. ¡Es como si un crítico de arte experto pudiera imitar el gusto de un humano al 100%!

5. Los Resultados: ¿Quién ganó la carrera?

Pusieron a competir a 6 IAs famosas (como GPT-4, DeepSeek, Qwen, etc.) para ver quién escribía mejor. Fue como una carrera de coches, donde cada uno tenía un motor diferente:

  • DeepSeek-R1 (El Pensador): Fue el ganador general. Es como un chef que piensa mucho antes de cocinar. Escribía frases muy detalladas y con muchas perspectivas. Su "entrenamiento de razonamiento" le ayudó a ser más creativo y flexible.
  • GPT-4.1 (El Polímata): Escribía frases muy fluidas y gramaticalmente perfectas, como un hablante nativo muy educado. Pero a veces le faltaba "chispa" o originalidad; usaba demasiadas metáforas comunes.
  • Qwen2.5 (El Innovador Arriesgado): Era muy original (usaba ideas raras), pero a veces su texto era difícil de entender, como un poema escrito en un idioma que solo él entiende. Le faltaba fluidez.

La lección: No hay un "robot perfecto". Cada uno tiene sus fortalezas, pero ninguno iguala la diversidad y la profundidad emocional de un humano.

6. El Detalle Oculto: Las "Herramientas Literarias"

Los investigadores también miraron si las IAs usaban las herramientas mágicas de la literatura persa:

  • Metáforas (decir "el tiempo es un río").
  • Hipérboles (exagerar: "te quiero hasta el infinito").
  • Antítesis (contrastes: "la luz en la oscuridad").

El hallazgo: Los humanos mezclan estas herramientas de forma natural y equilibrada. Las IAs, en cambio, tienden a abusar de una sola (como las metáforas) y a veces se confunden al intentar usarlas. Es como si un robot intentara pintar un cuadro usando solo el color rojo, mientras que un humano usa todo el arcoíris.

Conclusión Final

Este estudio nos dice que las IAs son herramientas muy útiles para escribir en persa, pero aún no tienen el "alma" creativa de un humano. A veces suenan bien, pero les falta la profundidad cultural y la sorpresa que tiene un escritor humano.

En resumen: Las IAs son como discípulos muy inteligentes que han leído todos los libros de la biblioteca, pero aún necesitan aprender a sentir el viento y el corazón para escribir poesía que realmente toque el alma. Los autores nos dan las herramientas (el dataset y el método) para seguir entrenando a estos robots hasta que puedan cocinar ese plato perfecto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →