← Últimos artículos
💬 NLP

Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

Este artículo introduce un marco escalable y agnóstico al dominio que cuantifica la creatividad de los modelos de lenguaje de gran tamaño en tareas abiertas mediante la combinación de la entropía semántica para medir la novedad divergente con un juez multiagente basado en la recuperación para evaluar el cumplimiento convergente de la tarea.

Autores originales: Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

Publicado 2026-06-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un cazatalentos tratando de juzgar qué tan "creativos" son un grupo de nuevos escritores, inventores y solucionadores de problemas de IA. En el pasado, juzgar la creatividad era como intentar calificar una pintura con una regla: era desordenado, requería un experto humano para cada pieza y solo funcionaba para tipos específicos de arte.

Este artículo presenta un nuevo "Tablero de Puntuación de Creatividad" automatizado que funciona para cualquier tipo de tarea abierta, desde resolver un rompecabezas hasta escribir una historia. Los autores descomponen la creatividad en dos superpoderes distintos y los miden por separado: Pensamiento Divergente (la capacidad de soñar con muchas ideas diferentes) y Pensamiento Convergente (la capacidad de elegir la mejor idea y hacer que funcione).

Así es como funciona su sistema, utilizando analogías simples:

1. Midiendo el "Soñar" (Creatividad Divergente)

El Problema: ¿Cómo sabes si una IA solo está repitiendo la misma idea con diferentes palabras o si realmente está explorando nuevos territorios?
La Forma Antigua: Contar palabras o verificar si las oraciones se ven diferentes en la superficie. Esto es como juzgar a un chef por cuántas palabras diferentes usa para describir la "sopa", incluso si todas saben igual.
La Nueva Forma (Entropía Semántica): Los autores utilizan un concepto llamado Entropía Semántica.

  • La Analogía: Imagina que le preguntas a una IA: "¿Cómo puedo cruzar un río?".
    • Una IA de baja creatividad podría decir: "Construir un puente", "Hacer un puente", "Construir un puente". Se ven diferentes, pero significan exactamente lo mismo. La "entropía" (variedad) es baja.
    • Una IA de alta creatividad podría decir: "Construir un puente", "Volar un dron", "Atar lianas juntas", "Esperar a que el agua se congele". Estos son caminos genuinamente diferentes. La "entropía" es alta.
  • El Resultado: Este método actúa como un "medidor de variedad". Ignora los cambios superficiales de palabras y mide cuántas direcciones conceptuales diferentes explora la IA. El artículo encontró que este medidor coincide con lo que los humanos consideran "creativo" mucho mejor que los métodos anteriores.

2. Midiendo el "Hacer" (Creatividad Convergente)

El Problema: Generar ideas salvajes es fácil; asegurarse de que esas ideas realmente resuelvan el problema es difícil. Una IA podría sugerir "volar un dragón" para cruzar un río, lo cual es creativo pero inútil.
La Forma Antigua: Usar un único juez de IA o a un humano para leer la respuesta. Esto es lento, costoso y difícil de escalar.
La Nueva Forma (El Equipo Multiagente Basado en Recuperación): Los autores construyeron un equipo de jueces de IA especializados que trabajan juntos, pero con un giro para ahorrar dinero y tiempo.

  • La Analogía: Imagina un panel de expertos (un Oficial de Seguridad, un Experto en Viabilidad y un Crítico de Historias) revisando un proyecto.
    • Método Antiguo: Cada vez que hablan, leen todo el historial de la conversación desde el principio. Esto es como una reunión donde todos vuelven a leer las últimas 100 páginas de notas antes de hablar. Se vuelve enorme y costoso.
    • Nuevo Método: El equipo utiliza un "sistema de archivo inteligente". En lugar de relecturar todo, solo extraen las notas específicas relevantes para el punto actual de la discusión.
  • El Resultado: Este enfoque "Basado en la Recuperación" reduce el costo de computación en un 63% mientras sigue siendo tan preciso como los expertos humanos. Asegura que la IA no solo esté soñando con tonterías, sino que realmente esté cumpliendo con los requisitos de la tarea.

3. El Gran Descubrimiento: Dos Habilidades Diferentes

El hallazgo más sorprendente del artículo es que estas dos habilidades —Soñar y Hacer— no crecen juntas automáticamente.

  • La Analogía: Piensa en un coche. Puedes tener un motor muy potente (Convergente/Cumplimiento de Tarea) que te lleva al destino perfectamente, pero eso no significa que el conductor sea bueno explorando senderos fuera de pista (Divergente/Creatividad).
  • El Hallazgo: A medida que los modelos de IA se vuelven más grandes y más inteligentes siguiendo instrucciones (Convergente), no necesariamente se vuelven mejores explorando ideas salvajes y nuevas (Divergente). De hecho, los modelos más grandes y "correctos" a veces exploran menos que los modelos más pequeños. El artículo sugiere que el entrenamiento actual hace que las IA sean mejores para ser "correctas", pero no necesariamente más "creativas".

4. Probando el Sistema

Los autores probaron este marco de trabajo en tres "parques de juegos" muy diferentes:

  1. MacGyver: Resolver problemas físicos con objetos cotidianos (por ejemplo, "¿Cómo arreglar una fuga con un calcetín?").
  2. HypoGen: Proponer nuevas ideas de investigación científica.
  3. BookMIA: Escribir historias creativas con puntos de inicio y fin específicos.

En los tres casos, su sistema midió con éxito qué tan "amplias" eran las ideas de la IA y qué tan "buenas" eran las soluciones finales, demostrando que funciona a través de diferentes tipos de creatividad.

Resumen

Este artículo proporciona una regla universal y automatizada para la creatividad. Separa la capacidad de generar muchas ideas únicas de la capacidad de resolver el problema correctamente. Demuestra que, si bien la IA está mejorando en la resolución de problemas, no está volviéndose automáticamente más imaginativa, y necesitamos nuevas herramientas para medir y fomentar esa "chispa creativa" específica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →