← Últimos artículos
💻 computer science

The Human Creativity Benchmark

El artículo presenta el Human Creativity Benchmark (HCB), el cual distingue entre la convergencia profesional en la corrección técnica y la divergencia en el gusto estético para argumentar que la evaluación de la IA creativa requiere preservar estas señales distintas en lugar de colapsarlas en una única métrica de calidad.

Autores originales: Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh

Publicado 2026-06-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Por qué lo "Bueno" es Complicado

Imagina que estás intentando juzgar un concurso de cocina.

  • El Juez "Objetivo": Este juez comprueba si la comida está realmente cocinada, si tiene sal y si el plato no está roto. Todo el mundo está de acuerdo en esto. Si el filete está crudo, es un fallo.
  • El Juez "Subjetivo": Este juez pregunta: "¿Me gusta el sabor?". A una persona puede gustarle la comida picante, mientras que otra puede odiarla. Ninguno está equivocado; simplemente tienen gustos diferentes.

El Problema: La mayoría de las pruebas de IA actuales actúan como si solo tuvieran al juez "Objetivo". Intentan forzar a que todo el mundo esté de acuerdo en una única puntuación (por ejemplo, "Esta IA es un 8/10"). Los autores de este artículo dicen que en el trabajo creativo (como crear anuncios, sitios web o vídeos), este enfoque está roto. Se está desechando la parte más importante de los datos: el hecho de que la gente debería discrepar sobre el gusto.

La Solución: El "Martini" de la Creatividad

Los autores proponen una nueva forma de probar la IA llamada Human Creativity Benchmark (HCB). Visualizan el proceso creativo como una copa de martini invertida (ver la Figura 1 del artículo):

  1. La Parte Ancha (Ideación): Al principio, quieres muchas ideas salvajes y diferentes. Aquí es donde la "divergencia" (diferentes opiniones) es buena.
  2. La Parte que se Estrecha (Maqueta/Mockup): Empiezas a seleccionar las mejores ideas y a hacer que parezcan reales.
  3. El Tallo (Refinamiento): Al final, estás puliendo el producto final. Aquí, necesitas "convergencia" (que todo el mundo esté de acuerdo) en los detalles técnicos, como la ortografía, el diseño o si el producto realmente funciona.

Cómo lo Probaron

En lugar de preguntar "¿Es buena esta IA?", preguntaron a creativos profesionales (diseñadores, editores de vídeo, programadores) para que evaluaran los resultados de la IA de tres formas específicas:

  1. Adherencia al Prompt: ¿Hizo la IA exactamente lo que se le pidió? (Como un seguidor de recetas).
  2. Usabilidad: ¿Se podría usar esto realmente en un trabajo real? (¿Es el texto legible? ¿Es el botón cliqueable?).
  3. Atractivo Visual: ¿Es bonito? (Aquí es donde entra el gusto).

Realizaron esta prueba a través de 15.000 juicios de expertos en cinco campos diferentes: Páginas de aterrizaje (Landing Pages), Aplicaciones de escritorio, Imágenes publicitarias, Imágenes de marca y Vídeos de producto.

Lo que Encontraron (Los Momentos "¡Ajá!")

1. La Concordancia vs. la Discrepancia son señales distintas

  • Convergencia (Acuerdo): Cuando la IA comete un error (como un texto ilegible o un diseño roto), todos los expertos coinciden en que es malo. Cuando la IA sigue las reglas perfectamente, también coinciden en que es bueno.
  • Divergencia (Desacuerdo): Cuando la IA es técnicamente correcta, los expertos empiezan a discrepar según su gusto. Un experto puede decir: "Este anuncio parece de moda de lujo", mientras que otro dice: "Esto parece barato". El artículo argumenta que este desacuerdo no es un error; es una característica. Significa que la IA está ofreciendo diferentes direcciones creativas.

2. Ninguna IA gana en todo
Si solo miras una puntuación media, podrías pensar que una IA es la "mejor". Pero el artículo descubrió que ningún modelo es el mejor en todo.

  • Algunos modelos son excelentes en la fase de Ideación (proponer conceptos salvajes y creativos).
  • Otros modelos son mejores en la fase de Refinamiento (corregir erratas y hacer que las cosas parezcan profesionales).
  • Analogía: Es como decir que un coche de Fórmula 1 es "mejor" que una camioneta (pickup truck). El coche de F1 gana en la pista de carreras (Refinamiento), pero la camioneta gana en la obra de construcción (Ideación/Utilidad). Necesitas la herramienta adecuada para la etapa específica del trabajo.

3. La Trampa de la "Puntuación Única"
El artículo advierte que si colapsas todas estas diferentes opiniones en un solo número (por ejemplo, "El Modelo X tiene 4.2 estrellas"), pierdes la información más útil. Dejas de ver dónde es fiable el modelo (corrección técnica) y dónde es flexible (estilo creativo).

La Conclusión para Humanos e IA

Los autores sugieren que no deberíamos intentar que la IA esté de acuerdo en una definición única de "belleza". En su lugar, deberíamos:

  • Usar modelos de IA que sean fiables cuando necesitemos corrección técnica (convergencia).
  • Usar modelos de IA que sean dirigibles (steerable) cuando necesitemos variedad creativa (divergencia).

En resumen: No pidas a la IA que sea perfecta en todo. Pídele que sea perfecta en la parte adecuada del proceso. Este benchmark ayuda a determinar qué IA es el "chef" adecuado para el plato específico que estamos cocinando.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →