← Últimos artigos
💬 NLP

Are LLMs becoming similarly creative? Evidence from three years of models

Este artigo analisa três anos de lançamentos de Grandes Modelos de Linguagem e constata uma diminuição estatisticamente significativa na diversidade de saídas em tarefas criativas de natureza aberta, sugerindo uma tendência à homogeneização que pode diminuir a agência humana em trabalhos de cocriação entre humanos e IA.

Autores originais: Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger

Publicado 2026-08-21
📖 1 min de leitura☕ Leitura rápida

Autores originais: Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: "Os LLMs estão se tornando igualmente criativos? Evidências de três anos de modelos"

Definição do Problema
Embora inúmeros benchmarks monitorem o desempenho de Grandes Modelos de Linguagem (LLMs) em tarefas com respostas verificáveis, há uma carência de dados longitudinais sobre o desempenho de LLMs em tarefas de natureza aberta, onde a criatividade, a originalidade e a diversidade são primordiais. Pesquisas existentes sugerem que, embora os LLMs possam parecer individualmente criativos, eles frequentemente exibem homogeneidade coletiva, produzindo resultados que são semelhantes entre si em diferentes modelos e ao longo do tempo. No entanto, permanece incerto se essa homogeneidade é um artefato temporário do desenvolvimento tecnológico ou uma característica inevitável de modelos de linguagem estatísticos. Os benchmarks atuais (ex: MMLU, HELM) focam em critérios explícitos com respostas verificáveis e falham em capturar tendências na diversidade ou originalidade dos outputs criativos ao longo do tempo.

Metodologia
Os autores conduziram uma análise temporal preliminar da diversidade de outputs de LLMs utilizando um processo de quatro etapas:

  1. Seleção de Prompts: Dois conjuntos complementares de prompts de natureza aberta foram selecionados para elicitar comportamento criativo:
    • Tarefa de Usos Alternativos (AUT): Uma avaliação psicométrica padronizada de pensamento divergente onde os modelos geram usos não convencionais para objetos comuns.
    • Infinity-Chat100: Uma coleção de 100 consultas de usuários do mundo real, abrangendo seis categorias, incluindo geração de conteúdo criativo, brainstorming e ideação.
  2. Coleta de Dados: Os prompts foram executados contra 68 modelos lançados entre março de 2023 e julho de 2026, representando 12 grandes provedores de modelos (33 de pesos fechados e 34 de pesos abertos). Todas as gerações utilizaram temperatura e top-p de 1.0 para manter a amostragem estocástica.
  3. Embedding Semântico: As respostas foram transformadas em vetores (embeddings) usando o modelo de sentence-transformer all-MiniLM-L6-v2. Para a AUT, todos os usos para um único objeto foram incorporados como um único vetor; para o Infinity-Chat, cada resposta foi incorporada individualmente.
  4. Análise de Regressão: O estudo computou as distâncias de cosseno entre embeddings de pares de famílias de modelos (modelos de diferentes provedores) para medir a divergência semântica. Esses pares foram agrupados em nove bins temporais baseados nas datas de lançamento. Uma regressão de Mínimos Quadrados Ordinários (OLS) foi realizada sobre a média da distância de cosseno em relação ao índice do bin. Para mitigar o viés da representação desigual das famílias, os autores realizaram 1.000 iterações de reamostragem balanceada por família para gerar uma distribuição de estimativas de inclinação.

Principais Contribuições

  • Framework Longitudinal: Este artigo fornece o primeiro framework para rastrear a evolução dos outputs criativos de LLMs ao longo do tempo, indo além de snapshots estáticos do comportamento dos modelos.
  • Análise de Dupla Tarefa: Ao combinar uma tarefa psicométrica controlada (AUT) com consultas de usuários do mundo real (Infinity-Chat100), o estudo avalia a criatividade tanto em contextos estruturados quanto não estruturados.
  • Evidência Quantitativa de Convergência: O estudo oferece evidência empírica de que os outputs de LLMs estão se tornando cada vez mais semelhantes ao longo do tempo, desafiando a suposição de que novos modelos oferecem inerentemente maior diversidade criativa.

Resultos
A análise revela uma diminuição estatisticamente significativa na diversidade de outputs dos modelos ao longo do período de observação de três anos:

  • Tendência: Tanto o conjunto de dados AUT quanto o Infinity-Chat mostram uma inclinação negativa consistente na distância de cosseno entre famílias ao longo do tempo, indicando um aumento na similaridade semântica (homogeneidade).
  • Magnitude: O declínio é mais pronunciado na Tarefa de Usos Alternativos, onde a distância média entre famílias caiu de aproximadamente 0,50 no bin de lançamento mais antigo para abaixo de 0,40 no mais recente. O conjunto de dados Infinity-Chat mostrou um declínio mais suave, porém consistente, de ~0,34 para ~0,32.
  • Robustez: Todas as 1.000 iterações de reamostragem produziram inclinações negativas para ambos os conjuntos de dados, confirmando que a tendência é robusta através de diferentes combinações de modelos de cada família.

Significância e Alegações
O artigo postula que os LLMs estão se tornando menos criativos em tarefas que exigem respostas abertas, sugerindo uma convergência na substância criativa entre os modelos. Os autores argumentam que, se essa tendência persistir, a "homogeneização impulsionada por LLMs pode diminuir progressivamente a agência humana no trabalho de cocriação humano-IA".

O estudo enquadra esses achados como uma análise preliminar que demanda consideração cuidadosa sobre o papel dos LLMs no processo criativo humano. Ele destaca um potencial "paradoxo da criatividade da IA": enquanto os modelos podem parecer individualmente criativos, seus outputs agregados estão se tornando menos diversos, potencialmente limitando o alcance de ideias que os usuários encontram e impactando negativamente a criatividade humana subsequente. Os autores declaram explicitamente que seu trabalho é preliminar e pedem pesquisas futuras para examinar os mecanismos subjacentes (como dados de treinamento compartilhados ou destilação) e os fatores específicos que impulsionam essa convergência.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →