Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
Este artigo introduz um framework escalável e agnóstico ao domínio que quantifica a criatividade de modelos de linguagem de grande escala em tarefas de código aberto ao combinar entropia semântica para medir a novidade divergente com um juiz multiagente baseado em recuperação para avaliar o cumprimento convergente da tarefa.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é um olheiro de talentos tentando julgar o quão "criativos" são um grupo de novos escritores, inventores e solucionadores de problemas de IA. No passado, julgar a criatividade era como tentar avaliar uma pintura com uma régua: era bagunçado, exigia um especialista humano para cada peça e só funcionava para tipos específicos de arte.
Este artigo apresenta um novo "Placar de Criatividade" automatizado que funciona para qualquer tipo de tarefa aberta, desde resolver um quebra-cabeça até escrever uma história. Os autores dividem a criatividade em dois superpoderes distintos e medem cada um separadamente: Pensamento Divergente (a habilidade de sonhar com muitas ideias diferentes) e Pensamento Convergente (a habilidade de escolher a melhor ideia e fazê-la funcionar).
Veja como o sistema deles funciona, usando analogias simples:
1. Medindo o "Sonhar" (Criatividade Divergente)
O Problema: Como saber se uma IA está apenas repetindo a mesma ideia com palavras diferentes ou se ela está realmente explorando novos territórios?
O Jeito Antigo: Contar palavras ou verificar se as frases parecem diferentes na superfície. Isso é como julgar um chef pela quantidade de palavras diferentes que ele usa para descrever "sopa", mesmo que todas tenham o mesmo gosto.
O Jeito Novo (Entropia Semântica): Os autores utilizam um conceito chamado Entropia Semântica.
- A Analogia: Imagine que você pergunta a uma IA: "Como posso atravessar um rio?"
- Uma IA de baixa criatividade pode dizer: "Construir uma ponte", "Fazer uma ponte", "Construir uma ponte". Elas parecem diferentes, mas significam exatamente a mesma coisa. A "entropia" (variedade) é baixa.
- Uma IA de alta criatividade pode dizer: "Construir uma ponte", "Voar com um drone", "Amarrar cipós", "Esperar a água congelar". Estas são caminhos genuinamente diferentes. A "entropia" é alta.
- O Resultado: Este método atua como um "medidor de variedade". Ele ignora mudanças superficiais de palavras e mede quantos direcionamentos conceituais diferentes a IA explora. O artigo descobriu que este medidor se aproxima muito mais do que os humanos consideram "criativo" do que os métodos anteriores.
2. Medindo o "Fazer" (Criatividade Convergente)
O Problema: Gerar ideias selvagens é fácil; garantir que essas ideias realmente resolvam o problema é difícil. Uma IA pode sugerir "voar em um dragão" para atravessar um rio, o que é criativo, mas inútil.
O Jeito Antigo: Usar um único juiz de IA ou um humano para ler a resposta. Isso é lento, caro e difícil de escalar.
O Novo Jeito (A Equipe Multiagente Baseada em Recuperação): Os autores construíram uma equipe de "juízes" de IA especializados que trabalham juntos, mas com um toque para economizar dinheiro e tempo.
- A Analogia: Imagine um painel de especialistas (um Oficial de Segurança, um Especialista em Viabilidade e um Crítico de Histórias) revisando um projeto.
- Método Antigo: Toda vez que eles falam, eles leem o histórico inteiro da conversa desde o início. Isso é como uma reunião onde todos relêem as últimas 100 páginas de notas antes de falar. Torna-se enorme e caro.
- Novo Método: A equipe utiliza um "sistema de arquivamento inteligente". Em vez de reler tudo, eles apenas buscam as notas específicas relevantes para o ponto atual em discussão.
- O Resultado: Esta abordagem "Baseada em Recuperação" reduziu o custo computacional em 63%, mantendo-se tão precisa quanto especialistas humanos. Ela garante que a IA não esteja apenas sonhando bobagens, mas sim cumprindo os requisitos da tarefa.
3. A Grande Descoberta: Duas Habilidades Diferentes
A descoberta mais surpreendente do artigo é que essas duas habilidades — Sonhar e Fazer — não crescem juntas automaticamente.
- A Analogia: Pense em um carro. Você pode ter um motor muito potente (Convergente/Cumprimento de Tarefa) que te leva ao destino perfeitamente, mas isso não significa que o motorista seja bom em explorar trilhas fora de estrada (Divergente/Criatividade).
- A Descoberta: À medida que os modelos de IA ficam maiores e mais inteligentes no seguimento de instruções (Convergente), eles não se tornam necessariamente melhores em explorar ideias novas e selvagens (Divergente). Na verdade, os modelos maiores e mais "corretos" às vezes exploram menos do que os menores. O artigo sugere que o treinamento atual torna as IAs melhores em serem "corretas", mas não necessariamente mais "criativas".
4. Testando o Sistema
Os autores testaram esta estrutura em três "parquinhos" muito diferentes:
- MacGyver: Resolver problemas físicos com objetos cotidianos (ex: "Como consertar um vazamento com uma meia?").
- HypoGen: Criar novas ideias de pesquisa científica.
- BookMIA: Escrever histórias criativas com pontos de partida e de chegada específicos.
Em todos os três casos, o sistema deles mediu com sucesso o quão "amplas" eram as ideias da IA e o quão "boas" eram as soluções finais, provando que funciona através de diferentes tipos de criatividade.
Resumo
Este artigo fornece uma régua universal e automatizada para a criatividade. Ele separa a habilidade de gerar muitas ideias únicas da habilidade de resolver o problema corretamente. Ele mostra que, embora a IA esteja ficando melhor em resolver problemas, ela não está se tornando automaticamente mais imaginativa, e precisamos de novas ferramentas para medir e incentivar essa "centelha criativa" específica.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.