← Últimos artigos
🤖 machine learning

Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs

Este artigo introduz o Conditional-Vendi e o Conditional-RKE, métricas de diversidade inovadoras que isolam a variabilidade induzida pelo modelo dos efeitos induzidos pelo prompt em IA generativa, permitindo uma avaliação e orientação mais precisas da diversidade em tarefas de texto para imagem, legenda de imagem e LLM.

Autores originais: Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

Publicado 2026-06-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef comandando uma cozinha de alta tecnologia que recebe pedidos (prompts) e prepara pratos (imagens, vídeos ou histórias). Durante anos, os críticos julgaram esses chefs baseando-se apenas em duas coisas:

  1. Fidelidade: O prato se parecia com o pedido? (ex: Se você pediu um "taco apimentado", ele parecia um taco?)
  2. Variedade Incondicional: Se você deixasse o chef cozinhar sem pedidos, quantos pratos diferentes ele seria capaz de fazer?

Mas faltava uma peça do quebra-cabeça: Quanta variedade o chef adiciona além do pedido?

Se você pede um "carro vermelho", o chef faz apenas um sedan vermelho genérico? Ou ele te surpreende com um conversível vermelho, um carro esportivo vermelho, uma caminhonete vermelha e um cupê clássico vermelho? As ferramentas existentes não consegravam distinguir entre "o chef é sem graça" e "o cliente fez um pedido muito específico".

Este artigo apresenta uma nova maneira de medir esse tipo específico de criatividade, chamada Vendi Score Condicional e RKE Condicional.

O Problema Central: O "Prompt" vs. O "Chef"

Os autores explicam que os escores de diversidade atuais misturam duas fontes diferentes de variedade:

  • Diversidade Induzida pelo Prompt: Esta é a variedade causada pelo cliente ao mudar seu pedido. Se você pede um "cachorro", depois um "gato", depois um "pássaro", o resultado muda. Isso não é a criatividade do chef; é apenas você mudando o cardápio.
  • Diversidade Induzida pelo Modelo: Esta é a variedade que o chef adiciona quando você dá o mesmo pedido. Se você pede um "cachorro" dez vezes, o chef faz dez raças diferentes ou dez cópias idênticas?

A Analogia:
Imagine uma cabine de fotos.

  • Cenário A: Você pede uma foto de um "cachorro", depois de um "gato", depois de um "cavalo". A cabine entrega três fotos muito diferentes. Os escores antigos dizem: "Uau, essa cabine é super diversa!"
  • Cenário B: Você pede uma foto de um "cachorro" dez vezes. A cabine entrega dez raças diferentes de cachorros. Os escores antigos podem dizer: "Meh, não é muito diverso", porque as fotos todas parecem "cachorros" em comparação ao "cavalo" no Cenário A.

Os autores argumentam que o Cenário B é onde reside a verdadeira magia da IA. Eles querem medir o quanto a IA varia sua produção mesmo quando o prompt permanece o mesmo.

A Solução: Um Escore "Consciente do Prompt"

O artigo propõe dois novos esscores: Vendi Condicional e RKE Condicional.

Pense nesses escores como um filtro especial que ignora o ruído "Induzido pelo Prompt" e mede apenas o sinal "Induzido pelo Modelo".

  • Como funciona: Em vez de olhar para todas as imagens juntas, a matemática observa o quão diferentes as imagens são dentro de cada categoria específica de prompt. Ela essencialmente pergunta: "Se agruparmos todas as fotos de 'cachorro' juntas, o quão diferentes elas são entre si? Se agruparmos todas as fotos de 'gato', o quão diferentes elas são?". Então, ela faz a média disso.
  • O Resultado: Este escore identifica corretamente que o chef no Cenário B (fazendo 10 cachorros diferentes) é mais criativo do que o chef no Cenário A (fazendo 1 cachorro, 1 gato, 1 cavalo), porque o chef em B está adicionando seu próprio toque ao pedido específico.

O "Obstáculo" e o Atalho

Calcular este novo escore é matematicamente pesado. Os autores descobriram que, para conjuntos de dados muito grandes (como 25.000 imagens), o cálculo fica preso na "maldição da dimensionalidade" — é como tentar contar cada grão de areia em uma praia para medir o tamanho da praia. Leva muito tempo e exige muitos dados para ser preciso.

A Correção: Eles introduziram uma versão "Truncada".

  • Analogia: Em vez de contar cada grão de areia individualmente, você conta apenas os 10.000 maiores grãos. Você percebe que esses grãos principais representam 99% do "peso" e da variedade da praia.
  • Benefício: Este "Vendi Condicional Truncado" é rápido, preciso o suficiente para uso no mundo real e não fica travado em conjuntos de dados massivos.

Colocando à Prova

Os autores testaram seus novos escores em modelos de IA reais:

  1. Texto-para-Imagem (como DALL-E 3 ou Stable Diffusion): Eles mostraram que, quando os prompts eram vagos (ex: "um animal"), a IA produzia uma enorme variedade de animais, e o escore subia. Quando os prompts eram específicos (ex: "um golden retriever"), o escore permanecia mais baixo porque a IA era restringida pelo pedido específico. Isso provou que o escore realmente mede a liberdade interna da IA, não apenas a variedade do prompt.
  2. Texto-para-Vídeo e LLMs: Eles testaram em geradores de vídeo e modelos de linguagem (como Llama). Descobriram que, conforme aumentavam a "temperatura" (aleatoriedade) do modelo de linguagem, o escore subia, indicando corretamente que as histórias se tornavam mais diversas.
  3. Guiando a IA: Eles não usaram o escore apenas para julgar a IA; eles o usaram para direcionar a IA. Ao dizer à IA: "Tente maximizar este escore enquanto você gera", eles conseguiram forçar a IA a produzir imagens mais diversas sem perder a conexão com o prompt de texto.

Resumo

Em suma, este artigo nos dá uma nova régua. Antes, podíamos apenas medir o quão bem uma IA seguia instruções ou o quão aleatória ela era quando deixada sozinha. Agora, temos uma régua que mede o quão criativa a IA é enquanto segue instruções. Ela separa o ruído do prompt do usuário do verdadeiro sinal da imaginação da máquina.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →