← Últimos artigos
💬 NLP

Anisotropy Decides Cosine vs. Rank Metrics for Text Embeddings

Este artigo demonstra que a métrica ideal para comparar embeddings de texto depende da anisotropia geométrica do espaço de embedding, mostrando que, enquanto a similaridade de cosseno é superior para codificadores isotrópicos, métricas baseadas em ranking e do tipo L1 superam significamente esta, uma relação previsível por uma única métrica de dominância de variância e confirmada causalmente pela projeção das direções dominantes.

Autores originais: V. S. Raghu Parupudi

Publicado 2026-06-30
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: V. S. Raghu Parupudi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Pergunta: Como Medimos a "Similaridade"?

Imagine que você tem uma biblioteca gigante de frases. Para encontrar frases semelhantes, os computadores as transformam em listas de números (vetores). Para ver se duas frases são parecidas, o computador precisa de uma régua para medir a distância entre essas listas.

Por muito tempo, todos usaram a mesma régua: a Similaridade de Cosseno (Cosine Similarity). É como verificar se duas setas estão apontando para a mesma direção, ignorando o comprimento das setas.

Mas alguns pesquisadores sussurraram: "Ei, talvez essa régua não seja perfeita para todas as situações". Eles tentaram réguas diferentes (como medir a distância real entre pontos ou contar quantos números coincidem) e, às vezes, essas novas réguas funcionavam melhor. Mas ninguém conseguia explicar o porquê ou quando mudar.

Este artigo é o trabalho de detetive que finalmente resolve o mistério.

A Descoberta: Tudo Depende do Formato da Sala

Os autores testaram 19 diferentes "codificadores de sentenças" (as máquinas que transformam texto em números) e 19 diferentes "réguas" (métricas) através de várias tarefas. Eles encontraram uma divisão clara:

  1. A Sala "Bem Espalhada": Em alguns codificadores, os pontos de dados estão espalhados uniformemente pelo espaço, como uma multidão de pessoas em um campo grande e aberto.

    • O Resultado: A régua padrão (Cosseno) funciona perfeitamente aqui. Tentar uma régua diferente não traz quase nenhum ganho.
    • A Lição: Se a sala está aberta, fique com a régua padrão.
  2. A Sala "Aperto/Lotada": Em outros codificadores, os pontos de dados estão espremidos em um canto estreito ou em uma única linha, como uma multidão de pessoas todas amontoadas em uma portinha minúscula.

    • O Resultado: A régua padrão (Cosseno) falha miseravelmente aqui. Ela acha que tudo é semelhante porque todos estão apontando na mesma direção.
    • A Solução: Mudar para uma régua diferente (especificamente métricas baseadas em Ranking ou do tipo L1) faz uma enorme diferença. Pode melhorar a precisão em cerca de 20% em média.

O "Porquê": A Dimensão Renegada

Por que a sala "Lotada" quebra a régua padrão?

Imagine uma sala onde 90% do peso está concentrado em uma única parede. Se você tentar medir a distância entre duas pessoas nessa sala, a medição será dominada pelo quão próximas elas estão dessa parede pesada, e não por onde elas estão posicionadas em relação umas às outras.

No artigo, isso é chamado de Anisotropia ou ter uma "Dimensão Renegada" (Rogue Dimension).

  • Em um codificador "Lotado", um único número na lista de números é tão grande que abafa toda a outra informação.
  • A Similaridade de Cosseno é como uma lupa que foca inteiramente nesse um único número enorme. Ela fica cega por ele.
  • As Novas Réguas (baseadas em Ranking ou L1) são como olhar para a ordem dos números ou para as diferenças entre eles. Elas ignoram o fato de um número ser enorme e focam no padrão real dos dados.

O Momento "Aha!": É a Geometria, Não o Treinamento

Você pode pensar: "Ah, então se um modelo foi treinado com um método específico, ele usa a nova régua".
Não. O artigo prova que esse não é o caso.

  • Exemplo A: Um modelo treinado especificamente para ser "bom em cosseno" (E5-Mistral) acabou resultando em uma sala "Lotada". As novas réguas ajudaram.
  • Exemplo B: Um modelo de linguagem comum, não treinado (Multilingual BERT), acabou com uma sala "Bem Espalhada". A régua padrão funcionou bem.

A Lição: Não importa como o modelo foi construído ou treinado. Só importa qual é o formato dos dados depois de serem construídos. Se os dados estão espremidos, você precisa de uma nova régua. Se os dados estão espalhados, a régua antiga serve.

Como Eles Provaram: O Experimento da "Cirurgia"

Para ter 100% de certeza de que a direção "Lotada" era a vilã, os autores realizaram uma pequena cirurgia.

  1. Eles pegaram os codificadores "Lotados".
  2. Eles matematicamente "cortaram fora" a direção dominante (a parede pesada) que estava causando o problema.
  3. O Resultado: De repente, a régua padrão (Cosseno) começou a funcionar muito bem novamente! A vantagem das novas réguas desapareceu.

Isso provou que a direção "Lotada" era a causa do problema, não apenas um efeito colateral.

A Lição Prática

  • Para a maioria das pessoas: Se você estiver usando ferramentas padrão e ajustadas (fine-tuned) para busca ou similaridade (como as que as empresas costumam implementar), seus dados provavelmente são "Bem Espalhados". Continue usando a Similaridade de Cosseno. É a melhor ferramenta para o trabalho.
  • Para os casos excepcionais: Se você estiver usando modelos de linguagem brutos, não treinados (como pegar uma IA gigante e apenas usar sua saída bruta sem ajuste fino), seus dados podem estar "Lotados".
    • A Solução: Antes de começar, verifique um número simples (a "Dominância da Dimensão Renegada").
    • Se esse número for alto, mude para uma métrica baseada em Ranking ou L1, ou remova a direção dominante, e seus resultados melhorarão significamente.

Em resumo: A melhor régua depende do formato da sala, não do nome do arquiteto. Se a sala está lotada, mude sua régua. Se a sala está aberta, fique com o clássico.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →