← Últimos artigos
⚡ electrical engineering

Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs

Este artigo apresenta o PreferenceASR, um novo conjunto de testes e um framework de avaliação projetados para avaliar a capacidade dos sistemas de ASR de aderir às preferências de saída especificadas pelo usuário em relação à normalização, entidades, disfluências e capitalização, abordando as limitações dos benchmarks tradicionais que ignoram tais variações estilísticas.

Autores originais: Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

Publicado 2026-06-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um tipo novo e muito inteligente de robô que consegue ouvir as pessoas falarem e escrever o que elas dizem. Isso é chamado de um sistema ASR (Reconhecimento Automático de Fala). No passado, esses robôs eram como datilógrafos rígidos: eles apenas escreviam as palavras e, se cometiam um erro, recebiam uma nota baixa.

Mas agora, temos os "Speech LLMs" (Modelos de Linguagem de Grande Escala para Fala). Estes são como assistentes superinteligentes que não apenas ouvem; eles conseguem seguir instruções. Você pode dizer a eles: "Escreva isto como um relatório formal" ou "Escreva exatamente como falado, incluindo todos os 'humms' e 'ahhs'".

O problema? Não tínhamos uma boa maneira de testar se eles estavam realmente ouvindo essas instruções.

O Problema: A "Régua de Tamanho Único"

Os autores deste artigo apontam que os testes antigos para esses robôs estão quebrados. É como tentar medir um pedaço de tecido com uma régua que fica mudando suas próprias marcações.

  • Regras Inconsistentes: Alguns conjuntos de dados de teste dizem que números devem ser escritos como palavras ("vinte e dois"), enquanto outros dizem para usar dígitos ("22"). Alguns querem que você mantenha palavras de preenchimento ("hum, ah"), enquanto outros querem que sejam removidas.
  • O "Efeito Borracha": Quando avaliamos esses robôs, geralmente usamos um "normalizador" padrão que age como uma borracha gigante. Ele apaga todas as diferenças de formatação (transformando "22" em "vinte e dois", removendo letras maiúsculas, deletando "hum").
  • O Resultado: Se um robô seguir corretamente sua instrução para escrever "22", o teste antigo apaga esse sucesso e o marca como errado porque esperava "vinte e dois". Estávamos avaliando o quão bem o robô ignorava suas instruções, não o quão bem ele as seguia.

A Solução: "Preference-ASR"

A equipe criou um novo teste chamado Preference-ASR. Pense nisso como um exame customizado para robôs de fala.

Em vez de uma chave de respostas fixa, este teste dá ao robô uma "instrução de preferência" específica para cada clipe de áudio.

  • A Instrução: "Escreva números como dígitos."
  • O Áudio: Alguém dizendo "vinte e dois".
  • O Objetivo: O robô deve escrever "22".

Eles construíram este teste usando 3.210 clipes de áudio de sete fontes diferentes (como gravações de reuniões, chamadas de resultados e podcasts). Eles usaram um processo de duas etapas:

  1. Classificação por LLM: Uma IA inteligente ajudou a classificar os clipes em categorias: Normalização (números/símbolos), Entidades (nomes de pessoas/empresas), Disfluências (palavras de preenchimento) e Caso (letras maiúsculas/pontuação).
  2. Verificação Humana: Pessoas reais verificaram as respostas para garantir que a IA não cometesse erros.

A Nova Ferramenta de Avaliação: A "Régua Inteligente"

Para avaliar esses robôs de forma justa, eles inventaram um Normalizador Consciente de Preferências.

  • Régua Antiga: "Não me importa o que lhe foi dito; vou transformar tudo em palavras minúsculas."
  • Nova Régra Inteligente: "Se a instrução disse 'use dígitos', eu avaliarei o robô com base em dígitos. Se disse 'mantenha os 'ums'', eu avaliarei o robô sobre manter os 'ums'."

Isso garante que, se um robô seguir seu pedido específico, ele receba uma boa nota.

O Que Eles Descobriram

Eles testaram quatro modelos de fala diferentes (alguns mais antigos, outros novos "SpeechLLMs") usando este novo sistema. Os resultados foram surpreendentes:

  1. As Classificações Mudam: Um robô que parecia "melhor" nos testes antigos às vezes parecia o "pior" nos novos testes, e vice-versa. Os testes antigos estavam escondendo as diferenças reais.
  2. A Armadilha da "Alucinação": Um modelo muito inteligente (Qwen3-Omni) foi ótimo em seguir instruções de formatação (como capitalização ou estilos de números). No entanto, quando solicitado a incluir nomes específicos de empresas, ele às vezes inventava esses nomes (alucinava) apenas porque eles estavam no prompt, mesmo que não estivessem no áudio. Os testes antigos teriam perdido isso porque apagariam a formatação de qualquer maneira.
  3. O Treinamento Importa: Um modelo (Canary-Qwen) tinha um cérebro poderoso (um LLM), mas não havia sido treinado para ouvir instruções de formatação. Ele ignorou completamente as instruções e apenas fez sua transcrição padrão. Isso provou que apenas ter um cérebro inteligente não é suficiente; você precisa ensinar especificamente o modelo a ouvir as preferências do usuário.

A Conclusão

Este artigo introduz uma nova maneira de testar robôs de fala. Ele mostra que o "melhor" robô depende inteiramente do que o usuário deseja. Se você precisa de um resumo limpo, um robô pode ser o melhor. Se você precisa de uma transcrição literal com todos os gaguejos, um robô diferente pode vencer.

Os autores lançaram este novo conjunto de testes e a ferramenta "régua inteligente" para o público para que todos possam construir melhores robôs de fala que realmente ouçam o que você quer, em vez de apenas adivinhar o que os criadores dos testes querem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →