Benchmarking Speech Recognition Models for Medical Consultations in Latin American Spanish: A Comparative Evaluation with Fine-Tuning
Este estudo avalia dez modelos de fala para texto em consultas médicas de espanhol latino-americano, constatando que, embora o ajuste fino do Whisper Large v3 não tenha superado sua versão vanilla, ele superou outros modelos de código aberto e proprietários em métricas fundamentais, estabelecendo-o como a solução de código aberto ideal para escribas médicos de IA neste contexto.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo
Imagine um mundo onde o seu médico não precise digitar uma única palavra enquanto você fala. Em vez disso, um computador inteligente ouve toda a sua consulta, escreve exatamente o que você disse e transforma isso em uma nota médica organizada. Este é o sonho do "escrevente médico de IA". Mas para que isso funcione, o computador precisa ser incrivelmente bom em um trabalho específico: ouvir a fala humana e transformá-la em texto. Esse trabalho é chamado de Speech-to-Text (STT), ou Conversão de Fala em Texto. Você deve conhecer isso pelo assistente de voz do seu telefone, mas esses assistentes geralmente são treinados em um inglês claro e padrão. O mundo real, no entanto, é bagunçado. As pessoas falam com diferentes sotaques, usam gírias, interrompem umas às outras e usam palavras médicas complicadas. Na América Latina, onde o espanhol é falado com uma enorme variedade de sabores regionais e dialetos, fazer um computador entender um médico e um paciente é como tentar ensinar um papagaio a recitar um poema em uma língua que ele nunca ouviu antes, enquanto o papagaio está sentado em um mercado barulhento e lotado. Se o computador errar as palavras, a nota médica estará errada, e isso pode ser perigoso. Portanto, os cientistas precisam descobrir quais computadores são realmente bons nesta tarefa complicada antes de deixá-los entrar em clínicas reais.
Este artigo é como um teste de degustação massivo e de alto risco para dez diferentes "cérebros de escuta" (modelos de IA) para ver qual deles é o melhor em entender conversas médicas em espanhol latino-americano. Os pesquisadores reuniram dez vídeos da vida real de médicos conversando com pacientes de diferentes países da região. Eles contrataram um humano para escrever exatamente o que foi dito em cada vídeo, criando uma resposta de "padrão ouro". Em seguida, alimentaram o áudio desses dez vídeos em dez modelos de IA diferentes — cinco que são gratuitos e abertos para qualquer pessoa usar, e cinco que são ferramentas pagas e de código fechado de grandes empresas de tecnologia. Eles pontuaram cada IA com base no quão próxima sua transcrição estava da versão perfeita do humano, observando tudo, desde erros simples de palavras até se o significado foi preservado.
Mas os pesquisadores não pararam apenas no teste; eles queriam ver se podiam tornar um dos melhores modelos de código aberto ainda melhor ao "ensiná-lo" especificamente com dados médicos. Eles pegaram o principal concorrente de código aberto, chamado Whisper Large v3, e deram a ele um curso intensivo usando nove dos dez vídeos. Eles cortaram o áudio em pequenos pedaços de 10 segundos e deixaram o modelo praticar repetidamente, tentando diferentes métodos de ensino para ver se ele conseguia aprender as gírias específicas e os termos médicos de médicos latino-americanos. Eles até tentaram a "aumentação de dados", que é como um professor adicionando ruído de fundo, mudando o tom da voz ou tocando duas conversas ao mesmo tempo para fazer o aluno trabalhar mais duro e aprender a ignorar distrações.
É aqui que a história fica interessante. Os pesquisadores descobriram que os modelos pagos e de código fechado eram, em geral, os ouvintes mais fortes, com um modelo chamado Gemini-2.5-pro saindo vencedor no geral. No entanto, entre os modelos de código aberto gratuitos, o Whisper Large v3 foi o vencedor claro. Quando tentaram o ajuste fino (fine-tuning) deste modelo para torná-lo ainda melhor, encontraram um obstáculo surpreendente. Eles pensaram que adicionar todo aquele "ruído" e prática (aumentação de dados) tornaria o modelo mais inteligente, como um aluno que aprende a estudar em uma biblioteca caótica. Em vez disso, isso tornou o modelo pior. O ruído extra confundiu o modelo, e ele na verdade teve um desempenho melhor quando apenas o deixaram estudar as gravações limpas e claras, sem o caos adicionado.
No confronto final, eles testaram seu modelo "treinado" no único vídeo que ele nunca tinha visto antes (o décimo vídeo). Mesmo com seu treinamento especial, o modelo ajustado não venceu os principais modelos pagos. Na verdade, naquele único vídeo não visto, ele ficou em quarto lugar entre seis, quando comparado às grandes ferramentas comerciais. No entanto, ele mostrou alguma promessa em áreas específicas, como entender o significado geral das frases, pontuando mais alto que outros modelos em "similaridade semântica". O artigo sugere que, embora o ajuste fino do Whisper Large v3 seja uma estratégia sólida para criar um escriba médico gratuito para a América Latina, não é uma solução mágica que derrota instantaneamente os gigantes corporativos e caros. Os pesquisadores concluem que, embora o modelo de código aberto ajustado seja uma base sólida, ainda precisamos de muito mais dados e um melhor treinamento para realmente dominar o mundo diverso e complexo da fala médica latino-americana.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.