← Últimos artículos
📄 public and global health

Benchmarking Speech Recognition Models for Medical Consultations in Latin American Spanish: A Comparative Evaluation with Fine-Tuning

Este estudio evalúa diez modelos de habla a texto en consultas médicas en español latinoamericano, encontrando que, si bien el ajuste fino de Whisper Large v3 no superó a su versión original, este superó a otros modelos de código abierto y de código cerrado en métricas clave, estableciéndolo como la solución de código abierto óptima para escribas médicos de IA en este contexto.

Autores originales: Carrillo, R. M., Carbajal Serrano, A., Condori Pinedo, P. S.

Publicado 2026-07-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Carrillo, R. M., Carbajal Serrano, A., Condori Pinedo, P. S.

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Imagina un mundo donde tu médico no tenga que escribir ni una sola palabra mientras hablas. En su lugar, una computadora inteligente escucha toda tu visita, escribe exactamente lo que dijiste y lo convierte en una nota médica impecable. Este es el sueño del "escriba médico de IA". Pero para que esto funcione, la computadora necesita ser increíblemente buena en una tarea específica: escuchar el habla humana y convertirla en texto. Este trabajo se llama Speech-to-Text (STT, de texto a voz). Tal vez lo conozcas por el asistente de voz de tu teléfono, pero esos asistentes suelen estar entrenados con un inglés claro y estándar. El mundo real, sin embargo, es desordenado. La gente habla con diferentes acentos, usa jerga, se interrumpe unos a otros y utiliza palabras médicas complicadas. En América Latina, donde el español se habla con una enorme variedad de sabores regionales y dialectos, lograr que una computadora entienda a un médico y a un paciente es como intentar enseñarle a un loro a recitar un poema en un idioma que nunca ha escuchado, mientras el loro está sentado en un mercado ruidoso y concurrido. Si la computadora se equivoca en las palabras, la nota médica será errónea, y eso podría ser peligroante. Por lo tanto, los científicos necesitan determinar qué computadoras son realmente buenas en esta tarea tan difícil antes de dejarlas entrar en las clínicas reales.

Este artículo es como una prueba de sabor masiva y de alto riesgo para diez diferentes "cerebros de escucha" (modelos de IA) para ver cuál es el mejor entendiendo conversaciones médicas en español latinoamericano. Los investigadores recopilaron diez videos de la vida real de médicos hablando con pacientes de diferentes países de la región. Contrataron a un humano para que escribiera exactamente lo que se decía en cada video, creando una clave de respuestas "estándar de oro". Luego, introdujeron el audio de estos diez videos en diez modelos de IA diferentes: cinco que son gratuitos y de código abierto para que cualquiera los use, y cinco herramientas de pago y de código cerrado de grandes empresas tecnológicas. Calificaron cada IA basándose en qué tan cercana era su transcripción a la versión perfecta del humano, observando todo, desde errores de palabras simples hasta si se preservaba el significado.

Pero los investigadores no se detuvieron solo en la prueba; querían ver si podían hacer que uno de los mejores modelos de código abierto fuera aún mejor "enseñándole" específicamente con datos médicos. Tomaron al principal contendiente de código abierto, llamado Whisper Large v3, y le dieron un curso intensivo utilizando nueve de los diez videos. Trocearon el audio en pequeños fragmentos de 10 segundos y dejaron que el modelo practicara una y otra vez, probando diferentes métodos de enseñanza para ver si podía aprender la jerga específica y los términos médicos de los médicos latinoamericanos. Incluso probaron la "aumentación de datos", que es como un profesor que añade ruido de fondo, cambia el tono de la voz o reproduce dos conversaciones a la vez para hacer que el estudiante trabaje más duro y aprenda a ignorar las distracciones.

Aquí es donde la historia se pone interesante. Los investigadores descubrieron que los modelos de pago y de código cerrado eran, por lo general, los oyentes más fuertes, con un modelo llamado Gemini-2.5-pro resultando el mejor en general. Sin embargo, entre los modelos gratuitos de código abierto, Whisper Large v3 fue el claro ganador. Cuando intentaron realizar un ajuste fino (fine-tuning) de este modelo para hacerlo aún mejor, se toparon con un obstáculo sorprendente. Pensaban que añadir todo ese "ruido" y práctica (aumentación de datos) haría al modelo más inteligente, como un estudiante que aprende a estudiar en una biblioteca caótica. En cambio, hizo que el modelo empeorara; el ruido adicional confundió al modelo, y en realidad funcionó mejor cuando simplemente lo dejaron estudiar las grabaciones limpias y claras sin el caos añadido.

En el enfrentamiento final, probaron su modelo "entrenado" en el único video que nunca había visto (el décimo video). Incluso con su entrenamiento especial, el modelo ajustado no venció a los principales modelos de pago. De hecho, en ese único video no visto, ocupó el cuarto lugar de seis cuando se comparó con las grandes herramientas comerciales. Sin embargo, mostró cierta promesa en áreas específicas como la comprensión del significado general de las oraciones, obteniendo una puntuación más alta que otros modelos en "similitud semántica". El artículo sugiere que, si bien el ajuste fino de Whisper Large v3 es una estrategia sólida para crear un escriba médico gratuito para América Latina, no es una solución mágica que venza instantáneamente a los gigantes corporativos y costosos. Los investigadores concluyen que, aunque el modelo de código abierto ajustado es una base sólida, todavía necesitamos muchos más datos y un mejor entrenamiento para dominar verdaderamente el diverso y complejo mundo del habla médica latinoamericana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →