← Últimos artículos
💻 computer science

Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications

Este informe técnico demuestra que el ajuste fino de los modelos de código abierto Canary Flash de NVIDIA en un conjunto de datos específico para telefonía reduce significativamente las tasas de error de caracteres para audio con ruido y terminología crítica para negocios, manteniendo al mismo tiempo las velocidades de inferencia en tiempo real para despliegues de voicebots empresariales.

Autores originales: Chanameth Boonpramuk, Winn Voravuthikunchai, Songpol Bunyang

Publicado 2026-08-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chanameth Boonpramuk, Winn Voravuthikunchai, Songpol Bunyang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una conversación ocurriendo a través de una línea telefónica. El sonido que viaja por ese cable no es igual a la voz clara y de alta fidelidad que escuchamos en una habitación silenciosa. Es más estrecho, a menudo comprimido y frecuentemente interrumpido por la estática de una calle concurrida o el zumbido de un auricular barato. Durante décadas, las computadoras han luchado por entender este tipo específico de audio. Si bien la inteligencia artificial se ha vuelto notablemente buena para transcribir el habla clara de podcasts o reuniones, a menudo tropieza cuando se enfrenta a la realidad desordenada de una llamada de servicio al cliente. Esta brecha es un obstáculo importante para las empresas que desean utilizar asistentes de voz para gestionar millones de llamadas, especialmente en regiones donde la tecnología no ha sido entrenada en los idiomas locales o en el ruido específico de las redes telefónicas locales.

Investigadores de Botnoi Group en Tailandia se propusieron resolver este problema enseñando a un poderoso modelo de computadora de código abierto a escuchar como lo hace un humano en una llamada telefónica. Se centraron en el idioma tailandés, una región donde los datos públicos para el habla telefónica son escasos. Su trabajo demuestra que, al alimentar cuidadosamente un modelo con grabaciones de llamadas del mundo real y vocabulario específico de negocios, pueden transformar un reconocedor de voz de propósito general en un especialista que funcione de manera confiable en un centro de contacto ruidoso. El resultado es un sistema que no solo entiende el idioma, sino que también ignora la estática, haciendo posible que los agentes de IA realicen tareas complejas como leer nombres y direcciones sin la intervención humana constante.

El núcleo de su trabajo consistió en tomar un modelo de inteligencia artificial preexistente y de gran tamaño llamado Canary, que ya era bueno entendiendo muchos idiomas, y darle una educación especializada. Los investigadores se dieron cuenta de que simplemente usar el modelo tal como estaba no funcionaría para sus necesidades. El modelo había sido entrenado principalmente con audio limpio y de alta calidad, dejándolo desprevenido ante las distorsiones de una conexión telefónica. Para solucionar esto, construyeron un flujo de trabajo de entrenamiento único. Reunieron dos tipos de datos: grabaciones de su propio sistema de vozbot en vivo, que capturaba el caos genuino de las llamadas telefónicas reales, y grabaciones de personas diciendo instrucciones en una aplicación de mensajería. Para hacer que las grabaciones de la aplicación sonaran como llamadas telefónicas, aplicaron filtros digitales que imitaban la compresión y el ruido de una línea telefónica. Este proceso creó una biblioteca masiva de 77 horas de audio de grado telefónico, incluyendo un subconjunto específico de 104 horas dedicado enteramente a la difícil tarea de reconocer nombres y direcciones.

Con este conjunto de datos personalizado, el equipo ajustó el modelo Canary. El ajuste fino (fine-tuning) es un proceso mediante el cual una computadora aprende de nuevos ejemplos para ajustar sus reglas internas, de forma muy parecida a cómo un estudiante estudia un libro de texto específico para prepararse para un examen particular. Probaron el modelo en su capacidad para reconocer el habla tailandesa en tres escenarios diferentes. Primero, verificaron si podía entender el idioma en general. Segundo, lo probaron con el audio telefónico ruidoso. Finalmente, lo probaron con la jerga empresarial específica de nombres y direcciones. Los resultados mostraron una mejora dramática. Antes de este entrenamiento, el modelo cometía errores en el audio telefónico aproximadamente el 23 por ciento de las veces. Después de aprender de los datos telefónicos, esa tasa de error cayó a solo un 9 por ciento. Esto fue un salto significativo, demostiendo que el modelo podía adaptarse a las condiciones acústicas específicas de una línea telefónica.

El desafío de los nombres y las direcciones es particularmente difícil para las computadoras porque estas palabras suelen ser únicas y pueden sonar muy similares entre sí. En las pruebas iniciales, el modelo tuvo dificultades con estos términos, cometiendo errores casi el 17 por ciento de las veces. Sin embargo, después de que los investigadores le dieron al modelo una segunda ronda de entrenamiento enfocada específicamente en el conjunto de datos de nombres y direcciones, la tasa de error se desplomó a menos del 4 por ciento. Este nivel de precisión es crítico para aplicaciones empresariales, donde un error en el nombre o la dirección de un cliente puede llevar a una transacción fallida o a un usuario frustrado. El estudio también comparó dos versiones del modelo: una versión más pequeña y rápida, y otra más grande y compleja. Aunque el modelo más grande era ligeramente más preciso, la versión más pequeña era casi tan buena pero funcionaba mucho más rápido, lo que la convertía en la mejor opción para sistemas en tiempo real que necesitan responder instantáneamente.

A lo largo de los experimentos, los investigadores midieron qué tan rápido podía procesar la computadora el audio. Encontraron que el modelo más pequeño podía manejar la carga de trabajo con una velocidad increíble, procesando el audio más de 600 veces más rápido que el tiempo real en hardware estándar. Esto significa que incluso un solo chip de computadora podría manejar miles de llamadas simultáneamente sin retraso. El estudio confirma que, al combinar un modelo potente y preentrenado con un conjunto de datos cuidadosamente recolectado y específico del dominio, es posible construir sistemas de voz robustos para idiomas y entornos que anteriormente habían sido desatendidos. El trabajo no pretende haber resuelto todos los problemas del reconocimiento de voz, ni sugiere que el sistema sea perfecto en todas las situaciones posibles. En cambio, ofrece un camino claro y probado para adaptar las herramientas de IA general a el mundo específico, ruidoso y de alto riesgo de la telefonía empresarial, demostiendo que, con los datos adecuados, las máquinas pueden aprender a escuchar tan bien como los humanos lo hacen por teléfono.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →