← Últimos artículos
💻 computer science

Bridging communication between hearing and visually impaired individuals via speech recognition and synthesis

Este artículo presenta una Herramienta de Reconocimiento y Síntesis de Voz (SRST, por sus siglas en inglés) rentable y basada únicamente en software, desarrollada en MATLAB, que facilita la comunicación bidireccional entre personas con discapacidad auditiva y visual mediante la conversión de voz a texto de alto contraste y de texto a voz sintetizada, logrando aproximadamente un 90% de eficiencia operativa sin requerir hardware especializado.

Autores originales: Dawit Teklu Weldeslasie, Mehamed Ahmed Abdurrahman, Yonas Desta Sheshegu

Publicado 2026-08-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Dawit Teklu Weldeslasie, Mehamed Ahmed Abdurrahman, Yonas Desta Sheshegu

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo de la comunicación como una fiesta gigante y bulliciosa donde todos intentan hablar entre sí. Para la mayoría de las personas, esto es fácil: hablas, tu amigo te oye, ellos hablan de vuelta y tú ves cómo se mueven sus labios. Pero para algunos invitados, la fiesta está un poco rota. Si no puedes oír la música (discapacidad auditiva), la conversación se siente como ver una película muda donde te pierdes los chistes. Si no puedes ver la pantalla (discapacidad visual), puede que oigas la música pero no tengas idea de qué trata la película porque no puedes leer los subtítulos.

Este artículo vive en el rincón de la ciencia llamado "Tecnología de Asistencia", que es básicamente el campo de la construcción de herramientas para ayudar a las personas con discapacidades a unirse a la fiesta. Para entender lo que hicieron estos investigadores, necesitas saber sobre dos trucos principales que las computadoras usan para hablar con los humanos. El primero es el Reconocimiento de Voz, que es como un traductor superrápido que escucha tu voz y la convierte en palabras escritas en una pantalla. El segundo es la Síntesis de Voz, que es lo opuesto: toma palabras escritas y usa una voz de computadora para leerlas en voz alta. Usualmente, estas herramientas están diseñadas para personas que pueden oír pero no ver, o viceversa. Pero, ¿qué pasa cuando una persona que no puede oír intenta hablar con una persona que no puede ver? Se quedan atrapados en un bucle donde uno no puede oír la respuesta y el otro no puede leer la pregunta. Este artículo intenta arreglar ese bucle roto específicamente.

Los investigadores, un equipo de la Universidad de Aksum en Etiopía, construyeron un puente digital llamado Herramienta de Reconocimiento y Síntesis de Voz (SRST, por sus siglas en inglés). Piensa en esto como un walkie-talkie de dos vías que no solo transmite sonido, sino que traduce instantáneamente el sonido en texto y el texto de vuelta en sonido. Su objetivo era crear un sistema donde una persona con discapacidad auditiva pudiera hablar en un micrófono, hacer que sus palabras aparecieran instantáneamente como texto grande y claro en una pantalla para que una persona ciega las pueda "oír" a través de una voz de computadora, y luego que esa persona ciega hablara de vuelta, convirtiendo su voz en texto para que la persona con discapacidad auditiva lo leyera.

Lo genial de este proyecto es que no construyeron ningún robot sofisticado ni hardware costoso. En su lugar, escribieron un programa de software ingenioso que se ejecuta en una computadora estándar usando un micrófono y un altavoz regulares. Es como convertir una laptop normal en un dispositivo de comunicación mágico. El sistema funciona en dos direcciones principales. Por un lado, escucha la voz de una persona ciega. Trocea el sonido en piezas diminutas, analiza los patrones únicos del habla (como una huella digital para el sonido) y los hace coincidir con una lista de palabras que se le han enseñado. Una vez que descubre qué se dijo, imprime las palabras en la pantalla en texto de alto contraste para que la persona con discapacidad auditiva pueda leerlas. En el otro lado, la persona con discapacidad auditiva escribe un mensaje. La computadora entonces toma esas letras y une pequeños fragmentos pregrabados de voz humana (llamados "dífonos") para crear una nueva voz que lee el mensaje en voz alta para la persona ciega.

El equipo probó su creación haciendo que la gente hablara al sistema en un laboratorio universitario ruidoso. Encontraron que el sistema funciona bastante bien, acertando el mensaje aproximadamente el 90% de las veces. Fue ligeramente mejor reconociendo palabras aisladas (alrededor del 91.2%) que entendiendo oraciones en una habitación silenciosa (89.5%), y bajó un poco más cuando había ruido de fondo (84.1%). Los autores sugieren que los pocos errores ocurrieron porque algunas palabras suenan muy similares al oído de la computadora, como gemelos en una multitud.

También descubrieron que el sistema es flexible. Debido a que no programaron reglas gramaticales complejas, el sistema pudo manejar una mezcla de idiomas, reconociendo con éxito palabras del inglés, tigriña y amhárico en la misma conversación. Sin embargo, admiten que el sistema aún no es perfecto. A veces se confunde con ruidos repentinos fuertes (como el arrastre de una silla) que no son habla, y puede ser un poco lento si la computadora tiene que revisar demasiadas palabras a la vez.

Los investigadores concluyen que, si bien este es un prototipo funcional y no un producto comercial terminado, demuestra que una solución de bajo costo, basada solo en software, puede cerrar con éxito la brecha entre estas dos comunidades. Sugieren que, en el futuro, añadir una capa de traducción permitiría que las personas hablen diferentes idiomas y aun así se entiendan, y usar mejores micrófonos podría ayudar al sistema a ignorar el ruido de fondo. Por ahora, sin embargo, han construido una base sólida —un apretón de manos digital— que muestra cómo la tecnología puede ayudar a dos personas que experimentan el mundo de manera diferente a tener finalmente una conversación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →