← Derniers articles
💻 computer science

Bridging communication between hearing and visually impaired individuals via speech recognition and synthesis

Cet article présente un outil de reconnaissance et de synthèse vocale (SRST) rentable, exclusivement logiciel, développé sous MATLAB, qui facilite la communication bidirectionnelle entre les personnes malentendantes et malvoyantes en convertissant la parole en texte à haut contraste et le texte en parole synthétisée, atteignant une efficacité opérationnelle d'environ 90 % sans nécessiter de matériel spécialisé.

Auteurs originaux : Dawit Teklu Weldeslasie, Mehamed Ahmed Abdurrahman, Yonas Desta Sheshegu

Publié 2026-08-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dawit Teklu Weldeslasie, Mehamed Ahmed Abdurrahman, Yonas Desta Sheshegu

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez le monde de la communication comme une immense fête animée où tout le monde essaie de se parler. Pour la plupart des gens, c'est facile : vous parlez, votre ami entend, il parle en retour, et vous voyez ses lèvres bouger. Mais pour certains invités, la fête est un peu cassée. Si vous ne pouvez pas entendre la musique (malentendant), la conversation ressemble à un film muet où l'on manque les blagues. Si vous ne pouvez pas voir l'écran (malvoyant), vous entendez peut-être la musique mais vous n'avez aucune idée de ce que raconte le film parce que vous ne pouvez pas lire les sous-titres.

Ce document vit dans un recoin de la science appelé « Technologie d'assistance », qui est essentiellement le domaine de la construction d'outils pour aider les personnes handicapées à rejoindre la fête. Pour comprendre ce que ces chercheurs ont fait, vous devez connaître deux astuces principales que les ordinateurs utilisent pour parler aux humains. La première est la Reconnaissance Vocale, qui est comme un traductteur super rapide qui écoute votre voix et la transforme en mots écrits sur un écran. La seconde est la Synthèse Vocale, qui est l'inverse : elle prend des mots écrits et utilise une voix informatique pour les lire à haute voix. Habituellement, ces outils sont conçus pour les personnes qui entendent mais ne voient pas, ou vice versa. Mais que se passe-t-il lorsqu'une personne qui ne peut pas entendre essaie de parler à une personne qui ne peut pas voir ? Elles sont coincées dans une boucle où l'une ne peut pas entendre la réponse, et l'autre ne peut pas lire la question. Ce document tente de réparer cette boucle brisée spécifique.

Les chercheurs, une équipe de l'Université d'Aksum en Éthiopie, ont construit un pont numérique appelé l'Outil de Reconnaissance et de Synthèse Vocale (SRST). Voyez cela comme un talkie-talkie bidirectionnel qui ne transmet pas seulement du son ; il traduit instantanément le son en texte et le texte en son. Leur objectif était de créer un système où une personne malentendante pourrait parler dans un microphone, faire apparaître instantanément ses mots sous forme de texte large et clair sur un écran pour qu'une personne aveugle puisse les « entendre » via une voix informatique, et ensuite faire en sorte que cette personne aveugle parle, sa voix se transformant en texte pour que la personne malentendante puisse le lire.

Le côté cool de ce projet est qu'ils n'ont pas construit de nouveaux robots sophistiqués ou de matériel coûteux. Au lieu de cela, ils ont écrit un programme logiciel ingénieux qui s'exécute sur un ordinateur standard utilisant un microphone et un haut-parleur ordinaires. C'est comme transformer un ordinateur portable normal en un dispositif de communication magique. Le système fonctionne dans deux directions principales. D'un côté, il écoute la voix d'une personne aveugle. Il découpe le son en minuscules morceaux, analyse les motifs uniques de la parole (comme une empreinte digitale pour le son) et fait correspondre ces motifs à une liste de mots auxquels il a été enseigné. Une fois qu'il a compris ce qui a été dit, il imprime les mots sur l'écran en texte à haut contraste pour que la personne malentendante puisse les lire. De l'autre côté, la personne malentendante tape un message. L'ordinateur prend ensuite ces lettres et assemble de minuscules fragments de parole humaine préenregistrés (appelés « diphones ») pour créer une nouvelle voix qui lit le message à haute voix pour la personne aveugle.

L'équipe a testé sa création en faisant parler des gens dans un laboratoire universitaire bruyant. Ils ont constaté que le système fonctionne plutôt bien, trouvant le message correct environ 90 % du temps. Il était légèrement plus performant pour reconnaître des mots isolés (environ 91,2 %) que pour comprendre des phrases dans une pièce calme (89,5 %), et il chutait un peu plus en présence de bruit de fond (84,1 %). Les auteurs suggèrent que les quelques erreurs sont survenues parce que certains mots se ressemblent beaucoup pour l'oreille de l'ordinateur, comme des jumeaux dans une foule.

Ils ont également découvert que le système est flexible. Comme ils n'ont pas codé de règles grammaticales complexes, le système peut gérer un mélange de langues, reconnaissant avec succès des mots d'anglais, de tigrinya et d'amharique dans une même conversation. Cependant, ils admettent que le système n'est pas encore parfait. Il est parfois confus par des bruits soudains et forts (comme une chaise qui racle le sol) qui ne sont pas de la parole, et il peut être un peu lent si l'ordinateur doit vérifier trop de mots à la fois.

Les chercheurs concluent que, bien qu'il s'agisse d'un prototype fonctionnel et non d'un produit commercial fini, cela prouve qu'une solution logicielle à bas coût peut combler avec succès le fossé entre ces deux communautés. Ils suggèrent qu'à l'avenir, l'ajout d'une couche de traduction permettrait aux gens de parler différentes langues et de se comprendre tout de même, et que l'utilisation de meilleurs microphones pourrait aider le système à ignorer le bruit de fond. Pour l'instant, cependant, ils ont construit une base solide — une poignée de main numérique — qui montre comment la technologie peut aider deux personnes qui vivent le monde différemment à enfin avoir une conversation.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →