American Sign Language Recognition Using Mediapipe and Deep Learning: A Real-Time Approach
Este artículo presenta un sistema de reconocimiento de la Lengua de Señas Americana en tiempo real y ligero que utiliza Google MediaPipe para la detección de puntos de referencia de la mano y una red neuronal profunda para lograr una precisión del 98,49% en la clasificación de gestos estáticos del alfabeto ASL en dispositivos de consumo.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Para muchas personas, la capacidad de comunicarse es algo dado, un flujo fluido de sonido y significado. Pero para quienes son sordos o tienen dificultades auditivas, el mundo a menudo presenta un muro de silencio, especialmente al interactuar con personas que no conocen la lengua de señas. El Lenguaje de Señas Americano, o ASL, es un lenguaje rico y visual donde el significado es transportado por la forma de la mano, el movimiento de los dedos y la posición de la palma. Durante décadas, investigadores han intentado construir máquinas que puedan observar a una persona haciendo señas y traducir esos gestos en palabras, con la esperanza de cerrar esa brecha. Los intentos iniciales a menudo requerían equipo costoso y voluminoso, como guantes especiales con sensores o cámaras pesadas que pudieran ver la profundidad, lo que hacía que la tecnología fuera poco práctica para el uso cotidiano. El objetivo siempre ha sido encontrar una manera de hacer que esta traducción ocurra usando solo una cámara simple, como la que viene integrada en una computadora portátil o un teléfono, para que la tecnología pueda ser utilizada por cualquier persona, en cualquier lugar.
Un estudio reciente de Amna Atiq, de la Universidad de Ingeniería y Tecnología en Lahore, da un paso significativo hacia ese objetivo. La investigadora desarrolló un sistema que puede reconocer las letras estáticas del alfabeto del Lenguaje de Señas Americano en tiempo real, utilizando nada más que una cámara web estándar y una computadora. En lugar de depender de hardware complejo, el sistema utiliza una herramienta de software llamada MediaPipe para actuar como un ojo digital. Esta herramienta escanea la transmisión de video y encuentra veintiún puntos específicos en una mano humana, tales como la punta del pulgar, los nudillos y la muñeca. Rastrea estos puntos a medida que se mueven, creando un esqueleto digital de la mano que existe en un espacio tridimensional. Al enfocarse en la posición de estos puntos en lugar de los píxeles brutos de la imagen, el sistema puede ignorar distracciones como el desorden del fondo o los cambios en la iluminación, concentrándose únicamente en la forma de la mano.
Una vez que el software ha mapeado la mano, envía esta información a un programa de computadora pequeño y eficiente diseñado para aprender patrones. Este programa, un tipo de inteligencia artificial conocida como red neuronal profunda, fue entrenado con una colección de más de seis mil ejemplos de gestos manuales. Cada ejemplo mostraba la mano formando una letra de la A a la Z. El programa aprendió a asociar la disposición específica de los veintiún puntos de la mano con la letra correcta. Para probar qué tan bien funcionaba esto, la investigadora dividió los datos, utilizando la mayor parte para enseñar al programa y reservando una porción separada para probar su conocimiento. Los resultados fueron impactantes: el sistema identificó correctamente el gesto de la mano en casi el noventa y nueve por ciento de los casos de prueba. Fue capaz de hacer esto con la rapidez suficiente para seguir el ritmo de una transmisión de video en vivo, procesando cada fotograma en unos treinta y dos milisegundos, lo cual es lo suficientemente rápido como para parecer instantáneo para un observador humano.
El estudio también analizó de cerca dónde podría tropezar el sistema. Aunque funcionó excepcionalmente bien en la mayoría de las letras, ocasionalmente confundía letras que se ven muy similares, como la M, la N y la T. Este es un desafío natural, ya que estas señas involucran diferencias sutiles en la posición de los dedos que son difíciles de distinguir incluso para los humanos si la vista no es perfecta. A pesar de estos contratiempos menores, el sistema demostró que una alta precisión no requiere supercomputadoras masivas o sensores especializados. Todo el montaje funcionó sin problemas en una computadora portátil estándar con ocho gigabytes de memoria, demostrando que la tecnología de asistencia poderosa puede ser ligera y accesible. La investigadora señaló que el sistema funciona mejor con gestos estáticos, es decir, letras individuales mantenidas en su lugar, en lugar del movimiento fluido y continuo de oraciones completas, lo cual sigue siendo un desafío más complejo para el futuro.
Lo que hace que este trabajo sea particularmente significativo es su enfoque en la practicidad. Al eliminar la necesidad de guantes, cámaras de profundidad o tarjetas gráficas de alta gama, la investigación muestra que una herramienta capaz de traducir el lenguaje de señas podría estar pronto disponible para cualquier persona con una computadora y una conexión a internet. El sistema no solo reconoce formas; abre una puerta a la comunicación para personas que de otro modo podrían estar aisladas. La investigadora planea construir sobre este fundamento enseñando al sistema a comprender el flujo de señas dinámicas y adaptando el software para que funcione en dispositivos móviles. Por ahora, el logro representa una clara demostración de que, con la combinación adecuada de software y hardware simple, podemos comenzar a desmantelar las barras que separan a los oyentes de los sordos, convirtiendo una cámara web estándar en un puente para la conexión humana.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.