Open Sign Bibles (OSB): An Open-Access Multilingual Sign Language Bibles Dataset
Este artículo presenta las Open Sign Bibles (OSB), el conjunto de datos multilingüe sin trabas legales más grande de su tipo, que comprende más de 700 horas de videos de la Biblia con licencia abierta en 20 lenguas de signos alineadas con texto paralelo en más de 800 lenguas habladas para facilitar la investigación en recuperación multimodal y aprendizaje contrastivo.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El lenguaje es la herramienta principal que los seres humanos utilizan para compartir pensamientos, contar historias y transmitir la historia. Para la mayor parte del mundo, esto ocurre a través del sonido y el habla. Pero para millones de personas sordas, el lenguaje es visual, formado por el movimiento de las manos, la expresión del rostro y la posición del cuerpo. Estas son las lenguas de señas, sistemas distintos y complejos con su propia gramática y cultura. Sin embargo, en la era digital, estos lenguas han quedado rezagadas. Mientras que las computadoras pueden buscar fácilmente a través de texto escrito o comprender palabras habladas, tienen dificultades para "leer" la lengua de señas. La tecnología necesaria para encontrar una seña específica dentro de un video largo, o para conectar una seña con una oración escrita, ha sido difícil de construir porque simplemente no ha habido suficientes datos. La mayoría de las colecciones existentes de videos de lengua de señas son demasiado pequeñas, están bloqueadas tras muros de pago o restringidas por derechos de autor, dejando a los investigadores sin la materia prima necesaria para enseñar a las máquinas cómo entender el mundo visual de los signantes.
Un equipo de investigadores ha lanzado ahora un nuevo y masivo recurso diseñado para cambiar esto: el conjunto de datos Open Sign Bibles. Esta colección reúne más de 700 horas de videos de la Biblia profesionalmente traducidos en 20 lenguas de señas diferentes. A diferencia de los conjuntos de datos anteriores que estaban dispersos por internet o requerían permisos especiales para su uso, toda esta biblioteca está disponible gratuitamente para que cualquiera pueda descargarla y estudiarla. El proyecto conecta estos videos con el texto de la Biblia en más de 800 lenguas habladas, creando un puente entre lo visual y lo escrito. Al emparejar un video de un signante en Lengua de Señas Americana, por ejemplo, con la misma historia escrita en inglés, español o hindi, los investigadores han creado una poderosa herramienta para entrenar a las computadoras para entender la relación entre una seña y su significado.
El conjunto de datos se construye a partir de dos fuentes principales. La primera proviene de la Digital Bible Library, que proporcionó miles de videos que presentan signantes de diversos entornos, a menudo acompañados de gráficos o texto en la pantalla. La segunda fuente es un conjunto de grabaciones de estudio en bruto de la India, que muestran a un único signante contra un fondo liso. En total, la colección incluye más de 8,000 clips de video individuales. Para que estos datos sean útiles para las computadoras, el equipo no solo subió los videos a internet; los organizó cuidadosamente. Vinculó cada video a versículos específicos de la Biblia, permitiendo que una computadora sepa exactamente qué historia se está contando. Para una parte más pequeña de los videos, fueron aún más allá, marcando manualmente los momentos exactos en que aparecen en pantalla señas específicas, como "Dios" o "día". Este nivel de detalle convierte un simple archivo de video en una herramienta de aprendizaje estructurada.
Los investigadores utilizaron este nuevo conjunto de datos para probar qué tan bien la tecnología actual podía encontrar señas específicas dentro de estos videos largos, una tarea conocida como "detección de señas" (sign spotting). Probaron dos enfoques diferentes. El primer método dependía de medir la distancia física entre las manos y el cuerpo del signante en el video, comparándolas con ejemplos conocidos. Este enfoque no funcionó bien; la computadora se confundía con el flujo continuo de movimiento y no podía identificar de manera confiable las señas individuales. El segundo método utilizó un sistema más avanzado que aprendió a entender el significado detrás de los movimientos, de manera similar a como un humano reconoce un concepto en lugar de solo una forma. Este enfoque mostró ser prometedor. Identificó con éxito ciertas señas, como "día" o "personas", con un alto grado de precisión. Sin embargo, el sistema todavía tuvo dificultades con otras. A veces confundía señas que se parecían, como "hombre" y "dios", incluso cuando significaban cosas muy diferentes. También falló al reconocer señas que eran realizadas de manera distinta a los ejemplos que había visto, como un signante zurdo o una seña utilizada en un contexto cultural específico que difería de la definición estándar del diccionario.
Los resultados resaltan tanto el potencial como los límites actuales de esta tecnología. El sistema funcionó mejor cuando el video que analizaba se parecía mucho a los ejemplos con los que había sido entrenado. Cuando el signante se movía rápidamente, usaba una mano diferente o hacía una seña con un significado único, la computadora a menudo fallaba. Los investigadores encontraron que, si bien la tecnología puede detectar de manera confiable algunas señas comunes, aún no está lista para comprender la complejidad total de una conversación continua. El conjunto de datos en sí es, sin embargo, un paso significativo hacia adelante. Al proporcionar una colección grande, abierta y legalmente clara de videos de lenguas de señas multilingües, los investigadores han dado a la comunidad científica una base sólida sobre la cual construir. Han demostrado que, con los datos adecuados, las computadoras pueden comenzar a aprender el lenguaje visual de las personas sordas, pero también dejaron claro que se necesita mucho más trabajo para manejar los matices de la expresión humana. El camino a seguir implica reunir ejemplos más diversos y refinar las herramientas para comprender mejor las sutiles diferencias entre señas que se parecen pero significan cosas distintas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.