← Últimos artículos
💻 computer science

LMS-FAIR-India: A FAIR Compliant Synthetic LMS Interaction Dataset from a Private University for Privacy Preserving Learning Analytics

Este artículo presenta LMS-FAIR-India, un conjunto de datos totalmente sintético y conforme con los principios FAIR de 1,7 millones de eventos de interacción de LMS de una universidad privada india que permite la investigación de analítica del aprendizaje preservando la privacidad sin utilizar datos reales de estudiantes.

Autores originales: Sanjay Agal

Publicado 2026-08-22
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Sanjay Agal

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el aula moderna, el aprendizaje rara vez ocurre de forma aislada. Se desarrolla en plataformas digitales donde los estudiantes inician sesión para ver clases, descargar materiales de lectura, entregar tareas y realizar cuestionarios. Cada clic, cada pausa y cada entrega deja un rastro digital, creando un vasto registro de cómo las personas aprenden. Los investigadores llaman a este campo la analítica del aprendizaje, y creen que al estudiar estos patrones, pueden comprender qué ayuda a los estudiantes a tener éxito y qué los pone en riesgo. Sin embargo, una barrera significativa se interpone en el camino de este progreso. Los datos que revelarían estos patrones contienen información profundamente personal sobre estudiantes reales. Las leyes diseñadas para proteger la privacidad, como las de la India y Europa, hacen que sea ilegal compartir estos datos brutos abiertamente. Esto crea una situación difícil: los científicos quieren estudiar los datos para mejorar la educación, pero no pueden tocar los datos sin violar la privacidad de los individuos que describen.

Para resolver este dilema, un investigador llamado Sanjay Agal, de la Universidad de Parul, ha creado un nuevo tipo de recurso. En lugar de compartir registros reales de estudiantes, lo que sería una violación de la confianza y la ley, el equipo generó un conjunto de datos completamente artificial que imita el comportamiento de los estudiantes reales. Esta colección, llamada LMS-FAIR-India, es una biblioteca masiva de interacciones ficticias que parecen y se sienten exactamente como las reales, pero que no contienen personas reales. Permite a los investigadores probar sus ideas y construir mejores herramientas educativas sin necesidad de ver jamás el nombre o la calificación de un estudiante real. El trabajo demuestra que es posible avanzar en la ciencia del aprendizaje honrando estrictamente el derecho a la privacidad.

El núcleo de este proyecto es un conjunto de datos sintéticos, que es esencialmente una simulación generada por computadora de un semestre universitario. Los investigadores construyeron un modelo de una universidad privada típica en la India, con diez mil estudiantes virtuales, ciento cincuenta cursos y un periodo académico de seis meses. No utilizaron ningún registro de estudiantes reales para crear este modelo. En su lugar, se basaron en reglas públicas sobre cómo operan las universidades indias, estadísticas generales sobre cómo se comportan típicamente los estudiantes en línea y consejos de profesores para asegurar que la simulación se sintiera auténtica. El resultado es una colección de datos que incluye detalles demográficos, información de cursos y más de un punto siete millones de eventos registrados, como inicios de sesión, visualizaciones de videos e intentos de cuestionarios. Cada pieza de información en este conjunto de datos fue creada por un programa informático siguiendo reglas estadísticas, lo que significa que hay cero riesgo de identificar a una persona real porque ninguna persona real estuvo involucrada en el proceso.

El conjunto de datos está estructurado para reflejar la complejidad de un entorno de aprendizaje real. No solo enumera eventos aleatorios; los conecta lógicamente. Por ejemplo, los datos muestran a qué cursos están inscritos los estudiantes, cuánto tiempo pasaron en la plataforma y qué calificaciones obtuvieron en sus tareas. Los investigadores se aseguraron de que los patrones en estos datos artificiales coincidieran con lo que se ve en la vida real. En la simulación, los estudiantes que tenían antecedentes académicos más sólidos antes de comenzar el semestre tendían a ser más activos en la plataforma, un patrón que refleja la realidad. Los datos también capturan el ritmo de la vida estudiantil, mostrando que la actividad alcanza su punto máximo a mitad del día durante los días de semana y disminuye significamente los fines de semana. Al reproducir estos comportamientos naturales, el conjunto de datos proporciona un campo de prueba realista para los investigadores que desean desarrollar herramientas para predecir qué estudiantes podrían tener dificultades o para diseñar mejores formas de involucrar a los alumnos.

Uno de los aspectos más importantes de este trabajo es cómo maneja el tema de la privacidad. En el pasado, los investigadores a veces intentaban proteger los datos reales eliminando nombres o escondiendo detalles específicos, un proceso conocido como anonimización. Sin embargo, los expertos han demostrado que incluso los datos anonimizados pueden, a veces, rastrearse hasta los individuos si se combinan con otra información. Este nuevo enfoque evita ese riesgo por completo. Debido a que los datos se generan desde cero utilizando distribuciones aleatorias y modelos estadísticos, es imposible vincular cualquier registro con un estudiante real. Los investigadores probaron esto intentando engañar a una computadora para que pensara que un estudiante ficticio era real, y la computadora falló al no encontrar ninguna conexión. Este método de "privacidad por diseño" significa que los datos pueden compartirse libremente con cualquier persona en el mundo, permitiendo la colaboración abierta sin el temor a violaciones legales o éticas.

Para que los datos sean útiles para la comunidad científica global, los investigadores siguieron un conjunto de principios conocidos como FAIR, que significa Encontrable (Findable), Accesible (Accessible), Interoperable (Interoperable) y Reutilizable (Reusable). El conjunto de datos está alojado en un archivo público en línea con una dirección digital permanente, de modo que puede encontrarse y citarse fácilmente. Está disponible de forma gratuita bajo una licencia que permite a cualquiera usarlo, modificarlo y compartirlo, siempre que se dé crédito a los creadores. Los datos están organizados en archivos claros y estandarizados que pueden abrirse con casi cualquier programa informático, y vienen con una guía detallada que explica exactamente qué significa cada columna y número. Además, los investigadores pusieron a disposición del público el código informático utilizado para crear los datos. Esta transparencia permite a otros científicos verificar los resultados, adaptar la simulación para sus propias universidades o generar nuevos conjuntos de datos adaptados a diferentes contextos educativos.

El valor de este conjunto de datos fue probado a través de una serie de pruebas diseñadas para ver si podía soportar investigaciones reales. Los investigadores utilizaron los datos artificiales para entrenar modelos computacionales para predecir el compromiso estudiantil e identificar a los estudiantes que podrían abandonar sus cursos. Los modelos funcionaron tan bien en estos datos falsos como modelos similares han funcionado en datos reales en estudios previos. Por ejemplo, cuando los investigadores intentaron predecir qué estudiantes terminarían sus cursos, el sistema identificó correctamente a los estudiantes en riesgo con un alto grado de precisión. También confirmaron que la relación entre la frecuencia con la que un estudiante inicia sesión y sus calificaciones finales se preservó en la simulación, coincidiendo con los hallazgos de estudios del mundo real. Estos resultados sugieren que los datos sintéticos son un sustituto confiable de los datos reales para desarrollar y probar nuevas tecnologías educativas.

Este trabajo aborda una brecha crítica en el campo de la analítica del aprendizaje, particularmente para el contexto de la educación superior en la India. Si bien existen algunos conjuntos de datos públicos de países occidentales, estos suelen reflejar sistemas educativos y contextos culturales diferentes. El conjunto de datos LMS-FAIR-India llena este vacío al proporcionar una simulación a gran escala y realista de una universidad privada india. Ofrece una oportunidad única para que los investigadores estudien cómo aprenden e interactúan con la tecnología los estudiantes en este entorno específico. Al proporcionar una herramienta que es tanto segura para la privacidad como científicamente robusta, el proyecto permite una nueva ola de innovación en la educación. Permite a los científicos plantear preguntas difíciles sobre el éxito estudiantil y encontrar respuestas sin comprometer la dignidad o la seguridad de las personas que estudian.

Las implicaciones de este trabajo se extienden más allá de un solo conjunto de datos. Demuestra un camino práctico a seguir para todo el campo de la investigación educativa. Al mostrar que se pueden generar y compartir abiertamente conjuntos de datos sintéticos de alta calidad y que preservan la privacidad, los investigadores han eliminado un obstáculo importante que ha frenado el progreso durante años. Otras instituciones pueden ahora utilizar los mismos métodos para crear sus propios conjuntos de datos sintéticos, adaptados a sus necesidades específicas, sin tener que navegar por complejos obstáculos legales. Este enfoque fomenta una cultura de apertura y colaboración, donde el enfoque permanece en mejorar los resultados del aprendizaje. El conjunto de datos es un testimonio de la idea de que proteger la privacidad y avanzar en la ciencia no son objetivos opuestos, sino metas complementarias que pueden lograrse juntas mediante un diseño cuidadoso y creativo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →