Multimodal examination answer data with expert-designed Outcome-Based Education rubrics for criterion-level assessment
Cet article présente un ensemble de données multimodal comprenant 485 copies d'examen numérisées provenant de 415 étudiants répartis dans quatre établissements, appariées avec des rubriques d'éducation fondée sur les résultats conçues par des experts et des métadonnées complètes afin de soutenir la recherche en évaluation automatisée, en compréhension de documents multimodaux et en évaluation respectueuse de la vie privée.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'éducation, la note finale d'un examen n'est souvent qu'un nombre, un score unique qui résume des semaines d'apprentissage. Mais derrière ce nombre se cache un processus complexe où un enseignant déchiffre l'écriture manuscrite d'un élève, interprète un croquis, vérifie un calcul et décide du degré de compréhension d'une idée spécifique. Ce processus est connu sous le nom d'évaluation basée sur les acquis, une méthode où l'accent n'est pas seulement mis sur l'obtention de la bonne réponse, mais sur la démonstration de compétences et d'étapes de connaissances spécifiques tout au long du chemin. Depuis des décennies, les ordinateurs peinent à comprendre ce côté humain de la notation. Ils sont excellents pour lire du texte dactylographié, mais ils trébuchent souvent face à la réalité désordonnée d'une page d'examen manuscrite remplie de mots raturés, de diagrammes griffonnés et d'équations écrites dans les marges. Pour apprendre à un ordinateur à noter comme un humain, les chercheurs ont besoin d'une immense bibliothèque d'exemples réels, couplée aux notes détaillées que les enseignants utilisent pour décider de la note. Sans cela, l'intelligence artificielle reste aveugle aux nuances de la manière dont les étudiants démontrent réellement ce qu'ils savent.
Une équipe de chercheurs de l'Université des sciences et technologies de l'armée du Bangladesh a construit exactement ce type de bibliothèque. Ils ont créé une nouvelle collection de 485 copies d'examen numérisées, recueillies auprès de 415 étudiants issus de quatre institutions différentes. Il ne s'agit pas de simples fichiers texte ; ce sont des photographies numériques de véritables copies d'examen, comprenant l'écriture manuscrite originale, des diagrammes imprimés, des tableaux et du code. Ce qui rend cette collection unique, c'est que chaque page numérisée est liée à un enregistrement numérique détaillé qui explique précisément comment un expert humain l'a notée. Cet enregistrement comprend la question d'origine, une réponse modèle et un ensemble de règles spécifiques appelé grille d'évaluation (rubric). Une grille décompose une question en plusieurs parties, telles que « compréhension du concept » ou « clarté de la présentation », et attribue un score à chaque partie selon la performance de l'élève. Cela permet aux données de montrer non seulement qu'un étudiant a obtenu 11 sur 15 points, mais aussi exactement quelles parties de sa réponse ont permis d'obtenir ces points et quelles parties manquaient.
Les chercheurs ont rassemblé ces éléments auprès de huit membres du corps professoral enseignant neuf disciplines distinctes, allant de sujets d'informatique comme l'apprentissage automatique et les algorithmes à des domaines plus spécialisés comme la pisciculture et l'e-commerce. La collection couvre 12 types différents de questions, qui contiennent ensemble 47 critères d'évaluation spécifiques. Pour garantir que les données soient utiles pour entraîner les ordinateurs à gérer des conditions réelles, l'équipe n'a pas seulement numérisé les copies de manière parfaite et uniforme. Ils ont utilisé un mélange d'applications de téléphones mobiles et de scanners à plat traditionnels. Cela signifie que les images de la collection varient en luminosité, en contraste et en angle, tout comme les documents réels dans une salle de classe. Certaines pages sont légèrement inclinées, certaines présentent des ombres, et d'autres sont compressées différemment. Le travail des étudiants varie également considérablement ; certains travaux sont soignés, tandis que d'autres contiennent des erreurs raturées, des corrections insérées et des flèches pointant vers des détails spécifiques. Cette variété est intentionnelle, conçue pour aider les chercheurs à construire des systèmes capables de lire et de comprendre des documents même lorsqu'ils sont désordonnés ou imparfaits.
Le cœur de ce travail réside dans la structure même des données. Pour chaque fichier PDF numérisé, il existe un fichier numérique correspondant qui fait office de carte. Cette carte lie l'image à la question posée, à la réponse correcte et à une liste des critères spécifiques utilisés par l'enseignant pour la notation. Pour chaque critère, la carte enregistre le nombre de points obtenus par l'étudiant et décrit ce qu'une performance parfaite, bonne, moyenne ou médiocre représente pour cette partie spécifique de la question. Ce niveau de détail est crucial car il dépasse la simple note totale. Il permet aux chercheurs d'entraîner les ordinateurs à identifier précisément quelles parties d'une réponse manuscrite sont correctes et lesquelles ne le sont pas, plutôt que de simplement deviner un chiffre final. L'équipe a consacré un temps considérable au nettoyage et à l'organisation de ces données. Ils ont vérifié chaque score pour s'assurer que les calculs étaient exacts, ont normalisé les noms des matières et ont remplacé tous les noms et identifiants des étudiants par des codes aléatoires pour protéger la vie privée. Ils ont également veillé à ce que chaque nom de fichier corresponde à son image correcte, créant ainsi un ensemble de données sécurisé et fiable.
Cette collection est désormais disponible pour d'autres chercheurs, mais avec des règles strictes pour protéger les étudiants concernés. Comme les images contiennent encore l'écriture manuscrite originale et parfois des noms ou des logos visibles, les données ne sont pas ouvertes au public. Elles sont réservées à des projets de recherche approuvés dont l'objectif est d'améliorer la compréhension des documents et des évaluations par les ordinateurs. Les chercheurs soulignent que ces données sont un outil d'étude, et non un système de notation pour de vrais étudiants. Les scores de la collection ont été attribués par des enseignants humains pour leurs propres cours, et l'ensemble de données est destiné à aider à construire de meilleurs outils pour l'avenir, et non à déterminer la note réelle d'un étudiant aujourd'hui. En fournissant un ensemble large, diversifié et soigneusement étiqueté de copies d'examen réelles, ce travail offre une base solide pour la prochaine génération de technologies éducatives, aidant à combler le fossé entre le jugement humain et la compréhension de la machine.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.