Multimodal examination answer data with expert-designed Outcome-Based Education rubrics for criterion-level assessment
本論文は、自動評価、マルチモーダルな文書理解、およびプライバシーに配慮したアセスメントの研究を支援するために、4つの教育機関の415人の学生による485件のスキャンされた試験解答を、専門家が設計した成果重視型教育(OBE)のルーブリックおよび包括的なメタデータと組み合わせた、マルチモーダルなデータセットを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
教育の世界において、テストの最終成績は、しばしば単なる一つの数字、つまり数週間にわたる学習を要約しただけのスコアに過ぎません。しかし、その数字の背後には、教師が学生の手書き文字を読み取り、スケッチを解釈し、計算を確認し、特定の考え方がどの程度理解されているかを判断するという、複雑なプロセスが存在します。このプロセスは「アウトカムベースの評価(成果に基づく評価)」として知られています。これは、単に正解を得ることだけではなく、その過程における特定のスキルや知識のステップを実証することに焦点を当てた手法です。何十年もの間、コンピュータはこの採りの「人間的な側面」を理解することに苦戦してきました。コンピュータはタイピングされたテキストを読むことには長けていますが、打ち消し線、書き殴られた図、余白に書かれた方程式など、手書きの試験用紙が持つ乱雑な現実を前にすると、しばしば躓いてしまいます。コンピュータに人間のように採点させるためには、研究者には、実際の事例を大量に集めたライブラリと、スコアを決定するために教師が用いた詳細なメモが必要です。これらがなければ、人工知能は、学生が実際にどのように知識を示すかという機微に対して盲目のままなのです。
バングラデシュ陸軍科学技術大学の研究チームは、まさにそのような種類のライブラリを構築しました。彼らは、4つの異なる機関の415人の学生から集められた、485枚のスキャンされた試験用紙からなる新しいコレクションを作成しました。これらは単純なテキストファイルではありません。元の手書き文字、印刷された図、表、コードを含む、実際の試験答案のデジタル写真です。このコレクションをユニークなものにしているのは、すべてのスキャンされたページが、人間による専門的な採点方法を正確に説明する詳細なデジタル記録に紐付けられている点です。この記録には、元の問題、模範解答、そして「ルーブリック」と呼ばれる特定のルールが含まれています。ルーブリックは、問題を「概念の理解」や「提示の明快さ」といった小さな要素に分解し、学生のパフォーマンスに基づいて各要素にスコアを割り当てるものです。これにより、データは単に学生が15点満点中11点を取ったということだけでなく、回答のどの部分がそれらの点数を獲得し、どの部分が欠けているのかを正確に示すことができます。
研究者たちは、機械学習やアルゴリズムといったコンピュータサイエンスのトピックから、漁業や電子商取引のようなより専門的な分野に至るまで、9つの異なる科目を教える8人の教員からこれらの資料を集めました。このコレクションは12種類の異なる質問タイプをカバーしており、それらは合わせて47の具体的な評価基準を含んでいます。コンピュータが現実世界の状況に対処できるよう訓練するために、チームは単に完璧で均一な方法で書類をスキャンしたわけではありません。彼らは、モバイルアプリと伝統的なフラットベッドスキャナーの両方を組み合わせて使用しました。これは、コレクション内の画像が、教室での実際の書類のように、明るさ、コントラスト、角度に変化を持っていることを意味します。ページが少し傾いていたり、影があったり、圧縮のされ方が異なっていたりすることもあります。学生の記述も多岐にわたります。整然としたものもあれば、修正のために書き消された箇所や、特定の詳細を指し示す矢印が含まれるものもあります。この多様性は意図的なものであり、乱雑であったり不完全であったりする文書であっても、コンピュータが読み取り理解できるシステムを構築するための助けとなるよう設計されています。
この作業の核心は、データ自体の構造にあります。各スキャンされたPDFファイルには、地図としての役割を果たす対応するデジタルファイルが存在します。この地図は、画像を、問いかけられた質問、正解、そして教師が採点に使用した特定の基準のリストへと結びつけます。各基準について、この地図は学生が得た点数を記録し、その特定の質問に対する「完璧な」「良い」「平均的な」「不十分な」パフォーマンスがどのようなものであるかを記述しています。このレベルの詳細さは極めて重要です。なぜなら、それは単なる合計スコアを超えたものだからです。これにより、研究者はコンピュータに対し、単に最終的な数字を推測するのではなく、手書きの回答のどの部分が正しく、どの部分が正しくないのかを正確に識別するように訓練することが可能になります。チームは、このデータのクリーニングと整理に多大な時間を費やしました。彼らはすべてのスコアをチェックして計算が合っているかを確認し、科目の名称を標準化し、プライバシー保護のためにすべての学生の名前とIDをランダムなコードに置き換えました。また、すべてのファイル名が正しい画像と一致していることを確認し、安全で信頼できるデータセットを作成しました。
このコレクションは他の研究者が使用できるようになっていますが、学生を保護するための厳格な規則が付随しています。画像には依然として元の手書き文字や、時には名前やロゴが見える場合があるため、このデータは一般には公開されていません。このデータは、コンピュータがいかに文書や評価を理解できるかを向上させることを目的とした、承認された研究プロジェクトのために予約されています。研究者たちは、このデータは学習のためのツールであり、実際の学生を採点するためのシステムではないことを強調しています。コレクション内のスコアは、彼ら自身のクラスのために人間の教師によって割り当てられたものであり、このデータセットは現在の学生の実際の成績を決定するためではなく、将来のより良いツールを構築するために役立てられることを意図しています。大規模で多様であり、かつ注意深くラベル付けされた実際の試験用紙を提供することで、この研究は、人間の判断と機械の理解との間の溝を埋めるための、次世代の教育テクノロジーに向けた強固な基盤を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。