AI-Assisted Grading in Biochemistry: Automated Long Answer Question Scoring with Expert-Level Accuracy
本研究は、GPT-4を用いたAI搭載ツールが、学部レベルの生化学の記述式問題の採点において、専門家レベルの正確性と一貫したルーブリックに基づくフィードバックを実現できることを示しており、大規模なクラス規模や教員不足によって生じる課題を効果的に解決するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
医学教育の世界において、生化学を教えることは、単に体がエネルギーをどのように処理するかという事実を暗記すること以上のことが求められます。それは、学生が深く思考し、複雑なプロセスを自分自身の言葉で説明できる能力を必要とします。この理解度を測定するために、講師はしばしば記述式問題を用います。そこでは、学生は生物学的なメカニズムの詳細な説明を書き出さなければなりません。これらの問題は、学生に思考を整理させ、真の習熟度を示すことを強いるため、学習のための強力なツールとなります。しかし、それらを採点することは重い負担となります。クラスの規模が大きくなると、一人の教師がすべてのエッセイを注意深く読み、パーソナライズされたフィードバックを提供し、すべての学生が同じ基準に対して公平に判断されるようにするための十分な時間を割くことはできません。課題は単に作業量にあるのではなく、一貫性の必要性にあります。ある教師が重視する特定の詳細を、別の教師は見落としてしまう可能性があり、それが不均衡な結果を招くのです。
インドの医科大学の研究チームは、新しい種類のコンピュータプログラムがこの問題を解決できるかどうかを確かめるべく、調査を開始しました。彼らは、人工知能システムがこれらの長いエッセイを読み、経験豊富な人間の教授と同じスキルで採点し、なぜ学生が特定のスコアを得たのかを正確に説明できるかどうかを知りたいと考えました。研究者たちは、デジタル試験官として機能するツールを構築しました。このシステムは、単に単語数を数えたりキーワードをチェックしたりするのではなく、完璧な回答を小さな部分へと分解する「ルーブリック」と呼ばれる特定のルールを与えられました。コンピュータは、学生の文章の中にそれらの特定の要素を探し出し、見つかったものに対して点数を付け、その後、回答をどのように改善できるかを提案するように指示されました。このタスクを実行するために、システムは、人間の言語を理解するために膨大な量のテキストで学習させたコンピュータプログラムの一種である、高度な言語モデルを使用しました。
研究には、2つの異なる生化学の問題に対して回答を書いた300人の学生が参加しました。研究者たちはこれら600の回答を収集し、一度はコンピュータによって、もう一度は当該科目を長年教えている2人の専門家によって採点されました。人間の教師も、同じ一連のルールを用いて論文を採点しました。コンピュータが単に推測しているのではないことを確実にするために、研究者たちは、わずかな変化を加えて各論文を5回採点させ、その中間のスコットを最終結果として採用しました。この手法は、コンピュータが発生させる可能性のあるランダムなエラーを平滑化するのに役立ちました。チームは、機械による採点と2人の人間の教師による採点の間にどの程度の一致が見られるかを確認するために、両者を比較しました。
結果は、機械と人間の間の驚くべきレベルの一致を示しました。人工知能によるスコアは、人間の専門家によるスコアとほぼ完璧に一致しました。研究者が、コンピュータの成績が教師の成績にどの程度密接に従っていたかを測定したところ、その数値は、2人の異なる人間が同じ論文を採点する場合に通常見られるものよりも優れた、極めて高い一致を示しました。コンピュータは、教師よりも一貫して高い、あるいは低い点数を与えることもなく、その平均スコアは人間の平均とほぼ同一でした。実際、コンピュータの採点は専門家と非常に一貫していたため、教室における信頼できるパートナーと見なすことができます。また、システムは学生の回答がどこで弱くなっているかについて具体的なコメントを提供し、学生が間違いから学ぶのに役立つレベルの詳細を提供しました。
この研究は、人工知能が、人間の教師が提供するニュアンスを失うことなく、科学における複雑な記述回答の採点という困難なタスクをこなせることを示唆しています。研究者たちは、コンピュータに何を探すべきかという明確な指示を与えることで、専門家レベルの正確さで学生の成果を評価できることを見出しました。これは、コンピュータが教師に取って代わることを意味するのではなく、むしろ、コンピュータが採点という重労働を引き受けることで、人間の教育者が教育やメンタリングに集中できるようにすることを意味します。この研究は、このアプローチが、より公平で効率的な評価を実現し、すべての学生が教材への理解を真に反映した成績を受け取れるようにするために、実際の教室で使用される準備ができていることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。