Leveraging Large Language Models for Assessments Grading and Personalised Feedback Generation: A Case of Software Engineering
本研究は、ソフトウェアエンジニアリングの評価およびパーソナライズされたフィードバックの生成におけるLLM(ChatGPT-4およびGemini 2.5)の有効性を評価しており、それらは高品質なフィードバックと予備的なスコアを生成する一方で、指導者の採点との相関性が限定的であることから、人間の指導者に取って代わるのではなく、それを支援するハイブリッドモデルに最も適していることを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の大学の教室では、大規模言語モデルとして知られる新しい種類の人工知能によって、静かな革命が起きている。これらは単に事実を検索する単純な検索エンジンではない。膨大な量の人間による文章で学習しており、文脈を理解し、複雑な問題に対して推論を行い、人間の会話を模倣したテキストを生成することができるシステムである。長年、教育者たちは、これらのツールが単なるチャット以上のことができるのか、つまり、実際に教えることができるのか、あるいは少なくとも教師が学生から提出される膨大な量の課題を採点するのを助けることができるのか、という疑問を抱いてきた。この問いは、ソフトウェア工学のような分野においては特に複雑である。なぜなら、学生は単にエッセイを書いたり数学の問題を解いたりするのではなく、プログラムの異なる部分がどのように接続し機能すべきかを示す図を描きながら、ソフトウェアシステムの複雑な設計図を作成するからである。これらの視覚的な設計には、論理や構造の微妙な誤りを見つけ出す人間の目が必要となる。もしコンピュータがこれらの課題を正確に採点し、改善方法について役立つ助言を提供できるのであれば、教師はより深い学習に集中できるようになるだろう。ただし、それはコンピュータが学生の成績を任せられるほど信頼できる場合に限られる。
パキスタンとイギリスの大学の研究チームは、まさにこのアイデアを検証するために立ち上がった。彼らは、利用可能な最も高度な2つの人工知能システムが、複雑なソフトウェア設計の課題を採点し、学生にパーソナライズされたフィードバックを提供できるかどうかを確かめたいと考えた。そのために、彼らはソフトウェア設計とアーキテクチャに関するコースから、54件の実際の学生の提出物を収集した。各学生は、ユーザーがシステムとどのように相互作用するかを示すユースケース図、ソフトウェアの構成要素を概説するクラス図、そしてシステムのレイヤーをマッピングする3層アーキテクチャ設計という、3つの特定の種類の図を作成した。経験豊富な人間の講師が、満点に必要な要素を正確に定義した厳格なルール、すなわちルーブリックを用いて、すでにこれらすべての課題を採点済みであった。その後、研究者たちはこれらの課題と講師のルールを、OpenAIという会社のものとGoogleのものという、2つの異なる人工知能モデルに入力した。
研究者たちは、単にコンピュータにスコアを与えるよう求めたわけではない。彼らは、コンピュータが人間の教師と同じように、ステップ・バイ・ステップで思考プロセスを踏むように、慎重なプロセスを設計した。彼らはモデルに対し、まず学生が正しいトピックに触れているかどうかを確認し、次にルーブリックのすべての項目を調べて必要な要素が存在するかを確認し、最後に発見された特定のエラーに基づいてスコアを算出するように指示した。結果が単なる偶然の的中ではなく、安定していることを確認するために、研究者たちは各モデルにすべての課題を3回ずつ採点させ、その結果を平均化した。また、彼らはこのプロセス全体を管理するためのカスタムウェブツールを構築し、モデルがテキストと複雑な図の両方を含む学生のPDFファイルを読み取り、各学生に対して詳細なレポートを生成できるようにした。
研究者がコンピュータによる採点結果と人間の講師による採点結果を比較したところ、結果は期待と限界の両面を示した。人工知能システムは概して人間の教師の平均スコアに近く、コンピュータによる採点は、50点満点中平均して約5点の差であった。しかし、コンピュータは、非常に優れた学生と非常に成績の悪い学生を区別する人間の教師の能力には及ばなかった。人間の講師は、誰が教材を習得し、誰が習得していないかを明確に理解していることを反映して、19点から49点という幅広いスコアを付けていた。一方で、コンピュータはこれらのスコアをより狭い範囲に圧縮してしまう傾向があり、平凡な成果物にはやや高い成績を、優れた成果物にはやや低い成績を与えることが多かった。これは、コンピュータがパフォーマンスの概算を行うことには長けているものの、学生を正確にランク付けする能力を失っているため、最終的な成績を決定する上で人間の教師に取って代わるほど信頼できる段階にはまだ達していないことを意味していた。
採点の不完全さにもかかわらず、コンピュータが生成したフィードバックは驚くほど好評であった。AIが生成したコメントを受け取った学生たちは、それらが明快で、有用であり、自分の間違いを理解するのに役立つと感じた。実際、どちらのコンピュータのフィードバックを好むか尋ねられた際、大多数の学生はOpenAIのモデルを選び、そのコメントはより個人的で建設的であり、人間の教師が言うことに近いと感じたと述べた。興味深いことに、この好みは必ずしも数学的に近いスコアを出したコンピュータと一致するわけではなかった。つまり、学生が文章のスタイルにおいて最も好ましいと感じたモデルは、必ずしも採点の正確さが最も高かったモデルではなかったのである。このことは、学生にとって、アドバイスの質が割り当てられた正確な数字よりも重要であることを示唆している。
本研究は、これらの人工知能ツールは強力な助手ではあるが、まだ完全に舵を取る準備はできていないと結論づけている。これらは、何百もの課題をレビューし、図の欠落した要素を見つけ、初期のフィードバックをドラフトするという重労働をこなすことができ、教師の時間を大幅に節約できる。しかし、本研究は、特に学生の将来が結果に左右されるようなハイステークスな評価においては、最終的な成績をレビューし公平性を確保するために、人間の教師がプロセスに関与し続ける必要があることを強く示唆している。これらの知見によれば、理想的な未来は、コンピュータが疲れを知らない最初の読者として機能し、予備的な評価と詳細な提案を提供し、一方で人間の講師が最終的な判断と、人間にしか持ち得ない微細な理解を提供するという、ハイブリッドなアプローチである。このパートナーシップは、教師に過度な負担を強いることなく、すべての学生にパーソナライズされたフィードバックを提供することを可能にし、ソフトウェア工学教育を変革することができるだろう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。