← 最新の論文
💻 computer science

Automated Scoring of Handwritten Mathematical Problem Posing Using Large Language Models

本研究は、大規模言語モデルGemini 3.5 Flashが、構造化されたルーブリックを用いたゼロショット・プロンプティング手法を用いることで、特に整数問題において、また修正されたOCRテキスト入力を利用することで、中学生の手書きによる数学的な問題作成課題に対して信頼性の高い自動採点を実現できることを示している。

原著者: Tuğrul Kar, Tarık Kışla, Muhammed Ali Kayici, Burak Aydın

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Tuğrul Kar, Tarık Kışla, Muhammed Ali Kayici, Burak Aydın

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、採点すべき大量の宿題を抱えた教師を想像してみてください。生徒に自分自身の算数の問題を「作らせる」ことは、創造性を育み、深い理解を築くためのスーパーパワーであることをあなたは知っています。しかし、これら創造的な手書きの回答を採点するのは悪夢です。生徒によって書き方は千差万別であり、中には不可能なシナリオを作り上げる者もいれば、ただのデタラメを書く者もいます。それには膨大な時間がかかり、人間である教師でさえ、何が良い問題であるかについて意見が分かれることさえあります。ここで人工知能(AI)が登場します。AIは、疲れを知らない採点アシスタントになることを約束しています。しかし、ここに落とし穴があります。AIは印刷されたテキストを読むのは得意ですが、乱雑な手書きの数学の落書きを実際に理解し、輝かしい生徒の問いと混乱したゴミとの違いを見分けることができるのでしょうか?この問いは、教育とコンピュータサイエンスの交差点に位置しており、機械が、生徒の創造性を評価する際に数学の教師のように「考える」ことを学習できるのかを探求しています。

この研究の研究者たちは、非常にスマートなAIである「Gemini 1.5 Flash」をテストにかけることにしました。彼らは、このAIが235人の中学生によって作成された手書きの算数の問題を読み取り、人間の教師と同じくらい正確に採点できるかどうかを確かめたいと考えました。そのために、彼らは2つの異なるシナリオ(走行距離のような整数に関するものと、ケーキを分け合うような分数に関するもの)を含む「味見」のテストを設定しました。彼らはAIに、同じ手書きテキストの2つのバージョンを与えました。一つはコンピュータの目によって直接読み取られたもの(これは乱雑な筆跡に対して間違いを起こすことがあります)、もう一つは人間の専門家によって丁寧に修正されたものです。また、指示の順番を変えることで、AIの考えが変わるかどうかを確認するために、採点ルールを低いスコアから高い方へ上げる順序と、高いスコアから低い方へ下がる順序の2通りで与えました。

結果は、「素晴らしいニュース」と「改善が必要な点」が混在したものでした。研究によると、AIが専門家によって修正されたテキストを使用した場合、生の乱雑なコンピュータの読み取りを使用した場合よりも、人間の教師との一致率がはるかに高くなりました。しかし、算数の問題の種類が大きく影響しました。AIは、分数の問題(ケーキのタスク)と比較して、整数の問題(運転のタスク)を採点する場合の方がはるかに正確でした。AIは分数のニュアンスを理解するのに苦労しているようで、数学的には正しいものの、生徒が語っているストーリーには実際には適合していない回答に対して、高いスコアを与えてしまうことがよくありました。興味深いことに、採点ルールの提示順序はAIにとって全く重要ではなく、AIがルーブリックの下から始めたとしても上から始めたとしても、そのパフォーマンスは変わりませんでした。

要約すると、この研究は、AIが手書きの算数の問題を採点するための信頼できる助けになり得ることを示唆していますが、まだ完璧ではありません。AIは、筆跡が明瞭で、数学の内容が整数である場合に最もよく機能します。研究者たちは、単にAIに優れたテキストを与えること(人間がコンピュータの読み取りエラーを修正すること)が顕著な違いをもたらす一方で、AIは、特に分数が関わる場合に、数学の背後にある「ストーリー」を理解するために依然として助けを必要としていることを発見しました。AIは指示の順序によって混乱することはありませんでしたが、数学的内容の複雑さによって躓いてしまいました。著者たちは、AIは教師を助ける上で多大な可能性を秘めているものの、より複雑なトピック(分数など)については、その使い方に注意する必要があり、コンピュータが生徒の手書き文字を正しく読み取っているかどうかを常にダブルチェックすべきであると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →