← 最新の論文
💻 computer science

A systematic comparison of Large Language Models for automated assignment assessment in programming education: Exploring the importance of architecture and vendor

本研究は、プログラミング課題の自動採点における18種類の現代的な大規模言語モデルに関する初の規模の大きな系統的な比較を提示するものであり、アーキテクチャやベンダー間での顕著な性能の差異、小規模なモデルバリアントの一貫した性能不足、および自動化された合意と人間の教師による評価との間に持続的に存在する中程度の乖離を明らかにしている。

原著者: Marcin Jukiewicz

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Marcin Jukiewicz

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、山のような宿題の採点に追われている教師だと想像してください。6,000件ものプログラミング課題をチェックしなければならず、目は疲れ切っています。そこに登場するのが「デジタル・グレーダー(デジタル採点者)」です。これは、大規模言語モデル(LLM)と呼ばれる超スマートなコンピューターの脳です。これらのモデルを、インターネット上のほぼすべてのもの、つまり何百万行ものコードを含むあらゆる情報を読み込んだ、非常に博識なロボットだと考えてください。彼らは言語と論理を理解するように設計されているため、学生の課題を即座に採点させるのは完璧なアイデアのように思えます。しかし、ここに落とし穴があります。人間と同じように、これらのロボットには異なる「性格」があるのです。厳しいものもいれば、寛大なものもいますし、ただ単に風変わりなものもいます。大きな疑問は、学校がこれらのロボットに採点を任せた場合、果たして公平であるのか? 彼らは人間の教師と意見が一致するのか? それとも、あるロボットはA+を与え、別のロボットは全く同じコードに対してF(不可)を与えるという、混沌としたゲームに変えてしまうのでしょうか?

この論文は、いわばこれらのデジタル採点者に対する大規模な「味見(テイスティング)」のようなものです。著者であるマルチン・ユキェヴィッチ(Marcin Jukiewicz)は、大学のコースから得られた6,000件の実在する学生のプログラミング課題を集め、18種類の異なるバージョンのAIロボットにそれらすべてを採点させました。彼は単にスコアを求めるだけでなく、彼らがどのように考え、どれほど厳しく、そして互いに、あるいは人間の教師とどの程度一致しているのかを観察しました。研究は、これらのAIモデルが均一な知能の塊ではなく、非常に異なる「いとこ同士」の家族であることを明らかにしています。一部のモデルは「リベラル(寛大)」で、お菓子を配るように高いスコアを出し、他のモデルは「制限的(厳格)」で、小さなミスで学生を落とします。さらに驚くべきことに、同じ会社(OpenAIやGoogleなど)のロボットは、まるで同じ家で同じルールのもとで育てられたかのように、非常に似た考え方や採点方法を持つ傾向があります。

最も重要な発見は、しかしながら、少し現実を突きつけるものでした。この研究における「最高の」AIロボットでさえ、統計的なレベルでは人間の教師との一致が中程度に過ぎず、完全な一致には程遠いものでした。採点の世界において、それは、あるオーディション番組の審査員二人が、同じ歌手に対して全く異なるスコアを出しているようなものです。この研究は、AIは「それ自体」とは一貫性を持てるものの、人間の教師が持つニュアンスを汲み取り、寛容であり、文脈を考慮した採点方法に合わせることは依然として困難であることを示唆しています。さらに、これらのモデルの「ミニ」や「ナノ」バージョン(より小さく安価なもの)は、一般的にフルサイズの兄弟モデルよりも採点能力が低いことが分かりました。したがって、もし学校がAIに宿題を採点させたいのであれば、適当なロボットを選んではいけません。なぜなら、ロボットの選択が、実際に学生が得る成績を変えてしまうからです。

グレート・ロボット・グレーディング・ショーダウン(偉大なるロボット採点対決)

あなたが教室に足を踏み入れると、18体の異なるロボットがデスクに座り、それぞれが赤ペンを手にしている場面を想像してください。彼らはこれから、6,000件のプログラミング課題の山を採点しようとしています。これらは単なるロボットではありません。OpenAI、Google、Anthropic、DeepSeekという4つの主要なテック巨人が提供する、最新鋭の「大規模言語モデル(LLM)」です。この研究の目的は、これらのロボットたちが、誰にAを与え、誰にBを与え、誰を落第させるかについて、意見が一致するかどうかを確認することでした。

結果は、審査員たちが全く意見をまとめられないリアリティ番組のようでした。著者は、これらのロボットが明確な「採点哲学」を持っていることを発見しました。

「優しい」ロボット vs 「厳しい」ロボット
一部のロボットは非常に寛大でした。GPT-4oClaude-haiku-3.5のようなモデルは、「リベラル」な採点者でした。彼らは高いスコア(「1」または満点)を頻繁に与える傾向がありました。学生のコードが概ね正しければ、これらのロボットは合格点を与えることに抵抗しませんでした。その反対側にいたのは、DeepSeek-ReasonerGPT-4.1-nanoのような「制限的」なロボットたちでした。彼らは厳格な規律遵守者でした。たとえ小さなエラーを見つけただけでも、「0」(不合格)を出す可能性が非常に高かったのです。優しいロボットが優しく促すだけで済ませるところを、これらのロボットはセミコロン一つがないという理由で学生を落とすような存在でした。

そして、Claude-sonnet-4Gemini-2.0-flash-liteのような「バランスの取れた」ロボットたちもいました。彼らは中間層の採点者でした。満点や不合格を出すだけでなく、「0.5」というスコアを好みました。彼らは、「要点は理解しているが、細部がいくつか欠けているので、部分点を与えます」と言うような存在でした。

家族の類似性
最も興味深い発見の一つは、同じ会社のロボットが兄弟のように振る舞うことでした。もし、異なるOpenAIのモデル(GPT-4o、GPT-5、およびその「ミニ」バージョンなど)の採点パターンを見たならば、それらは互いに集まり、同じように考えていました。GoogleのGeminiモデルやAnthropicのClaudeモデルについても同様でした。まるでOpenAIはすべてのロボットに特定のスタイルで採点するように教え、Googleはまた別のスタイルを教えているかのようでした。研究では、6つの明確なグループが見つかりました。共通のスタイルを持つ5つの主要な「氏族(GPT-5、GPT-4、Gemini、DeepSeek、Claude)」と、どこにも当てはまらなかった2つのユニークなモデルをまとめた1つの特別な「アウトライヤー(外れ値)クラスター」です。

「ミニ」 vs 「メガ」
研究では、ロボットのサイズについても調査が行われました。テック企業はしばしば、より小さく、高速で、安価に動作する「ミニ」や「ナノ」バージョンのモデルをリリースします。論文によると、これらの小さなロボットは、一般的に採点能力が低いことが判明しました。フルサイズの「フラッグシップ」モデルの方が、一貫性と信頼性が高かったのです。これは、プロのシェフと、料理番組を観たばかりの子供を比較するようなものです。子供も料理を完成させることはできますが、プロの方が毎回確実に味を正しく判断できるのです。「ミニ」や「ナノ」モデルは、人間の教師との一致度が低く、学校がコスト削減のために安価で小さなモデルを使用しようとすれば、採点の質が低下する可能性があることを示唆しています。

人間という要素
ここで、あなたを驚かせるかもしれない展開があります。著者が、これらすべてのロボットを、同じ課題を採点した実際の人間教師と比較したところ、ロボットたちはうまく一致しませんでした。事実、人間教師が最も寛大だったのです! 人間教師は最も高い平均スコア(0.726)を出し、ロボットのどのモデルよりも「1(満点)」を与える確率が高かったのです。

最高のロボットであったClaude-haiku-3.5でさえ、人間の教師との統計的な一致スコアは0.470でした。統計学の世界では、これは「良好」ではなく「中程度」の一致とみなされます。一致が「良好」であるためには、通常0.75以上のスコアが必要です。これは、もしあなたがこのロボットに宿題を採点させたとしても、おそらく先生が付けるであろう成績とは異なる、より厳しい成績を付けられることを意味しています。

「群衆」のパラドックス
研究では、ロボット同士を戦わせる巧妙なテストが行われました。研究者たちは、人間と比較する代わりに、「もし18種類のロボットが出した最も一般的な成績を取ったとしたら、それが『真の』成績になるのか?」と問いかけました。その結果、ロボットたちは互いに(トップモデルにおいて80%以上の合意率で)非常によく一致していました。これは、ロボットたちが自分たちの仲間同士では非常に一貫している一方で、人間の教師とは一貫して異なっていることを示唆しています。

ここで大きな疑問が生じます。ロボットが正しく、教師が甘すぎるのでしょうか? それとも、ロボットたちは似たようなデータで訓練されているために、皆同じ間違いを犯しているのでしょうか? 論文は、ロボットは一貫しているものの、「人間のタッチ」、つまり、学生が努力したことや、小さなミスが必ずしも概念の理解不足を意味しないといったことを理解することには苦労している可能性があると示唆しています。

これが未来に意味すること

この論文は、AIによる採点が壊れているとか、使用をやめるべきだと言っているわけではありません。むしろ、学校に対して注意を促しています。宿題の採点にどのロボットを選ぶかは、中立的な決定ではありません。それは結果を変えてしまう選択なのです。もし「リベラル」なロボットを選べば、学生の成績は上がるかもしれません。もし「制限的」なロボットを選べば、成績は下がるかもしれません。

結論として、この研究は、AIに採点を完全に任せきることはできないと述べています。私たちは依然として、監視を行うための人間の教師を必要としています。ロボットは優れたツールですが、それは電卓の種類のようなものです。あるものは切り上げを行い、あるものは切り下げを行い、またあるものは異なるボタンを持っています。ロボットを人間の教師と一致させる方法が見つかるまでは、ロボットが付ける成績は、あなたの先生が付ける成績とは異なる可能性があるということを覚えておく必要があります。そして、教育の世界において、その差は非常に重要なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →