Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026
この2026年の研究は、5つの高度な生成AIシステムを初級オブジェクト指向プログラミングの評価指標で検証しており、それらが概して平均的な学生を上回り、前年と比較して著しい向上を示している一方で、インターフェースや抽象クラスといった特定の高度な概念、およびグラフィックス関連のタスクにおいては依然として苦戦していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
若者が初めてソフトウェアの構築を学ぶ教室に、新しい種類の助け舟が到着した。これらは人間のチューターではなく、膨大なテキストとコードのライブラリで学習し、質問を読み取ってそれに応じたプログラムを書くことができるコンピュータプログラム、すなわち大規模言語モデルである。長年、教育者たちはこれらのツールの進化を見守り、それらがプログラミングの論理を真に理解しているのか、それとも単にパターンを模倣しているだけなのかという疑問を抱いてきた。この問いが重要なのは、プログラミングはしばしば「オブジェクト指向プログラミング」と呼ばれる特定のスタイルを通じて教えられるからである。そこでは、現実世界のオブジェクトが属性と振る舞いの両方を持つように、コードはデータと動作を保持する自己完結型のユニットへと整理される。もしこれらの人工的なシステムが学生と同じ問題を解決できるのであれば、それは私たちの教え方、テストの仕方、そしてコードを学ぶ未来に対する考え方を変えることになる。
エストニアのタルトゥ大学の研究者たちは、最も人気のある5つの人工知能システムを、実際の大学の環境でテストすることに決めた。彼らは機械に対して抽象的なパズルを解かせたり、真空状態でコードを書かせたりしたわけではない。代わりに、彼らは初年次学生向けの入門コースで使用されているのと全く同じプログラミングテストと期末試験の問題を取り上げ、それらを直接機械に投入した。タスクは現地の言語であるエストニア語で書かれており、研究者たちはシステムに対して特別な指示やヒントを与えなかった。彼らは単に、学生が行うように問題を解くよう機械に求め、教師が人間の成果物に適用するのと同じ採点基準を用いた。目的は、これらのツールが平均的な学生に追いつけるかどうか、そしてより重要なことに、どこで依然としてつまずくのかを確認することであった。
結果は、人工知能システムが驚くほど有能であり、比較対象となった人間の学生を上回ることが多いことを示した。複数のパーツからなる完全なプログラムの構築を必要とする最初のプログラミングテストでは、一つのシステムを除いて、すべてのシステムが平均的な学生よりも高いスコアを獲得した。Microsoft Officeに統合されている一つのツールは、小さな構文エラーのために一度プログラムを動作させることに失敗したが、他のシステムは一貫してトップの成績を収めた。より複雑なデータ処理を含む、少し難易度の高い二番目のテストにおいても、機械は再び圧倒し、ほとんどが満点またはそれに近いスコアを達成した。コース全体を網羅し、トリッキーな概念的質問も含まれていた期末試験においても、機械は概してクラスの平均を大きく上回るスコアを記録した。
しかし、機械は完璧ではなく、その間違いは彼らの理解がいまだに浅いことを露呈させている。彼らはクラッシュすることのない長く複雑なプログラムを書くことはできたが、人間の教師なら気づくであろう特定の詳細を見落とすことがあった。例えば、一部のシステムはテキストのフォーマットを適切に行えなかったり、コードを動作させるために必要な指示を含めるのを忘れたりして、プログラムの実行を停止させるエラーを引き起こした。また、彼らは「インターフェース」と呼ばれる特定のルールを通じてプログラムの異なる部分がどのように対話すべきかといった、特定の高度な概念についても苦戦した。これらの領域において、機械は見た目は正しいものの、実際には問題が求めている通りには動かないコードを生成することがあった。さらに、研究では、画像解釈を伴うグラフィックス関連の質問におけるパフォーマンスの限界についても指摘されており、これはAIが非テキスト情報を扱う際に直面する広範な課題を反映している。
研究者たちは、これらのシステムがわずか1年前の評価と比較して大幅に向上していることを見出した。以前のバージョンのツールではコースに合格することさえできなかった可能性があるが、新しいモデルは現在、一貫して学生のパフォーマンスの上位層のスコアを記録している。しかし、明確なパターンが現れた。機械は標準的な構造を構築するための指示に従うことには長けているが、システムの異なる断片が概念的にどのように組み合わさるかについての深い推論を必要とするタスクでは、躓くことがある。彼らは要求されていない追加の機能を追加したり、学生がまだ学習していない高度なテクニックを使用したりすることがあり、これは彼らがコースのカリキュラムよりもはるかに広い知識のプールから引き出していることを示唆している。
結局のところ、この研究は、強力ではあるが、あらゆる教育的ニーズに対して完全に信頼できるわけではないというツールの姿を描き出している。人工知能システムは、平均的な学生を上回ることが多い動作するコードを生成でき、プログラミングのメカニズムを習得していることを証明している。しかし、彼らには依然として、真の論理的理解の欠如を示す特定の、繰り返されるエラーが存在する。教育者にとって、これは、これらのツールが学習をサポートするために使用できる一方で、人間の監視や、単にコードを生成する能力ではなく深い概念的理解をテストするような評価の入念な設計の必要性を代替することはできないことを意味している。機械は毎年進化しているが、プログラマーのように真に考えるようになるには、まだ長い道のりがある。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。