The NTNU System at the S&I Challenge 2025 SLA Open Track
S&I Challenge 2025 SLA Open TrackにおけるNTNUチームのシステムは、モダリティ固有の限界を克服するために、スコア融合戦略を介してwav2vec 2.0とPhi-4マルチモーダル大規模言語モデルを統合しており、平方根平均二乗誤差0.375で第2位のランクを獲得しました。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、生徒のスピーキング英語を採点しようとしている教師だと想像してください。あなたは彼らの声を聞き、こう判断しなければなりません。「彼らはどの程度上手いのか?」流暢に聞こえるか?発音は明瞭か?適切な言葉を使っているか?
長い間、コンピュータはこの作業を行うために、互いに会話のできない二人の専門家のように、二つの異なることを別々に行おうとしてきました。
- 「書き起こし担当」(BERT): このコンピュータは、聞き取った内容を正確に書き出し、その「言葉」を採点します。生徒が正しい語彙を使っているかをチェックすることには長けています。しかし、もしコンピュータが言葉を聞き間違えると(アクセントのせいでよく起こります)、採点全体が台無しになってしまいます。また、生徒がどのように話したか(例えば、緊張していたか、あるいは変なリズムで話していたか)までは聞き取ることができません。
- 「音響エンジニア」(wav2vec 2.0): このコンピュータは、言葉の内容を完全に無視します。ただ音波を聞くだけです。生徒がスムーズに話しているか、アクセントが明瞭か、あるいは間延びしていないかを聞き取ることに優れています。しかし、生徒が「何を」言っているのかについては、あまり理解していません。たとえ生徒が流暢に話していても、支離滅裂なことを言っていれば、その生徒を優秀だと判断してしまう可能性があります。
NTNUチームの解決策:「スーパー教師」
台湾師範大学(NTNU)のチームは、完璧な成績をつけるためには、「書き起こし担当」と「音響エンジニア」の両方が協力し合う必要があると気づきました。彼らは、AIによるスピーキング採点の大規模なコンテストである「Speak & Improve Challenge 2025」に向けて、**「スーパー教師」**として機能するシステムを構築しました。
彼らのシステムがどのように機能するか、簡単な比喩を使って説明します。
1. 二人の採点者
彼らは、同じ生徒の録音を同時に聞く、二つの異なる「AI採点者」を作成しました。
- 採点者A(音の専門家): wav2vec 2.0というモデルを使用します。これは、スピーチの「音楽」の部分、つまりリズム、発音、そして流れに完全に集中します。
- 採点者B(意味の専門家): Phi-4という、非常に賢い大規模なAIを使用しています。これは「マルチモーダル大規模言語モデル」です。これは、テキストを読みながら、同時に声も聞くことができる、超優秀なチューターのようなものです。生徒が語っている物語の意味、文法、そして文脈を理解します。
2. 「スコア融合」(最終決定)
彼らは、どちらか一方のAIに最終判断を任せるのではなく、両者を組み合わせました。一人の審査員が「流暢さ」に投票し、もう一人の審査員が「内容」に投票するパネルディスカッションを想像してください。
- 彼らは単にスコアを盲目的に平均化したわけではありません。**「スコア融合(Score Fusion)」**と呼ばれるスマートな戦略を用いました。
- 彼らは、英語の異なるレベル(初級から上級まで)ごとに、最も正確な結果を得るために、音の専門家と意味の専門家のどちらにどれだけの重みを与えるべきかを正確に算出しました。
- これは、「初級者の場合は、音の専門家を少し多めに信頼しよう。上級者の場合は、意味の専門家をより信頼しよう」と言うようなものです。
結果:第2位!
彼らがこの「スーパー教師」システムを公式テストセットに対してテストした結果は以下の通りです。
- 従来の方法(ベースライン): 平均して約 0.44 ポイントの誤差が出ました。
- 音の専門家のみ: 誤差は 0.39 でした。
- 意味の専門家のみ: 誤差は 0.39 でした。
- NTNUスーパー教師(結合モデル): 誤差はわずか 0.375 に抑えられました。
この小さな改善が、多くのトップ研究者を抑えて、コンテスト全体での第2位獲得につながりました。彼らよりわずかに優れたスコア(0.364)を出したのは、唯一の第1位のチームでした。
なぜこれが重要なのか(論文による)
この論文は、一つのタイプのAIだけに頼ることはできないということを証明していると主張しています。
- 言葉だけを見ていると、スピーチの「感じ」を見逃してしまいます。
- 音だけを聞いていると、その「意味」を見逃してしまいます。
- 特化した「音の専門家」と「超スマートなチューター」を組み合わせ、彼らに共同で投票させることで、より公平で正確な成績をつけることができるのです。
またチームは、特定の種類のテスト問題(インタビュー形式かプレゼンテーション形式かなど)に対して、それぞれ専用の「チューター」を用意する方が、一つの「チューター」がすべてに応答しようとするよりも効果的であることも発見しました。
要するに、人間のスピーキングを採点するには、コンピュータが音楽(音)を聞き、かつ歌詞(意味)を理解し、チームとして協力し合う必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。