想像你是一位正在嘗試為學生的英語口說進行評分的老師。你必須聆聽他們,並做出決定:他們表現得如何? 他們聽起來流利嗎?他們的發音清晰嗎?他們使用了正確的單字嗎?
長期以來,電腦嘗試透過做兩件分開的事情來達成這個目標,但它們就像是無法互相溝通的兩位專家:
「轉錄員」(BERT): 這台電腦負責聆聽、寫下學生所說的內容,然後對單字進行評分。它非常擅長檢查學生是否使用了正確的詞彙。但如果電腦聽錯了一個單字(這在遇到口音時經常發生),整個評分就會出錯。此外,它無法聽到學生是如何說話的——例如,他們聽起來是否緊張,或者說話的節奏是否奇怪。
「音響工程師」(wav2vec 2.0): 這台電腦完全忽略單字。它只專注於聽聲波。它非常擅長察覺學生說話是否流暢、口音是否清晰,以及停頓是否過多。但它並不真正理解學生在說什麼。它可能會認為一個學生表現很棒,僅僅是因為他講話很流利,即使他說的是些不知所云的話。
NTNU 團隊的解決方案:「超級老師」
國立臺灣師範大學(NTNU)的團隊意識到,要得到完美的評分,你需要「轉錄員」和「音響工程師」同時協作。他們為「Speak & Improve Challenge 2025」(一場關於 AI 如何評分口說能力的重大競賽)建立了一個運作起來像**「超級老師」**的系統。
以下是他們的系統如何運作,我們使用一個簡單的比喻:
1. 兩位評分員
他們建立了兩個不同的「AI 評分員」,同時聆聽同一個學生的錄音:
- 評分員 A(聲音專家): 使用名為 wav2vec 2.0 的模型。它完全專注於說話的「音樂性」——節奏、發音和流暢度。
- 評分員 B(意義專家): 使用一個龐大且聰明的 AI 叫做 Phi-4。這是一個「多模態大型語言模型」。它就像一位超強大的導師,可以同時閱讀文本並聆聽聲音。它能理解學生所講故事的意義、語法和上下文。
2. 「分數融合」(最終決策)
他們並沒有讓其中一個 AI 做出最終判斷,而是將兩者結合起來。想像一個評審團,其中一位評審負責投票決定「流暢度」,而另一位則負責「內容」。
- 他們並非盲目地取平均值。他們使用了一種稱為**「分數融合」(Score Fusion)**的聰明策略。
- 他們觀察了不同的英語水平(從初學者到進階者)。針對每個等級,他們計算出應該給予「聲音專家」與「意義專家」多少權重,才能獲得最準確的結果。
- 這就像是在說:「對於初學者,讓我們多信任一點『聲音專家』;對於進階學生,讓我們多信任一點『意義專家』。」
結果:第二名!
當他們使用這個「超級老師」系統測試官方測試集時:
- 舊方法(基準線): 平均誤差約為 0.44 分。
- 僅使用聲音專家: 誤差為 0.39 分。
- 僅使用意義專家: 誤差為 0.39 分。
- NTNU 超級老師(結合後): 誤差僅為 0.375 分。
這小小的進步足以讓他們在整個競賽中奪得第二名,擊敗了許多其他頂尖的研究團隊。唯一表現稍好(第一名)的團隊,其得分為 0.364。
為什麼這很重要(根據論文內容)
論文聲明,這證明了你不能只依賴單一類型的 AI。
- 如果你只看單字,你會錯失說話的「感覺」。
- 如果你只聽聲音,你會錯失「意義」。
- 通過將專業的「聲音專家」與「超聰明導師」結合,並讓他們共同投票,你就能得到更公平且更準確的評分。
團隊還發現,針對每一種特定類型的測試問題(例如面試與簡報),擁有一個特定的「導師」會比讓一個「導師」試圖回答所有問題的效果更好。
簡而言之,要評分人類的口說,你需要一台既能聽懂「音樂」,又能理解「歌詞」的電腦,並且讓它們作為一個團隊共同協作。
技术摘要:NTNU 系统在 S&I 2025 挑战赛中的表现
问题陈述
针对第二语言(L2)学习者的口语评估(SLA)面临着建模声学表达与语言内容之间的根本权衡。传统的基于文本的方法(例如利用 BERT 处理自动语音识别(ASR)转录文本)能有效捕捉语义内容,但由于依赖于易出错的转录文本,无法对关键的韵律和语音特征进行建模。相反,声学自监督模型(如 wav2-vec 2.0 (W2V))擅长处理原始音频以捕捉发音和流利度,但往往缺乏高层语言评估所需的语义解释能力。虽然多模态大语言模型(MLLM)为这种模态的统一提供了潜在方案,但其在整体性 SLA 评分中的应用仍有待深入探索。挑战在于开发一个能够在有限数据和计算资源约束下,稳健集成声学与语义特征的系统,正如 Speak & Improve (S&I) 2025 挑战赛所呈现的那样。
方法论
作者提出了一个双重评分器系统——NTNU SMIL V,该系统通过评分融合策略整合了两个不同的评估组件:
- 声学评分器 (W2V): 该组件利用预训练的 wav2vec 2.0 编码器从原始语音波形中提取帧级声学表示。它采用注意力池化(attention pooling)生成话语级向量,随后通过原型嵌入模块进行处理。该模块计算与代表不同 CEFR 等级(A2 到 C1+)的可学习原型的余弦相似度,并将结果输入多层感知器(MLP)以预测连续的熟练度分数。
- 多模态评分器 (MLLM): 第二个组件基于 Phi-4-multimodal 架构,这是一个拥有 38 亿参数的仅解码器(decoder-only)Transformer 模型。该模型使用低秩自适应(LoRA)技术结合专门的音频适配器进行微调,用以处理原始音频信号以及 ASR 转录文本、任务描述和问题提示。
- 作者研究了两种配置:跨任务泛化多模态评分器 (Phi4-CTG),该模型在所有任务部分的组合数据上进行训练;以及特定任务评分器 (Phi4-STG),其中针对每个特定的评估部分(访谈、观点、演示、交流活动)分别微调独立的模型。
- Phi4-STG 方法优先考虑直接处理原始音频波形,以减轻 ASR 错误传播的影响,从而利用模型对语音细微差别(发音、流利度、韵律)进行联合推理的能力,并兼顾语言内容。
- 评分融合: 最终系统结合了 W2V 评分器和 Phi4-STG 评分器的预测结果。首先将 MLLM 的连续分数离散化为八个与 CEFR 对齐的区间。对于每个区间,通过在开发集上进行网格搜索来确定最优插值权重 (wk),以最小化相对于参考分数的均方根误差 (RMSE)。融合后的分数为 y^=(1−wk)y^w2v+wky^mllm。
核心贡献
- 模态集成: 本文展示了将自监督语音编码器 (W2V) 与多模态大语言模型 (Phi-4) 进行融合的成功案例,有效地结合了细粒度的声学建模与深层的上下文推理。
- 特定任务 MLLM 适配: 研究强调,在 SLA 背景下,特定任务微调 (Phi4-STG) 的表现优于泛化跨任务模型 (Phi4-CTG),这表明不同的评估部分受益于专门化的建模。
- 对 ASR 错误的鲁棒性: 通过将原始音频处理直接纳入 MLLM 流水线,系统减少了对可能存在缺陷的 ASR 转录文本的依赖,解决了仅基于文本基准模型的关键局限性。
- 评分级融合策略: 实现了一种基于预测分数区间的动态调整权重机制,实现了两个互补评分器的优化集成。
结果
所提出的 NTNU SMIL V 系统在 Speak & Improve 2025 官方测试集上实现了 0.375 的均方根误差 (RMSE)。
- 排名: 这一表现使其获得了比赛的第二名。
- 对比: 该系统的表现优于官方基准(RMSE 0.444)和第三名选手(RMSE 0.384),略逊于第一名系统(RMSE 0.364)。
- 组件分析:
- 独立的 W2V 模型实现的 RMSE 为 0.394。
- 独立的 Phi4-STG 模型实现的 RMSE 为 0.389。
- 融合系统 (W2V + Phi4-STG) 取得了最佳结果 (0.375),证明了声学与语义建模的结合比单一组件更具优势。
- 将 W2V 与泛化模型 Phi4-CTG 进行融合得到的 RMSE 为 0.377,略低于特定任务变体,进一步证实了特定任务适配的价值。
意义与主张
作者声称,他们的工作验证了将自监督语音编码器与 MLLM 相结合在口语评估中的有效性。结果表明,虽然声学特征对于捕捉表达特征至关重要,但特定任务 MLLM 的语义推理能力显著提升了整体评分的准确性。论文谦逊地总结道,尽管 MLLM 为统一早期范式提供了一个充满希望的方向,但在 SLA 中的应用需要精细的架构选择(如特定任务微调和直接音频处理),才能充分发挥其潜力。这项工作强调,未来的改进应侧重于完善融合策略,并解决模型效率以及不同学习群体之间的公平性问题。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。