← 最新论文
⚡ electrical engineering

The NTNU System at the S&I Challenge 2025 SLA Open Track

NTNU 团队为 2025 年 S&I 挑战赛 SLA 开放赛道设计的系统通过得分融合策略将 wav2vec 2.0 与 Phi-4 多模态大语言模型相结合,以克服特定模态的局限性,并凭借 0.375 的均方根误差获得了第二名。

原作者: Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想像你是一位正在嘗試為學生的英語口說進行評分的老師。你必須聆聽他們,並做出決定:他們表現得如何? 他們聽起來流利嗎?他們的發音清晰嗎?他們使用了正確的單字嗎?

長期以來,電腦嘗試透過做兩件分開的事情來達成這個目標,但它們就像是無法互相溝通的兩位專家:

  1. 「轉錄員」(BERT): 這台電腦負責聆聽、寫下學生所說的內容,然後對單字進行評分。它非常擅長檢查學生是否使用了正確的詞彙。但如果電腦聽錯了一個單字(這在遇到口音時經常發生),整個評分就會出錯。此外,它無法聽到學生是如何說話的——例如,他們聽起來是否緊張,或者說話的節奏是否奇怪。

  2. 「音響工程師」(wav2vec 2.0): 這台電腦完全忽略單字。它只專注於聽聲波。它非常擅長察覺學生說話是否流暢、口音是否清晰,以及停頓是否過多。但它並不真正理解學生在說什麼。它可能會認為一個學生表現很棒,僅僅是因為他講話很流利,即使他說的是些不知所云的話。

NTNU 團隊的解決方案:「超級老師」

國立臺灣師範大學(NTNU)的團隊意識到,要得到完美的評分,你需要「轉錄員」和「音響工程師」同時協作。他們為「Speak & Improve Challenge 2025」(一場關於 AI 如何評分口說能力的重大競賽)建立了一個運作起來像**「超級老師」**的系統。

以下是他們的系統如何運作,我們使用一個簡單的比喻:

1. 兩位評分員
他們建立了兩個不同的「AI 評分員」,同時聆聽同一個學生的錄音:

  • 評分員 A(聲音專家): 使用名為 wav2vec 2.0 的模型。它完全專注於說話的「音樂性」——節奏、發音和流暢度。
  • 評分員 B(意義專家): 使用一個龐大且聰明的 AI 叫做 Phi-4。這是一個「多模態大型語言模型」。它就像一位超強大的導師,可以同時閱讀文本並聆聽聲音。它能理解學生所講故事的意義、語法和上下文。

2. 「分數融合」(最終決策)
他們並沒有讓其中一個 AI 做出最終判斷,而是將兩者結合起來。想像一個評審團,其中一位評審負責投票決定「流暢度」,而另一位則負責「內容」。

  • 他們並非盲目地取平均值。他們使用了一種稱為**「分數融合」(Score Fusion)**的聰明策略。
  • 他們觀察了不同的英語水平(從初學者到進階者)。針對每個等級,他們計算出應該給予「聲音專家」與「意義專家」多少權重,才能獲得最準確的結果。
  • 這就像是在說:「對於初學者,讓我們多信任一點『聲音專家』;對於進階學生,讓我們多信任一點『意義專家』。」

結果:第二名!

當他們使用這個「超級老師」系統測試官方測試集時:

  • 舊方法(基準線): 平均誤差約為 0.44 分。
  • 僅使用聲音專家: 誤差為 0.39 分。
  • 僅使用意義專家: 誤差為 0.39 分。
  • NTNU 超級老師(結合後): 誤差僅為 0.375 分。

這小小的進步足以讓他們在整個競賽中奪得第二名,擊敗了許多其他頂尖的研究團隊。唯一表現稍好(第一名)的團隊,其得分為 0.364。

為什麼這很重要(根據論文內容)

論文聲明,這證明了你不能只依賴單一類型的 AI。

  • 如果你只看單字,你會錯失說話的「感覺」。
  • 如果你只聽聲音,你會錯失「意義」。
  • 通過將專業的「聲音專家」與「超聰明導師」結合,並讓他們共同投票,你就能得到更公平且更準確的評分。

團隊還發現,針對每一種特定類型的測試問題(例如面試與簡報),擁有一個特定的「導師」會比讓一個「導師」試圖回答所有問題的效果更好。

簡而言之,要評分人類的口說,你需要一台既能聽懂「音樂」,又能理解「歌詞」的電腦,並且讓它們作為一個團隊共同協作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →