The NTNU System at the S&I Challenge 2025 SLA Open Track
S&I Challenge 2025 SLA Open Track에 참여한 NTNU 팀의 시스템은 모달리티별 한계를 극복하기 위해 wav2vec 2.0과 Phi-4 멀티모달 대규모 언어 모델을 점수 융합 전략을 통해 통합하였으며, 0.375의 평균 제곱근 오차(RMSE)를 기록하며 2위를 차지했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 학생의 영어 말하기를 채점하려는 선생님이라고 상상해 보세요. 당신은 그들의 말을 듣고 결정해야 합니다. 얼마나 잘하는가? 유창하게 들리는가? 발음은 명확한가? 적절한 단어를 사용하는가?
오랫동안 컴퓨터는 두 가지 별개의 작업을 수행함으로써 이 일을 하려고 노력했지만, 마치 서로 대화할 수 없는 두 명의 전문가와 같았습니다:
- "전사 전문가" (BERT): 이 컴퓨터는 듣고 학생이 말한 내용을 그대로 받아 적은 뒤, 그 단어들을 채점합니다. 학생이 올바른 어휘를 사용했는지 확인하는 데 탁관합니다. 하지만 컴퓨터가 단어를 잘못 알아들으면(억양 때문에 자주 발생하는 일입니다), 전체 점수가 망가질 수 있습니다. 또한, 학생이 어떻게 말했는지—예를 들어 긴장했는지 혹은 이상한 리듬으로 말했는지—는 들을 수 없습니다.
- "음향 엔지니어" (wav2vec 2.0): 이 컴퓨터는 단어를 완전히 무시합니다. 오직 음파(sound waves)만을 듣습니다. 학생이 얼마나 매끄럽게 말하는지, 억양이 명확한지, 혹은 너무 많이 멈추는지 등을 파악하는 데 탁월합니다. 하지만 학생이 무엇을 말하고 있는지는 잘 이해하지 못합니다. 학생이 유창하게 말하기만 하면, 설령 횡설수설하고 있더라도 훌륭하다고 판단할 수도 있습니다.
NTNU 팀의 해결책: "슈퍼 선생님"
국립 타이완 사범대학교(NTNU) 팀은 완벽한 점수를 받으려면 전사 전문가와 음향 엔지니어가 모두 함께 작동해야 한다는 것을 깨달았습니다. 그들은 "Speak & Improve Challenge 2025"(AI가 말하기를 채점하는 큰 대회)를 위해 슈퍼 선생님처럼 작동하는 시스템을 구축했습니다.
이 시스템이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다:
1. 두 명의 채점자
그들은 동일한 학생의 녹음본을 동시에 듣는 두 개의 별도 "AI 채점자"를 만들었습니다:
- 채점자 A (소리 전문가): wav2vec 2.0이라는 모델을 사용합니다. 이 모델은 오로지 말의 음악성—리듬, 발음, 그리고 흐름에 집중합니다.
- 채점자 B (의미 전문가): Phi-4라는 거대하고 똑똑한 AI를 사용합니다. 이것은 "멀티모달 거대 언어 모델(Multimodal Large Language Model)"입니다. 이는 텍rd과 목소리를 동시에 읽고 들을 수 있는 초스마트 튜터와 같습니다. 학생이 이야기하는 내용의 의미, 문법, 그리고 맥락을 이해합니다.
2. "점수 융합" (최종 결정)
그들은 한 명의 AI가 최종 결정을 내리게 하는 대신, 두 모델을 결합했습니다. 한 명의 심사위원이 "유창성"에 투표하고, 다른 심사위원이 "내용"에 투표하는 심사 패널을 상상해 보세요.
- 그들은 단순히 점수를 맹목적으로 평균 내지 않았습니다. 그들은 **점수 융합(Score Fusion)**이라는 스마트한 전략을 사용했습니다.
- 그들은 영어의 다양한 "단계"(초급부터 고급까지)를 살펴보았습니다. 각 단계별로, 가장 정확한 결과를 얻기 위해 소리 전문가와 의미 전문가에게 각각 얼마만큼의 가중치를 줄 것인지 정확히 계산해 냈습니다.
- 이는 마치 이렇게 말하는 것과 같습니다. "초보자에게는 소리 전문가를 조금 더 신뢰하자. 상급자에게는 의미 전문가를 더 신뢰하자."
결과: 2위 달성!
그들이 이 "슈퍼 선생님" 시스템을 공식 테스트 세트로 테스트했을 때의 결과입니다:
- 기존 방식 (Baseline): 평균적으로 약 0.44 점의 오차를 보였습니다.
- 소리 전문가 단독: 오차가 0.39였습니다.
- 의미 전문가 단독: 오차가 0.39였습니다.
- NTNU 슈퍼 선생님 (결합형): 오차가 단 0.375에 불과했습니다.
이 작은 개선 덕분에 그들은 전체 대회에서 2위를 차지하며 많은 다른 우수한 연구자들을 제쳤습니다. 1위를 한 팀은 0.364의 점수를 기록했습니다.
이 논문이 시사하는 바 (논문에 따르면)
이 논문은 단순히 한 종류의 AI에만 의존해서는 안 된다는 것을 증명한다고 주장합니다.
- 단어만 본다면, 말하기의 느낌을 놓치게 됩니다.
- 소리만 듣는다면, 의미를 놓치게 됩니다.
- 특화된 "소리 전문가"와 "초스마트 튜터"를 결합하고, 그들이 함께 투표하게 함으로써 훨씬 더 공정하고 정확한 점수를 얻을 수 있습니다.
또한 팀은 각 특정 유형의 테스트 질문(예: 인터뷰 대 발표)에 대해 각각의 특정 "튜터"를 두는 것이, 하나의 "튜터"가 모든 것에 답하려고 하는 것보다 더 효과적이라는 것을 발견했습니다.
요약하자면, 인간의 말하기를 채점하려면 음악을 듣고 가사를 이해하는 컴퓨터가 한 팀이 되어 함께 작동해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.