← Últimos artigos
⚡ electrical engineering

The NTNU System at the S&I Challenge 2025 SLA Open Track

O sistema da equipe da NTNU para o S&I Challenge 2025 SLA Open Track integra o wav2vec 2.0 com o modelo de linguagem de grande escala multimodal Phi-4 por meio de uma estratégia de fusão de pontuação para superar limitações específicas de cada modalidade, alcançando o segundo lugar com um erro quadrático médio de 0,375.

Autores originais: Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

Publicado 2026-06-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um professor tentando avaliar a fala em inglês de um aluno. Você tem que ouvi-lo e decidir: Qual é o nível dele? Ele soa fluente? A pronúncia dele é clara? Ele usa as palavras certas?

Por muito tempo, os computadores tentaram fazer isso realizando duas tarefas separadas, mas eram como dois especialistas que não consegravam conversar entre si:

  1. O "Transcritor" (BERT): Este computador ouve, escreve exatamente o que o aluno disse e, então, avalia as palavras. É ótimo para verificar se o aluno usou o vocabulário correto. Mas, se o computador entender uma palavra errado (o que acontece frequentemente com sotaques), toda a nota é prejudicada. Além disso, ele não consegue ouvir como o aluno falou — como, por exemplo, se ele parecia nervoso ou falava em um ritmo estranho.

  2. O "Engenheiro de Som" (wav2vec 2.0): Este computador ignora as palavras completamente. Ele apenas ouve as ondas sonoras. É incrível para perceber se o aluno está falando de forma fluida, se o seu sotaque é claro e se ele está fazendo pausas demais. Mas ele não entende realmente o que o aluno está dizendo. Pode achar que um aluno é excelente apenas porque falou com fluência, mesmo que estivesse dizendo algo sem sentido.

A Solução da Equipe NTNU: O "Superprofessor"

A equipe da Universidade Normal Nacional de Taiwan (NTNU) percebeu que, para obter uma nota perfeita, você precisa de ambos, o Transcritor e o Engenheiro de Som, trabalhando juntos. Eles construíram um sistema para o "Speak & Improve Challenge 2025" (uma grande competição de IA para avaliar a fala) que atua como um Superprofessor.

Veja como o sistema deles funciona, usando uma analogia simples:

1. Os Dois Avaliadores
Eles construíram dois "avaliadores de IA" distintos que ouvem a mesma gravação do aluno ao mesmo tempo:

  • Avaliador A (O Especialista em Som): Usa um modelo chamado wav2vec 2.0. Ele foca inteiramente na música da fala — o ritmo, a pronúncia e o fluxo.
  • Avaliador B (O Especialista em Significado): Usa uma IA massiva e inteligente chamada Phi-4. Este é um "Modelo de Linguagem Grande Multimodal". É como um tutor superinteligente que pode ler o texto e ouvir a voz ao mesmo tempo. Ele entende o significado, a gramática e o contexto da história que o aluno está contando.

2. A "Fusão de Notas" (A Decisão Final)
Em vez de deixar uma única IA tomar a decisão final, eles combinaram as duas. Imagine um painel de juízes onde um juiz vota na "Fluência" e o outro vota no "Conteúdo".

  • Eles não apenas tiraram a média das notas cegamente. Eles usaram uma estratégia inteligente chamada Fusão de Notas (Score Fusion).
  • Eles observaram diferentes "níveis" de inglês (do iniciante ao avançado). Para cada nível, eles determinaram exatamente quanto peso dar ao Especialista em Som versus o Especialista em Significado para obter o resultado mais preciso.
  • É como dizer: "Para um iniciante, vamos confiar um pouco mais no Especialista em Som. Para um aluno avançado, vamos confiar mais no Especialista em Significado."

O Resultado: Segundo Lugar!

Quando testaram este sistema "Superprofessor" contra o conjunto de testes oficial:

  • O Jeito Antigo (Baseline): Cometeu um erro de cerca de 0,44 pontos em média.
  • O Especialista em Som Sozinho: Cometeu um erro de 0,39.
  • O Especialista em Significado Sozinho: Cometeu um erro de 0,39.
  • O Superprofessor da NTNU (Combinado): Cometeu um erro de apenas 0,375.

Essa pequena melhoria foi suficiente para garantir o 2º lugar em toda a competição, superando muitos outros pesquisadores de alto nível. A única equipe que fez um pouco melhor (1º lugar) teve uma pontuação de 0,364.

Por Que Isso Importa (De Acordo com o Artigo)

O artigo afirma que isso prova que você não pode confiar em apenas um tipo de IA.

  • Se você olhar apenas para as palavras, você perde o sentimento da fala.
  • Se você apenas ouvir os sons, você perde o significado.
  • Ao combinar um "Especialista em Som" especializado com um "Tutor Superinteligente" e deixá-los votar juntos, você obtém uma nota muito mais justa e precisa.

A equipe também descobriu que ter um "Tutor" específico para cada tipo específico de questão de teste (como uma entrevista versus uma apresentação) funcionou melhor do que ter um único "Tutor" tentando responder a tudo de uma vez.

Em resumo, para avaliar um humano falando, você precisa de um computador que consiga ouvir a música e entender a letra, trabalhando juntos como uma equipe.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →