← Últimos artigos
💬 NLP

PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation

A equipe PSK alcançou o 2º lugar geral na SemEval-2026 Tarefa 9 com um macro-F1 médio de 0,811 ao empregar um ensemble de modelos Gemma 3 ajustados com LoRA e aumentados com dados sintéticos gerados pelo GPT-4o-mini e ajuste de limiar por idioma, ao mesmo tempo em que demonstrou a importância crítica da generalização em relação a arquiteturas que se saíram bem em conjuntos de desenvolvimento, mas falharam no conjunto de teste.

Autores originais: Srikar Kashyap Pulipaka

Publicado 2026-05-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Srikar Kashyap Pulipaka

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um grupo de 22 alunos diferentes (representando 22 idiomas distintos) a identificar uma "discussão acalorada" versus uma "conversa calma" em publicações de redes sociais. Este foi o desafio da SemEval-2026 Task 9, e a equipe PSK (liderada pelo pesquisador independente Srikar Kashyap Pulipaka) construiu um sistema para resolvê-lo.

Veja como eles fizeram isso, explicado de forma simples:

1. O Objetivo: Identificar o "Calor"

A tarefa era ler publicações de redes sociais em 22 idiomas (do inglês ao amárico) e decidir: esta publicação é polarizada (cheia de estereótipos, ódio ou intolerância)? Ou é neutra?

  • O Desafio: Alguns idiomas tinham muito poucos exemplos para aprender, e a "polarização" se parece diferente em cada cultura. É como tentar ensinar alguém a reconhecer uma "tempestade" quando essa pessoa só viu chuva em um único país.

2. Os Professores: Os Modelos "Gemma"

Em vez de usar um único professor gigante para todos, a equipe contratou dois "tutores" específicos para cada idioma:

  • O Tutor 12B: Um modelo inteligente e eficiente (12 bilhões de parâmetros).
  • O Tutor 27B: Um modelo ainda mais inteligente e poderoso (27 bilhões de parâmetros).
    Eles usaram uma técnica chamada LoRA, que é como dar a esses tutores uma pequena "cola" especializada para aprender o idioma específico sem precisar reescrever todo o seu cérebro.

3. O Colega de Estudo: Dados Sintéticos

A equipe percebeu que alguns alunos não tinham problemas de prática suficientes. Então, usaram uma IA (GPT-4o-mini) para escrever problemas de prática falsos (dados sintéticos).

  • Geração Direta: A IA escreveu novos argumentos falsos do zero.
  • Parafraseamento: A IA pegou exemplos reais e os reescreveu com palavras diferentes (como um aluno reescrevendo uma pergunta de tarefa de casa).
  • Pares Contrastivos: A IA criou exemplos "gêmeos" — um polarizado e um calmo — para que o modelo pudesse ver a diferença exata.
  • O Filtro: Eles não apenas despejaram esses dados falsos. Submeteram-nos a um filtro rigoroso de "controle de qualidade" para remover duplicatas e nonsense, garantindo que os alunos estudassem apenas material de alta qualidade.

4. A Estratégia: Ajustando o "Botão de Volume"

Após o treinamento, os modelos precisavam tomar uma decisão final. Normalmente, a IA diz "Sim" se tiver mais de 50% de certeza. Mas a equipe descobriu que, para alguns idiomas, 50% era alto demais ou baixo demais.

  • A Correção: Eles trataram o limiar de decisão como um botão de volume. Para alguns idiomas, eles baixaram o botão para 30% (para capturar mais argumentos), e para outros, aumentaram para 70% (para evitar falsos alarmes). Esse ajuste simples melhorou suas pontuações em 2–4% sem nenhum treinamento extra.

5. O "Ensemble": Um Painel de Juízes

Para a decisão final, eles não ouviram apenas um tutor. Usaram um Ensemble:

  • Permitiram que ambos os tutores 12B e 27B votassem.
  • Às vezes, eles fizeram a média dos votos; outras vezes, deram mais peso ao tutor mais inteligente.
  • Para cada idioma, escolheram a estratégia de votação que funcionou melhor nos testes de prática.

6. Os Resultados: Quem Venceu?

  • O Vencedor: A equipe ficou em 2º lugar no geral entre 60 equipes.
  • A Pontuação: Eles alcançaram uma pontuação de 0,811 (uma medida de precisão). Ficaram em 1º lugar em 3 idiomas e no topo-3 em outros 8.
  • A Surpresa: Eles tentaram usar outros modelos de IA famosos (XLM-RoBERTa e Qwen3). Esses modelos se saíram bem nos testes de prática, mas falharam no teste real, perdendo 30–50% de sua precisão.
    • A Lição: É melhor ter um modelo que generaliza bem (aprende o conceito de polarização) do que um que apenas memoriza as respostas de prática. Os modelos Gemma foram os únicos que não "esqueceram" quando o teste começou.

7. A Única Fraqueza: O "Capítulo Faltante" do Italiano

O sistema teve mais dificuldades com o italiano. Por quê?

  • Os dados de treinamento para o italiano estavam faltando categorias inteiras de tópicos (como "política" ou outros problemas).
  • No entanto, o teste final incluía muitas perguntas sobre esses tópicos faltantes.
  • É como estudar para uma prova de matemática apenas em adição, mas o exame final inclui uma grande seção sobre divisão. O modelo nunca tinha visto esses tipos específicos de argumentos antes, então não conseguiu adivinhar corretamente.

Resumo

A equipe construiu um sistema que usa tutores de IA especializados, problemas de prática gerados por IA e regras de decisão personalizadas para identificar argumentos online em 22 idiomas. Seu segredo não foi apenas usar a maior IA, mas usar aquela que realmente podia aprender o conceito de polarização sem memorizar as respostas, e depois ajustar finamente as regras para cada idioma específico.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →