← Últimos artigos
💬 NLP

Malaysian English News Decoded: A Linguistic Resource for Named Entity and Relation Extraction

Este artigo apresenta o conjunto de dados Malaysian English News (MEN), um recurso anotado manualmente contendo 6.061 entidades e 3.268 relações de 20 artigos de notícias, o qual aborda a falta de dados adaptados para o inglês malaio e melhora significativamente o desempenho do Reconhecimento de Entidades Nomeadas quando utilizado para o ajuste fino de modelos de PLN.

Autores originais: Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

Publicado 2026-06-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um bibliotecário muito inteligente e culto chamado SpaCy. Este bibliotecário passou anos lendo milhões de livros escritos em "Inglês Padrão" (o tipo que você encontra em livros didáticos britânicos ou americanos). Por causa disso, o SpaCy é excelente em encontrar nomes de pessoas, lugares e organizações nesses livros padrão.

No entanto, os pesquisadores neste artigo descobriram um problema: o SpaCy fica confuso ao ler o "Inglês Malaio".

O Problema: A Confusão do "Sabor Local"

O Inglês Malaio é como um ensopado delicioso e único. Ele é feito com a base do Inglês Padrão, mas é temperado com ingredientes locais das culturas malaia, chinesa e tâmil. Possui palavras especiais (como nasi lemak ou ang pow) e estruturas de frases únicas.

Quando os pesquisadores pediram ao SpaCy para ler artigos de notícias da Malásia, ele teve dificuldades. Foi como pedir a um bibliotecário que só sabe organizar livros de biblioteca para organizar uma coleção de receitas de comida de rua. O bibliotecário continuava perdendo os ingredientes importantes.

Em um teste com apenas 30 frases, o SpaCy e outras ferramentas semelhantes acertaram apenas cerca de 58% dos nomes e lugares. Eles perderam títulos locais (por exemplo, Datuk ou Tan Sri) e organizações específicas da Malásia. Os pesquisadores perceberam que ninguém jamais havia construído um "manual de treinamento" especificamente para o Inglês Malaio, então a IA tinha que adivinhar, e estava adivinhando errado.

A Solução: Construindo um Manual de Treinamento Personalizado

Para corrigir isso, a equipe decidiu construir seu próprio "manual de treinamento", que eles chamam de MEN Dataset (Conjunto de Dados de Notícias em Inglês Malaio).

Pense neste processo como treinar um novo aprendiz:

  1. Coleta de Material: Eles coletaram 14.320 artigos de notícias de grandes sites de notícias da Malásia.
  2. O Toque Humano: Eles não usaram apenas um computador para classificá-los. Eles contrataram quatro especialistas humanos que são fluentes tanto no Inglês Malaio quanto na língua local (Bahasa Malaysia).
  3. A Anotação: Esses humanos leram 200 artigos e destacaram manualmente cada pessoa, lugar, organização e relação entre eles. Eles até criaram categorias especiais para coisas locais, como TITLE (para títulos reais ou honoríficos) e ROLE (para cargos específicos comuns na Malásia).
  4. Controle de Qualidade: Para garantir que os humanos concordassem entre si, eles verificaram o trabalho uns dos outros. Quando discordavam, um especialista sênior atuava como árbitro para dar a decisão final.

O resultado? Um conjunto de dados massivo e de alta qualidade contendo 6.061 entidades nomeadas e 3.268 relações (como "Pessoa X trabalha para Organização Y").

O Experimento: Ensinando ao Bibliotecário um Novo Truque

Assim que tiveram esse manual personalizado, voltaram ao bibliotecário (SpaCy) e dissemos: "Aqui, leia este manual e aprenda a identificar nomes malaios."

Eles pegaram o modelo padrão do SpaCy e o ajustaram (fine-tuned) usando seu novo conjunto de dados malaio. É como dar ao bibliotecário um curso intensivo de cultura malaia antes de pedir que ele organize as receitas novamente.

Os Resultados: Uma Melhoria Dramática

A diferença foi do dia para a noite:

  • Antes do treinamento: O modelo padrão era como um turista tentando navegar em um mercado local; ele se perdia e perdia a maioria das barracas.
  • Após o treinamento: O modelo ajustado tornou-se um especialista local.
    • Os pesquisadores descobriram que treinar um modelo do zero usando seus novos dados (spacy-blank) alcançou uma pontuação de precisão de 94%.
    • Mesmo os modelos que já eram inteligentes, mas que foram apenas "atualizados" com os novos dados, melhoraram seu desempenho em mais de 200% em comparação com suas tentativas anteriores.

A Conclusão

O artigo conclui que você não pode simplesmente pegar uma ferramenta construída para o Inglês Padrão e esperar que ela funcione perfeitamente no Inglês Malaio. Assim como você não usaria um mapa de Londres para navegar em Kuala Lumpur, você precisa de um mapa (conjunto de dados) construído especificamente para o terreno.

Ao criar este MEN Dataset e mostrar como ele melhora dramaticamente o desempenho da IA, os pesquisadores entregaram à comunidade de PLN (Processamento de Linguagem Natural) uma nova e essencial ferramenta. Eles publicaram este conjunto de dados e as regras que usaram para criá-lo no GitHub, para que outros pesquisadores possam usá-lo para construir uma IA melhor que realmente entenda a voz da Malásia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →