← Últimos artigos
💬 NLP

Binary Token-Level Classification with DeBERTa for All-Type MWE Identification: A Lightweight Approach with Linguistic Enhancement

Este artigo apresenta um modelo DeBERTa-v3-large leve e linguisticamente aprimorado que reformula a identificação de expressões multi-palavras como uma classificação binária ao nível de token, alcançando o estado da arte nos conjuntos de dados CoAM e STREUSLE enquanto utiliza 165 vezes menos parâmetros do que os principais grandes modelos de linguagem.

Autores originais: Diego Rossini, Lonneke van der Plas

Publicado 2026-01-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Diego Rossini, Lonneke van der Plas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando encontrar frases específicas em um livro, como "kick the bucket" ou "look up the information". Às vezes, essas frases estão grudadas, mas outras vezes, outras palavras ficam no meio delas, como "look the information up". Encontrar essas "Expressões de Múltiplas Palavras" (MWEs) é como jogar um jogo de "Onde está o Wally?" onde o Wally pode estar escondido à vista de todos ou dividido em duas partes com uma multidão entre elas.

Por muito tempo, os computadores tiveram dificuldade com isso. Eles ou perdiam as frases divididas ou ficavam confusos com os milhões de parâmetros em modelos gigantes e cerebrais (como o Qwen-72B) que tentavam memorizar tudo, mas ainda assim não acertavam o alvo.

Aqui está como os autores deste artigo resolveram o problema usando uma abordagem "leve":

1. Mudando o Jogo: De "Adivinhar o Todo" para "Identificar as Bordas"

Tradicionalmente, os computadores tentavam adivinhar a frase inteira de uma só vez, como tentar adivinhar uma frase inteira antes mesmo de ter lido a primeira palavra. Isso é difícil e lento.

Os autores mudaram as regras. Em vez de adivinhar a frase inteira, eles ensinaram seu modelo a responder a três simples perguntas de "Sim/Não" para cada palavra em uma frase:

  • Esta é o INÍCIO de uma frase?
  • Esta é o FIM de uma frase?
  • Esta palavra está DENTRO de uma frase?

Pense nisso como construir uma cerca. Em vez de tentar desenhar a cerca inteira de uma vez, você apenas coloca um poste de "Início", um poste de "Fim" e preenche com os postes de "Dentro". Isso torna o trabalho muito mais rápido e fácil para o computador aprender.

2. Dando ao Computador um "Mapa Gramatical"

Mesamente com as novas regras do jogo, o computador ainda precisava de ajuda para identificar as frases complicadas e divididas. Os autores deram ao modelo uma "folha de cola" baseada na gramática humana:

  • Fragmentação de Sintagmas Nominais (Noun Phrase Chunking): Eles disseram ao modelo: "Ei, se estas palavras estiverem agrupadas como um substantivo (como 'mercado de ações'), preste atenção extra".
  • Caminhos de Dependência (Dependency Paths): Eles deram ao modelo um mapa de como as palavras se conectam entre si. Se duas palavras estão longe uma da outra na frase, mas são gramaticalmente conectadas (como "look" e "up" em "look the info up"), o modelo sabe que deve tratá-las como uma equipe, mesmo que outras palavras estejam no meio.

3. Equilibrando a Classe de Treinamento

Os dados que eles usaram estavam desequilibrados. Era como ter uma sala de aula com 100 alunos que são muito bons em matemática, mas apenas 5 que são bons em artes. O computador continuava ignorando os alunos de "artes" (as frases raras e complicadas).

Para corrigir isso, os autores usaram oversampling (sobreamostragem). Eles pegaram os exemplos raros e os mostraram ao computador com mais frequência, como dar a esses 5 alunos de artes um tempo extra de prática para que o computador também aprenda a reconhecê-los.

Os Resultados: Pequenos e Poderosos

Os autores testaram seu novo método (usando um modelo chamado DeBERTa-v3-large) contra o gigante "Qwen-72B".

  • O Gigante: O Qwen-72B é enorme (bilhões de parâmetros) e obteve uma pontuação de 57,8%.
  • O Leve: O novo modelo deles é 165 vezes menor, mas obteve uma pontuação de 69,8%.

É como um detetive ágil e bem treinado resolvendo um caso mais rápido e com mais precisão do que um robô gigante e lento que está tentando memorizar toda a biblioteca.

Por Que Isso Importa

O artigo mostra que você não precisa de um supercomputador massivo e faminto por energia para entender estruturas de linguagem complexas. Ao usar truques inteligentes (como o jogo "Início/Fim/Dentro") e dar um pouco de ajuda com regras gramaticais, um modelo menor e mais eficiente pode, na verdade, superar os gigantes.

Eles também testaram isso em um conjunto de dados diferente (STREUSLE) e obtiveram resultados excelentes semelhantes, provando que o método deles não é apenas um golpe de sorte em um teste específico, mas uma forma sólida de encontrar essas frases ocultas em textos em inglês.

Em resumo: Eles encontraram uma maneira mais inteligente, rápida e menor de ensinar computadores a identificar frases complexas, mesmo quando essas frases são interrompidas por outras palavras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →