← Últimos artigos
💬 NLP

UCSC NLP at SemEval-2026 Task 10: Boundary-Aware Span Extraction and RoBERTa Classification for Conspiracy Detection

Os sistemas da equipe de PLN da UCSC para a Tarefa 10 do SemEval-2026 (PsyCoMark) empregam extração de spans sensível a limites com amostragem de falsos positivos (hard-negative sampling) e classificação baseada em RoBERTa para detectar marcadores e documentos de conspiração, alcançando o 7º e o 11º lugares respectivamente, ao mesmo tempo em que destacam a detecção robusta de papéis do tipo entidade versus a sensibilidade em limites de papéis abstratos.

Autores originais: Dom Marhoefer, Milos Suvakovic, Glenn Grant-Richards, Aidan Pinero, Ryan King

Publicado 2026-07-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Dom Marhoefer, Milos Suvakovic, Glenn Grant-Richards, Aidan Pinero, Ryan King

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando resolver um mistério, mas em vez de procurar por impressões digitais, você está procurando pelos "ingredientes" específicos que fazem uma história parecer uma teoria da conspiração. Este artigo descreve como uma equipe da UC Santa Cruz construiu um programa de computador para fazer exatamente isso para uma competição chamada SemEval-2026.

Aqui está o detalhamento do trabalho deles, usando analogias simples:

Os Dois Trabalhos Principais

A competição tinha dois desafios distintos, os quais a equipe abordou com dois "agentes detetives" (modelos de IA) separados.

1. O Caçador de Ingredientes (Subtarefa 1)

  • O Objetivo: Encontrar partes específicas de uma frase que desempenham um papel em uma história de conspiração. Os papéis são:
    • O Ator: Quem está fazendo a coisa ruim?
    • A Vítima: Quem está sendo prejudicado?
    • A Ação: Qual é a coisa ruim?
    • A Evidência: Que "prova" está sendo oferecida?
    • O Efeito: Qual é o resultado assustador?
  • O Desafio: Não basta apenas encontrar a palavra "Jeffrey". O computador tem que saber exatamente onde a frase começa e termina. Por exemplo, a "Ação" é apenas "contou o segredo" ou é toda a frase "contou o segredo sobre a operação da Mossad"?
  • O Truque: A equipe ensinou o computador a ser um "perfeccionista de limites". Eles disseram a ele: "Se você errar o início ou o fim da frase, mesmo que seja ligeiramente, não conta". Eles também usaram uma técnica chamada Mineração de Negativos Difíceis (Hard-Negative Mining). Imagine um professor mostrando a um aluno a foto de um gato e dizendo: "Isso é um gato". Então, eles mostram a foto de um cachorro muito peludo que se parece com um gato e dizem: "Isso não é um gato". Isso ajuda o aluno a aprender a linha tênue entre os dois. O computador aprendeu a distinguir entre um marcador real de conspiração e uma frase que quase parece uma, mas não é exatamente aquilo.

2. O Juiz da História (Subtarefa 2)

  • O Objetivo: Ler o documento inteiro e decidir: Isso é uma teoria da conspiração? É definitivamente não? Ou é impossível dizer?
  • O Truque: Este modelo não olhou para os ingredientes específicos encontrados pelo primeiro detetive. Em vez disso, ele leu a história inteira como um leitor humano, procurando pela "vibe" ou tom geral. Ele aprendeu a distinguir entre um relatório de notícias crítico (que pode mencionar um ator e uma vítima, mas não é uma conspiração) e uma narrativa de conspiração real (que usa esses mesmos papéis, mas com um tom suspeito e secreto).

Como Eles Fizeram Isso

A equipe usou um cérebro de IA poderoso chamado RoBERTa. Pense nisso como um bibliotecário muito bem informado que leu quase tudo na internet e entende como as palavras se encaixam.

  • Para o Caçador de Ingredientes: Eles não apenas pediram ao bibliotecário para rotular as palavras uma por uma. Em vez disso, pediram ao bibliotecário para olhar para cada pedaço possível de texto (de até 32 palavras) e perguntar: "Este pedaço se encaixa na definição de 'Evidência'?" Eles treinaram o bibliotecário para ser extremamente exigente com o início e o fim das datas desses pedaços.
  • Para o Juiz da História: Eles alimentaram o bibliotecário com a história inteira e pediram um veredito simples: Sim, Não ou Talvez.

Os Resultados

Quando a equipe colocou seus detetives na competição oficial:

  • O Caçador de Ingredientes ficou em 7º lugar entre todas as equipes. Foi muito bom em encontrar o "Ator" e a "Vítima" (como nomes de pessoas), mas às vezes teve dificuldades com as partes mais abstratas como "Ação" ou "Efeito", onde os limites da frase são mais nebulosos.
  • O Juiz da História ficou em 12º lugar. Foi bastante bom em dizer a diferença entre uma história de conspiração e uma notícia comum.

O Que Eles Aprenderam (Os Momentos "Aha!")

  • Precisão é Difícil: O maior erro que o computador cometeu foi errar ligeiramente o início e o fim de uma frase. Se a "Evidência" era a palavra "relatório", o computador às vezes adivinhava "um relatório" ou "de acordo com um relatório". As regras da competição eram rigorosas: se você não pegasse as palavras exatas, ganhava zero pontos.
  • Duas Cabeças são Melhores que Uma (Separadamente): A equipe decidiu não deixar os dois detetives conversarem entre si enquanto trabalhavam. Eles pensaram: "Se o primeiro detetive cometer um erro, não queremos que o segundo detetive fique confuso por esse erro". Eles os mantiveram separados e só combinaram suas respostas no final.
  • O Problema do "Não Sei Dizer": A competição tinha uma terceira opção chamada "Não sei dizer". No entanto, as regras finais de pontuação ignoraram essa categoria. Isso significou que o desempenho do computador pareceu diferente no dia do teste em comparação com o seu desempenho durante a prática, simplesmente porque as regras mudaram ligeiramente na linha de chegada.

Em Resumo

A equipe da UC Santa Cruz construiu um sistema que atua como um editor muito preciso e um observador atento. Eles mostraram que, embora os computadores estejam ficando melhores em detectar os ingredientes de teorias da conspiração, eles ainda têm dificuldades com os limites exatos desses ingredientes. No entanto, eles são bastante bons em sentir o humor geral de uma história para decidir se é uma conspiração ou não.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →