← Ultimi articoli
💬 NLP

mdok-style at SemEval-2026 Task 10: Finetuning LLMs for Conspiracy Detection

Il documento presenta il sistema in stile mdok, che ottiene risultati competitivi (8° su 52) nella sfida di rilevamento delle cospirazioni di SemEval-2026 Task 10, affinando il modello Qwen3-32B con aumento dei dati e auto-addestramento per affrontare la limitatezza dei dati di addestramento.

Autori originali: Dominik Macko

Pubblicato 2026-05-06
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Dominik Macko

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover individuare un tipo specifico di voce di corridoio in una folla enorme e rumorosa di persone che chiacchierano su una piattaforma di social media (Reddit). Alcune persone stanno semplicemente condividendo fatti, mentre altre stanno diffondendo teorie del complotto selvagge. Il tuo compito è costruire un detective robotico in grado di ascoltare un singolo commento e gridare: "Sì, è una teoria del complotto!" oppure "No, è solo una conversazione normale".

Questo articolo descrive come il team mdok-style ha costruito il proprio detective robotico per una competizione chiamata SemEval-2026 Task 10. Ecco come hanno fatto, spiegato in modo semplice:

1. Il Problema: Una Piccola Biblioteca per un Cervello Gigante

Il team aveva un grosso problema: possedevano un robot molto intelligente (un Large Language Model chiamato Qwen3-32B, che è come un super-cervello con 32 miliardi di "neuroni"), ma avevano solo una minuscola biblioteca di libri di addestramento (circa 4.000 esempi di commenti).

Di solito, insegnare a un super-cervello richiede una biblioteca enorme. Con così pochi esempi, il robot potrebbe confondersi o "pensare troppo". È come cercare di insegnare a uno chef maestro a cucinare un piatto complesso usando solo tre ricette.

2. La Soluzione: La "Macchina Magica di Copia" e il Ciclo "Studente-Insegnante"

Per risolvere il problema della biblioteca ridotta, il team ha utilizzato due trucchi intelligenti presi in prestito dal loro lavoro precedente sulla rilevazione di testi generati dall'IA.

Trucco A: La Macchina Magica di Copia (Data Augmentation)
Invece di limitarsi a copiare i commenti esistenti, hanno usato una "macchina magica di copia" per creare versioni leggermente diverse delle stesse storie. Non si sono limitati al copia-incolla; hanno:

  • Cambiato il caso: Hanno scritto alcuni commenti in MAIUSCOLO e altri in tutto minuscolo. Hanno capito che una teoria del complotto rimane una teoria del complotto sia che venga urlata che sussurrata.
  • Nascosto le identità: Hanno sostituito nomi specifici, indirizzi email e numeri di telefono con etichette generiche come [USER] o [PHONE]. Questo ha insegnato al robot a concentrarsi sull'idea del complotto, non su persone specifiche.
  • Scambiato le lettere: Hanno sostituito alcune lettere con caratteri simili di altri alfabeti (come scambiare una 'a' con una 'alpha' greca). È come indossare un travestimento. Addestrando il robot a vedere attraverso questi travestimenti, hanno reso molto più difficile per il robot essere ingannato da trucchi visivi in seguito.

Non hanno usato tutte queste copie, solo una piccola fetta (il 10%) di esse, per mantenere l'addestramento equilibrato.

Trucco B: Il Ciclo Studente-Insegnante (Self-Training)
Questa è la parte più creativa. Poiché non disponevano di etichette per i dati di test (le domande dell'esame finale), hanno lasciato che il robot si insegnasse da solo.

  1. L'Insegnante: Per prima cosa, hanno addestrato il robot sulla piccola biblioteca nota.
  2. L'Esame: Hanno chiesto al robot di indovinare le risposte per i commenti di test sconosciuti.
  3. Il Filtro: Il robot era molto sicuro di alcune risposte (ad esempio: "Sono al 99% sicuro che questa sia una teoria del complotto"). Il team ha preso solo quegli indovinamenti super-sicuri e li ha trattati come nuovi dati di addestramento "gold standard".
  4. La Ripetizione: Hanno reimmesso questi nuovi esempi "gold" al robot e lo hanno insegnato di nuovo. È come uno studente che sostiene un test di pratica, mantiene solo le domande che ha risposto correttamente al 100%, e poi le studia di nuovo per diventare ancora più intelligente.

3. Il Risultato: Un Detective di Livello Superiore

Il team ha iscritto il proprio robot alla competizione.

  • Il Punteggio: Il loro robot ha ottenuto un punteggio di 0,78 (su una scala in cui 1,0 è perfetto).
  • La Classifica: Su 52 squadre, si sono classificati . Questo li colloca nel top 20% (l'85° percentile).

Interessante notare che hanno scoperto che anche un robot molto più piccolo e semplice (un modello chiamato DeBERTa) ha ottenuto risultati quasi pari al loro super-cervello gigante. Questo suggerisce che, sebbene i loro sofisticati trucchi della "macchina magica di copia" e dell'"auto-insegnamento" abbiano funzionato benissimo, a volte uno strumento più piccolo ed economico può svolgere il compito quasi altrettanto efficacemente.

Riassunto

Il team ha preso un modello di IA massiccio e potente e lo ha insegnato a individuare teorie del complotto nei commenti dei social media. Poiché non disponevano di dati sufficienti, hanno utilizzato travestimenti (cambiando i formati del testo) per creare più materiale di pratica e hanno lasciato che l'IA si insegnasse da sola utilizzando le proprie ipotesi sicure. Il risultato è stato un sistema altamente competitivo che si è classificato 8° su 52, dimostrando che tecniche originariamente progettate per rilevare testi generati dall'IA possono essere utilizzate anche per individuare teorie del complotto create dall'uomo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →