UCSC NLP at SemEval-2026 Task 10: Boundary-Aware Span Extraction and RoBERTa Classification for Conspiracy Detection
Los sistemas del equipo de NLP de la UCSC para la Tarea 10 de SemEval-2026 (PsyCoMark) emplean la extracción de fragmentos con conciencia de límites mediante el muestreo de negativos difíciles y la clasificación basada en RoBERTa para detectar marcadores y documentos de conspiración, logrando los puestos 7 y 11 respectivamente, al tiempo que destacan la detección robusta de roles de tipo entidad frente a la sensibilidad en los límites de roles abstractos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un detective tratando de resolver un misterio, pero en lugar de buscar huellas dactilares, estás buscando los "ingredientes" específicos que hacen que una historia parezca una teoría de conspiración. Este documento describe cómo un equipo de la Universidad de California en Santa Cruz construyó un programa informático para hacer exactamente eso para una competición llamada SemEval-2026.
Aquí está el desglose de su trabajo, utilizando analogías sencillas:
Los dos trabajos principales
La competición tenía dos desafíos distintos, que el equipo abordó con dos "agentes detectives" (modelos de IA) separados.
1. El cazador de ingredientes (Subtarea 1)
- El objetivo: Encontrar partes específicas de una oración que desempeñen un papel en una historia de conspiración. Los roles son:
- El Actor: ¿Quién está haciendo la mala acción?
- La Víctima: ¿Quién está siendo perjudicado?
- La Acción: ¿Qué es lo malo que ocurre?
- La Evidencia: ¿Qué "prueba" se está ofreciendo?
- El Efecto: ¿Cuál es el resultado aterrador?
- El desafío: No basta con encontrar la palabra "Jeffrey". La computadora tiene que saber exactamente dónde empieza y dónde termina la frase. Por ejemplo, ¿es la "Acción" solo "soltó la lengua" o es toda la frase "soltó la lengua sobre la operación de la Mossad"?
- El truco: El equipo enseñó a la computadora a ser una "perfeccionista de los límites". Le dijeron: "Si adivinas el inicio o el final de la frase aunque sea ligeramente mal, no cuenta". También utilizaron una técnica llamada Minería de Negativos Difíciles (Hard-Negative Mining). Imagina a un profesor mostrándole a un estudiante la foto de un gato y diciéndole: "Eso es un gato". Luego, le muestran la foto de un perro muy peludo que se parece a un gato y le dicen: "Esto no es un gato". Esto ayuda al estudiante a aprender la fina línea entre ambos. La computadora aprendió a distinguir entre un verdadero marcador de conspiración y una frase que casi parece uno, pero que no lo es del todo.
2. El juez de historias (Subtarea 2)
- El objetivo: Leer el documento completo y decidir: ¿Es esto una teoría de conspiración? ¿Definitivamente no lo es? ¿O es imposible saberlo?
- El truco: Este modelo no buscaba los ingredientes específicos encontrados por el primer detective. En su lugar, leía toda la historia como un lector humano, buscando el "vibrato" o tono general. Aprendió a distinguir entre un reporte de noticias crítico (que puede mencionar a un actor y a una víctima, pero no es una conspiración) y una narrativa de conspiración real (que utiliza esos mismos roles pero con un tono sospechoso y secreto).
Cómo lo hicieron
El equipo utilizó un cerebro de IA muy potente llamado RoBERTa. Piensa en esto como un bibliotecario muy culto que ha leído casi todo en internet y entiende cómo encajan las palabras.
- Para el Cazador de Ingredientes: No solo le pidieron al bibliotecario que etiquetara las palabras una por una. En su lugar, le pidieron que mirara cada fragmento posible de texto (de hasta 32 palabras) y le preguntaran: "¿Este fragmento encaja con la definición de 'Evidencia'?". Entrenaron al bibliotecario para que fuera extremadamente meticuloso con el inicio y el fin de estos fragmentos.
- Para el Juez de Historias: Le entregaron la historia completa al bibliotecario y le pidieron un veredicto simple: Sí, No o Tal vez.
Los resultados
Cuando el equipo introdujo sus detectives en la competición oficial:
- El Cazador de Ingredientes quedó en el 7º puesto de todos los equipos. Fue muy bueno encontrando al "Actor" y a la "Víctima" (como nombres de personas), pero a veces tuvo dificultades con las partes más abstractas como la "Acción" o el "Efecto", donde los límites de la frase son más difusos.
- El Juez de Historias quedó en el 12º puesto. Fue bastante bueno diferenciando una historia de conspiración de una noticia normal.
Lo que aprendieron (Los momentos "¡Ajá!")
- La precisión es difícil: El error más grande que cometió la computadora fue acertar ligeramente mal el inicio y el fin de una frase. Si la "Evidencia" era la palabra "reporte", la computadora a veces adivinaba "un reporte" o "según un reporte". Las reglas de la competición eran estrictas: si no obtenías las palabras exactas, obtenías cero puntos.
- Dos cabezas piensan mejor que una (por separado): El equipo decidió no dejar que los dos detectives hablaran entre sí mientras trabajaban. Pensaron: "Si el primer detective comete un error, no queremos que el segundo detective se confunda por ese error". Los mantuvieron separados y solo combinaron sus respuestas al final.
- El problema del "No puedo saberlo": La competición tenía una tercera opción llamada "No puedo saberlo". Sin embargo, las reglas finales de puntuación ignoraron esta categoría. Esto significó que el rendimiento de la computadora se vio diferente el día de la prueba en comparación con cómo funcionó durante la práctica, simplemente porque las reglas cambiaron ligeramente en la línea de meta.
En resumen
El equipo de UC Santa Cruz construyó un sistema que actúa como un editor muy preciso y un observador agudo. Demostraron que, si bien las computadoras están mejorando en la detección de los ingredientes de las teorías de conspiración, todavía tienen dificultades con los límites exactos de esos ingredientes. Sin embargo, son bastante buenos detectando el estado de ánimo general de una historia para decidir si es una conspiración o no.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.