UCSC NLP at SemEval-2026 Task 10: Boundary-Aware Span Extraction and RoBERTa Classification for Conspiracy Detection
UCSC NLP 팀의 SemEval-2026 Task 10 (PsyCoMark) 시스템은 음성적 표식과 문서를 탐지하기 위해 하드 네거티브 샘플링을 결합한 경계 인식 스팬 추출과 RoBERTa 기반 분류를 채택하여 각각 7위와 11위의 순위를 달성하였으며, 엔티티와 유사한 역할에 대한 강력한 탐지와 추상적 역할 경계에 대한 민감성을 동시에 강조하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 마치 미스터리를 풀려는 탐정이라고 상상해 보세요. 하지만 당신은 지문을 찾는 대신, 어떤 이야기가 음모론처럼 느껴지게 만드는 특정한 '재료'들을 찾고 있습니다. 이 논문은 UC 산타크루즈(UC Santa Cruz) 팀이 SemEval-2026이라는 경진 대회를 위해 정확히 그 일을 수행하는 컴퓨터 프로그램을 어떻게 구축했는지 설명합니다.
다음은 이들의 연구 내용을 쉬운 비유를 사용하여 정리한 내용입니다.
두 가지 주요 임무
이 경진 대회에는 두 가지 뚜렷한 과제가 있었으며, 팀은 두 개의 별도 '탐정 요원'(AI 모델)을 사용하여 이 과제들을 해결했습니다.
1. 재료 사냥꾼 (Subtask 1)
- 목표: 문장에서 음모론 이야기에서 역할을 하는 특정 부분들을 찾아내는 것입니다. 역할은 다음과 같습니다:
- 행위자 (The Actor): 나쁜 짓을 하고 있는 사람은 누구인가?
- 피해자 (The Victim): 피해를 입는 사람은 누구인가?
- 행동 (The Action): 나쁜 짓이 무엇인가?
- 증거 (The Evidence): 어떤 '증거'가 제시되고 있는가?
- 효과 (The Effect): 무서운 결과는 무엇인가?
- 도전 과제: 단순히 "Jeffrey"라는 단어를 찾는 것만으로는 부족합니다. 컴퓨터는 문장이 정확히 어디에서 시작해서 어디에서 끝나는지 알아야 합니다. 예를 들어, "행동"이 단지 "비밀을 누설했다(spilled the beans)"인지, 아니면 "모사드 작전에 대한 비밀을 누설했다(spilled the beans on the Mossad operation)"라는 구절 전체인지 알아야 합니다.
- 기술: 팀은 컴퓨터에게 '경계 완벽주의자'가 되도록 가르쳤습니다. 그들은 컴퓨터에게 이렇게 말했습니다: "만약 네가 구절의 시작이나 끝을 아주 조금이라도 틀리게 맞춘다면, 그것은 점수로 인정되지 않는다." 또한 **하드 네거티브 마이닝(Hard-Negative Mining)**이라는 기법을 사용했습니다. 이것은 마치 선생님이 학생에게 고양이 사진을 보여주며 "저건 고양이야"라고 말한 뒤, 고양이처럼 보이는 매우 털이 많은 강아지 사진을 보여주며 "저것은 고양이가 아니야"라고 말하는 것과 같습니다. 이를 통해 학생은 미세한 차이를 배울 수 있습니다. 컴퓨터는 실제 음모론의 표식과, 음모론처럼 보이지만 실제로는 아닌 구절 사이의 미세한 차이를 식별하는 법을 배웠습니다.
2. 이야기 판사 (Subtask 2)
- 목표: 문서 전체를 읽고 결정합니다: 이것은 음모론인가? 확실히 음모론이 아닌가? 아니면 판단할 수 없는가?
- 기술: 이 모델은 첫 번째 탐정이 찾아낸 특정 재료들을 보지 않았습니다. 대신, 인간 독자처럼 전체 이야기를 읽으며 전반적인 '분위기'나 어조를 살폈습니다. 이 모델은 비판적인 뉴스 보도(행위자와 피해자를 언급할 수는 있지만 음모론은 아닌 경우)와 실제 음모론적 서사(동일한 역할들을 사용하지만 의심스럽고 비밀스러운 어조를 사용하는 경우)를 구분하는 법을 배웠습니다.
어떻게 수행했는가
팀은 RoBERTa라는 강력한 AI 두뇌를 사용했습니다. 이것을 인터넷의 거의 모든 것을 읽었으며 단어들이 어떻게 연결되는지 이해하는 매우 박식한 사서라고 생각하면 됩니다.
- 재료 사냥꾼을 위해: 그들은 단순히 사서에게 단어 하나하나에 라벨을 붙이라고 요청하지 않았습니다. 대신, 사서에게 가능한 모든 텍스트 덩어리(최대 32단어 길이)를 살펴보고, "이 덩어리가 '증거'의 정의에 부합하는가?"라고 묻도록 했습니다. 그들은 사서가 이 덩어리들의 시작과 끝 지점에 대해 극도로 까다로워지도록 훈련시켰습니다.
- 이야기 판사를 위해: 그들은 사서에게 전체 이야기를 입력하고, "예", "아니오", 또는 "모름" 중 하나로 결론을 내리라고 요청했습니다.
결과
팀이 공식 경진 대회에 그들의 탐정들을 투입했을 때의 결과는 다음과 같습니다:
- 재료 사냥꾼은 모든 팀 중 7위를 차지했습니다. 이 모델은 "행위자"나 "피해자"(사람의 이름 등)를 찾는 데 매우 뛰어났지만, 구절의 경계가 모호한 "행동"이나 "효과"와 같은 더 추상적인 부분에서는 때때로 어려움을 겪었습니다.
- 이야기 판사는 12위를 차지했습니다. 이 모델은 음모론 이야기와 일반적인 뉴스 이야기를 구분하는 데 꽤 능숙했습니다.
무엇을 배웠는가 (아하! 모먼트)
- 정밀함은 어렵다: 컴퓨터가 저지른 가장 큰 실수는 구절의 시작과 끝을 약간 틀리는 것이었습니다. 만약 "증거"가 "report"라는 단어였다면, 컴퓨터는 가끔 "a report"나 "according to a report"라고 추측했습니다. 경진 대회의 규칙은 엄격했습니다: 정확한 단어를 맞추지 못하면 0점을 받았습니다.
- 두 명의 머리가 따로 있을 때 더 낫다: 팀은 두 탐정이 작업하는 동안 서로 대화하지 않기로 결정했습니다. 그들은 "만약 첫 번째 탐정이 실수를 한다면, 두 번째 탐사가 그 실수 때문에 혼란을 겪지 않기를 바란다"라고 생각했습니다. 그들은 두 모델을 분리하여 유지했고, 마지막에만 답변을 결합했습니다.
- "판단 불가" 문제: 경진 대회에는 "판단할 수 없음"이라는 세 번째 옵션이 있었습니다. 그러나 최종 채점 규칙에서는 이 카테고리를 무시했습니다. 이는 테스트 당일의 컴퓨터 성능이 연습 기간 동안의 성능과 다르게 보이게 만들었는데, 이는 결승선에서 규칙이 약간 변경되었기 때문입니다.
요약
UC 산타크루스 팀은 매우 정밀한 편집자이자 예리한 관찰자 역할을 하는 시스템을 구축했습니다. 그들은 컴퓨터가 음모론의 재료를 포착하는 데 점점 더 능숙해지고 있지만, 그 재료들의 정확한 경계를 찾는 데는 여전히 어려움을 겪고 있다는 것을 보여주었습니다. 그러나 그들은 이야기가 음모론인지 아닌지를 결정하기 위해 이야기의 전반적인 분위기를 감지하는 데는 꽤 유능합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.