Lingo_Research_Group at SemEval-2026 Task 9: Evaluating Prompt Variants for Polarization Detection
Lingo_Research_Group 논문은 SemEval-2026 Task 9를 위해 Gemma3-27B 모델을 사용하여 12가지 프롬프트 변형을 체계적으로 평가하였으며, 프롬프트 기반 접근 방식이 22개 언어에 걸쳐 조립된 수준의 양극화를 효과적으로 탐지하는 반면, 미세한 수준의 다중 레이블 사회언어학적 분류에서는 점점 더 큰 어려움에 직면한다는 것을 입증하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 전 세계 22개 언어로 일어나는 미스터리를 풀려는 탐정이라고 상상해 보세요. 이 미스터리는 훔쳐간 보석에 관한 것이 아니라, **"양극화(polarization)"**라고 불리는 것에 관한 것입니다. 쉬운 말로 설명하자면, 양극화란 소셜 미디어에서 사람들이 서로에게 소리를 지르고, "우리"와 "그들" 사이에 명확한 선을 그으며 상대방의 말을 듣기를 거부하는 현상을 말합니다.
이 논문의 저자인 Lingo Research Group은 컴퓨터(AI)에게 이러한 싸움을 포착하고, 누구에 대해 싸우고 있는지, 그리고 어떻게 싸우고 있는지를 가르치는 법을 배우기 위해 글로벌 콘테스트(Semeval-2026)에 참여했습니다.
이들이 어떻게 이 일을 해냈는지, 일상적인 비유를 들어 설명하겠습니다.
미스터리의 세 가지 단계
콘테스트에는 비디오 게임처럼 세 가지 난이도의 단계가 있었습니다:
- 1단계 ("현상이 일어나고 있는가?" 확인): AI는 단순히 "예" 또는 "아니오"로 답하면 됩니다. 이 게시물은 화나 있고 분열적인가요, 아니면 그냥 평범한 게시물인가요?
- 비유: 연기 감지기와 같습니다. 단지 "연기가 있는가?"라고 말하기만 하면 됩니다.
- 2단계 ("누구에 대한 것인가?" 확인): 만약 게시물이 양극화되어 있다면, 누구를 두고 싸우고 있는 걸까요? 정치인인가요? 특정 인종인가요? 종교인가요? 성별인가요?
- 비유: 탐정이 "용의자가 누구인가?"라고 묻는 것과 같습니다. AI는 라인업 중에서 한 명 이상의 용의자를 골라내야 합니다.
- 3단계 ("어떻게 싸우고 있는가?" 확인): 이것이 가장 어려운 단계입니다. 증오는 어떤 방식으로 표현되고 있나요? 고정관념을 사용하고 있나요? 사람들에게 이름을 부르며 모욕하고 있나요? 혹은 타인의 감정에 무관심한 태도를 보이고 있나요?
- 비유: 싸움의 스타일을 분석하는 것과 같습니다. 칼을 쓰고 있나요, 둔기를 쓰고 있나요, 아니면 그저 소리를 지르고 있나요? 이는 미묘하고 까다로운 행동을 포착해야 하는 작업입니다.
도구: "프롬프트"는 레시피와 같다
컴퓨터에게 수천 개의 예시를 보여주며 가르치는 대신(이는 학생에게 교과서를 통째로 암기하게 하는 것과 같습니다), 팀은 프롬프트를 사용했습니다. 프롬프트는 매우 유능하지만 글자 그대로만 이해하는 요리사(AI)에게 주는 레시피나 지침 세트라고 생각하면 됩니다.
팀은 12가지의 서로 다른 레시피를 시도했습니다.
- 어떤 레시피는 매우 짧았습니다: "이것은 화가 나 있는가?"
- 어떤 레시피는 매우 상세했습니다: "사람들을 집단으로 나누는 단어를 찾아라. 만약 비꼬는 말투(sarcasm)가 보인다면, 그것이 무례한 것인지 확인하라. 여기 그런 모습이 나타나는 세 가지 예시가 있다..."
그들은 이 레시피들을 두 명의 서로 다른 "요리사"(AI 모델)인 aya-101과 Gemma3-27B에게 테스트했습니다. 그 결과 Gemma3-27B가 더 뛰어난 요리사라는 것을 발견했고, 최종 콘테스트에는 이를 사용했습니다.
결과: 기초에는 강하지만, 미묘함에는 약하다
팀의 결과는 성공과 고전이 섞여 있었으며, 이는 흥미로운 이야기를 들려줍니다:
- 1단계 (연기 감지기): AI는 이 부분에서 매우 뛰어났습니다. 평균적으로 76%의 확률로 양극화된 게시물을 정확히 식별했습니다. 이는 불이 났을 때 거의 놓치지 않는 연기 감지기와 같습니다.
- 2단계 (용의자): 점수가 약 59%로 떨어졌습니다. 정확히 누구를 공격하고 있는지 짚어내는 것이 더 어려웠습니다.
- 3단계 (싸움의 스타일): 점수가 훨씬 더 떨어져 약 44%를 기록했습니다. 이것이 가장 어려운 부분이었습니다.
왜 더 어려워졌을까요?
저자들은 과제가 더 구체적일수록 AI가 혼란을 느낀다고 설명합니다.
- "보수적인 요리사" 문제: AI는 매우 조심스럽도록 훈련되었습니다. 아주 명백한 증거(예: 누군가 욕설을 내뱉는 경우)가 있을 때만 "예, 이것은 양극화되었습니다"라고 말했습니다.
- "비꼬기 함정": 영어에서 사람들은 종종 비꼬기, 아이러니, 또는 영리한 말장난을 사용하여 싸웁니다 (예: "오, 훌륭하군, 예수의 이름으로 사회주의자가 또 나타났네"). 너무 글자 그대로만 받아들이는 AI는 이런 부분을 놓쳤습니다. 직접적인 욕설이 없었기 때문에, AI는 "직접적인 모욕이 없으니 안전한 것이 틀림없다"라고 판단했습니다.
- "직접적 vs 간접적"의 차이: 힌디어나 중국어 같은 많은 다른 언어에서 사람들은 종종 더 직접적으로 논쟁합니다. AI는 이러한 직접적인 타격은 잘 포착했지만, 미묘하고 간접적인 영어식 논쟁에는 어려움을 겪었습니다.
언어의 퍼즐
AI는 모든 언어에서 동일하게 작동하지 않았습니다.
- 네팔어와 중국어는 AI에게 쉬웠는데, 이는 양극화가 매우 명확하고 직접적이었기 때문입니다 (예: "집단 A 대 집단 B").
- 영어는 놀랍게도 어려웠습니다. 영어 사용자들은 비꼬기나 문화적 암시를 많이 사용하기 때문에, AI는 계속해서 싸움을 놓쳤습니다. 이는 언어를 완전히 이해하지 못한 채 농담을 이해하려고 애쓰는 것과 같습니다. 단어는 들리지만, 농담의 핵심(punchline)은 놓치는 것입니다.
핵심 결론
이 논문은 AI가 "시끄러운" 싸움(1단계)은 잘 잡아내지만, "조용하거나" "영리한" 싸움(2단계 및 3단계)에는 어려움을 겪는다고 결론짓습니다.
팀은 단순히 AI에게 간단한 지침을 준다고 해서 다양한 문화권의 복잡한 인간 감정을 이해할 것이라고 기대할 수는 없다는 것을 배웠습니다. AI에게 더 많은 뉘앙스(그 방식과 대상)를 분석하도록 요구할수록, 특히 사람들이 비꼬거나 간접적으로 표현할 때 미묘한 신호들을 놓치는 경향이 있습니다.
요약하자면: AI는 명백한 범죄를 잡는 데는 좋은 탐정이지만, 온라인에서 사람들이 논쟁하는 미묘하고 까다로우며 비꼬는 방식을 이해하기 위해서는 더 많은 훈련이 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.