PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation
PSK 팀은 개발 세트에서는 잘 작동했으나 테스트 세트에서는 실패한 아키텍처보다 일반화의 중요성을 입증하면서, GPT-4o-mini 가 생성한 합성 데이터와 언어별 임계값 조정을 통해 증강된 LoRA 미세조정 Gemma 3 모델의 앙상블을 활용하여 SemEval-2026 태스크 9 에서 평균 매크로-F1 점수 0.811 로 전체 2 위를 달성했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
22 명의 서로 다른 학생 (22 가지 서로 다른 언어를 대표함) 이 소셜 미디어 게시물에서 "열띤 논쟁"과 "차분한 대화"를 구별하는 법을 가르치려 한다고 상상해 보세요. 이것이 SemEval-2026 태스크 9의 도전 과제였으며, 독립 연구자 스리카르 카슈얍 풀리파카 (Srikar Kashyap Pulipaka) 가 이끄는 PSK팀이 이를 해결하기 위한 시스템을 구축했습니다.
그들이 어떻게 했는지 간단히 설명해 드리겠습니다:
1. 목표: "열기"를 포착하기
이 태스크는 영어에서 암하라어에 이르기까지 22 가지 언어로 된 소셜 미디어 게시물을 읽고, 이 게시물이 편향적 (고정관념, 혐오 또는 불관용이 가득한) 인지, 아니면 중립적인지 판단하는 것이었습니다.
- 도전 과제: 일부 언어는 배울 수 있는 예시가 매우 적었고, "편향성"은 문화마다 다르게 나타났습니다. 이는 한 나라에서만 비를 본 사람에게 "폭풍"을 인식하는 법을 가르치는 것과 같습니다.
2. 교사들: "Gemma" 모델들
모두를 위한 거대한 교사 한 명을 사용하는 대신, 팀은 각 언어마다 두 명의 특정 "튜터"를 고용했습니다:
- 12B 튜터: 효율적이고 똑똑한 모델 (120 억 개의 파라미터).
- 27B 튜터: 더 똑똑하고 강력한 모델 (270 억 개의 파라미터).
그들은 LoRA라는 기법을 사용했는데, 이는 튜터들이 전체 뇌를 다시 쓸 필요 없이 특정 언어를 배울 수 있도록 작은 전문적인 "요약 노트"를 제공하는 것과 같습니다.
3. 학습 파트너: 합성 데이터
팀원들은 일부 학생들에게 연습 문제가 부족하다는 것을 깨달았습니다. 그래서 그들은 AI(GPT-4o-mini) 를 이용해 가짜 연습 문제 (합성 데이터) 를 작성했습니다.
- 직접 생성: AI 가 처음부터 새로운 가짜 논쟁을 작성했습니다.
- 개조 (Paraphrasing): AI 는 실제 예시를 가져와 다른 단어로 다시 썼습니다 (학생이 숙제 문제를 다른 말로 표현하는 것처럼).
- 대조 쌍: AI 는 편향된 예시 하나와 차분한 예시 하나를 "쌍"으로 만들어 모델이 정확한 차이를 볼 수 있도록 했습니다.
- 필터: 그들은 이 가짜 데이터를 무작정 넣지 않았습니다. 중복과 무의미한 내용을 제거하여 학생들이 고품질 자료만 공부하도록 엄격한 "품질 관리" 필터를 통과시켰습니다.
4. 전략: "볼륨 조절기" 조정
학습 후, 모델들은 최종 결정을 내려야 했습니다. 보통 AI 는 50% 이상 확신할 때 "예"라고 말합니다. 하지만 팀은 일부 언어의 경우 50% 가 너무 높거나 너무 낮다는 것을 발견했습니다.
- 해결책: 그들은 결정 임계값을 볼륨 조절기처럼 취급했습니다. 일부 언어의 경우 논쟁을 더 많이 포착하기 위해 조절기를 30% 로 낮췄고, 다른 언어의 경우 오경보를 피하기 위해 70% 로 높였습니다. 이 간단한 조정으로 추가 학습 없이 점수가 2~4% 향상되었습니다.
5. "앙상블": 심사 위원회
최종 결정에 있어 그들은 한 명의 튜터만 듣지 않았습니다. 대신 앙상블을 사용했습니다:
- 그들은 12B 와 27B 튜터 모두에게 투표하게 했습니다.
- 때로는 투표 결과를 평균냈고, 다른 때는 더 똑똑한 튜터의 의견에 더 가중치를 두었습니다.
- 각 언어마다 연습 테스트에서 가장 잘 작동한 투표 전략을 선택했습니다.
6. 결과: 누가 이겼나?
- 승자: 팀은 60 개 팀 중 전체 2 위를 차지했습니다.
- 점수: 그들은 0.811의 점수 (정확도 측정치) 를 달성했습니다. 3 개 언어에서 1 위를 차지했고, 다른 8 개 언어에서는 상위 3 위에 들었습니다.
- 놀라운 사실: 그들은 다른 유명한 AI 모델 (XLM-RoBERTa 와 Qwen3) 을 사용해 보았습니다. 이 모델들은 연습 테스트에서는 훌륭했지만 실제 테스트에서는 망쳐 정밀도가 30~50% 떨어졌습니다.
- 교훈: 연습 답안을 단순히 암기하는 모델보다 편향성이라는 개념을 잘 학습하는 일반화 능력이 뛰어난 모델을 사용하는 것이 더 좋습니다. Gemma 모델들만이 시험이 시작되었을 때 "잊어버리지" 않은 유일한 모델들이었습니다.
7. 유일한 약점: 이탈리아어 "누락된 장"
이 시스템은 이탈리아어에서 가장 어려움을 겪었습니다. 왜일까요?
- 이탈리아어 학습 데이터에는 "정치"나 "기타" 문제와 같은 전체 주제 카테고리가 누락되어 있었습니다.
- 그러나 최종 테스트에는 이러한 누락된 주제에 대한 질문이 많이 포함되어 있었습니다.
- 이는 덧셈만 공부하여 수학 시험을 준비했는데, 최종 시험에 나눗셈에 대한 거대한 섹션이 포함된 것과 같습니다. 모델은 이러한 특정 유형의 논쟁을 본 적이 없기 때문에 올바르게 추측할 수 없었습니다.
요약
이 팀은 22 가지 언어로 온라인 논쟁을 포착하기 위해 전문 AI 튜터, AI 가 생성한 연습 문제, 그리고 맞춤형 조정된 결정 규칙을 사용하는 시스템을 구축했습니다. 그들의 비결은 단순히 가장 큰 AI 를 사용하는 것이 아니라, 답을 암기하는 것이 아니라 편향성이라는 개념을 실제로 학습할 수 있는 모델을 사용하고, 각 특정 언어에 맞게 규칙을 미세 조정하는 데 있었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.