← 최신 논문
💬 NLP

BioSentinel at EXIST 2026: Soft-Label Optimization with XLM-RoBERTa for Sexism Intent Classification in Memes

BioSentinel 팀의 논문은 그들이 EXIST 2026 Task 2.2에 참여한 상세 내용을 다루고 있으며, 여기서 그들은 밈(meme) 내의 성차별적 의도를 분류하기 위해 소프트 라벨(soft-label)과 하드 라벨(hard-label) 예측 사이의 균형을 효과적으로 맞추도록 합성 손실 함수(composite loss function)로 학습된 XLM-RoBERTa 기반 모델을 활용하였고, 궁극적으로 CLEF 2026 평가에서 특정 순위를 달성하였다.

원저자: Chandru Munisamy, Karthikeya Raguveer, Alapan Kuila

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Chandru Munisamy, Karthikeya Raguveer, Alapan Kuila

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 모두가 소리 지르고, 속삭이고, 벽에 그림을 그리는 거대하고 혼란스러운 마을 광장이라고 상상해 보세요. 때때로 이 그림들(밈이라고 불리는 것들)은 그저 재미있는 농담일 때도 있지만, 다른 때는 알아차리기 어려운 성차별적인 악의를 담은 댓글을 숨기고 있기도 합니다. 이것이 바로 컴퓨터 과학의 한 분야인 **성차별 탐지(sexism detection)**의 세계입니다. 여기서는 기계에게 분위기를 읽는 법, 즉 농담이 무해한 것인지 아니면 해로운 것인지를 이해하는 법을 가르칩니다.

하지만 까다로운 점이 있습니다. 인간은 항상 의견이 일치하지 않는다는 것입니다. 어떤 사람은 어떤 밈을 직접적인 모욕으로 보는 반면, 다른 사람은 그것을 미묘하고 아이러니한 농담이라고 생각하며, 세 번째 사람은 아무런 문제도 발견하지 못할 수도 있습니다. 이를 **불일치(disagreement)**라고 합니다. 과거에 컴퓨터는 단 하나의 정답만을 고르도록 교육받았습니다. 마치 정답지가 하나뿐인 시험을 채점하는 선생님처럼 말이죠. 하지만 이 논문은 인간이 동의하지 못할 때, 컴퓨터가 단순히 하나의 답을 추측하는 것이 아니라, 의견의 '분포'를 이해하도록 배워야 한다고 주장합니다. 이는 "비가 온다!"라고 외치는 대신 "강수 확률 60%"라고 말하는 일기 예보와 비슷합니다. 이 접근 방식을 **불일치를 활용한 학습(Learning with Disagreement)**이라고 부르며, 이는 기계가 더 미묘한 차이를 이해하고 과도한 확신을 갖지 않도록 도와줍니다.


BioSentinel 팀의 미션: 텍스트를 읽고, 이미지는 무시하라

BioSentinel 팀을 만나보세요. 이들은 EXIST 2026이라는 고도의 경쟁 대회에 참여한 연구자 그룹입니다. 그들의 과제는 무엇이었을까요? 밈을 보고 제작자가 직접적(명백하게 성차별적인)인지, 판단적(아이러니나 미묘한 암시를 사용하는)인지, 아니면 아닌지(성차별적이지 않은)를 결정할 수 있는 로봇을 만드는 것이었습니다.

반전은 이 대회에서 로봇이 단 하나의 라벨을 선택하기만을 원하지 않았다는 점입니다. 대회 측은 로봇이 확률 분포, 즉 "70%의 확률로 직접적이고, 20%의 확률로 판단적이며, 10%의 확률로 무해하다"라고 말할 수 있는 결과물을 내놓기를 원했습니다. 이는 여러 명의 인간 심사위원이 동일한 밈에 대해 서로 다르게 투표하는 방식을 모방한 것입니다.

전략: 텍스트 전용 탐정

Chandru Munisamy와 인도 출신의 동료들이 이끄는 이 팀은 매우 구체적인 게임을 하기로 했습니다. 밈은 텍ًا과 이미지가 결합된 형태이지만, 그들은 이미지를 완전히 무시하기로 했습니다. 그들은 마치 표정이나 몸짓을 무시하고 대화의 녹취록만 읽는 탐정처럼 행동했습니다.

왜 그랬을까요? 그들은 시각적인 부분에 의해 방해받지 않고, 오직 단어와 라벨의 불확실성을 이해하는 데 집중하여 정말 능숙해질 수 있는지 확인하고 싶었기 때문입니다. 그들은 XLM-RoBERTa(영어와 스페인어를 모두 구사하는 2억 7천만 개의 파라미터를 가진 모델)라는 강력한 언어 뇌를 사용했고, 여기에 특별한 기술을 가르쳤습니다.

모델에게 단순히 "이것이 정답이다"라고 말하는 대신, 두 가지 유형의 숙제를 주었습니다:

  1. 부드러운 숙제(The Soft Homework): "여기에 인간들이 투표한 방식이 있다. 이 정확한 의견의 조합을 따라 해보아라." 그들은 모델의 예측이 인간의 투표 패턴과 일치하도록 만드는 수학 도구인 **KL 발산(KL Divergence)**을 사용했습니다.
  2. 단단한 숙제(The Hard Homework): "여기에 투표의 공식적인 승자가 있다. 이것도 반드시 맞혀라." 그들은 모델이 너무 혼란스러워하지 않도록 **가중치 교차 엔트로피(Weighted Cross-Entropy)**라는 표준 도구를 사용했습니다.

이 두 가지 수업(70%의 부드러운 수업, 30%의 단단한 수업)을 혼합함으로써, 그들은 모델이 정확하면서도 인간의 불일치를 인지할 수 있기를 바랐습니다.

결과: 견고하지만 완벽하지는 않은 성능

BioSentinel 팀이 공식 시험(테스트 세트)에서 시스템을 테스트했을 때 다음과 같은 결과가 나왔습니다:

  • 소프트 라벨 점수: 그들은 0.3229(ICM-Soft-Norm)를 달성했습니다. 이는 가장 흔한 답을 추측하는 기본 로봇의 점수인 0.2835보다 높았습니다.
  • 하드 라벨 점수: 단일 최적의 답을 고르는 데 있어서는 0.4236(F1-score)을 기록했습니다.
  • 순위: 소프트 라벨 예측을 제출한 118개 팀 중 40위를 차지했습니다. 하드 라벨 예측을 제출한 187개 팀 중에서는 49위를 기록했습니다.

팀은 이러한 "믹스 앤 매치" 훈련 방식이 효과적이라는 것을 발견했습니다. 만약 "부드러운" 수업(KL 발산)을 제거한다면, 인간의 의견을 따라가는 능력이 0.312에서 0.142로 급격히 떨어졌습니다. 또한 "단단한" 수업을 제거하면 단일 답변에 대한 정확도가 떨어졌습니다. 이 둘의 조합이 성공의 열쇠였습니다.

"판단적" 카테고리의 고전

하지만 로봇에게는 약점이 있었습니다. 로봇은 판단적(judgemental) 성차별(미묘하고 아이러니한 종류)을 포착하는 데 서툴렀습니다. 이 특정 카테고리에 대한 점수는 0.071로 매우 낮았습니다.

왜 그랬을까요? 팀은 이미지를 제외하면 로봇이 농담의 핵심(punchline)을 놓치게 된다는 사실을 깨달았습니다. 많은 밈은 텍-텍만으로는 설명할 수 없는 시각적 유머(예: 캐리커처나 특정한 표정)에 의존하기 때문입니다. 예를 들어, "당신의 가족 식탁에 앉아 있으면..."이라는 텍스트는 무해해 보일 수 있지만, 만약 사진 속에 아버지는 가장 큰 생선을 받고 어머니는 가장 작은 생선을 받는 모습이 있다면 농담의 의도가 명확해집니다. 이미지가 없다면 로봇은 그저 중립적인 문장만을 보게 될 뿐입니다.

또한 팀은 로봇이 학습하는 방식에 대해서도 흥미로운 점을 발견했습니다. 훈련 초기 이틀 동안 로봇은 "판단적"이라고 한 번도 예측하지 않았습니다. 로봇은 이미 "무해함"과 "직접적임"의 차이를 배운 후에야 비로소 이 까다로운 카테고리를 이해하기 시작했습니다. 이는 미묘한 내용이 배우기 가장 어렵고, 더 많은 시간이나 특별한 훈련이 필요할 수 있음을 시사합니다.

하지 않은 것 (그리고 그것이 중요한 이유)

이 논문은 자신들이 하지 않은 것에 대해서도 매우 솔직하게 밝히고 있습니다. 그들은 대회 주최 측이 제공한 뇌파(EEG) 데이터나 안구 추적 데이터를 사용하지 않았습니다. 그 이유는 훈련 세트와 테스트 세트 간의 데이터가 일치하지 않았기 때문입니다. 또한 더 크고 복잡한 모델을 사용하려고 시도하지도 않았는데, 그들의 특정 설정에서는 그러한 모델들이 불안정해지고 혼란을 겪었기 때문입니다.

그들은 또한 로봇의 예측을 더 혹은 덜 확신하게 만드는 조절 장치인 "온도(temperature)" 설정도 테스트했습니다. 연습 테스트에서 이 조절 장치를 0.7로 설정했을 때, 로봇은 인간의 의견을 더 잘 따라 했으며(점수가 0.317에서 0.326으로 상승) 더 현실적인 확신을 보여주었습니다. 그러나 최종 공식 테스트에서는 안전을 위해 표준 설정을 유지했습니다.

요약

BioSentinel 팀은 인간의 불일치를 존중하도록 가르친다면, 텍스트만으로도 괜찮은 성차별 탐지기를 구축할 수 있다는 것을 보여주었습니다. "부드러운" 수업과 "단단한" 수업을 혼합함으로써, 그들은 기존 방식보다 인간의 의견 속에 존재하는 회색 지대를 더 잘 이해하는 모델을 만들었습니다.

하지만 이 논문은 우리에게 경고합니다. 만약 교묘하고 아이러니한 농담을 잡아내고 싶다면, 텍스트만 읽어서는 안 됩니다. 그림을 봐야 합니다. 로봇이 "판단적" 카테고리에서 겪은 어려움은, 때때로 시각적 맥락만이 농담(또는 모욕)을 이해하게 만드는 유일한 요소라는 점을 증명합니다. 팀은 향-후의 로봇들이 전체 이야기를 파악하기 위해 단어와 그림을 모두 살펴봐야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →