ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification
ZeroR@CHiPSAL 2026 팀은 OCR 의존성을 제거하고 저자원 멀티모달 혐오 표현 및 감정 탐지를 효과적으로 처리하기 위해 대조 학습과 LoRA 미세 조정을 적용한 Qwen3-VL-8B-Instruct 기반의 2단계 시각-언어 적응 파이프라인을 채택함으로써 네팔 밈 분류에서 상위 순위를 달성했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 모두가 소리 지르고, 속삭이고, 벽에 그림을 그리는 거대하고 혼란스러운 디지털 광장이라고 상상해 보세요. 이 마을에서 "밈(meme)"은 가장 인기 있는 소통 방식입니다. 밈은 재미있는 사진과 재치 있는 문구를 결다한 일종의 내부 농담과 같습니다. 하지만 때때로 이러한 농담은 웃음 속에 혐오 표현이나 괴롭힘을 숨긴 무기로 변하기도 합니다. 까다로운 점은 그림 자체는 무해해 보일 수 있지만, 텍스트가 그것을 끔찍한 의미로 만들거나, 혹은 그 반대의 경우가 발생할 수 있다는 것입니다. 이를 막기 위해 컴퓨터는 단순히 부분만이 아니라 전체 이야기를 이해하기 위해 이미지와 텍스트를 동시에 "읽는" 법을 배워야 합니다. 이는 컴퓨터에게 매우 큰 도전이며, 특히 네팔어처럼 글자(데바나가리 스크립트)가 그림 위에 직접 그려지는 언어의 경우 더욱 그렇습니다.
과학자들은 해로운 밈을 찾아내기 위해 더 나은 "디지털 탐정"을 구축하려고 노력해 왔습니다. 보통 그들은 긴 조립 라인을 구축하려 합니다. 먼저 기계가 사진에서 텍ot를 읽고(스캐너처럼), 그다음 기계가 이를 번역하며, 마지막으로 세 번째 기계가 그것이 나쁜 것인지 결정하는 방식입니다. 하지만 이것은 퍼즐을 조각조각 분해해서 푸는 것과 같아서, 전체적인 그림을 놓칠 수 있습니다. 이 논문은 이 조립 라인이 필요 없는 새로운 탐정 팀을 소개합니다. 대신, 그들은 인간처럼 이미지와 텍스트를 동시에 볼 수 있는 초스마트 올인원 브레인을 사용합니다. 연구진은 이 브레인을 네팔어 밈에 테스트하여 혐오 발언을 포착하고 분위기가 행복한지, 슬픈지, 혹은 중립적인지를 파악할 수 있는지 확인했습니다.
논문의 이야기: 2단계 탐정 훈련
연구자 니티즈 칸날(Nitiz Khanal)과 그의 팀은 네팔어 밈에서 혐오를 감지하고 감정을 분석하는 최고의 시스템을 구축하는 것이 목표인 CHiPSAL 2026이라는 경진대회에 참가했습니다. 그들은 단순히 컴퓨터를 문제에 던져 넣은 것이 아니라, AI 모델을 위한 영리한 2단계 훈련 캠프를 설계했습니다.
주연 배우: Qwen3-VL
그들의 시스템 중심에는 Qwen3-VL-8B-Instruct라는 거대하고 사전 학습된 AI가 있습니다. 이 모델을 전 세계의 수백만 권의 책을 읽고 수백만 장의 사진을 본 천재 학생이라고 생각해보세요. 결정적으로, 이 학생은 이미 네팔에서 사용하는 데바나가리 스크립트를 읽는 법을 알고 있기 때문에, 연구진은 처음부터 읽는 법을 가르치거나 텍스트를 스캔하기 위한 별도의 도구를 사용할 필요가 없었습니다. 이 모델은 밈을 보고 즉시 이미지 위에 쓰인 단어들을 "볼" 수 있었습니다.
1단계: 창의적인 작가
첫 번째 훈련 단계에서 팀은 AI에게 창의적인 작가처럼 행동하도록 가르쳤습니다. 그들은 AI에게 수천 개의 밈을 보여주고 "혐오(Hate)" 또는 "안전(Safe)", 혹은 "부정적(Negative)", "중립적(Neutral)", "긍정적(Positive)"이라는 답을 쓰도록 요청했습니다. 컴퓨터에 무리를 주지 않기 위해 그들은 LoRA(Low-Rank Adaptation)라는 기술을 사용했습니다. AI를 수백만 권의 책이 있는 거대한 도서관이라고 상상해 보세요. 연구진은 네팔어 밈을 가르치기 위해 모든 책을 새로 쓰는 대신, 선반에 몇 개의 포스트잇(학습 가능한 작은 레이어)을 붙이는 방식을 택했습니다. 이를 통해 AI는 새로운 작업을 빠르고 효율적으로 배울 수 있었습니다.
하지만 그들이 가진 데이터는 지저도했습니다. "안전한" 밈은 "혐오" 밈보다 훨씬 많았고, "중립적" 밈은 "긍정적"이나 "부정적"인 밈보다 훨씬 많았습니다. 이는 호랑이 사진은 한 장뿐인데 고양이 사진은 천 장이 있는 상황에서 희귀 동물을 식별하는 법을 배우는 것과 같습니다. 이를 해결하기 위해 팀은 오버샘플링(희귀한 밈의 복사본을 추가로 만드는 것)과 이미지 증강(이미지를 뒤집고, 회전시키고, 밝기를 조절하는 것)을 사용하여 AI가 단순히 그림을 암기하는 것이 아니라 패턴을 실제로 학습하도록 했습니다. 세 가지 클래스의 감정 작업의 경우, AI가 계속 틀리는 어려운 예시에 더 집중하도록 하는 포컬 로스(Focal Loss)라는 특별한 수학적 트릭도 사용했습니다.
2단계: 엄격한 코치
첫 번째 단계도 좋았지만, 연구진은 AI가 훨씬 더 날카로워지기를 원했습니다. 두 번째 단계에서는 "대조 학습(contrastive learning)" 코치를 추가했습니다. 이것은 마치 "틀린 그림 찾기" 게임과 같습니다. 코치는 AI에게 둘 다 "혐오"에 해당하는 밈 두 개를 보여주며 "이 둘은 함께 속해 있어!"라고 말합니다. 그러고 나서 "혐오" 밈 하나와 "안전한" 밈 하나를 보여주며 "이 둘은 완전히 달라! 서로 멀리 떨어뜨려 놔!"라고 말합니다. 이를 통해 AI는 유사한 아이디어들을 마음속에서 밀접하게 그룹화하고, 서로 다른 아이디어들은 멀리 밀어내는 법을 배웠습니다. 이 단계는 단순히 답을 요구하는 것이 아니라, AI가 데이터의 '형태'를 이해하도록 강제하여 그 결정을 더 견고하게 만들었습니다.
최종 판결: 점수 혼합하기
최종 시험을 치를 때, 팀은 1단계나 2단계의 답 중 하나만을 선택하지 않았습니다. 그들은 **팀 허들(team huddle)**을 만들었습니다. 그들은 "창의적인 작가"(1단계)의 확률 점수와 "엄격한 코치"(2단계)의 점수를 가져와 특별한 가중치를 두어 함께 섞었습니다. 그들은 가장 높은 점수를 주는 완벽한 균형을 찾기 위해 연습 세트에서 다양한 혼합 비율을 테스트했습니다.
연구 결과
결과는 인상적이었습니다. 팀의 시스템은 혐오 발언 탐지 작업의 공식 리더보드에서 2위를 차지했으며, 점수(Macro F F1)는 0.797을 기록했습니다. 이는 시스템이 까다로운 클래스 불균형에도 불구하고 유해한 콘텐츠를 매우 잘 포착했음을 의미합니다. 감정 분석 작업(밈이 긍정적인지, 부정적인지, 혹은 중립적인지 파악하는 것)에서는 점수 0.518로 리더보드 4위를 차지했습니다.
연구진은 2단계 접근 방식이 비결이었다는 것을 발견했습니다. 만약 그들이 첫 번째 단계(단순히 답을 쓰는 것)만 사용했다면 점수가 더 낮았을 것입니다. 두 번째 단계(대조 학습)를 추가함으로써 성능이 크게 향상되었습니다. 또한 그들은 두 작업이 서로 다른 훈련 스타일을 필요로 한다는 것을 발견했습니다. 혐오 발언 작업은 비교적 명확했지만, 감정 작업은 "중립"과 "긍정" 또는 "부정" 사이의 경계가 모호하기 때문에(특히 유머가 섞여 있을 때) 배우기가 훨씬 더 어려웠습니다. 감정 모델은 AI가 혼란에 빠지지 않도록 훨씬 더 엄격한 규제(regularization)를 필요로 했습니다.
이것이 왜 중요한가 (그리고 무엇이 부족한가)
이 논문은 네팔어와 같은 저자원 언어의 경우, 스크립트를 기본적으로 이해하는 강력한 올인원 시각-언어 모델을 사용하는 것이 게임 체인저가 될 수 있음을 시사합니다. 이는 텍스트 스캐너나 번역기 같은 별도의 도구 체인을 사용하지 않고도, 단 하나의 스마트한 모델이 엔드투엔드로 밈을 이해할 수 있다는 것을 증명합니다.
하지만 저자는 자신의 시스템이 완벽하지 않다는 점도 분명히 밝히고 있습니다. AI가 깊은 문화적 맥락을 놓칠 때가 있다는 점을 인정합니다. 예를 들어, 어떤 밈은 역사적 인물이나 특정 문화적 농담을 포함하고 있어 AI에게는 무해해 보일 수 있지만, 실제로는 네팔 사람들에게는 모욕적일 수 있습니다. AI는 똑똑하지만, 아직 그 문화의 삶의 경험을 가지고 있지는 않습니다. 또한 데이터셋이 상대적으로 작기(작업당 약 1,000개의 밈) 모델이 진정으로 학습한 것이 아니라 훈련 데이터를 암기했을 위험이 있으며, 다른 랜덤 시드로 다시 시작할 경우 결과가 달라질 수 있다고 언급했습니다.
결론적으로, 이 연구는 크고 똑똑한 AI 모델에게 기술로부터 소외되었던 언어들의 복잡하고, 재미있고, 때로는 위험한 밈의 세계를 가르치는 유망한 길을 보여줍니다. 이는 디지털 광장을 모두에게 더 안전하고 포용적인 곳으로 만들기 위한 한 걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.