← 최신 논문
💻 computer science

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

이 논문은 20개의 하위 커뮤니티에 걸친 500개 이상의 영어 퀴어 속어(slang)를 담은 최초의 커뮤니티 검증 데이터셋인 "SLAyiNG"을 소개하며, 많은 언어 모델이 퀴어 정체성에 대한 표현 편향(representation bias)은 결여되어 있을지라도 퀴어 구어체, 특히 아프리카계 미국인 및 라틴계 커뮤니티의 속어를 처리하는 데는 여전히 어려움을 겪고 있다는 점을 밝힘으로써 NLP 시스템을 개선하기 위한 다양한 언어적 자원의 필요성을 강조한다.

원저자: Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 거의 모든 책, 웹사이트, 그리고 기록된 대화를 집어삼킨 거대하고 탐욕스러운 독서가라고 상상해 보세요. 대규모 언어 모델(LLM)이라 불리는 이 기계들은 오늘 이 시대 우리가 사용하는 많은 챗봇과 AI 도구들의 두뇌 역할을 합니다. 이들은 단어 속에서 패턴을 찾아내고, 문장에서 다음에 올 단어가 무엇일지 추측하며 학습합니다. 하지만 여기 함정이 있습니다. 만약 컴퓨터가 특정 방식의 말투를 들어본 적이 없다면, 그것은 혼란에 빠집니다. 친근한 농담을 모욕으로 오해하거나, 문화적 참조를 전혀 이해하지 못할 수도 있습니다. 이것은 특정 집단, 예를 들어 십 대, 게이머, 또는 LGBTQ+ 커뮤니티가 사용하는 특화된 언어인 '사회 방언(sociolects)'에 있어 큰 문제입니다. AI가 이러한 집단들을 이해하지 못하면, 의도치 않게 무례하게 굴거나, 사람을 잘못 식별하거나, 혹은 제대로 대화를 나누는 데 실패할 수 있습니다. 연구자들이 던지는 질문은 이것입니다. 어떻게 하면 이 디지털 두뇌들에게 퀴어 커뮤니티의 풍부하고 다채로우며 진화하는 슬랭(속어)을 틀리지 않고 이해하도록 가르칠 수 있을까요?

여기서 SLAYING이라는 새로운 프로젝트가 등장합니다. 이것을 퀴어 슬랭을 위해 특별히 만들어진, 커뮤니티의 승인을 받은 거대한 사전이자 이야기책이라고 생각해 보세요. 연구자들은 AI가 많은 유형의 언어를 이해하는 데 점점 능숙해지고 있지만, 퀴어 버내큘러(구어체) 앞에서는 종종 비틀거린다는 사실을 깨달았습니다. 때때로 AI는 너무 혼란스러워한 나머지, 무해하고 축하하는 의미의 문구를 혐오 표현으로 오해하거나, 사용자가 특정 단어를 사용했다는 이유만으로 무례한 응답을 생성하기도 합니다. 이를 해결하기 위해 팀은 500개 이상의 퀴어 슬랭 용어와, 이 단어들이 실제 문장에서 어떻게 사용되는지에 대한 3,405개의 예시를 담은 최초의 실질적인 데이터셋을 구축했습니다. 그들은 단순히 교과서에서 이 단어들을 뽑아낸 것이 아닙니다. 영화, 팟캐스트, 소셜 미디어에서 이들을 수집한 다음, 실제 퀴어 커뮤니티 구성원들에게 각 예시가 올바르게 사용되었는지, 그리고 해롭지는 않은지 확인받았습니다.

팀은 이 새로운 데이터셋을 사용하여 몇몇 인기 있는 AI 모델들을 테스트했고, 놀라운 사실을 발견했습니다. 그들은 컴퓨터가 퀴어들에게 "친절"할 수는 있지만(즉, 고정관념을 갖거나 그들을 미워하지는 않지만), 그들의 언어에 대해서는 여전히 "무지"할 수 있다는 것을 발견했습니다. 이는 마치 당신을 사랑하지만 당신이 가장 좋아하는 내부 농담(inside joke)은 이해하지 못하는 친구와 같습니다. 그들이 못된 것이 아니라, 단지 그 맥락을 모르는 것뿐입니다. 연구는 이 새로운 데이터셋의 커뮤니티 승인을 받은 무해한 슬랭을 통해 AI 모델을 가르쳤을 때, 모델이 단순히 단어뿐만 아니라 퀴어 사람들을 전반적으로 이해하는 능력이 실제로 향상되었다는 것을 보여주었습니다.

하지만 연구진은 또한 AI가 모든 사람을 평등하게 대우하고 있지 않다는 점도 발견했습니다. 모델들은 특정 집단, 특히 아프리카계 미국인 및 라틴계 퀴어 커뮤니티의 슬랭과 드래그(drag) 및 논바이너리 정체성과 관련된 용어들에 대해 가장 큰 어려움을 겪었습니다. 이는 마치 AI가 배우고자 하는 슬랭을 만든 바로 그 커뮤니티들에 대해 일종의 '맹점'을 가지고 있는 것과 같습니다. 더욱이, 연구는 "유해한(toxic)" 언어를 잡아내기 위해 설계된 자동화된 시스템들이 퀴어 용어들이 긍정적이거나 재전유(reclaimed)된 방식으로 사용될 때조차도 이를 위험한 것으로 분류한다는 것을 보여주었습니다. 이는 인터넷을 안전하게 지키기 위한 도구들이 의도치 않게 퀴어의 목소리를 검열하고 있음을 시사합니다. 이 논문은 모델에게 더 다양하고 실제적인 퀴어 언어의 예시를 제공함으로써, 모델이 커뮤니티를 더 잘 이해하도록 돕고, 이로 인한 혼란과 무고한 발언을 해로운 것으로 잘못 분류하는 경향을 줄일 수 있다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →