← 최신 논문
💬 NLP

Exploring the Capability Boundaries of LLMs in Mastering of Chinese Chouxiang Language

이 논문은 중국 인터넷 하위문화 언어인 '추상어 (Chouxiang Language)'의 처리 능력을 평가하기 위해 'Mouse'라는 전용 벤치마크를 제안하고, 현재 최첨단 대규모 언어 모델 (LLM) 들이 문맥적 의미 이해에서는 우수하지만 추상어 특유의 표현 처리에는 한계를 보임을 실험을 통해 규명했습니다.

원저자: Dianqing Lin, Tian Lan, Jiali Zhu, Jiang Li, Wei Chen, Xu Liu, Aruukhan, Xiangdong Su, Hongxu Hou, Guanglai Gao

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dianqing Lin, Tian Lan, Jiali Zhu, Jiang Li, Wei Chen, Xu Liu, Aruukhan, Xiangdong Su, Hongxu Hou, Guanglai Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 가 중국 인터넷의 가장 난해하고 독특한 '똥말' (추상어) 을 얼마나 잘 이해할 수 있을까?"**라는 질문에 답하기 위해 진행된 연구입니다.

쉽게 말해, **"AI 는 중국 젊은이들이 쓰는 암호 같은 인터넷 은어를 해독할 수 있을까?"**를 실험한 보고서라고 보시면 됩니다.

이 내용을 일상적인 언어와 비유로 설명해 드릴게요.


1. 연구의 배경: "추상어 (Chouxiang Language) 란 무엇인가?"

중국 인터넷에는 **'추상어 (Chouxiang Language)'**라는 독특한 언어가 있습니다.

  • 비유: 마치 우리가 "ㅋㅋㅋ"를 쓰거나, "ㅅㅂ" 같은 자음만 따서 욕을 하거나, 이모지로 감정을 표현하는 것과 비슷하지만, 훨씬 더 복잡하고 체계화된 인터넷 은어입니다.
  • 특징: 원래는 검열을 피하거나 부정적인 감정을 표현하기 위해 시작되었지만, 지금은 단순히 재미있거나 친근감을 주기 위해 쓰이기도 합니다.
    • 예: "너 정말 똑똑하네"를 "宁 (닝) 은 작은 귀신 (鬼) 이야"라고 표현합니다. (한자 '닝'은 '너'와 발음이 비슷하고, 귀신 이모지는 '재치'를 뜻하는 등 여러 장난이 섞여 있습니다.)

2. 연구의 목적: "AI 는 이 암호를 풀 수 있을까?"

최근 AI(대형 언어 모델) 는 일반 대화는 잘하지만, 이런 문화적 암호를 해독하는 능력은 아직 알려지지 않았습니다.
저자들은 **'Mouse(마우스)'**라는 새로운 시험지를 만들어 AI 들을 시험에 붙였습니다.

3. 시험지 (Mouse 벤치마크) 의 구성

이 시험지는 총 6 가지 과제로 이루어져 있습니다.

  1. 번역 (Translation): 추상어를 표준 중국어로 다시 번역하기. (예: "너 죽을래?"를 "너 정말 미쳤어?"로 바꾸기)
  2. 코드 분류: 이 문장이 '발음 놀이', '이모지 그림', '의미 변형' 중 어떤 방식으로 만들어졌는지 찾기.
  3. 의도 파악: 이 말의 진짜 의도가 '농담', '분노', '칭찬' 중 무엇인지 맞추기.
  4. 유해성 탐지: 겉보기엔 농담 같지만 실제로는 욕설이나 폭력적인 내용이 숨어있는지 찾기.
  5. 의미 선택: 여러 보기 중 진짜 뜻이 맞는 것을 고르기.
  6. 빈칸 채우기: 대화 상황에서 가장 자연스러운 추상어 한 줄을 고르기.

4. 실험 결과: "AI 는 아직 초보생입니다"

최고 성능의 최신 AI 모델들 (GPT-4, Qwen 등) 을 시험에 붙였더니 놀라운 결과가 나왔습니다.

  • 성공한 부분: 문맥을 보고 "아, 이거 농담이구나"라고 감을 잡는 정도는 잘합니다.
  • 실패한 부분:
    • 암호 해독 실패: 발음 놀이나 이모지 그림을 통해 숨겨진 진짜 뜻을 찾아내는 것은 매우 어렵습니다. 마치 외계인 문자를 보며 "이게 무슨 뜻이지?"라고 헤매는 것과 비슷합니다.
    • 과도한 생각 (Overthinking): AI 가 너무 많이 생각하다가 오히려 틀리는 경우가 많았습니다. (작은 모델이 오히려 직관적으로 맞춘 경우도 있었습니다.)
    • 유해성 탐지: 욕설이 숨겨진 것은 잘 찾아내지만, 그건 과거에 욕설 탐지 훈련을 많이 받았기 때문입니다. 하지만 추상어의 재미있는 기능이나 문화적 뉘앙스는 전혀 이해하지 못합니다.

5. 핵심 교훈: "문화는 코드가 아니라 경험이다"

이 연구는 중요한 사실을 알려줍니다.

  • AI 는 데이터만 보고 배웁니다. 하지만 추상어는 단순한 데이터가 아니라, 중국 인터넷 커뮤니티의 살아있는 문화와 경험에서 나옵니다.
  • 인간 vs AI: 추상어를 잘 아는 중국 젊은이들은 이 시험을 95% 이상 맞췄지만, AI 는 50% 대에 머물렀습니다. 이는 AI 가 아직 인간 사회의 미묘한 문화적 코드를 완전히 이해하지 못한다는 뜻입니다.

6. 결론: "이제 시작입니다"

이 논문은 **"AI 가 서구 중심의 문화만 잘 알고, 아시아의 복잡한 인터넷 문화를 이해하는 데는 한계가 있다"**는 것을 증명했습니다.

  • 비유: AI 가 영어권 영화는 다 이해하지만, 한국 드라마의 '오빠', '형', '누나' 같은 호칭의 미묘한 차이나, 한국의 '짤 (밈)' 문화를 이해하지 못하는 것과 비슷합니다.
  • 의의: 앞으로 AI 가 더 똑똑해지려면, 단순히 말을 잘하는 것을 넘어 다양한 문화와 인터넷 은어를 이해할 수 있도록 훈련되어야 한다는 점을 강조합니다.

한 줄 요약:

"최고의 AI 들도 중국 인터넷의 '암호 같은 은어'를 해독하기엔 아직 너무 어리숙합니다. AI 가 진짜로 똑똑해지려면, 단순한 언어 학습을 넘어 문화의 맥락까지 배워야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →