← 最新论文
💬 NLP

Exploring the Capability Boundaries of LLMs in Mastering of Chinese Chouxiang Language

本文提出了名为"Mouse"的专用基准测试,旨在评估大语言模型在中文抽象语言(Chouxiang Language)上的能力边界,揭示了当前顶尖模型在多项任务中表现受限,并深入探讨了其性能瓶颈、评估方法的合理性及翻译关键因素。

原作者: Dianqing Lin, Tian Lan, Jiali Zhu, Jiang Li, Wei Chen, Xu Liu, Aruukhan, Xiangdong Su, Hongxu Hou, Guanglai Gao

发布于 2026-04-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Dianqing Lin, Tian Lan, Jiali Zhu, Jiang Li, Wei Chen, Xu Liu, Aruukhan, Xiangdong Su, Hongxu Hou, Guanglai Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次**“大模型(AI)去考中文互联网‘黑话’资格证”**的考试报告。

为了让你轻松理解,我们可以把这篇论文想象成一场**“AI 与互联网亚文化圈的‘斗法’"**。

1. 背景:什么是“抽象话”?

想象一下,中文互联网上有一群年轻人,他们发明了一种**“加密通话”,叫“抽象话”**(Chouxiang Language)。

  • 普通中文:“你脑子进水了。”
  • 抽象话:“你⑧要命辣”(用数字、谐音、表情符号拼凑)。

这种语言就像**“互联网方言”**,它把汉字拆了、把读音改了、把表情符号当字用。比如用"🧠"代表“聪明”,用"91"代表“安排”。

  • 初衷:最早是为了骂人时躲避平台的“审核机器人”( censorship)。
  • 现状:现在它已经变成了一种**“圈子暗号”,用来开玩笑、表达情绪、甚至只是单纯觉得好玩。它不再全是脏话,更像是一种“只有圈内人懂的密码”**。

2. 问题:AI 能看懂这些“密码”吗?

现在的 AI(大语言模型,LLM)很聪明,能写诗、能写代码、能翻译英语。但是,当它们面对这种**“充满梗、谐音和表情符号的抽象话”时,就像是一个“刚学会中文的外国留学生”突然被扔进了“北京胡同里的老茶馆”**,完全听不懂大家在聊什么。

作者们发现,现有的 AI 虽然能看懂正经文章,但一遇到这种“加密黑话”,就经常**“翻车”**。

3. 解决方案:推出"Mouse"考试

为了测试 AI 到底懂不懂这种语言,作者们设计了一套专门的**“考试系统”,名字叫 Mouse
这就好比给 AI 发了一张
“中文互联网亚文化能力测试卷”**。

这张卷子包含6 种题型,难度层层递进:

  1. 翻译题 (Translation):把“抽象话”翻译成正常的中文。(比如把"🧠"翻译成“脑子”)
  2. 成分分析题 (Component Classification):判断这句话是用“谐音”造的,还是用“表情符号”造的,或者是“拆字”造的。
  3. 意图识别题 (Intent Recognition):这句话是想骂人?还是想开玩笑?还是想表达悲伤?
  4. 毒性检测题 (Toxicity Detection):这句话是脏话(有毒),还是只是玩梗(无毒)?
  5. 选择题 (Meaning Selection):给出一个抽象句,让你从三个选项里选对的意思。
  6. 填空题 (Cloze Completion):给一段对话,让你选最合适的下一句(考察语境理解)。

4. 考试结果:AI 考得怎么样?

作者找来了市面上最厉害的 14 个 AI 模型(包括 GPT-5.2, Qwen3, DeepSeek 等)来参加考试。结果让人大跌眼镜:

  • 简单题(如毒性检测):AI 考得还不错。因为它们以前被训练过很多“骂人话”的数据,所以能认出哪些是脏话。
  • 难题(如翻译、成分分析):AI 考得很烂。
    • 比喻:这就好比 AI 能认出一个人“在生气”(毒性检测),但完全听不懂他为什么生气,也听不懂他用的“方言梗”(成分分析和翻译)。
    • 具体表现:很多 AI 在翻译时,要么**“胡编乱造”(幻觉),要么“完全看不懂”**。比如把表情符号当成乱码,或者把谐音字当成真字。
  • 越大的模型越聪明吗?:不一定。有时候,参数稍微小一点的模型(比如 14B)反而比超大的模型(32B)考得好。
    • 原因:大模型有时候**“想太多”**(Overthinking),在简单的谐音梗上过度推理,反而把自己绕晕了;小模型比较“直”,反而能蒙对。

5. 核心发现:为什么 AI 这么笨?

论文指出了三个关键原因:

  1. 文化偏见:现在的 AI 大多是用西方数据训练的,或者主要学习“标准中文”。它们就像**“只会说普通话的学霸”**,完全听不懂“方言”和“黑话”。
  2. 训练数据偏差:以前的研究只关注“抽象话”里的脏话(为了过滤有害信息),忽略了它**“好玩、幽默、社交”**的一面。所以 AI 只学会了识别骂人,没学会识别玩梗。
  3. 缺乏“语境感”:抽象话高度依赖**“圈子文化”。比如"91"在某个特定语境下是“安排”,换个语境可能就不是。AI 缺乏这种“活在社会里”**的直觉。

6. 总结与意义

这篇论文就像是在告诉 AI 开发者们:

“别光顾着让 AI 做数学题和写论文了,它连咱们中国网友在群里发的‘暗号’都看不懂呢!如果不把这种‘亚文化语言’教给 AI,它就永远无法真正理解中国互联网的生态。”

一句话总结
作者们给 AI 出了一套**“中文互联网黑话考卷”,发现现在的 AI 虽然“书读得多”,但“社会阅历浅”,完全搞不懂这种充满谐音梗和表情包的“加密语言”**。他们希望未来的 AI 能变得更“接地气”,真正融入人类的多元文化圈。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →