Entropy of Ukrainian
本文首次通过让 184 名志愿者复现克劳德·香农 1951 年的字符预测实验来估算乌克兰语的熵,得出每字符约 1.201 比特的上限,并将该结果与当前的大语言模型进行了比较。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和朋友玩一个“猜下一个字母”的游戏。你给他们看一个在中间被截断的句子,比如:“猫坐在……"
你的朋友必须猜下一个字母。
- 如果他们猜 "m"(代表 mat,垫子),那就对了。这很简单。
- 如果他们猜 "z",那就错了。他们必须再猜一次。
- 如果他们猜 "p"(代表 pillow,枕头),那就对了。
这个游戏衡量的是某种称为熵的东西。在语言世界中,熵并非关于热量或混乱;它是对意外程度的衡量。
- 高熵: 下一个字母完全出乎意料。你需要猜很多次才能猜对。语言感觉混乱且不可预测。
- 低熵: 下一个字母显而易见。你立刻就能猜出来。语言感觉可预测且重复。
实验:猜测乌克兰语
几十年来,科学家们一直在用英语玩这个猜字游戏。1951 年,一位名叫克劳德·香农(Claude Shannon)的人让人们猜测英语句子中的下一个字母。他发现英语相当可预测;平均而言,你只需要大约 1.2 次猜测就能猜对下一个字母。
但直到现在,从来没有人用乌克兰语玩过这个游戏。
三位来自乌克兰的研究人员(安东、米基塔和马尔基扬)决定首次进行这项实验。以下是他们做法的通俗解释:
1. 参与者(志愿者)
他们没有雇佣专业工作人员,而是邀请社交媒体(主要是 Telegram)上的普通人来玩。
- 设置: 他们给志愿者提供来自新闻文章的句子。
- 转折: 为了保持人们的兴趣,他们并没有从句子的开头开始。他们展示了前 70 个字符(大约是一个短句的长度),然后问:“接下来是什么?”
- 游戏: 志愿者输入一个字母。如果错了,它会变红,他们再试一次。如果对了,他们就进入下一个字母。
- 目标: 他们想看看在人们猜对字母之前,需要多少次“错误猜测”。
2. 结果:乌克兰语有多可预测?
在收集了 184 名志愿者提供的超过 17,000 次猜测数据后,研究人员进行了数据分析。
- 得分: 他们发现乌克兰语的“意外程度”(熵)约为每字符 1.201 比特。
- 这意味着什么? 这意味着在可预测性方面,乌克兰语与英语极其相似。就像英语一样,如果你知道前面的字母,乌克兰语中的下一个字母通常相当明显。
- 冗余性: 因为这种语言如此可预测,乌克兰语句子中大约**76%**的字母是“冗余”的。你实际上可以删除一大块文本,而母语者仍然可以完美地猜出缺失的部分。
3. “作弊”问题
研究人员必须小心。由于这是一个在线游戏,有些人可能会:
- 在网上查找完整的句子。
- 随机猜测并碰巧猜对。
- 失去兴趣,中途停止游戏。
为了解决这个问题,他们扮演了严格的裁判。他们剔除了那些表现不佳(可能没有认真尝试)的人的结果,以及那些表现过于完美(可能作弊)的人的结果。即使非常严格并删除了大量数据,结果仍然保持在1.20左右。
4. AI 对比:人类与机器人
研究人员还让现代人工智能模型(大型语言模型)玩同样的游戏。
- AI 的优势: AI 模型比人类强得多。一些最好的 AI 模型猜下一个字母的得分约为0.7。
- 陷阱: 研究人员警告说,AI 可能以另一种方式在“作弊”。因为 AI 是在海量新闻数据上训练的(类似于游戏中使用的句子),它可能只是记住了特定的句子,而不是真正理解了语言。这就像一个背下了答案键而不是学习数学的学生。
- 结论: AI 非常厉害,但由于它非常接近“完美”得分,很难判断它是否真的理解了乌克兰语,还是仅仅对所使用的特定新闻文章产生了过拟合。
主要启示
这篇论文是我们首次获得关于乌克兰语可预测性的确切数据。
- 乌克兰语并非混乱无序。 它像英语一样,具有高度结构化和可预测性。
- 人类很擅长这个。 普通人猜下一个字母大约需要 1.2 次尝试。
- AI 更好,但可能好得过头了。 AI 模型猜得更快,但我们必须小心,不要将“记忆”与“智能”混淆。
研究人员承认他们的研究并不完美(他们没有足够的参与者,且句子全部来自新闻文章),但这为我们提供了一个比以往更好的起点。他们甚至分享了代码和数据,以便他人在未来尝试改进这个游戏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。