← 最新论文
💬 NLP

CharBench: Evaluating the Role of Tokenization in Character-Level Tasks

本文提出了名为 CharBench 的大规模字符级任务基准,通过评估多种模型发现,虽然分词特性对字符计数任务影响微弱,但在涉及词内位置理解的任务中,包含目标字符的 token 长度越长,模型表现越差,从而揭示了分词机制对字符级推理能力的差异化影响。

原作者: Omri Uzan, Yuval Pinter

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Omri Uzan, Yuval Pinter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的超级人工智能(大语言模型)做一场"找茬考试",专门测试它们能不能数清楚单词里的字母,或者找到字母在单词里的具体位置。

想象一下,现在的 AI 就像是一个读过万卷书、能写诗能写代码的“天才图书管理员”。但是,如果你让它数一数"strawberry"(草莓)这个单词里有几个"r",它可能会像被施了魔法一样,自信地回答错误(比如说是 2 个,其实是 3 个)。

这篇论文的作者(Omri Uzan 和 Yuval Pinter)就很好奇:为什么这个“天才”会在这么简单的任务上犯傻? 大家猜测是因为 AI 看单词的方式和我们不一样。

1. 核心问题:AI 是怎么“看”单词的?

  • 人类的视角:我们看单词是看一个个字母(Character)。比如 "strawberry",我们一眼就能看出有 10 个字母。
  • AI 的视角:AI 其实并不直接看字母,它看的是**“词块”(Tokens)。你可以把“词块”想象成乐高积木**。
    • 对于 AI 来说,"strawberry"可能不是一个由 10 个字母组成的长条,而是被切成了几块大积木,比如 ["straw", "berry"] 或者 ["straw", "b", "erry"]
    • 关键矛盾:AI 的“乐高积木”有时候太大,把好几个字母包在一起了。这就好比你想数清楚积木里有多少个红色的小颗粒,但积木被胶水粘成了一大块,AI 就看不清里面的细节了。

2. 他们做了什么?(CHARBENCH 大考)

为了搞清楚这个问题,作者们造了一个超级大的题库,叫 CHARBENCH

  • 规模巨大:以前的类似测试只有几百道题,这个有17.5 万道题。
  • 题目类型
    1. 数数题:比如“单词 'mississippi' 里有几个 's'?”
    2. 定位题:比如“单词 'cheese' 里的第一个 'e' 是第几个字母?”

他们把市面上最厉害的 AI(包括 GPT-4o, Llama, DeepSeek 等)都拉来做了这场考试。

3. 考试结果:AI 考得怎么样?

  • 总体表现:平均得分只有 50% 左右。也就是说,这些顶尖 AI 在数字母这件事上,基本上是在瞎蒙
  • 谁考得好? GPT-4o 是“优等生”,但也只考了 70 分。
  • 谁考得差? 一些开源模型(如 Mistral-7B)甚至只有 30 多分。
  • 最难的题: “定位题”(找第几个字母)比“数数题”更难。这说明 AI 不仅数不清楚,连字母在单词里的具体位置都搞混了。

4. 深度分析:为什么 AI 会输?

作者们像侦探一样,分析了为什么 AI 会做错。他们发现了一些有趣的规律:

📏 规律一:单词越长,AI 越晕

就像你让一个人背一串很长的数字,背得越长越容易出错。单词越长,AI 的准确率就越低。这很好理解。

🧱 规律二:积木(Token)越大,越看不清位置(这是最重要的发现!)

这是论文最核心的发现。

  • 现象:如果 AI 把目标字母(比如要找的 'r')包在一个很大的积木块里(比如整个单词被切成了一个大块),AI 就很难找到这个字母的具体位置。
  • 比喻:想象你在一个巨大的包裹(大 Token)里找一枚硬币(目标字母)。包裹越大,你越难知道硬币具体在包裹的哪个角落。
  • 结论:AI 的“压缩”机制(把字母打包成 Token 是为了省空间、算得快)反而牺牲了它对字母位置的精确感知能力。打包越紧,看得越模糊

🤔 规律三:大家猜错了,积木的数量不是关键

以前大家以为,是因为 AI 把单词切成了太多块(Token 数量多)或者切得太少,才导致它不会数数。
但这次研究发现:切成了几块其实不重要! 重要的是那个包含目标字母的“块”有多大

5. 总结与启示

这篇论文告诉我们:

  1. AI 不是全能的:它们在处理“微观”的字符任务时,存在明显的短板,这不仅仅是因为不够聪明,而是因为它们“看”世界的方式(分词机制)有先天缺陷。
  2. 压缩是有代价的:为了让 AI 跑得更快、更省内存,我们把字母打包成“词块”。但这就像把文件压缩了,虽然体积小了,但想从压缩包里精准提取某个小零件(字母位置)就变得困难了。
  3. 未来的方向:要解决这些问题,不能只靠让 AI 读更多的书,可能需要改进它的“眼睛”(分词机制),或者设计新的方法让它能同时看清“大块积木”和“内部细节”。

一句话总结
现在的 AI 是个宏观上的天才,微观上的近视眼。这篇论文通过一场大规模的“找字母”考试,揭示了 AI 因为“打包”单词太紧,导致看不清字母位置的秘密。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →