← 最新论文
💬 NLP

CIRF: Tokenizing Chain-of-Thoughts into Reusable Functional Units for Efficient Latent Reasoning in Large Language Models

本文提出了 CIRF,这是一个将显式思维链推理 tokenize 为可复用功能单元的框架,旨在使大语言模型能够实现高效、自适应且可解释的潜在推理,同时兼顾精度与延迟的有利权衡。

原作者: Yukyung Lee, Yumeng Shen, Jinhyeong Park, Hyein Yang, Jun-Hyung Park

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yukyung Lee, Yumeng Shen, Jinhyeong Park, Hyein Yang, Jun-Hyung Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《CIRF:将思维链 tokenize 为可重用的功能单元》的通俗解释,辅以生动的类比。

核心难题:大声思考太慢了

想象你正在向一个超级聪明的机器人(大型语言模型)提出一个数学问题。为了得到正确答案,机器人通常必须“大声思考”。它会在给出最终数字之前,用完整的句子写下推理的每一个步骤。

  • 旧方法: 如果你问“阅读 120 页需要多少小时?”,机器人会写出一整段话:“乔伊 20 分钟读 8 页。这意味着她每分钟读 0.4 页。要计算总时间,我需要将 120 除以 0.4……"
  • 问题所在: 写出所有这些文字既耗时又耗费算力。这就像要求一位厨师在端上晚餐前,为切每一根胡萝卜都写下一篇详细的日记。虽然准确,但既缓慢又浪费。

解决方案:CIRF(“秘密代码”厨房)

研究人员提出了一种名为 CIRF 的新方法。他们不再让机器人写长篇大论,而是教它使用由简短、可重用的“功能 token"组成的秘密代码

把它想象成一个厨师的厨房,机器人就是厨师:

  1. 菜单(显式思维链): 首先,研究人员观察人类如何一步步解决问题(即那种“日记式”风格)。
  2. 翻译(Tokenization): 他们将那些冗长的步骤转化为紧凑的功能 token菜单。
    • 与其写下“我需要将 120 除以 0.4",机器人只需思考一个符号:[DIVIDE](除法)
    • 与其写下“答案是 5 小时”,它只需思考 [ANSWER](答案)
  3. 秘密食谱(代码本): 他们创建了一个这些符号的字典。
    • 一个符号可能代表“加法”。
    • 另一个可能代表“常识检查”。
    • 还有一个可能代表“乘法”。
    • 关键在于,这些符号是可重用的。用于关于页数数学题的 [DIVIDE] 符号,与用于关于切披萨问题的符号完全相同。机器人不必每次都重新学习如何除法;它只需从架子上取出同一件工具。

实际运作方式

当机器人收到问题时,它不会写故事。它会生成一串快速、不可见的代码符号序列:

  • 输入: “乔伊 20 分钟读 8 页。120 页需要多久?”
  • 机器人内部思维(CIRF): [CALC_RATE](计算速率)→ [DIVIDE](除法)→ [CONVERT_MINUTES](转换分钟)→ [ANSWER](答案)
  • 输出: "5 小时。”

机器人利用这些微小、高效的 token 在内部完成繁重的工作。它只为你写出最终答案。

为何这更好(“帕累托前沿”)

该论文声称,CIRF 达到了其他方法错过的“甜蜜点”。想象一张图表,X 轴代表速度,Y 轴代表准确性

  • 旧方法(写出所有内容): 高准确性,但非常慢(位于图表的最右侧)。
  • 其他“秘密代码”方法: 有些尝试隐藏思维,但使用通用、模糊的符号(例如只是按下“暂停”或使用随机噪声)。这些方法很快,但经常答错,因为这些符号没有具体含义。
  • CIRF: 它位于左上角。它既(因为它使用简短代码)又准确(因为这些代码是具体的、有意义的工具,如“加法”或“减法”)。

“自适应”特性

CIRF 的一个有趣之处在于它是自适应的。

  • 如果问题很简单("2+2 等于几?”),机器人使用简短的代码序列:[ADD](加法)→ [ANSWER](答案)。
  • 如果问题很难(一个复杂的逻辑谜题),机器人会自动使用更长的代码链:[ANALYZE](分析)→ [COMPARE](比较)→ [SUBTRACT](减法)→ [VERIFY](验证)→ [ANSWER](答案)。

这就像一名机械师:遇到爆胎,他们只拿一把扳手;遇到引擎故障,他们则拿出整工具箱。机器人会根据问题的难易程度调整其“思考”的长度。

结果

研究人员在数学、逻辑和常识问题上测试了这种方法。他们发现:

  1. 更快: 机器人解决问题快得多,因为它不需要输入长篇解释。
  2. 准确: 它获得正确答案的频率几乎与缓慢、冗长的方法一样高。
  3. 可解释: 尽管机器人使用“秘密代码”,但研究人员检查后发现,这些代码实际上对应着真实的逻辑步骤(如“加法”或“选择答案”)。它们不是随机的胡言乱语,而是有意义的功能单元。

总结

CIRF 是一种教会 AI 高效思考的方法。与其强迫 AI 为简单的数学问题写一部小说,CIRF 赋予它一套可重用的、有意义的速记符号。这使得 AI 能够快速、准确地解决复杂问题,在保持“思考”隐蔽且紧凑的同时,依然交付正确的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →