DEL: Digit Entropy Loss for Numerical Learning of Large Language Models
本文介绍了数字熵损失(DEL),这是一种新颖的训练目标,它将无监督熵优化重构为一种有监督的、无需距离度量的框架,以提升大语言模型在数学推理和代码生成任务中预测整数和浮点数的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但略显困惑的机器人做数学题。这个机器人擅长写故事和聊天,但一涉及数字,就经常把数字搞错。它可能会在答案是"13"时说成"12",或者把"12"猜成"14"。
这篇来自香港理工大学视觉计算实验室的论文,介绍了一种教导该机器人更好地处理数字的新方法。他们将其新方法称为数字熵损失(Digit Entropy Loss, DEL)。
以下是他们利用简单类比来修复机器人数学技能的故事:
1. 问题所在:机器人的“最佳猜测”习惯
传统上,在训练这些人工智能机器人(称为大语言模型)时,我们使用一种称为**最大似然估计(Maximum Likelihood Estimation, MLE)**的方法。
- 类比:想象机器人正在参加多项选择题考试。MLE 告诉机器人:“只需选出你认为最可能的答案。”
- 缺陷:机器人太客气了。它会想:“嗯,'12'是最好的答案,但'13'和'11'也有点接近,所以我也给它们一点点概率吧。”
- 结果:机器人变得优柔寡断。它在数字之间徘徊,导致错误,例如在答案必须是整数时说出"12.4",或者仅仅因为不够自信而选错了数字。
2. 旧有的修复方案:“距离”陷阱
研究人员曾试图通过添加“惩罚”系统来解决这个问题。
- 类比:他们告诉机器人:“如果答案是 5,而你猜了 4,那还可以,毕竟很接近。但如果你猜了 9,那就太糟糕了!”他们创建了一张地图,将数字排列在一条线上,机器人会根据其猜测与真实值的距离远近受到惩罚。
- 问题:论文认为这种“距离地图”是人为的。在现实世界中,数字不仅仅是直线上的点;它们是拥有各自含义的符号。有时,机器人会学到数字"2"看起来更像字母"Z",而不像数字"3"。强迫机器人遵循严格的距离规则会让它感到困惑,并使其猜测变得要么过于僵化(锐化),要么过于模糊(扁平化)。
3. 新解决方案:“信心教练”(DEL)
作者提出了数字熵损失(DEL)。与其衡量机器人离答案有多远,不如关注机器人有多确定。
- 类比:想象一位教练,他不在乎你的猜测与目标之间的距离。相反,教练说:“我不在乎你是接近还是远离。我只希望你100% 确定你的答案。如果你对'5'有 90% 的把握,对'6'有 10% 的把握,那你就是在犹豫不决。我希望你对'5'有 100% 的把握,而对其他所有数字的把握为 0%。”
- 工作原理:
- 监督确定性:他们教导机器人将每个数字视为一个简单的“是/否”问题。“这个数字是 5 吗?是或否?”这迫使机器人做出清晰明确的决定,而不是模糊的猜测。
- 摒弃距离规则:他们扔掉了“距离地图”。他们让机器人根据所见数据学习数字之间的自然关系,而不是将人为制定的规则强加给它。
- 处理小数:以前的方法将整数(如 10)和小数(如 10.5)区别对待,导致了一个“悬崖”,机器人会在此处跌倒。DEL 将整数部分和小数部分视为一个平滑、连续的流,就像一条单一的长数轴,而不是两个分离的岛屿。
4. 结果:更精准的数学
研究人员在四种不同类型的人工智能机器人(CodeLlama、Mistral、DeepSeek 和 Qwen-2.5)上,使用七个不同的数学基准测试了这位新的“信心教练”。
- 结果:经过 DEL 训练的机器人犯错更少。它们不仅更频繁地得到正确答案;而且当它们答错时,错误答案也更接近正确答案(例如,猜 12 而不是 13,而不是猜 50)。
- 视觉证据:在论文的示例中,你可以看到旧方法往往逻辑正确但最终数字错误(例如计算购物总费用时算对了逻辑,但最终的美元金额算错了)。而 DEL 方法则同时确保了逻辑和最终数字的正确性。
总结
简而言之,这篇论文指出:停止教导人工智能机器人猜测数字有多“接近”。相反,要教导它们对自己预测的确切数字绝对确定。 通过去除人为的距离规则,并专注于建立清晰、自信的预测,这些机器人在数学和代码生成方面变得更强大了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。