← 最新论文
💬 NLP

Neural Neural Scaling Laws

本文介绍了神经神经缩放定律(NeuNeu),这是一种基于神经网络的方法,通过将下游任务性能预测构建为时间序列外推问题,从而在跨多种模型系列和任务中实现显著更低的误差率和零样本泛化能力,其表现优于传统参数化模型。

原作者: Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图根据学生日常作业的表现,来预测他们在期末考试中的成绩。

长期以来,研究人员一直使用一条简单的经验法则(称为“缩放定律”)来进行这些预测。他们假设,只要查看学生的平均作业分数,就能画出一条平滑、可预测的曲线来推测其最终成绩。他们认为:“如果平均分上升,最终成绩就会沿着一条漂亮的直线上升。”

但本文的作者 Michael Y. Hu 及其团队指出,这条简单的规则已经失效。以下是原因,以及他们如何加以修正。

问题所在:“平均数”在撒谎

该论文认为,仅关注平均分数会掩盖真相。

  • 类比:想象两名学生的平均分都是 80%。
    • 学生 A 除了错了一道题外,其余所有题目都答对了。他们的表现稳定且可靠。
    • 学生 B 一半的题目得了 100%,另一半得了 60%。他们的表现混乱且不可预测。
    • 如果你只看"80% 的平均分”,就无法区分两者。但如果你查看每一道具体题目(即“词元级”数据),就会发现学生 A 在期末考试中表现优于学生 B 的可能性更大。

旧的方法(称为“逻辑缩放定律”)丢弃了所有这些详细信息。它们仅仅取平均值,将其平滑化,然后试图拟合一条简单的数学曲线。作者发现,当学生(或 AI 模型)开始表现异常时——有时进步,有时退步,或陷入停滞——这种方法就会失效。

解决方案:NEUNEU(“神经”预测器)

团队开发了一种新工具,名为NEUNEU(神经神经缩放定律)。请将 NEUNEU 想象成一位观察力超群的导师,而非简单的计算器。

NEUNEU 不仅仅查看平均分数,它还关注:

  1. 历史:学生成绩随时间的变化趋势。
  2. 细节:每一道具体题目的表现,而不仅仅是平均分。

工作原理(隐喻)
想象你试图预测一辆汽车在长途旅行中的表现。

  • 旧方法:你检查汽车迄今为止的平均速度,并假设它将永远以该速度行驶。
  • NEUNEU 方法:你观察发动机的震动、燃油混合比、驾驶员的反应时间,以及汽车刚刚驶过的具体路面颠簸。你利用一台智能计算机(神经网络)从成千上万辆其他汽车的数据中学习,以精确预测这辆车将如何应对剩余的旅程。

他们的发现

团队利用来自许多开源 AI 模型(如同来自不同学校的学生)的数据训练了 NEUNEU。他们在 66 项不同的任务上对其进行了测试(例如回答科学问题、撰写故事或解决逻辑谜题)。

以下是他们的主要发现:

  • 准确度大幅提升:NEUNEU 的准确度比旧的“基于平均数”的方法高出44%。它在预测 AI 未来表现时犯的错误更少。
  • 它能处理异常现象:有时,扩大 AI 规模或延长训练时间反而会导致其在某些任务上的表现变差(这种现象称为“逆缩放”)。旧方法无法预测这一点;它们只是假设情况总会好转。NEUNEU 学会了识别这些模式并做出正确预测。
  • 它是“零样本”天才:NEUNEU 是在特定的一组模型和任务上训练的。但当他们向它展示一种全新的模型类型或一种它从未见过的新任务时,它仍然比旧方法表现更好。这就像一位导师,仅通过观察学生的学习习惯,就能教授一门他们从未研究过的新学科。
  • 它知道何时在猜测:NEUNEU 不仅仅给出一个答案;它给出一个可能性范围(例如:“有 90% 的把握分数在 75 到 85 之间”)。这有助于研究人员知道何时可以信任预测,何时需要保持谨慎。

结论

该论文声称,试图使用简单的、预先写好的公式(如旧的“平均分数”方法)来预测 AI 模型的未来性能,是一条死胡同。相反,我们应该使用一个智能、灵活的计算机系统(NEUNEU),它直接从模型实际行为的混乱、详细数据中学习。

通过这样做,他们能够以更高的准确度预测 AI 的未来性能,从而帮助研究人员决定哪些 AI 模型值得投入时间和资金去构建。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →