Ratio-based Loss Functions
本文系统综述了专注于相对误差而非绝对差异的回归任务中基于比率的损失函数,通过分析其基本数学性质,为未来研究和新损失函数的开发奠定基础。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教计算机进行预测,比如猜测房屋价格或人体体重。为此,计算机需要一张“记分卡”来评判其猜测的优劣。在机器学习领域,这张记分卡被称为损失函数。分数越低,猜测越准确。
长期以来,大多数记分卡都像一把尺子。如果计算机猜测房屋价格为 50 万美元,而实际价格为 50.2 万美元,那么“误差” simply 就是差值:2000 美元。这被称为基于距离的方法。当你测量那些固定误差量在任何情况下都同等重要的事物时(例如测量桌子的长度),这种方法效果极佳。
然而,本文作者认为,有时尺子并非合适的工具。有时,你需要的是放大镜或百分比计算器。这在处理会增长或缩小的事物时尤为如此,例如价格、人口或生物测量值。
核心思想:比率与距离
本文引入了一类新的记分卡,称为基于比率的损失函数。
这些新记分卡不再问“猜测偏离了多少?”(距离),而是问“猜测在比例上有多接近?”(比率)。
“通货膨胀”类比:
作者使用了一个绝佳的例子来解释为何这很重要:
- 想象一份报纸售价3 美元。如果价格上涨5 美元,那是件大事(价格几乎翻倍了!)。
- 现在想象一辆汽车售价30,000 美元。如果价格上涨5 美元,没人会注意到。这只是沧海一粟。
如果你使用“尺子”(基于距离的方法),这两个误差都仅仅是"5 美元”。计算机认为它们同样糟糕。但在现实中,报纸的误差是巨大的,而汽车的误差微乎其微。基于比率的记分卡能看出这一点:它知道报纸价格偏差 5 美元意味着 166% 的误差,而汽车价格偏差 5 美元仅意味着 0.01% 的误差。因此,它对两者的处理方式截然不同。
本文实际做了什么
作者们不仅仅是说“嘿,比率很酷”。他们付出了艰辛的努力,为这些新记分卡构建了坚实的数学基础。以下是他们取得的成就,用通俗的语言表述如下:
他们绘制了蓝图(定义):
他们为什么是“基于比率”的损失函数制定了严格、正式的定义。他们解决了当计算机的猜测可能为负数时(这对于体重或价格等事物毫无意义)如何处理数学问题,方法是使用“链接函数”——你可以将其视为一种翻译器,将计算机的原始数字转换为比率能够理解的格式。他们检查了结构完整性(性质):
在将新型记分卡用于实际算法之前,你需要知道它是否安全且稳定。作者们对这些新函数进行了以下测试:- 平滑性: 计算机能否轻松沿着记分卡“滑下”以找到最佳答案?(数学上:可微性)。
- 形状: 记分卡是否呈碗状,从而确保只有一个最佳答案?(数学上:凸性)。
- 稳定性: 如果输入发生微小变化,分数是剧烈跳跃,还是平缓变化?(数学上:利普希茨连续性)。
他们发现,虽然其中一些新记分卡非常平滑且稳定,但另一些则较为棘手。例如,要制造一个既完美平滑又完美稳定的记分卡,使用比率比使用尺子要困难得多。
他们展示了工具箱(新示例):
本文是这些新记分卡的目录。他们从其他领域(如“对数损失”或“霍伯损失”)汲取现有概念,并将其重塑为基于比率的版本。他们还发明了一些全新的记分卡,例如“霍伯型相对损失”,试图兼得两者之长:既对小误差敏感,又不会对巨大的异常值感到恐慌。他们厘清了关系:
他们证明,你不能在任何情况下都简单地将尺子替换为放大镜。有时,你可以通过取对数(一种数学技巧)将比率问题转化为距离问题,但通常,这两种方法在本质上是不同的。基于距离的工具无法捕捉误差的“相对”性质,而基于比率的工具也无法捕捉固定的“绝对”误差。
他们未做什么
根据作者自己的表述,重要的是要注意本文未做之事:
- 他们没有在特定的 AI 算法(如特定的神经网络)上测试这些记分卡,以观察其是否能赢得竞赛。
- 他们没有精确计算这些新方法的学习速度或所需的数据量。
- 本文没有将其应用于特定的医疗诊断或金融市场预测。
总结
将本文视为一种新型建筑材料的建筑师手册。作者们已经:
- 精确定义了该材料是什么。
- 测试了其强度、柔韧性和耐用性。
- 提供了可用该材料构建的不同形状和尺寸的目录。
他们正将这份手册交给其他研究人员,说道:“这是一个坚实的基础。现在,你们可以构建更好的 AI 系统,这些系统能理解相对误差,而不仅仅是绝对差异。”他们邀请学术界利用这些新工具,去解决那些“比例”比“距离”更重要的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。