Toward Machine Learning with the Unit as a Primitive: Learning from Unit-Linked Events
本文通过显式地引入“单元”(unit)作为一种原初语义实体来提议将机器学习形式化,并将监督学习定义为在以分词器生成的单元标记为条件的共享响应律的推理,以此来区分同质与异质世界模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在机器学习的世界里,计算机通常是通过观察数据行来进行学习的,就像学生复习一叠闪卡一样。每张卡片都包含一个问题和一个答案,而计算机的任务就是找到连接它们的模式。几十年来,这种方法在许多任务中都取得了显著成效,从识别面部到预测天气。然而,这种方法将每一张卡片都视为孤立的事件,忽略了一个关于现实世界的根本事实:许多这些卡片实际上属于同一个人、动物或设备。当计算机从患者的病史、用户的购物习惯或传感器的读数中学习时,它看到的往往是同一个持续存在的个体的多个快照。标准的算法通常将这些快照视为独立的、互不相关的条目,或者依赖于计算机仅仅是在进行猜测的隐藏假设。这造成了一个盲点。如果计算机无法区分一个属于特定个体的模式和一个对所有人通用的模式,那么当被要求预测该人在新情况下的表现时,它可能会失败,或者它可能会把某人的独特怪癖误认为是普遍规律。
一篇新论文提出了一种通过改变这些学习任务定义的基础来解决此问题的方法。研究人员建议,不要从一份记录列表开始,而是从“单元”(unit)的概念开始——即数据所属的那个持续存在的个体。想象一个图书馆,馆员不仅是编目书籍,首先还要识别出借阅这些书的具体读者。在这个新框架下,计算机首先被告知这个个体是谁,或者至少被赋予一个明确的规则来决定什么时候两份数据属于同一个人。这个简单的转变使得计算机能够理解,虽然事件(问题和答案)在变化,但底层的个体保持不变。研究人员表明,通过将这个“单元”作为问题的一个显式组成部分,机器可以学习一套适用于所有人的共享规则,同时仍然尊重每个个体的独特差异。
这项发现的核心是计算机用来理解世界的一个两步过程。首先,它充当翻译官,将关于一个人的原始证据(例如其过去的习惯或身体特征)转化为一个紧凑的摘要,作者称之为“标记”(token)。可以将这个标记想象成计算机即时创建的一个代表该特定个体的唯一身份证。第二步,计算机使用一套单一的、共享的规则来阅读这张身份证,并预测接下来会发生什么。这是一个至关重要的区别。在旧的方法中,计算机可能会尝试为它遇到的每一个人记住一套单独的规则,如果它遇到从未见过的人,这是不可能实现的。在这种新方法中,计算机学习的是一本通用的规则手册。它只需查看身份证(标记)来了解那个特定的人如何符合一般模式。这使得系统具有泛化能力:它可以通过根据现有证据为新认识的人创建一个标记,然后应用从其他人那里学到的相同共享规则,从而对其做出准确预测。
研究人员还探讨了当计算机并不确切知道那个人是谁时会发生什么。有时,数据是不完整的,或者记录之间的联系是不确定的。在这种情况下,计算机不能简单地在数据库中查找姓名。相反,它利用可用的证据来形成对个人身份的最佳猜测,创建一个反映这种不确定性的标记。论文证明,即使在这种猜测的情况下,只要将识别个人与预测结果的行为分开,系统仍然可以有效地学习。研究表明,如果你只观察单个、孤立的记录而不了解它们属于谁,你就无法区分一个“每个人都完全相同”的世界和一个“每个人虽然不同但在平均水平上看起来相同”的世界。然而,如果你能以确定性地将多条记录链接到同一个人,计算机就可以检测出个体之间的隐藏差异。这一发现至关重要,因为它设定了一个清晰的界限,即什么是可能的:如果机器只被展示每个人的单个快照,而没有任何将其链接回源头的方法,它就无法学习个体差异。
这项工作还阐明了我们应该如何衡量成功。在许多现有系统中,我们通过模型对所有数据点的平均结果预测得有多好来评判它。作者指出,这可能会产生误导。如果某些人在数据中出现多次,而其他人仅出现一次,那么简单的平均值可能会被频繁使用的用户所主导,从而忽略了稀有用户的独特需求。论文建议,我们需要基于个体而非仅仅基于记录来评估模型。这意味着要检查模型是否能够预测特定的人在某种新情况下的表现,而不仅仅是获得整体统计数据。研究人员提供了一份如何正确设计这些测试的清单,以确保我们不会在无意中诱导计算机去死记硬背名字,而不是学习模式。
最终,这篇论文为构建智能系统提供了一种更诚实的方式。它承认世界是由持续存在的个体组成的,而不仅仅是一系列脱节的事件。通过迫使计算机在开始猜测答案之前先声明它正在学习的对象,系统变得更加稳健,并且更有能力处理现实生活的复杂性。它并不声称已经解决了人工智能中的所有问题,但它提供了一个坚实的逻辑框架,用于理解机器如何在不忽视个体身份的情况下向人类学习。其结果是一种不仅在数学上严谨,而且在概念上也更清晰的方法,弥合了混乱的人类数据与机器学习的结构化逻辑之间的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。