Longitudinal Component Level Analysis of Neural Network Training Dynamics Beyond Accuracy and Loss
本研究引入了一种用于分析纪元级(epoch-level)神经网络组件动态的非侵入式框架,揭示了具有相似准确率的模型往往表现出截然不同的内部行为,并证明了描述符引导的剪枝可以优于随机剪枝,同时证实了内部指标具有补充性的诊断价值,但尚未超越基于量级的准则。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
为了理解计算机如何学习识别模式,我们通常会观察最终得分。当一台机器被教导去识别手写数字或诊断医疗状况时,我们通过它答对问题的频率来衡量其成功。我们还会追踪一个叫做“损失”(loss)的数值,它告诉我们机器的猜测与真相之间相差了多少。这两个数字是人工智能的标准成绩单。它们告诉我们系统是否有效,但并不告诉我们它是如何运作的。它们就像考试的最终成绩;它们揭示了结果,却隐藏了学生在学习过程中思维变化的那个混乱且不断变化的过程。长期以来,研究人员一直在思考,如果两台计算机得到了相同的最终得分,它们是否真的以同样的方式学习,或者它们是否只是通过完全不同的路径抵达了同一个终点。
来自以色列阿费卡工程学院(Afeka College of Engineering)的一项新研究决定在机器仍在学习的过程中,而不是仅仅等待期末考试时,去观察机器内部的情况。研究人员构建了一个安静的观察者,观察计算机内部组件随时间的变化。他们没有改变计算机的学习方式或其试图实现的目标;他们只是记录了其内部组件的日常活动。他们追踪了单个部件触发的频率、信号的强度,以及它们之间的连接发生了多少变化。通过观察这些在多日训练过程中的微小移动,团队发现,拥有相同最终得分的计算机可能拥有完全不同的内部生活。两台机器可能都达到了 98% 的准确率,但其中一台可能依赖于少数几个努力工作的部件,而另一台则有很多部件已经完全停止工作,或者处于精疲力竭的状态。
该研究侧重于两项不同的任务:识别手写数字和区分良性和恶性乳腺癌细胞。研究人员多次运行了相同的训练过程,改变了一些微小的细节,例如起始条件或计算机学习的速度。他们发现,即使最终的准确率保持稳定,网络的内部行为却表现出惊人的不稳定性。在识别数字的任务中,连接从一天到下一天的变化程度,比最终准确率的变化程度高出一百倍以上。这意味着,虽然计算机的表现看起来非常稳固,但其内部机制却在不断地重新排列。研究人员还注意到,计算机的学习速度会产生巨大的影响。当学习速度增加时,计算机会更快地产生大量的非活跃部件。这些连接在早期就停止了工作并一直保持这种状态,而当计算机学习得更慢时,这种现象并未发生。
团队还测试了观察这些内部移动是否能通过移除不必要的部件来帮助改进计算机。他们尝试了一种方法,即剪掉那些在训练期间似乎最不活跃或变化最小的连接。在识别数字的任务中,这种方法比简单地随机剪掉连接的效果更好。即使在移除五分之一的连接后,计算机仍保持了高准确率。然而,这种方法并没有胜过标准的剪枝方法,即移除那些附着数值最小的连接。研究人员发现,他们的新方法并不是一个总能优于旧方法的“灵丹妙药”。事实上,在医学数据集上,新方法仅略好于随机水平,且结果在不同的运行中并不一致。
这项研究真正展示的是,计算机如何学习的历史与最终结果同样重要。研究人员发现,计算机的某些部分可能会处于不活跃状态一段时间,然后又苏醒并开始工作,或者它们可能会陷入永久性的停滞。这些活动与不活动的模式取决于计算机正在解决的问题类型以及所使用的特定设置。研究表明,我们不应仅仅通过最终得分来理解一台机器。相反,我们应该观察它是如何到达那里的过程。虽然观察与剪枝的新方法并没有取代使计算机小型化的标准工具,但它证明了在这些系统中存在着一层丰富且隐藏的活动层。这一层包含了关于哪些部分是真正重要的、哪些仅仅是噪声的线索,而如果只看最终成绩,这些线索是完全不可见的。这项工作并不声称已经解开了人工智能之谜,但它开启了一扇窗,让我们能够以一种此前无法实现的方式观察这个过程,向我们展示了学习的旅程往往比目的地所呈现的更加复杂和多样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。