CNN Regularization and Model Capacity: An Empirical Investigation of L1, L2, and Dropout in Hand Sign Image Classification
这项实证研究表明,在手势图像分类中,增加卷积神经网络(CNN)的容量并不保证性能的提升,且 Dropout 正则化(尤其是针对架构依赖型的速率)显著优于 L1 和 L2 惩罚,其中一个中等规模的模型达到了 96.66% 的最高准确率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉的世界里,机器正在学习如何观察。它们通过使用被称为卷积神经网络的数字大脑来实现这一目标,这些网络旨在识别图像中的模式,就像人类的眼睛和大脑一样。这些系统功能极其强大,能够识别从路标到医学扫描图像的一切事物。然而,这里有一个陷阱。当这些数字大脑变得过于庞大和复杂时,它们可能会开始死记硬背所展示的具体示例,而不是学习识别物体的通用规则。这被称为过拟合。想象一个学生背下了特定练习考试的所有答案,但因为无法将所学知识应用到新问题上而在正式考试中失败了。为了防止这种情况,科学家们使用了被称为正则化的技术。这些方法会温和地约束学习过程,迫使系统寻找更简单、更稳健的模式,从而使其适用于从未见过的数据。研究人员一直以来的问题是,让数字大脑变大是否总是有帮助的,或者是否存在一个甜点区(sweet spot),即大脑的大小与约束的强度能完美结合。
印度理工学院卡拉格普尔分校的一位研究人员致力于回答这个问题,他通过构建一系列用于识别手势的数字大脑来进行研究。任务是教计算机区分六种不同的手势,每种手势代表一个从一到六的数字。研究人员创建了同一计算机视觉系统的三个版本,每个版本的容量不同。第一个是小型系统,第二个是中型系统,第三个是大型系统。它们之间唯一的区别在于内部连接的数量;大型系统拥有的信息传输路径比小型系统多得多。其目标是观察仅仅增加更多的连接是否会让系统变得更聪明,还是只会让它更容易产生对训练数据的死记硬背。
实验以一个令人惊讶的发现开始。当系统在没有任何约束的情况下进行学习时,中型系统的表现最好。它大约有 91.67% 的概率能正确识别测试图像中的手势。尽管大型系统拥有最强的学习能力,但其表现却较差,准确率仅为 83.33% 左右。这是因为大型系统过于强大,以至于它记住了训练图像的具体细节,包括随机噪声,而不是学习手势的真实形状。这就像一个学生如此刻苦地研究练习题,以至于他们记住了问题的确切顺序,却未能理解背后的基本概念。由于连接较少,中型系统被迫寻找一种平衡,在不被噪声干扰的情况下学习核心特征。
为了提高这些结果,研究人员应用了不同的技术来阻止系统发生过拟合。一种方法是针对过大的内部权重增加惩罚,这类似于鼓励系统保持其内部设置的简洁。另一种方法是在训练期间随机关闭系统的一部分,迫使它依赖不同的路径来解决问题。这种被称为“丢弃法”(dropout)的技术被证明是最有效的工具。当应用于中型系统时,它将准确率提升到了 96.66%,这是整个研究中取得的最高分。
研究还表明,使用这些工具的最佳方式取决于系统的规模。对于小型系统,适度的随机关闭效果良好。对于中型系统,适中的程度最为理想。但对于具有最强记忆能力的系统——大型系统,研究人员发现需要更强剂量的随机关闭才能获得良好的结果。这表明,较大的系统需要更强的约束,以防止它们死记硬背训练数据。研究人员还测试了结合不同方法的情况,但发现简单地将它们堆叠在一起并不会自动让系统变得更好。事实上,最好的结果来自于使用单一且经过精心调优的方法,而不是复杂的混合。
实验结果通过使用不同的初始条件多次运行进行了可靠性检查,主要结果保持一致。研究结论指出,构建一个更大的计算机视觉系统并不保证更好的性能。相反,系统的大小必须与合适的约束量相匹配。一个带有正确约束平衡的中型系统可以胜过一个大得多的系统。这项工作为如何调节这些数字大脑提供了一个清晰、实用的指南,表明在追求人工智能的过程中,有时“少即是多”,而规则的力量与大脑的大小同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。