A Generalized Optimization Engine (GOE) for Edge AI Inference Acceleration
本文提出了一种硬件和模型无关的通用优化引擎(GOE),该引擎集成了多种人工智能优化技术,旨在实现压缩模型在资源受限的边缘设备上的高效、准确部署,并证明了为了保持任务准确性,特定的压缩方法比名义位宽更为关键。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能已从科幻领域的虚构概念转变为日常生活的组成部分,为从医疗诊断到自动驾驶车辆的一切事物提供动力。在这场革命的核心是被称为“模型”的复杂数学结构,它们通过处理海量数据来学习识别模式并做出决策。虽然这些模型在数据中心强大的计算机上表现出色,但仍面临一个重大障碍:它们通常过于庞大且过于耗能,无法在野外发现的小型电池供电设备上运行。这种局限性在战术环境中尤为突出,因为在这些环境下,士兵或自主系统必须在没有稳定电网或高速互联网接入的情况下做出瞬时决策。科学家面临的挑战不仅在于如何缩小这些模型,还在于如何在不剥离其有用智能的前提下实现小型化。
美国陆军研发实验室(DEVCOM Army Research Laboratory)和西佛罗里达大学的研究人员通过开发一种名为“通用优化引擎”(Generalized Optimization Engine,简称 GOE)的系统,解决了这一挑战。该系统充当了一个自动化向导,能够将大型、复杂的人工智能模型进行重塑,使其适配特定硬件(如笔记本电脑或没有图形处理器的传感器)的严格限制。该团队并非发明了某种单一的新技巧来缩小模型,而是构建了一个能够智能结合现有技术的框架,例如通过“剪枝”(pruning)去除模型的冗余部分,以及通过“量化”(quantization)简化模型用于思考的数值。其目标是创建一个通用的方法,使其能够处理不同类型的模型和不同类型的硬件,而无需为每种场景都开发定制化方案。
研究人员发现,仅仅缩小模型是不够的;缩减模型所使用的方法决定了模型是保持智能还是变得毫无用处。在实验中,他们针对用于图像识别的标准视觉模型测试了各种压缩策略。他们发现,通过仔细移除模型内部特定的连接,并随后进行短暂的重新训练,他们可以将模型的体积减少高达 75%,同时实际上还提高了其准确性。同样,当他们简化模型用于计算答案的数值时,他们在标准处理器上实现了巨大的速度提升,有时能让模型的运行速度提高 25 倍,且几乎没有性能损失。这些结果表明,一个统一的系统可以成功优化多样化的模型,证明如果应用正确组合的技术,一种“一劳永逸”的方法是可行的。
最关键的测试发生在团队将该引擎应用于大型语言模型(即能够理解并生成人类语言的技术类型)时。他们尝试在没有图形处理器的设备上运行这些压缩后的模型,这种情况代表了战术环境下可能面临的极端极限。结果非常具有启发性。当研究人员使用一种经过精心设计的成熟方法来降低模型所用数值的精度时,该语言模型运行平稳,在体积变小、速度变快的同时,仍保留了正确回答问题的能力。然而,当他们尝试一种更激进、更直接的方法——即在没有细致处理的情况下直接削减数值时,模型的智能便崩溃了,开始随机猜测。这表明,压缩方法的选择远比模型的最终尺寸更为重要;只有在依然有效的前提下,较小的模型才具有价值。
研究结论指出,通用优化引擎成功弥合了强大的预训练人工智能与资源受限的边缘设备现实之间的鸿沟。通过将这些模型的部署视为速度、内存、能量与准确性之间的平衡行为,该系统可以自动找到模型所能采取的最佳路径。研究人员认为,这种方法对于未来计算能力稀缺且不可预测的操作至关重要。虽然目前的系统侧重于视觉和语言,但该框架旨在未来扩展以处理更复杂的数据类型。这项工作证实,只要工程师知道如何精确地进行“无损缩减”,通过正确的优化策略,复杂的人工智能确实可以在最小、受限程度最高的设备上有效运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。