Wasted large language models: A life cycle thinking approach
本文提出将欧盟的废物层级框架应用于大语言模型(LLMs),将其作为一种生命周期思维方法来减轻其日益增长的环境影响,并强调防止不必要的利用和训练新模型是减少其碳足迹最有效的策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
我们生活在一个机器可以惊人快速地撰写诗歌、解决复杂方程并生成计算机代码的时代。这些机器由大型语言模型驱动,这是一种通过处理海量信息进行学习的人工智能。虽然这些工具承诺将彻底改变我们的工作方式,但它们也带来了沉重的代价:训练和运行这些模型需要消耗大量的电力,给地球留下了显著的碳足迹。多年来,科学家们一直试图提高这些模型的能效,希望能降低其对环境的影响。然而,一种被称为“杰文斯悖论”(Jevons paradox)的现象经常削弱这些努力;随着模型变得更加高效且运行成本更低,我们往往会使用得更多而非更少,从而导致总能耗的净增长。这产生了一种迫切的需求,即寻找一种不同的解决方案,一种能够超越单纯效率、并考虑技术从创造到最终退役整个生命周期的方案。
来自挪威 SINTEF Digital 的一个研究小组提出了一种看待这一问题的新颖方式,即应用通常保留给物理垃圾的概念:废物层级结构(waste hierarchy)。在欧盟,关于物理废物的法律优先考虑五个步骤:防止产生废物、重复使用物品、将其回收利用为新材料、从中回收能量,最后是负责任地处置它们。研究人员建议,我们不应仅将大型语言模型视为软件,而应将其视为可以变成废物的“产品”。正如塑料瓶在不再有用时会被丢弃一样,当一个语言模型被新版本取代或仅仅是被弃用时,它也会变成废物。作者认为,通过将这些数字工具视为具有生命周期的产品,我们可以找到超越仅仅让它们变得更快或更小之外的、减少环境影响的新途径。
研究人员论点的核心在于,降低人工智能气候影响最有效的方法是通过避免不必要的创建新模型来防止浪费。每当训练一个新模型时,都需要巨大的能量来进行数据处理、实验和实际的学习过程。如果我们能够延长现有模型的寿命,或者找到将其用于不同任务的方法,我们就能避免为了从头开始构建一个新模型而消耗能量。论文强调,与物理对象不同,软件不会损坏或磨损,因此模型成为废物的唯一原因在于它们被更新、更快的版本所取代。这种快速更迭是由竞争激烈的市场驱动的,实验室不断发布更新的模型,往往使得之前的模型在尚未被充分利用前就已过时。研究人员建议,将关注点从追求“绝对最佳性能”转向寻找“足够好”的性能,可以显著减缓这种更换周期,并减少用于训练的能源消耗。
为了管理确实发生的浪费,作者探讨了废物层级结构的其它步骤如何应用于数字模型。重复使用是最直接的方法;由于数字模型可以无成本地复制,我们应该在考虑其过时之前,最大限度地将其应用在不同的场景中。论文提到了诸如“微调”(fine-tuning)之类的技术,即通过给予现有模型少量的额外训练使其专业化以执行特定任务,这可以看作是一种“回收利用”。这使得原始的、高能耗的模型可以被适配而非被丢弃。同样,“回收”涉及寻找让这些模型发挥更长时间作用的方法,例如将它们连接到外部数据库以提高准确性,而无需从头开始重新训练。甚至连通常意味着扔掉东西的最后一步——“处置”,在这里也有其作用。虽然删除一个数字文件不会留下物理残留物,但存储未使用模型的服务器仍然会消耗电力。因此,积极删除不再需要的模型,是节省能源并尊重投入其创造过程中的资源的一种切实可行的方式。
研究人员还对数字便利性所催生的“丢弃心态”提出了警告。由于删除一个模型感觉几乎没有成本,开发者和用户往往忽视了在其创造过程中投入的巨大能量和时间。论文指出,目前我们在与这些工具互动方面存在差距;界面往往鼓励持续使用,却未能帮助用户理解环境成本,或引导他们走向更高效的替代方案。作者认为,我们需要变得更加自觉,去思考何时真正需要大型语言模型,何时使用更简单、能耗更低的工具即可。他们认为,虽然这项技术很强大,但必须权衡其价值与成本,盲目追随不断更新模型的趋势可能会导致我们将资源浪费在那些几乎没有带来净收益的产品上。
最终,这项研究并非声称已经解决了人工智能的气候危机,也不建议我们完全停止开发新模型。相反,它提供了一个更仔细地思考这些工具生命周期的框架。通过将大型语言模型视为可以变成废物的“产品”,我们可以识别出预防不必要训练、延长现有模型使用寿命以及负责任地处置未使用模型的机会。作者认为,这种视角的转变对于迈向更可持续的人工智能未来至关重要,敦促我们在急于创造新事物之前,先重视我们已经投入的资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。