Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations
本文介绍了 TMO,一种端云协同的大语言模型(LLM)推理系统,该系统利用一种资源受限的强化学习策略,在多模态、多任务和多轮对话中动态优化卸载决策,从而在平衡响应质量、延迟和成本的同时,克服端侧部署的资源限制以及仅靠云端的通信开销。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个住在遥远云端、超级聪明且巨大的大脑,还有一个坐在你口袋里、反应敏捷且机智的小脑。大脑能看到一切、听到一切并解决不可能的难题,但它和你交流需要很长时间,而且使用它需要花费大量的“数字金币”。而小脑速度极快且免费使用,但它有点健忘,只能理解文字,无法理解图片或复杂的场景。
这正是开发 TMO(三重卸载)的研究人员试图解决的问题。他们构建了一个聪明的“交通控制器”,决定对于你提出的每一个问题,是让你的小脑处理,还是将其发送给云端的大脑。但这里有个转折:你不仅仅是在问一个问题,你正在进行一场长期的、多轮的对话(比如问完“晚餐吃什么?”接着问“盘子在哪儿?”然后问“能把灯打开吗?”)。此外,你可能还会拍摄照片或视频来帮助大脑理解。
研究人员发现,仅仅靠猜测或者始终使用大脑是一个坏主意。相反,他们使用强化学习(可以想象成一个 AI 玩视频游戏,通过尝试来学习如何获得速度快、成本低和准确度高的分数)训练了一个特殊的决策者。这个 AI 学会了玩一场高风险的“资源管理”游戏。
重大发现
主要发现是,这个智能控制器可以同时处理三个棘手的任务:多模态(文本、照片、视频)、多任务(编辑消息、寻找丢失物品、提供推荐)以及多轮对话(保持对话的连贯性)。
在他们的测试中(涉及超过 21,000 轮对话以及一个名为 M4A1 的自定义数据集),TMO 系统表现出了能够击败其他方法的能力。它在保持高响应质量(在他们的量表上得分约为 1.06)的同时,将等待时间控制在约 13.07 秒,并将成本控制在 0.01371 美元(即 13.71 个千分之一美元)。最重要的是,它在不违反规则的情况下完成了任务:从未超过 30 秒的时间限制或 0.05 美元的支出限制。
他们对什么说“不”
论文非常明确地指出了哪些方法是行不通的。他们测试了一个“路由”(另一种仅仅是进行猜测而不进行学习的 AI),并发现它失败了。有些路由太懒,忽略了所有的照片;而有些则太贪婪,为每个问题都发送所有照片,从而浪费了金钱和时间。研究人员还反对使用“专家”数据(即由人类展示完美答案的情况)。他们发现,即使是人类也难以知道在长对话中何时是发送照片或切换大脑的最佳时机,因此他们使用随机化动作构建了他们的系统。这迫使 AI 学习游戏本身的规则,而不是仅仅模仿一个可能也在瞎猜的人。
他们的确定性如何?
作者对他们的结果充满信心,但也谨慎地表示,这些是基于其特定数据集的模拟和实验,目前还不是解决现实世界所有情况的万能药。他们通过进行数千次试验,证明了他们的系统比他们测试的**先进技术(SOTA)**方法(如 AIwRG 和 PerLLM)表现更好。
例如,当他们测试如果云端变得极其缓慢(导致等待时间延长 10 倍)会发生什么时,他们的系统会聪明地切换回小脑,以避免违反时间限制。当他们测试不同的设备类型时,从微小的树莓派到强大的 iPhone 15 Pro,系统都能完美适配,显示出只要它了解规则,并不在乎你使用的是什么样的硬件。
“不确定性”技巧
最酷的部分之一是他们如何处理 AI 回答具有一定不可预测性的事实。有时同一个问题得到的评分会有所不同。为了解决这个问题,他们使用了“最近邻”策略。想象你在尝试猜测一个新问题的得分;与其盲目猜测,不如看看之前见过的与该问题最接近的 5 个问题(即它的邻居),并取它们的平均分。这有助于系统在数据较为混乱时保持稳定。
底线
论文表明,通过使用这种智能的、具备资源意识的学习方法,我们可以拥有两全其美:既有设备的快速和低成本,又有云端超强的大脑和多维视觉能力。这目前还不是一个解决全世界问题的方案,但在他们的模拟中,TMO 展示了它如何处理在处理照片、视频和长对话时,如何在不超出预算或耗尽耐心的情况下,应对现实世界中复杂的 AI 对话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。