Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices
本文介绍了 CORE,一种轻量级的两阶段提示词压缩方法,它无需辅助小语言模型即可显著提高准确率、减少内存占用并加速资源受限边缘设备上的检索增强问答推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜题的侦探。你面前有一大叠旧报纸、日记和信件(即检索到的上下文),其中可能隐藏着问题的答案。然而,这叠资料中有 95% 都是与你的案件无关的天气报告、广告或八卦。
如果你试图把整叠资料读给一位非常聪明但很忙的助手(即大语言模型或 LLM)听,会发生两件糟糕的事情:
- 助手会被淹没: 它要在这些垃圾信息中花费大量时间阅读,可能会因为噪音干扰而感到困惑,从而错过真正的线索。
- 助手会耗尽空间: 你的手机或边缘设备(比如智能汽车或机器人)没有足够的内存来一次性容纳整叠资料。
当前解决方案的问题
目前,为了清理这叠资料,人们会雇佣一名“小侦探”(即小语言模型或 SLM)来阅读这些文件,并告诉主助手哪些内容需要保留。
- 缺陷: 这个小侦探非常沉重。它需要大量的内存和电量。尝试在智能手机上运行这种小侦探,就像是在背包里背着一台沉重的冰箱一样;它运行速度太慢,且会瞬间耗尽电量。
解决方案:CORE(基于实体感知的上下文精炼)
论文的作者提出了一种名为 CORE 的新方法。CORE 并不雇佣沉重的“小侦探”,而是使用一种巧妙、轻量化的两步处理流程,就像一位拿着放大镜的熟练图书管理员。
第一步:“人物、事物、地点”过滤器(候选过滤)
CORE 不会阅读每一个字,它首先观察问题,以推测你需要什么样的答案。
- 类比: 如果你问“谁是船长?”,CORE 知道你在寻找一个人物。如果你问“这件事发生在什么时候?”,它知道你在寻找一个日期。
- 行动: 它快速扫描文本,寻找包含这些特定“类型”词汇(如姓名或日期)的句子。它还会寻找与你的问题语义非常相似的句子。
- 结果: 它创建了两个短列表:
- 答案集: 可能包含答案的句子。
- 线索集: 提供上下文或证据以证明答案正确的句子。
- 为什么很酷: 这一步使用的是微型、轻量化的工具(就像一个可以轻松装进口袋的简单放大镜),而不是像旧方法那样需要一个沉重的“冰箱”。
第二步:“交叉核对”(证据精炼)
现在,CORE 有了两个列表,但它们可能仍然过长,或者包含一些虚假的线索。它需要在不使用重型计算机的情况下进一步清理它们。
- 精炼线索: 想象一下线索就是拼图碎片。CORE 会对它们进行排列,使其不会重复相同的信息。如果两个线索表达的是同一件事,它会保留最好的那一个并丢弃重复项。它通过检查一个新线索是否增加了“新”内容来进行判断。
- 修剪答案: CORE 会检查“答案”句子是否得到了“线索”句子的支持。如果一个答案句子远离支持它的线索,或者它只是一个缺乏上下文的随机姓名提及,CORE 就会将其丢弃。它只保留那些“站在其证据旁边”的答案。
结果:快速、轻量且准确
作者在真实的边缘设备上测试了 CORE,例如 NVIDIA Jetson(用于机器人/汽车的高性能计算机)和华为智能手机。
- 速度: CORE 极其迅速。其他方法可能需要一分钟以上才能清理完一份文档,而 CORE 只需几秒钟。
- 内存: 它使用的内存极少。如果其他方法需要一整个硬盘的空间,CORE 只需要一个 U 盘的大小。
- 电池: 在智能手机上,与目前最好的现有方法相比,CORE 节省了 95% 的能量。这就像是从油耗巨大的卡车切换到了电动滑板车。
- 准确度: 尽管丢弃了大量文本,AI 实际上在回答问题时变得更准确了。通过去除噪音,AI 能够专注于有效信号。在测试中,相比于其他压缩方法,它的准确率提升了 30% 以上。
总结
CORE 是一种智能、轻量化的方法,可以将庞大的文档缩减到最核心的部分,以便它们能适配手机等小型设备。它不需要使用沉重的“小 AI”来完成工作,而是利用关于实体(姓名、日期、地点)和关系的智能规则来过滤掉垃圾信息。这使得边缘设备上的 AI 助手更快、更准确,并且大大降低了耗电量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。