← 最新论文
🤖 AI

CAMI: Cost-Aware Agent-Guided Multi-Indexing for Semantic Retrieval

CAMI 是一个成本感知型框架,它通过将富集选择视为一个预算组合问题,利用智能体发现和早期剪枝来优化语义检索索引的构建,从而识别出具有高召回率且计算成本显著低于穷举搜索的配置。

原作者: Adnan Qidwai, Anand Eswaran, Sonam Mishra, Jaydeep Sen, Sachindra Joshi

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Adnan Qidwai, Anand Eswaran, Sonam Mishra, Jaydeep Sen, Sachindra Joshi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图从一个巨大的食材库(你的“文档语料库”)中,寻找一份完美的、复杂的巨型汤品配方(你的“搜索结果”)。

在过去,你可能只是把所有东西都扔进锅里,然后听天由命。但现代搜索系统试图变得更聪明。它们不仅仅使用原始食材;它们甚至在开始烹饪之前,会为每一种食材制作“风味增强剂”(例如摘要、改写问题或思维导图)。这有助于让汤的味道更好,并更符合客户(用户)真正想要的东西。

然而,有一个巨大的问题:制作这些风味增强剂需要花费一大笔钱。

如果你有一百万种食材,并且尝试用五种不同的厨师(AI 模型)为每一种食材制作五种不同类型的风味增强剂,在你开始烹饪之前,你就会把钱花光。你不能尝试所有可能的组合来观察哪种味道最好;那份账单将是天文数字。

这就是 CAMI 发挥作用的地方。把 CAMI 想象成一位精明且注重预算的主厨,他知道如何在不浪费一分钱的情况下,找到最好的汤品配方。

以下是 CAMI 的工作原理,分为简单的步骤:

1. “试味”策略(多保真度评估)

与其为了测试一个新配方而先煮一整百万加仑的汤,CAMI 会先煮一小勺具有代表性的汤进行测试。

  • 隐喻: 想象你想测试加入“烟熏红椒粉”是否有效。你不会煮整锅汤。你只煮一小杯。如果味道不好,你就立即把它扔掉。如果味道好,那么你再换一个更大的锅。
  • 论文观点: CAMI 首先在小规模的数据子集上测试这些“风味增强剂”(称为富化数据表示,即 EDRs)。这节省了大量的资金,因为它能在昂贵的错误发生之前,及早停止那些糟糕的想法。

2. “乐高积木”法(原子单元)

旧方法试图将整个预制的汤品配方作为一个单一的、不可更改的整体块来进行测试。CAMI 则将食材视为乐高积木

  • 隐喻: 与其测试“配方 A”(即红椒粉、盐和洋葱的固定混合物),CAMI 会分别测试“红椒粉积木”和“盐积木”。一旦它知道“红椒粉积木”效果很好,它稍后就可以将其扣在“盐积木”上,而无需从头开始重新测试红椒粉。
  • 论文观点: CAMI 将问题分解为“原子单元”(一种特定类型的风味增强剂 + 一种特定的 AI 模型)。它单独测试这些单元,然后将胜出的部分重新组合。这意味着它不会在重新评估那些它已经知道有效的配方部分时浪费钱。

3. “创意副厨”(代理发现)

通常,厨师会固守一份固定的食材清单(比如“摘要”或“改写”)。但有时,某种特定的汤可能需要一种没人想到的奇特、定制的食材。

  • 隐喻: CAMI 有一个创意助手(一个 AI 代理),它会观察你库中的特定食材,然后说:“嘿,对于这道特定的汤,也许我们应该尝试一个‘因果联系’增强剂,而不是标准的摘要。”
  • 论文观点: 该系统使用 AI 代理来发明新的、定制的“风味增强剂”,这些增强剂是专门针对它正在处理的数据量身定制的,而不是仅仅使用通用的、预设的列表。

4. “预算守护者”(成本感知搜索)

最重要的部分是,CAMI 绝不会过度消费。它对“试味”有着严格的预算。

  • 隐喻: 主厨有一个钱包。每当他们尝试一种新的组合时,钱就会流出。如果一种组合太贵或者味道不好,它会立即被砍掉。厨师只会在那些有真正获胜机会的组合上花钱。
  • 论文观点: 该系统使用一种数学方法(称为 MO-ASHA)来决定哪些想法值得下一步测试。它会停止在那些不太可能成功的想法上浪费钱,从而确保找到最佳的“召回率 vs 成本”平衡。

结果:他们发现了什么?

论文在几个困难的“汤品配方”(如科学论文、经济数据和技术问答等数据集)上测试了这个系统。

  • 更好的味道: CAMI 发现的汤品配方在寻找正确答案的能力上,比标准方法高出多达 9.4%
  • 更便宜的采购: 它找到这些更好的配方所使用的资金比随机猜测或尝试所有组合要少 5 倍
  • 黄金分割点: 它成功识别了“帕累托前沿”(Pareto Frontier)。用通俗的话说,这意味着它找到了一个完美的平衡点,即用最少的“钱”(成本)获得最多的“味道”(检索质量)。

总结

CAMI 是一个聪明的系统,它阻止了我们在完善搜索引擎时浪费金钱。它不再盲目地尝试 AI 模型和文本摘要的所有可能组合,而是通过以下方式实现目标:

  1. 小规模测试以节省资金。
  2. 利用模块构建(重复使用好的部分)而不是从头开始。
  3. 发明定制工具以应对特定任务。
  4. 一旦想法看起来很糟,立即停止支出

其结果是一个既更智能、构建成本也显著降低的搜索系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →