MegaMem: A Retrieval Solution for Ultra-Large Context Windows
MegaMem 是一个源解析的双视图检索系统,通过将语义搜索与受限证据检索解耦,实现了对超大规模持久记忆(高达十亿个 token)的准确生成,并在 EnterpriseRAG-Bench 上取得了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能在回答问题方面已经变得非常出色,但它面临着一个根本性的局限:它一次只能在活跃的“大脑”中持有一定量的信息。想象一下,如果你试图在阅读一本书的同时,还要在脑海中同时记住整座大型图书馆的所有内容;你尝试记住的书籍越多,就越难专注于正在阅读的那一本。多年来,研究人员一直试图通过构建能够将大量数据存储在计算机即时注意力之外的系统来解决这个问题,仅在被问及问题时才检索所需的特定页面。这种方法对于小型收藏效果良好,但当图书馆增长到包含数亿页内容时(例如一家软件公司的完整代码或多年的企业记录),它就开始显得力不从心。挑战不仅在于这样庞大的堆积中寻找正确的页面,还在于如何在不让计算机因处理过多文本而变慢或产生混乱的情况下完成这一过程。
一个研究小组开发了一种名为 MegaMem 的新系统来解决这一特定问题。他们的工作解决了人工智能处理大规模、持久性记忆时的一个关键瓶颈。该团队没有试图强迫计算机在每次被提问时都阅读数百万份文档,而是创建了一个将“搜索行为”与“回答行为”分离的两步走过程。他们构建了一个首先利用高度浓缩的信息摘要来寻找答案的系统,只有在发现有希望的线索后,才会检索完整的详细文本。这使得系统可以在包含数亿个单词的图书馆中进行搜索,而仅向计算机提供少量的、可控的文本量来生成答案。
研究人员在超过 50 万份真实世界企业文档(总计约 6.5 亿个单词)的大规模数据集上测试了他们的系统。这个集合包括从技术手册、法律合同到会议记录和产品规格书的一切内容。在实验中,他们将 MegaMem 与直接尝试搜索原始文档的标准方法进行了对比。结果令人瞩目。当系统被要求在如此庞大的图书馆中查找信息时,它成功地将整体回答质量从约 68% 提升到了 82% 以上。更重要的是,即使图书馆的规模从 2000 万词增长到 2.5 亿词,它仍能保持高水平的准确性。这表明该系统可以扩展到处理几乎相当于一个小国家全部书面输出规模的图书馆,而不会丧失寻找正确事实的能力。
这一成功的秘密在于系统如何组织和检索信息。在构建图书馆之初,计算机阅读每一份文档并创建两个不同版本的数据。一个版本由原始的、详细的文本组成,完全按照其原本的写法保留。第二个版本是一套精炼的、紧凑的笔记,捕捉了这些文档中的主要观点、事实和程序。当用户提出问题时,系统首先搜索这些紧凑的笔记。由于笔记简短且专注,计算机可以在不到一秒的时间内扫描完整个包含数百万词的图书馆。如果搜索找到了相关的笔记,系统随后会使用一个唯一的标识符来定位该笔记所对应的精确原始文档。它仅检索那部分特定的详细文本,以帮助计算机构思最终答案。这确保了计算机拥有精确、未经篡改的证据,而不会被无关信息干扰。
研究人员还发现,这种方法比以往的方法效率更高。通过使用浓缩笔记来引导搜索,该系统将每次回答需要处理的文本量减少了近 70%,但其产生的答案准确度几乎与阅读全文一样高。这种效率至关重要,因为这意味着即使系统管理的记忆规模不断扩大,它也能保持快速响应。研究还表明,处理如此大型图书馆的主要困难不在于计算机在找到文本后的理解能力,而在于首先找到正确文本的难度。随着图书馆规模的增长,系统的性能略有下降,但这归因于在更多干扰项中定位正确证据的挑战,而非计算机在找到证据后无法理解证据。
为了确保系统的可靠性,研究人员增加了最后一步,即让计算机审查自己的答案,并明确指出哪些文档支持了其观点。这一过程过滤掉了那些虽然被检索到但实际上并未被使用的来源,从而得到了更清晰、更准确的引用列表。团队在各种类型的问题上测试了他们的系统,包括那些需要跨多个文档进行复杂推理以及涉及冲突信息的问题。在每种情况下,这种先搜索摘要再检索细节的两步走方法都优于直接搜索原始文本的方法。这项工作表明,对于人工智能要真正发挥作为组织长期记忆的功能,它必须将“搜索规模”与“一次能阅读的规模”分离开来。通过这样做,MegaMem 为构建能够记忆并推理现代企业庞大且复杂历史,且不会迷失在噪音中的系统提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。