TrustRAG: Blockchain-Enhanced RAG via Committee-Based Credibility Scoring
TrustRAG 是一个基于区块链增强的检索增强生成系统,通过采用由零知识证明和安全多方计算保障的基于委员会的可信度评分机制,确保关键领域内检索文档的完整性与可验证性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字时代,人工智能已经学会了以资深专家的流利程度进行交谈,通过从其训练数据中提取海量信息来回答问题、撰写故事并解决问题。然而,这种知识是静态的,就像一个停止更新书架的图书馆一样,被冻结在了时间里。为了解决这个问题,研究人员开发了一种称为检索增强生成(Retrieval-Augmented Generation)的方法,它允许这些智能系统在形成答案之前,向外部来源寻求并获取新鲜、具体的实事。这种方法在医学、法律和金融等领域变得至关重要,因为在这些领域,正确事实与过时事实之间的差异,可能意味着安全决策与危险错误之间的区别。然而,一个新的问题出现了:虽然系统可以找到新信息,但通常没有可靠的方法知道这些信息的来源、作者是谁,或者是否被篡改过。获取这些事实的过程往往由单一且不透明的组织控制,导致用户无法验证他们阅读的证据是真实的还是被操纵的。
为了解决这场信任危机,一组研究人员构建了一个名为 TrustRAG 的新系统,它作为一个安全、透明的管道,为向人工智能输入信息提供保障。想象一下这样一个世界:每一条进入系统的信息首先都经过一个独立专家小组的审核,他们在不透露身份的情况下对质量进行投票,从而确保没有任何一个人可以操纵结果。该系统使用一种数字账本(类似于一个无法被擦除或更改的公共记录册)来锁定这些专家的意见以及他们所背书的文件。当用户提问时,系统不仅仅是抓取最热门或最新的文档;相反,它只检索那些经过这个专家委员会预先认证的文档,并跨多个独立来源进行交叉比对,以确保没有任何信息被遗漏或替换。其结果是一个带有内置真实性证书的响应,允许任何人追溯到其原始的、经过验证的来源,并确认这些来源的排名计算过程是公平的。
TrustRAG 的核心创新在于它如何处理隐私与验证之间的微妙平衡。在许多现有系统中,如果专家公开他们的评分,他们可能会受到压力或贿赂而改变主意。为了防止这种情况,研究人员设计了一个过程,专家使用一种特殊的密码学方法提交他们的评估,这种方法在证明其有效性的同时隐藏了实际的分数。这就像是将一张密封的选票放入一个透明的箱子中;箱子显示了一张选票已被投出,且来自一名注册选民,但没有人能在最终由一组协同工作的计算机进行安全统计之前看到投票的具体内容。这个被称为“委员会”的小组将这些隐藏的选票结合起来,为每个文档生成最终的信任得分。至关重要的是,这个得分被计算一次并永久存储,因此系统不需要在每次用户提问时都重复复杂的投票过程。相反,它只需检索预先批准的分数并使用它们来对文档进行排序,从而确保最值得信赖的信息脱颖而出。
研究人员测试了这个系统,以观察它是否能在不减慢处理速度的情况下承担起安全方面的重任。他们构建了一个工作原型,模拟了一个拥有不同数据源及其各自验证委员会的网络。在测试中,他们发现最耗时的部分是初始投票和最终的得分统计,这些过程发生在任何用户提问之前。一旦这些分数准备就绪,检索答案和验证它们的过程实际上非常迅速。例如,生成用于证明投票有效的密码学证明所需的时间是以毫秒计的,而将小型委员会中四个专家的隐藏分数进行合并所需的时间也非常快。这表明该系统可以在提供高水平安全性的同时,不会产生让等待答案的用户感到沮丧的瓶颈。
该研究的一个重要发现是,系统不需要依赖一个单一的、庞大的证明来一次性验证所有内容,因为那会导致计算成本高昂且速度缓慢。相反,它使用一种将独立的信息链通过数字指纹连接在一起的方法。每个数据源计算自己的信任得分,并为其结果创建一个小的、唯一的哈希值(或称数字摘要)。随后,一个中央协调器将这些摘要组合成一个单一的全局指纹。这使得任何人都可以检查某个特定文档是否包含在最终答案中,以及其得分是否计算正确,而无需从头开始重新运行整个复杂的计算过程。研究人员证明,这种方法成功地防止了不诚实的业务提供商用低质量文档替换高质量文档,或隐藏本应包含的来源。
研究还仔细定义了该系统的能力边界。它保证了检索到的信息未被篡改,并且排名过程遵循了约定的规则,但它并不保证内容本身在现实世界中是事实正确的。如果一个专家委员会错误地背书了一份包含事实错误的文档,系统仍会将其视为可信,因为系统验证的是委员会的投票过程,而非陈述本身的真实性。该系统旨在检测篡改并确保程序完整性,而非充当绝对真理的“神谕”。这种区别对于医疗和法律等高风险领域至关重要,因为在这些领域,目标是确保决策基于现有的、经过妥善审核的证据,而非未经证实或被操纵的数据。
通过将去中心化验证与隐私保护技术相结合,TrustRAG 为构建既强大又负责任的人工智能系统提供了一种新途径。它解决了人们日益增长的担忧,即我们赖以获取关键信息的工具正在变成黑箱,由少数实体控制且公众无法对其工作进行审计。研究人员展示了,创建一个专家可以协作认证知识而无需担心胁迫、数据源可以安全地链接在一起、且每个答案都附带可验证历史记录的系统是完全可能的。这项工作表明,可靠人工智能的未来不仅取决于更聪明的算法,还取决于建立能够使“信任”成为一个可衡量、可验证过程的基础设施。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。