A Retrieval-Augmented Generation Method for Industrial Documents based on Reinforcement Learning
本文提出了 RLo-RAG,一种通过 LoRA 增强的基于强化学习的多轮检索增强生成模型,该模型利用动态奖励函数迭代检索高相关性文档块,与传统的 RAG 方法相比,显著提高了工业文档的检索精度和生成质量。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代工业世界中,工厂和工程公司正在产生海量的复杂文档。这些不仅仅是简单的手册,而是由技术报告、设备日志和测试记录组成的密集集合,它们是解决关键问题的关键。几十年来,在这些庞大的档案中寻找特定信息一直是一项缓慢且依赖人工的任务,通常依赖于员工个人的记忆或专业知识。最近,被称为大语言模型的强大计算机程序为寻找出路提供了新途径。这些模型能够以卓越的技巧阅读并理解人类语言,扮演着超级智能助手的角色。然而,当被问及特定的工业细节时,这些助手往往会遇到困难,因为它们的训练数据是通用的互联网数据,而非工厂车间内那些专门且碎片化的记录。为了解决这个问题,研究人员开发了一种称为检索增强生成(RAG)的方法,其原理是让计算机在回答问题之前,先从私有数据库中查找相关的实事。然而,即使是这种改进后的方法,在需要跨多个文档进行信息关联时也经常失效,导致答案不完整或产生混乱。
同济大学的一个研究团队通过创造一种旨在处理工业知识中杂乱、破碎特性的新系统,解决了这一特定挑战。他们将这种方法称为 RLo-RAG,这是一种结合了大语言模型的能力与一种被称为强化学习的学习技术的方法。简单来说,强化学习是一种通过让计算机程序尝试不同行动,并在做出正确选择时给予奖励来教授程序的方法,就像用零食训练表现正确的狗一样。在这个系统中,计算机扮演着一个好奇代理人的角色,它不仅仅是进行一次搜索来寻找答案。相反,它会提出一系列问题,从每次搜索的结果中学习,并优化下一个问题,以填补缺失的信息碎片。这个过程会持续进行,直到计算机觉得它已经收集了足够的证据来构建一个完整且准确的答案。
研究人员发现,工业文档经常存在一种被称为“语义碎片化”的问题。这意味着回答单个问题所需的信息可能散落在不同的章节、表格甚至单独的文件中。传统的搜索可能会找到一段描述测试程序的文字,却遗漏了位于另一页表格中的具体数值。新系统通过使用动态奖励机制解决了这个问题。随着计算机的搜索,它会根据三个因素获得反馈:所找到信息的关联性、是否在重复已看到的信息,以及找到答案的速度。如果计算机找到了高度相关的文档,它会获得奖励;如果它浪费时间查看重复的信息,它会受到惩罚。至关重要的是,系统会随着时间的推移调整这些奖励。在学习的早期阶段,它侧重于寻找高质量的信息,但随着能力的提升,它学会了在寻找优质信息与高效完成任务之间取得平衡。
为了测试这一想法,研究人员构建了一个原型系统,并使用了一种称为 LoRA 的技术对其进行了训练,该技术允许他们在无需从头开始重建整个“大脑”的情况下,教给计算机特定的技能。他们使用两个旨在挑战计算机处理多事实关联问题的知名数据集对系统进行了测试。结果显示,他们的新方法显著优于现有方法。旧的方法往往会遗漏关键细节,或者陷入重复搜索相同信息的循环中,而新系统在其中一个测试集上成功检索到正确信息的比例达到了 88.9%。它生成的答案也比其他先进模型产生的答案更准确、更有条理。研究人员指出,系统决定何时停止搜索以及何时继续寻找的能力是其成功的关键因素,这既防止了时间的浪费,又确保了不会遗漏重要事实。
该团队还将他们的方法与其他使用强化学习的方式进行了对比,以观察他们的特定方法是否为最佳选择。他们发现,他们那种仔细平衡计算机学习过程的策略比其他流行方法更稳定且更有效。这种稳定性在工业环境中至关重要,因为错误的答案可能会导致代价高昂的错误。通过采用平滑、循序渐进的学习目标调整,该系统避免了计算机试图同时学习过多内容时可能产生的混乱。研究人员通过多次运行实验验证了这些发现,以确保结果具有一致性,而非仅仅是运气好。他们还通过一个涉及民用飞机制造的真实案例展示了系统的能力,展示了它如何通过整合文本、表格和图表中的信息,来提供关于电气测试要求的完整答案。
尽管该系统展现出了巨大的潜力,但研究人员也承认仍有改进空间。目前,该系统依赖文本描述来链接到图像和表格,这意味着它知道某段文字提到了某个特定的图表,但它并不会深入分析该图表的视觉内容本身。未来的改进可以让系统直接“看到”并理解图像和图表,而不仅仅是阅读指向它们的文本。尽管存在这一局限性,这项研究仍标志着人工智能在处理复杂的现实工业任务方面迈出了重要一步。通过教导计算机像人类专家一样思考——进行迭代、检查工作并判断何时拥有足够的信息——研究人员创造了一个能够帮助工厂和工程师释放其庞大文档档案全部价值的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。