← 最新论文
🤖 AI

FactoryLLM: A Safe and Open-Source AI Playground for Evaluating LLMs in Smart Factories

FactoryLLM 是一个安全、开源的 AI 游乐场,它通过提供一个无需暴露敏感工业数据的受控环境,使评估用于智能工厂跨机器故障诊断的基于大语言模型检索增强生成(RAG)的模型成为可能。

原作者: Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Abdur Forkan, Prem Prakash Jayaraman

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Abdur Forkan, Prem Prakash Jayaraman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

不要将现代工厂仅仅视为孤立机器的集合,而要将其想象成一个巨大的、互联互通的管弦乐队。当其中一件乐器(比如机械臂)奏错了一个音符时,它不仅仅是听起来难听,更会打乱整个乐队的节奏,引发连锁性的混乱。

问题在于,这个乐队的“乐谱”(维修手册)是分散的。机械臂的手册在一本书里,传送带的手册在另一本书里,而控制它们的软件则在第三本书里。它们使用的术语各不相同。当一台机器发生故障时,人类技术人员必须翻阅不同书籍中的数百页内容,才能弄清楚问题究竟出在硬件还是软件上。这就像试图通过阅读三本用不同语言编写的字典来解开一个谜团。

FactoryLLM 来了。

FactoryLLM 想象成一个专为工厂工人打造的、超级聪明的开源“侦探事务所”。它不仅仅是一个修理单台机器的工具;它更是一个专门设计的“游乐场”,旨在测试人工智能(AI)在连接所有不同机器之间表现得有多好。

以下是它的工作原理,我们使用一些简单的类比:

1. 安全沙盒

通常情况下,由于隐私顾虑,工厂对于将秘密手册上传到云端持谨慎态度。FactoryLLM 就像一个安全的、私有的沙盒。它允许用户直接在自己的计算机上运行 AI 模型(使用开源软件),而无需将敏感的工业数据发送到外界。这是一个你可以安全进行实验的受控环境。

2. “跨机器”大脑

大多数 AI 工具都像是只精通单一领域的专家。如果你问它们关于汽车发动机的问题,它们可能很了解,但如果你问它们关于影响那辆车的交通法规,它们可能会感到困惑。
FactoryLLM 被设计为一个全能侦探。它将特定机器人(“自主智能车辆”或 AIV)的手册与其控制软件(“移动规划器”)整合在一起,融合成一个巨大的知识库。然后,它会测试 AI 是否能够回答那些需要同时理解机器人和软件的问题。

3. “双重检查”系统

我们如何知道 AI 是否在胡编乱造(幻觉)?FactoryLLM 使用了双法官系统

  • 法官 A (RAGAS): 这就像一位严厉的图书管理员,负责检查 AI 的回答是否确实得到了它所阅读的页面内容的支撑。
  • 法官 B (LLM-as-a-Judge): 这是另一个扮演高级编辑角色的 AI,负责审查答案是否合乎逻辑。
    这确保了 AI 不仅仅是在瞎猜,而是将其回答扎根于手册的实际文本之中。

4. 现实世界测试

作者使用了一个现实场景对该系统进行了测试:一个智能工厂机器人及其车队管理软件。他们向系统输入了来自这两个来源的约 600 页技术文档。
随后,他们向 AI 提出了 30 个棘手的问题,这些问题需要将机器人上的问题与软件中的设置联系起来。

  • 结果: 他们测试的每一个 AI 模型都表现得非常好,其“落地性”(groundedness)得分高于 0.88。这意味着 AI 成功地从海量文档中找到了正确信息,并利用这些信息给出了正确且有据可查的答案。

为什么这很重要

论文指出,虽然我们已经拥有可以阅读单本手册的 AI,但我们缺乏能够同时阅读多本手册并理解它们如何相互作用的工具。FactoryLLM 填补了这一空白。它是一个开源工具包,让制造业中的任何人都可以测试不同的 AI 模型,以观察哪一个最擅长解决这些复杂的跨机器谜题,同时还能确保数据的安全与私密。

简而言之:FactoryLLM 是一个测试场,它证明了只要我们提供正确的工具和安全检查,AI 就能成为解开现代工厂复杂网络问题的得力伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →