← 最新论文
🤖 AI

Assessing the Business Process Modeling Competences of Large Language Models

本文介绍了 BEF4LLM 框架,旨在从四个质量维度系统地评估大语言模型在 BPMN 生成方面的表现,研究表明,尽管大语言模型在语法和语用方面表现出色,但在语义质量和有效性方面仍略逊于人类专家,但已展现出在未来业务流程建模应用中的竞争潜力。

原作者: Chantale Lauer, Peter Pfeiffer, Alexander Rombach, Nijat Mehdiyev

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Chantale Lauer, Peter Pfeiffer, Alexander Rombach, Nijat Mehdiyev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图给一位非常聪明、但有点刻板的机器人厨师传达一份食谱。你希望这个机器人根据你的书面指令,绘制出一张业务运作图(比如工厂或银行的流程图)。这种地图被称为 BPMN 模型

多年来,绘制这些地图一直是那些既懂业务又精通该绘图语言严格规则的昂贵专家的工作。但现在,我们有了 大语言模型(LLMs)——也就是那些能写邮件和故事的同类 AI。核心问题在于:这些 AI 厨师能否像人类专家一样,绘制出这些复杂的业务地图?

这篇论文是一场旨在寻找答案的大规模“烹饪比赛”。以下是他们所做的工作以及研究发现,我将用简单的语言进行解释。

竞赛机制:BEF4LLM 框架

研究人员构建了一个新的评分系统,称为 BEF4LLM。你可以把它想象成一个包含四个特定类别的裁判计分卡:

  1. 有效性(Validity,即“它是真实的吗?”检查): AI 是否真的生成了一个计算机可以打开并读取的文件?如果 AI 写的是乱码或者破坏了文件格式,那么在此项得分为零。这是最基本的门槛。
  2. 句法质量(Syntactic Quality,即“语法”检查): AI 是否遵循了绘图语言的严格规则?(例如:“每个循环必须有起点和终点”、“箭头必须指向正确的方向”)。
  3. 语用质量(Pragmatic Quality,即“可读性”检查): 这张地图是否易于人类观察和理解?是否过于拥挤?线条是否到处交叉?一张语法完美但看起来像蜘蛛网一样的地图是毫无用处的。
  4. 语义质量(Semantic Quality,即“含义”检查): 地图是否真的讲述了正确的故事?如果你说“客户付款,然后商品发货”,地图是否展示了那个顺序,还是 AI 搞混了并将它们颠倒了?

参赛者

他们测试了 17 种不同的开源 AI 模型,涵盖各种规模:

  • 小型模型: 像一个聪明的计算器。
  • 中型模型: 像一位博学多才的图书管理员。
  • 大型模型: 像一台拥有庞大大脑的超级计算机。

他们给了这些 AI 105 种不同的业务描述(例如“客户订购披萨,付款,然后等待送货”),并要求它们绘制地图。

大惊喜(结果)

1. 越大并不一定越好。
你可能会认为最大的、最昂贵的 AI 每次都会获胜。但论文发现,更大的模型并不一定能做出更好的地图。

  • 类比: 想象一位过度热情的大型 AI 厨师,他在食谱中加入了过多的额外食材和步骤,导致即使味道在技术上是正确的,菜肴也变得一团糟。有时,一个更专注的小型厨师(中型 AI)能做出更简洁、更易读的地图。
  • 陷阱: 最大的模型在遵循严格规则(语法)和把握故事(含义)方面表现更好,但它们往往会让地图变得过于复杂而难以阅读(可读性)。

2. “有效文件”问题。
这是最大的障碍。许多 AI,尤其是较小的模型,无法生成计算机能够实际打开的文件。

  • 类比: 这就像 AI 写了一封优美的信,但它忘了把信装进信封,或者信封是用胶水封死的,邮递员根本打不开。即使信件本身完美无缺,如果无法交付,它也是徒劳的。只有少数顶尖模型能够稳定地生成“可打开”的文件。

3. AI 对阵人类专家。
研究人员让人类专家针对相同的描述绘制了地图。

  • 结果: AI 和人类在整体技能水平上表现得惊人地接近。
    • AI 的优势: AI 在遵循严格的语法规则和使地图看起来整洁有序方面,实际上做得更好。
    • 人类的优势: 人类在捕捉故事深层的含义和逻辑方面略胜一筹。
    • 结论: AI 不再是一个笨拙的初学者;它已经达到了可以与人类专业人士竞争的水平,尽管在处理故事最深层的细微差别时仍有挑战。

4. “精炼”循环。
研究人员给了 AI 第二次机会。如果 AI 犯了错,他们会告诉它:“嘿,你的文件损坏了,请修复它”,并让它再次尝试。这很有帮助,但并不是万灵药。

底线

这篇论文告诉我们,AI 已经准备好协助进行业务流程建模,但我们在选择 AI 时必须谨慎。

  • 不要只选最大的模型: 有时,中型模型才是那个“金发姑娘原则”下的最佳选择——恰到好处。
  • 有效性是关键: 如果 AI 甚至无法生成一个可以打开的文件,那么它内部的地图有多聪明都毫无意义。
  • 未来方向: 我们需要教导这些 AI 变得更加一致,并更好地理解业务流程背后的“故事”。

简而言之,AI 是一个非常有天赋的学徒,它精通规则且画线工整,但它仍然需要一位人类监督员,来确保它讲述的故事确实合乎逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →