← 最新论文
💻 computer science

The Say-Do Gap Architecture Applied to Agentic AI: A Reproducible NLP Pipeline for Detecting Governance Rhetoric–Reality Divergence in Corporate ESG Communication

本研究引入了一种可复现的双语自然语言处理(NLP)流水线,该流水线通过将“言行差距指数”(Say-Do Gap Index)架构应用于检测 IBEX 35 指数内企业修辞与代理型人工智能(agentic AI)可观测治理实践之间的分歧,展示了该框架在传统 ESG 领域之外的泛化能力。

原作者: Alfredo Merlet

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Alfredo Merlet

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代企业世界中,公司经常发布报告,详细阐述其负责任地管理新技术计划。它们谈论伦理、安全和监督,承诺对其使用先进工具的行为处于控制之下。然而,商业和治理领域面临着一个持久的挑战,即机构所言与其实际所为之间的距离。这种差距并非新技术所特有;每当一个机构对其内部实践做出公开声明时,这种现象就会出现。研究人员长期以来一直在研究这一现象,指出语言往往比支持这些言论所需的结构性变革更容易产生。当一家公司声称其正在治理一个复杂的系统,却缺乏可见的委员会、政策或认证来证明这一点时,结果就是修辞与现实之间的脱节。这种脱节至关重要,因为它可能会误导投资者、监管机构和公众,使其对企业责任的真实状态产生误解。

来自 IACC 专业学院的研究员阿尔弗雷多·梅雷特(Alfredo Merlet)的一项新研究,专门针对“代理人工智能”(agentic artificial intelligence)探讨了这一问题。这个术语指的是一种可以自主行动的人工智能,它可以在没有持续人类指令的情况下做出决策并采取行动。随着这些系统变得越来越普遍,公司开始讨论如何治理它们。梅雷特的著作不仅仅是在询问公司是否在谈论这项技术,而是在询问它们的言论是否与行动相符。为了回答这个问题,研究人员构建了一个全新的、可重复的系统,旨在衡量企业承诺与治理硬证据之间的差距。该研究以西班牙前三十五大公司名单——IBEX 35 指数为研究对象,将其作为测试该方法是否有效的案例。

这项研究的核心是一个流水线,或者说是一个将公司“所言”与其实际“所为”区分开来的逐步过程。“说”的部分来自于这些公司在 2023 年至 2025 年间发布的数千篇新闻文章和企业通信。研究人员使用了一种专门的计算机程序来扫描这些文本中关于代理人工智能治理的提及。该程序经过训练,能够识别与监督和控制相关的特定语言,从而区分公司仅仅是在谈论使用人工智能,还是在讨论如何管理该人工智能带来的风险。“做”的部分则不同。与其依赖公司的自述,这一部分寻找的是物理证据。研究人员搜索了三种特定类型的证据:专门负责技术风险的董事会级委员会的存在、正式发布的 AI 治理政策文件,以及证明公司遵循外部认证标准的证据。这些是可验证的实物,不像演讲或新闻稿那样难以捉行。

当研究人员将该系统应用于样本中的三十四家公司时,结果令人震惊,尽管可能并非人们预期的那样。研究发现,该系统几乎没有检测到企业通信中存在代理人工智能治理的论述,相应地,也未发现管理该技术所需的特定治理结构。在 2023 年至 2025 年期间,通过对新闻和报告的计算机分析发现,代理人工智能的提及率在结构上极低或为零,而对三种类型硬证据的搜索对于绝大多数公司来说也是空手而归。为了确保这不是计算机阅读错误,研究人员手动检查了被计算机标记为不含相关内容的文章样本。人工复核证实了计算机是正确的:这些公司尚未产生关于代理人工智能治理的显著论述,也没有展示出证明其正在进行管理的具体治理步骤。

这一结果具有重要意义,因为它证明了该方法是有效的。该研究的主要目的是测试最初为通用环境和社会议题构建的框架是否可以适配到特定的、技术性的自主人工智能领域。该系统成功识别出了一个“零结果”——即表明既缺乏论述也缺乏行动——这一事实证明了其架构是健全的,并且能够区分真实的发现与分类器错误。研究人员的目的并不是指责这些特定的西班牙公司失败;相反,目标是展示存在一种工具,可以衡量言论与实质之间的差异,即使这种差异表现为两者皆无。该研究明确排除了认为这是对整个行业进行最终审计或对每家公司诚信进行定论的观点。相反,它提出了一个可重复的工具,其他人可以用它来检查不同的市场或不同的技术。

这项工作的价值在于其透明度和开放性。研究人员已向公众开放了整个系统,包括计算机寻找的词汇列表以及用于寻找证据的代码。这使得其他科学家、监管机构或投资者可以使用相同的方法来检查其他国家的公司,或观察不同的新兴技术。研究表明,只要考虑到这些地区特定的文件和法规,这种方法可以适配到拉丁美洲及其他市场。它提供了一种超越仅仅阅读公司声称的内容,进而转向验证它们实际构建了什么的方法。

最终,本文提供了一种清晰、可重复的方式,用以观察公司的治理是否与其言论相符。它表明,对于该特定样本和时间窗口内的代理人工智能而言,目前的格局呈现出论述与控制的结构性证据均处于低水平的状态。这并不意味着这些公司在撒谎,但确实意味着其管理的可视化证明及其相关的论述目前尚处于缺失状态。研究结论指出,这种衡量差距的方法是理解企业行为的强大工具,可以应用于任何组织声称其如何管理复杂系统的场景。通过将承诺与证明分离,这项研究为看待快速演进的人工智能与企业责任的景观提供了一个新的视角。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →