Extracting and Coding Digital Sustainability Data using Text Mining and AI: A Design Science Approach
本研究采用设计科学方法,开发并验证了结合文本挖掘、专用词典和生成式人工智能提示词的半自动人工制品,这些人工制品在保持与专家人工编码高度一致性的同时,显著提升了从文本源中提取和编码数字化可持续性数据的效率与可扩展性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解一个巨大谜题的侦探:公司是如何利用技术来帮助地球和人类的?这些线索并不是藏在尘封的阁楼里,而是埋藏在公司每年编写的成千上万份厚重、枯燥的报告之中。这些报告就像是巨大的文本图书馆,充满了关于“绿色数据中心”、“智能传感器”和“数字公平”之类的词汇。问题在于,靠手工阅读每一份报告的每一页,就像是用吸管试图喝干大海——这既耗时又漫长,而且你可能会错过最重要的一滴水。这就是“数字可持续发展”(Digital Sustainability)的世界,研究人员在这个领域研究计算机和软件如何让世界变得更好。但为了理解大局,他们需要快速找到并分类这些线索。这正是“文本挖掘”(教计算机阅读并寻找模式)和“生成式人工智能”(能够写作和思考的超智能聊天机器人)发挥魔力的地方。研究人员不想溺死在文书工作中,他们希望有一个机器人助手来承担繁重的体力活,这样他们就能专注于解开谜题。
这篇论文正是关于构建这样一个机器人助手的。研究人员 Thomas Abraham、Viet Dao 和 Nesreen El-Rayes 决定使用一种称为“设计科学”(Design Science)的方法,这基本上是一种高级说法,意为:“让我们制造一个工具来解决问题,测试它,然后使其变得更好。”他们的目标是创建一个半自动系统,该系统可以扫描可持续发展报告,提取出相关的数字可持续发展故事,然后将这些故事整齐地分类到逻辑清晰的类别中。他们不仅仅是在凭空猜测,而是构建了三个具体的“人工制品”(工具):一个专门用于寻找关键词的词典、一套教人工智能如何思考的指令(提示词),以及如何将它们结合使用的整个流程。
首先,他们解决了“寻找”的部分。想象一下你正在洞穴中寻找特定类型的宝藏。如果你只是大喊“宝藏!”,你会得到很多石头和泥土。你需要一张精确的地图。研究人员构建了一个“数字可持续发展词典”,它就像是一个经过高度调优的金属探测器。他们向其中输入了来自以往研究的数千个词汇,以教它“数字可持续发展”听起来究竟是什么样的。他们在包括 Biogen 和可口可乐在内的公司报告上测试了这个词典。结果令人印象深刻:计算机找到了人类专家通过人工查找发现的 94% 的数字可持续发展故事,但它完成的速度比人工快得多。它甚至还发现了 54 个人类错过的额外故事!然而,它并不完美;计算机有时会被像“网站”这样听起来很重要但实际上与可持续发展举措无关的词汇所分心。这告诉研究人员,虽然计算机是一个优秀的扫描仪,但它仍然需要人类来复核结果。
接下来,他们解决了“分类”的部分。一旦计算机找到了这些故事,它就需要把它们放入正确的盒子中。研究人员根据既定的理论使用了两种不同的“归档系统”。一种系统根据技术“做什么”(例如“自动化”一个流程或“转型”一种商业模式)来对故事进行分类;另一种系统则根据“谁受益”(例如“内部”与“外部”或“今天”与“明天”)来进行分类。为了教人工智能如何使用这些归档系统,他们并没有仅仅给它一个简单的命令。他们使用了“少样本提示”(few-shot prompting)技术,这就像是给人工智能展示几个完成后的拼图示例,然后说:“看,这个碎片是怎么嵌进去的?现在由你来完成剩下的部分。”他们利用三家公司的数据对人工智能进行了训练,让它犯错、纠正它,并不断完善其指令,直到它掌握了其中的逻辑。
当他们将这个训练好的 AI 应用于新公司(如强生和沃尔沃)时,结果非常有力。对于“做什么”的类别,AI 与人类专家的分类匹配度达到了 78%。对于“谁受益”的类别,匹配度达到了 85.3%。研究人员计算了一个名为“Cohen's Kappa”的分数,该分数衡量两个人(或一个人与一个机器人)之间的契合程度。该分数超过了 0.7,这被认为是一个很高的契合水平。这表明人工智能不仅仅是在瞎猜,它实际上是在学习研究人员的逻辑。
然而,论文谨慎地指出,这并不是一个能解决一切问题的“魔杖”。研究人员明确排除了这一过程可以完全自动化的想法。他们发现,AI 有时在理解业务背景方面需要帮助。例如,如果一家公司在数年间一直谈论某项安全系统,AI 可能会将其计为多个不同的项目,而人类则会知道这只是一个长期的单一项目。词典也不是完美的,它是一个需要随着新词汇进入世界而不断更新的生命体。作者得出结论:最好的方法是建立一种伙伴关系——计算机充当一个超快速的研究助手,承担寻找和分类的繁重工作,但人类专家必须始终参与其中,负责训练 AI、修正其错误并做出最终决定。
最后,这篇论文表明,我们不必在人类智慧和机器速度之间做选择。通过将文本挖掘和生成式人工智能与细致、循序渐进的训练过程相结合,研究人员可以比以前更快地建立大规模的数字可持续发展数据集。这还不是一个已解决的问题,但它是一个强大的新工具,让拯救世界的任务变得不再那么孤独,也变得更加高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。