← 最新论文
💻 computer science

Prompts in the Wild: A Large Analyzed Collection of Transactional Prompts in Code

本文引入了一种结构化本体,用于分析来自 GitHub 的 57,500 个独特的事务性提示词的大规模集合,将其转化为丰富的结构化语言对象,以揭示跨语言和跨领域的多种使用模式,并通过全面的误差分析验证标注质量。

原作者: Victoria Basmov, Yoav Goldberg, Reut Tsarfaty

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Victoria Basmov, Yoav Goldberg, Reut Tsarfaty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人去做一项特定的工作,比如写一首诗或修复计算机程序中的一个漏洞。你并不给机器人编写正式的编程代码,而是用平实的英语为它写下一套指令。这套指令被称为提示词(prompt)。把提示词想象成厨师的食谱卡。如果食谱很模糊(“做点好吃的”),厨师可能会猜错。但如果食谱很详细(“切两个洋葱,翻炒五分钟,加盐”),厨师就会确切地知道该怎么做。长期以来,科学家们一直在深入研究这个“厨师”(AI 模型)本身,试图让它变得更聪明。但他们并没有对这些“食谱卡”(提示词)投入太多关注,而是将其视为杂乱、非正式的笔记,而非值得认真研究的对象。本文认为,这些提示词实际上是人类用来为 AI 编程的一种“新语言”,它们值得像任何其他语言或代码一样被进行分析。

这项研究背后的研究人员决定将提示词视为一个科学对象。他们深入挖掘了 GitHub 上的公共代码仓库,GitHub 就像一个软件开发人员分享作品的巨大图书馆。他们在寻找一种特定类型的提示词,称为事务型提示词(transactional prompt)。为了理解其中的区别,请想象与朋友的一次闲聊,你问:“天气怎么样?”而他们回答。那是一个“交互式”提示词。事务型提示词则不同,它就像是贴在机器上的预写指令,每当按下按钮时就会自动运行。它是为了重复、稳健以及作为更大软件系统的一部分而设计的。团队收集了 57,500 个这类独特的、现实世界的提示词,以观察它们的形态、结构以及人们究竟在要求 AI 做什么。

为了理清这堆庞大的文本,作者构建了一个特殊的“地图”或本体(ontology)。想象一下试图整理一个堆满了随机物品的杂乱阁楼。如果没有系统,那只会是一片混乱。这个本体就像一套带有标签的盒子和标签,让研究人员可以将提示词分类:它用什么语言编写?任务是什么?是否需要特定的格式?提示词是否在告诉 AI 不要 做什么?通过将非结构化文本转化为这些丰富的、结构化的数据点,他们才能够开始提出严肃的问题。

他们发现了什么?首先,数据展示了巨大的多样性,但它遵循一种被称为 齐普夫分布(Zipf-like distribution) 的模式。你可以把这想象成一个城市的统计:一些大城市(如英语)拥有数百万人口,而数千个小村庄(其他语言)的人口则非常稀少。在提示词的世界里,英语是那个巨型城市,占据了约 84.66% 的比例。然而,仍然有 62 种不同的语言被体现出来,甚至在这些英语提示词中,人们也经常提到其他语言(例如要求 AI “翻译成西班牙语”),显示出了一个隐藏的语言多样性层面。

研究还表明,这些提示词具有惊人的复杂性。它们不仅仅是简单的句子。平均而言,每个提示词包含大约 6.85 个不同的“指令块”。这些指令块就像食谱中的步骤。最常见的步骤包括诸如“这是上下文”、“不要让答案太长”或“将结果输出为 JSON 文件”之类的内容。有趣的是,约 31% 的提示词包含“负面指令”——即告诉 AI 不要 做什么,比如“不要幻觉”或“不要使用多余的文本”。这表明开发者一直在努力约束 AI 过于话痨或编造事实的倾向。

研究人员还观察了人们如何构建这些提示词。他们发现最常见的设置是两部分的对话:一个“系统(System)”消息(设定规则,如“你是一个得力的助手”)和一个“用户(User)”消息(给出具体任务)。这种“系统-用户”组合已成为事务型提示词的标准单元,出现在 64% 的案例中。看起来,开发者将“系统”角色视为一个静态配置层,而将“用户”角色视为动态输入,而不是在单个脚本中使用 AI 进行复杂的、多轮的角色扮演游戏。

在人们实际做的事情方面,NLP 任务(自然语言处理,如总结文本或回答问题)是最受欢迎的,前四个任务涵盖了近一半的数据。然而,数据的“长尾”部分显示,人们将 AI 用于各种奇特且美妙的事情,从游戏策略到政策生成。数据还表明,大多数此类提示词都是“落地(grounded)”的,这意味着它们依赖于提示词中提供的特定上下文(如文档或代码片段),而不是仅仅依赖 AI 的内部记忆。约 89.25% 的案例使用了这种落地方式。

作者谨慎地指出,他们的发现来自于互联网的一个特定切片(使用特定 Python 库的公共 GitHub 项目),因此可能无法代表所有存在的提示词。他们还使用了 AI 来辅助标注和分析数据,这意味着其中存在一些误差,尽管他们检查了质量并发现对于大多数类别,准确度都相当高(通常超过 90%)。

最终,这篇论文不仅给了我们一份提示词清单,还给了我们一个工具包。作者发布了数据集和一个特殊的网站,任何人都可以通过其特征来浏览、搜索和探索这些提示词。他们希望这能帮助科学家、工程师和语言学家理解人类是如何真正与 AI 进行交互的。通过将提示词视为第一等的科学对象,我们可以开始观察人们塑造这些强大机器行为时的模式、“潜规则”以及创造性的方式。这是理解我们正在创造的、用于与数字伙伴交流的新语言的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →