← 最新论文
💻 computer science

What You Prompt is What You Get: Increasing Transparency of Prompting Using Prompt Cards

该论文针对大语言模型提示工程缺乏标准化文档与评估的难题,提出受模型卡片启发的“提示卡片”方法,通过结构化记录提示目标、设计决策及评估实践,以提升提示过程的透明度、可复现性并优化文本生成质量。

原作者: Amandine M. Caut, Beimnet Zenebe, Amy Rouillard, David J. T. Sumpter

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Amandine M. Caut, Beimnet Zenebe, Amy Rouillard, David J. T. Sumpter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种解决人工智能(AI)领域“黑箱”问题的新方法,叫做**“提示卡”(Prompt Cards)**。

为了让你轻松理解,我们可以把大语言模型(LLM,比如 ChatGPT)想象成一位才华横溢但性格多变的“超级厨师”

1. 现在的困境:只给菜名,不给食谱

以前,我们评价一位厨师(AI 模型)好不好,主要看他的**“招牌菜”(模型本身)。我们会给模型做各种标准测试(比如“切菜速度测试”或“调味准确度测试”),这就像给厨师发一张“模型身份证”(Model Card)**,上面写着他的学历、擅长菜系和使用的食材。

但是,现在的 AI 时代变了。我们不再只是依赖厨师的“招牌菜”,而是开始**“点菜”(Prompt Engineering)**。我们会给厨师写非常详细的指令:“请用四川口味,把这块牛肉做成像红烧肉一样,但不要放糖,还要加一点柠檬汁。”

问题出在哪?

  • 指令太随意: 每个人写的指令(Prompt)千差万别。同样的厨师,你让他“做红烧肉”,他可能做出来是甜的;你让他“做微辣红烧肉”,他可能做出来是辣的。
  • 无法复现: 如果你今天写了一个完美的指令,明天换个说法,或者换个时间,厨师做出来的味道可能完全不一样。
  • 缺乏记录: 很多人只把“菜”(结果)端上桌,却把“食谱”(指令细节、数据来源、思考过程)扔进了垃圾桶。如果别人想学做这道菜,或者想检查这道菜里有没有毒(偏见、错误信息),根本无从下手。

这就好比厨师说:“我凭感觉做的。”但没人知道他的“感觉”到底是怎么来的。

2. 解决方案:给“指令”也发一张身份证

这篇论文的作者们提出:既然“模型”需要身份证,那么“指令”(Prompt)也需要一张身份证,我们叫它“提示卡”(Prompt Card)。

这就好比在餐厅里,不仅要有厨师的简历,还要在每道菜的菜单上,附带一张**“烹饪说明书”**。

这张“提示卡”里应该包含什么?作者用了一个叫**“文字化”(Wordalisation)**的例子(把枯燥的数据变成生动的故事)来演示,卡片里必须包含:

  • 厨师是谁(模型详情): 你用的是哪个版本的 AI?(因为 AI 经常更新,就像厨师换了新菜谱,味道会变)。
  • 这道菜是给谁吃的(预期用途): 这个指令是给学生看的,还是给专业球探看的?警告: 别拿这个去给职业球队做签约决定,因为数据可能过时了。
  • 食材从哪来(数据集): 你的数据是哪里来的?是维基百科?还是某个问卷调查?有没有包含偏见?(比如,如果数据只来自男性球员,那生成的描述可能就不适合女性)。
  • 烹饪环境(上下文): 你给厨师提供了什么背景信息?比如,“请扮演一个严厉的球探”或者“请引用维基百科关于性格的描述”。
  • 烹饪步骤(指令架构): 你是怎么一步步引导厨师的?先让他看什么,再让他想什么?
  • 安全与隐私(数据安全): 你有没有把客户的隐私(比如病人的名字、身份证号)直接发给云端?如果发给了,有没有风险?
  • 伦理与偏见(伦理考量): 这道菜会不会冒犯某些人?比如,用性格测试来招聘,会不会导致公司只招同一类人,从而失去多样性?

3. 为什么要这么做?(核心比喻)

比喻一:从“考试”到“日记”

以前,我们评价 AI 就像**“考试”**(Benchmarking)。我们给 AI 一套标准试卷,看它考多少分。

  • 缺点: 就像如果题目稍微改一个字,分数就天差地别。而且,很多现实世界的问题(比如“把球员数据写成感人的故事”)根本没法出标准试卷。

现在,作者提倡像**“写日记”**一样。

  • 优点: 你不需要考满分,但你需要诚实。你记录下:“今天我用这个指令,是因为我想强调球员的团队精神,但我忽略了年龄因素,所以结果可能有点偏颇。”
  • 好处: 这样,别人看到你的“日记”(提示卡),就能明白你的思路,知道哪里可能出错,也能放心地模仿或改进你的做法。

比喻二:透明厨房

现在的 AI 应用就像**“透明厨房”**。

  • 如果没有提示卡,顾客(用户)只能看到端上来的菜,不知道里面有没有放老鼠药(偏见),也不知道厨师是不是偷工减料(幻觉/胡编乱造)。
  • 有了提示卡,就像在厨房墙上贴了**“透明菜单”**。顾客可以清楚地看到:
    • “这道菜用了 2022 年的数据(可能过时)。”
    • “厨师在描述时,特意强调了‘外向’,但忽略了‘内向’的优点。”
    • “这道菜不适合对花生过敏的人(伦理限制)。”

4. 总结:这篇论文想告诉我们什么?

这篇论文的核心思想是:在 AI 时代,光有强大的模型(厨师)是不够的,我们更需要透明的指令(食谱)和诚实的记录(提示卡)。

  • 不要只盯着“考试分数”: 传统的 AI 评测(Benchmark)在很多复杂任务上已经失效了。
  • 要追求“透明度”: 通过“提示卡”,把那些原本藏在脑子里的、隐形的决策(比如“我为什么选这个数据”、“我为什么这么写指令”)全部显性化地写出来。
  • 为了负责任: 这样不仅能防止 AI 胡说八道(幻觉)或带有偏见,还能让普通人、监管者和开发者都能理解 AI 到底是怎么工作的,从而更安全、更信任地使用它。

一句话总结:
以前我们只关心 AI 这个“大脑”聪不聪明;现在,我们要给 AI 的“说话方式”(指令)发一张**“透明身份证”**,告诉全世界:我是怎么想的,我用了什么材料,我可能有什么缺点。这样,大家才能放心地吃下这碗“人工智能”做的饭。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →