← 最新论文
💬 NLP

Designing large language model prompts to extract scores from messy text: A shared dataset and challenge

本文介绍了一个包含 1,446 条带有英国质量评分的杂乱研究文本的共享数据集,以及一项相应的挑战,旨在设计最优的大型语言模型提示词,以准确提取有效评分或识别缺失值,目标是超越 72.6% 的初始准确率基准,同时推进对复杂数值任务中提示工程的理解。

原作者: Mike Thelwall

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Mike Thelwall

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正试图整理一大堆信件的图书管理员。每封信都是由一个机器人(AI)写的,用来描述一篇研究论文有多好。这些机器人本应给出一个简单的评分,比如 1 到 4 星的星级分数。

但这些机器人写得非常乱。有些信件以分数开头,有些把分数藏在段落中间,有些给出了三个不同的分数却忘了合并它们,还有些只是在闲聊而根本没有给出分数。更糟的是,有些机器人甚至会发明一些虚假的分数,比如“95%”或“4/5”,而规则只允许 1 到 4 星。

问题所在
迈克·瑟尔瓦尔(Mike Thelwall),这篇论文的作者,收集了 1,446 封这样混乱的信件。他称之为“共享数据集”。他的目标是挑战其他研究人员,去为一个新的、更聪明的机器人编写一本“神奇的说明书”(称为 提示词/Prompt)。

这个新机器人的任务是阅读这些混乱的信件并提取出正确的数字。但它必须遵守两条严格的规则:

  1. 做一个侦探: 它必须在信件令人困惑的情况下也能找出正确的评分。如果信件分别提到了“原创性”、“重要性”和“严谨性”,机器人需要知道要将它们取平均值。如果信件没有分数,它必须说“-1”(这意味着“我不知道”)。
  2. 做一个机器人,而不是话痨: 机器人只能吐出那个数字(例如“3*”或“-1”)。它不能说:“我认为分数是 3,因为……”如果它增加了任何多余的词汇,答案就是错的。

挑战
把这想象成一场由一个非常听话但有点糊涂的机器人参与的“老师说”游戏。

  • 当前得分: 作者尝试了一份简单的说明书,机器人的正确率约为 73%
  • 目标: 挑战在于,任何人都可以设计一份更好的说明书,以获得更高的分数。

为什么要这样做?
这篇论文并不是关于现在就用这个来给真实的学生的论文评分或修正医疗诊断。相反,这是一个训练练习。通过迫使研究人员研究如何让机器人从混乱的文本中提取特定的数字,我们学习到:

  • 如何与机器人沟通,让它们听得更好(提示词设计)。
  • 机器人在哪里会感到困惑,以及如何修复这些指令。
  • 如何处理机器人不确定的情况(知道何时说“-1”而不是瞎猜)。

底线
这篇论文是一份竞赛邀请函。它在说:“这里有一堆混乱的机器人笔记和一份正确答案列表。你能写出一套完美的指令,让机器人阅读这些笔记并每次都给你那个完全正确的数字吗?”获胜者将是那个能获得最高正确百分比的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →