Information Extraction from Electricity Invoices with General-Purpose Large Language Models
本研究证明,对于未经微调的通用大语言模型从西班牙语电力发票中提取信息而言,提示工程的质量是决定性能的关键因素,其中少样本策略显著优于零样本基线,实现了超过 96% 的 F1 分数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你面前有一大堆来自不同公司的电费账单。有些整齐划一,有些杂乱无章,而且它们的外观都略有不同。你的目标是从每一份账单中提取特定的数字和名称(例如“总费用”或“客户姓名”),并将它们填入一张整洁的电子表格中。
多年来,计算机一直难以应对这一任务。老式程序就像僵化的机器人:如果账单的外观与它们训练时所见哪怕有一丁点不同,它们就会困惑并失败。
本文讲述的是如何教导一种新型的“超级智能机器人”(称为大语言模型,或 LLM)来阅读这些账单,而无需针对每一种新设计重新训练。研究者们提出了一个问题:我们是否只需给这些智能机器人提供正确的指令,它们就能自行搞定?
以下是他们研究发现的拆解,并辅以一些日常类比:
1. “食谱”比“厨师帽”更重要
研究者们测试了两位不同的“厨师”(AI 模型):Gemini 1.5 Pro(一位庞大且复杂的厨师)和 Mistral-small(一位更小、更快、更高效的厨师)。
他们还尝试调整“烹饪设置”(如温度和随机性等技术参数)。他们原本以为,也许是更大的厨师或完美的烹饪设置会带来最大的差异。
令人惊讶的是: 使用哪位厨师或如何调整设置,结果差异并不大。结果的差别微乎其微——就像一块 99% 完美的蛋糕和一块 99.5% 完美的蛋糕之间的区别。
真正的赢家: 提示词(Prompt),即给 AI 的指令。
把提示词想象成食谱。
- 零样本(无食谱): 仅仅说“阅读这份账单并给我数字”,就像让厨师在没有食谱的情况下烹饪。结果尚可(准确率约 78%),但不够出色。
- 少样本(带示例): 给 AI 提供几个“这是一份账单,这是我要的数据”的示例,就像给厨师一道样板菜让其模仿。准确率跃升至 96% 以上。
启示: 关键不在于拥有最昂贵的厨师或最华丽的烤箱,而在于编写一份真正出色的食谱。
2. “模仿者”策略效果最佳
研究者们尝试了不同的示例提供方式:
- “单样本”方法: 展示一个示例。效果不错,但并非最佳。
- “交叉验证”方法: 这是冠军。他们向 AI 展示了三种不同类型的账单(例如表格型、列表型和复杂型),然后让它阅读一种它从未见过的第四种类型。
- 结果: AI 成为了模仿大师。它学会了电费账单的概念,而不仅仅是某一种特定账单的外观。使用 Gemini 时,它达到了 97.6% 的准确率,使用 Mistral 时达到了 96.1%。
3. “翻译”问题
在 AI 能够阅读账单之前,研究者们必须将 PDF 文件转换为文本(Markdown)。
- 类比: 想象试图透过脏窗户复印来阅读一张手写便条。如果便条排列在整洁的表格中,出来的文本就很清晰。如果便条被挤在杂乱的多栏布局中,文本就会变得混乱。
- 发现: AI 的表现取决于它接收到的文本质量。当账单具有干净、类似表格的布局时,AI 的表现近乎完美。当账单是杂乱、密集的设计时,AI 就会挣扎,因为从 PDF 到文本的“翻译”丢失了重要线索。
4. “幻觉”陷阱
他们注意到了两位“厨师”之间的性格差异:
- Gemini(谨慎的厨师): 如果不确定数字在哪里,它会说“我没看到”。它非常准确,但有时会遗漏内容。
- Mistral(自信的厨师): 如果不确定,它仍会猜测一个数字。它几乎找到了所有内容(高“召回率”),但它编造了一些不存在的数字(低“精确率”)。
- 结论: 如果你需要 100% 确定数字是真实的,你需要那位谨慎的厨师。如果你想找到所有内容并稍后检查答案,那位自信的厨师也可以接受。
5. 击败旧式机器人
本文将这些新型 AI 厨师与老式“机器人”(传统机器学习)进行了比较。
- 旧式机器人: 如果你用 A 类账单训练它,它可以完美地阅读 A 类账单(91% 的准确率)。但如果你给它 B 类账单,它就会彻底崩溃(准确率降至 67%)。它记住了纸张的外观,而非含义。
- 新型 AI: 它不需要针对 B 类账单进行训练。因为它理解了电费账单的含义,它以 95% 以上的准确率阅读了新型账单。它泛化了这项技能,而不是死记硬背模式。
总结
该论文得出结论:要让计算机完美地阅读商业文档,你无需为每一种文档类型构建一个定制的大脑。相反,你只需要编写更好的指令,并向它展示几个好的示例。
“秘密配方”不在于 AI 模型的规模或复杂的数学设置,而在于提示词(指令)的质量,以及文档转换为 AI 可读文本的效果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。