Iterative Definition Refinement for Zero-Shot Classification via LLM-Based Semantic Prototype Optimization
本文提出了一种无需训练、迭代式的框架,该框架利用大语言模型基于误分类信号逐步优化类别定义,从而在不更新模型参数的前提下,显著提升各类嵌入模型在零样本网络内容分类任务中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个非常聪明但极其字面化的机器人,如何将一大堆杂乱无章的网页分类到“体育”、“烹饪”或“新闻”等不同文件夹中。
通常,要教机器人,你需要向它展示每种类型网页的数千个示例,并让它从错误中学习(这被称为“训练”)。但如果你没有时间这样做,或者机器人已经“冻结”且无法学习新事物呢?
本文提出了一种巧妙的技巧:与其试图改变机器人的大脑,不如改变文件夹上的标签。
核心问题:模糊的标签
将机器人想象为拥有一个超精准的 GPS(即“嵌入模型”)。它确切知道每个网页在一张巨大、无形的地图上的位置。然而,机器人需要知道“体育”文件夹在哪里,“新闻”文件夹又在哪里。
如果你告诉机器人,“体育”文件夹就是“关于游戏的东西”,而“新闻”文件夹是“关于事件的东西”,机器人就会感到困惑。这些描述过于模糊。在机器人的地图上,“体育”和“新闻”文件夹最终会紧挨在一起,导致机器人不断将足球比分放入新闻文件夹,而将关于丑闻的突发新闻放入体育文件夹。
解决方案:“定义精炼”循环
作者构建了一个系统,其中第二个、甚至更智能的人工智能(大型语言模型,或 LLM)充当标签编辑。以下是该过程的逐步说明:
- 初步猜测:系统从文件夹的简单、通用定义开始(例如,“关于体育的网页”)。
- 测试:机器人尝试对网页进行分类。它会犯错。
- 反馈:系统查看哪些页面被混淆了。它是将“游戏”页面与“体育”页面混淆了吗?
- 编辑的工作:LLM(编辑)查看这些错误,并说:“啊,‘体育’的定义太宽泛了。让我们使其更具体:‘关于体育竞技和团队比分的网页,不包括电子游戏’。”
- 更新:系统用这个新的、更清晰的定义更新“体育”标签,然后再次尝试。
- 重复:这个过程反复进行。机器人分类得越来越好,不是因为其大脑改变了,而是因为指令(定义)变得更清晰了。
三种“编辑”策略
本文测试了编辑(LLM)从错误中学习的三种不同方式:
策略 1:“展示与讲述”(示例引导)
编辑会看到一个被正确分类的页面的随机示例。它利用这个示例来调整定义,以匹配该特定示例。这就像说:“这是一张猫的图片;确保你的‘猫’的定义符合这张图片。”策略 2:“故障排除者”(混淆感知)
编辑只关注那些最常被混淆的文件夹对。如果“电影”和“电视节目”不断被互换,编辑会专门重写这两个定义,以突出它们之间的差异。这就像老师只专注于学生反复做错的数学题。策略 3:“时间旅行者”(历史感知)
这是最先进的方法。编辑不仅查看当前的错误,还查看它迄今为止尝试过的所有定义的历史。它会记住:“上次我把定义变长时,情况变糟了;上次我把定义变短时,情况变好了。”
为了避免陷入糟糕想法的循环,系统使用了一种数学技巧(称为模拟退火,类似于金属缓慢冷却以变得坚固的过程)。这允许系统偶尔接受一个“更差”的定义,仅仅是为了看看它是否会在后来导向更好的结果,从而防止其陷入局部困境。
结果
研究人员在 13 种不同类型的机器人大脑(嵌入模型)和两组不同的网页上测试了这种方法。
- 无需训练:他们无需重新训练机器人。他们只需更改标签。
- 显著改进:在几乎所有情况下,系统的分类能力都显著提高。有些机器人的准确率提高了近 20%。
- “时间旅行者”获胜:查看历史并使用“冷却”技巧的策略(策略 3)通常表现最佳。
- 视觉证明:他们展示了地图,其中“体育”和“新闻”文件夹最初像两堆杂乱的衣物一样重叠。在定义经过精炼后,这些堆栈清晰地分离成不同的组。
结论
本文证明,在人工智能领域,如何描述一个类别与人工智能本身同样重要。通过使用智能人工智能迭代地完善类别描述,你可以让一个“冻结”的人工智能在不教授任何新事实的情况下,变得更擅长对网络内容进行分类。
他们还发布了一个包含 10,000 个网页的新数据集("B2MWT-10C"),带有经人工验证的标签,以帮助他人测试这一想法,因为找到高质量、人工标注的网页数据非常难得。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。