← 最新论文
💻 computer science

In-Context Learning for Wound Classification with Small Multimodal Language Models

本研究表明,小型多模态语言模型可以通过基于检索的上下文学习有效地执行无需训练的伤口图像分类,通过利用查询条件的支撑示例和最大边际相关性重排序,在无需进行特定任务重训练的情况下,在公开数据集上实现了高准确率。

原作者: George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何识别不同类型的伤口,比如擦伤、灼伤或深切伤。通常情况下,要教会机器人这些知识,你必须向它展示数以千计的有标签图片,并通过一个叫做“训练”的过程让它强行记忆。这就像让一名学生为了单次考试而连续学习数周。但如果机器人可以在考试前直接看几个例子,并当场就能掌握呢?这就是“上下文学习”(In-Context Learning, ICL)背后的理念。想象一下,你在考试前递给一名学生一张“小抄”,上面有三个关于“灼伤”和“切伤”的完美范例。他们不需要背诵整本教科书;他们只需要看一眼这些例子,然后说:“哦,这个新伤口看起来很像那个灼伤的例子。”

现在,想象一下这个机器人很小,可以装进笔记本电脑或手机里,而不是运行在云端的巨型超级计算机上。这些被称为“小型多模态语言模型”(Small Multimodal Language Models, SMLMs)。它们在隐私保护方面表现出色,因为你不需要将私密的医疗照片发送到大型服务器;机器人可以直接在你的设备上进行思考。科学家们一直在探讨的一个核心问题是:这些小型、本地化的机器人是否真的能仅凭几个例子就做得很好,还是说它们必须依赖巨型超级计算机和海量训练数据才能做对?

这篇论文正是为了测试这个想法。研究人员想要看看他们是否可以使用这些小型、本地化的 AI 模型来对伤口图像进行分类,而无需每次都对其进行重新训练。他们使用两个公开的伤口照片集设计了一个实验:一个包含约 1,469 张图像,另一个包含 560 张。他们并没有直接让 AI 进行猜测(这被称为“零样本学习/zero-shot”,往往会导致瞎猜),而是尝试给它一份“小抄”作为示例。但这里的诀窍在于:他们并没有随机挑选例子。他们使用了一个智能搜索系统,来寻找与新伤口图像最相似的例子。

结果对于这些“小机器人”来说非常令人兴奋。当 AI 被给予一组经过智能筛选的示例时(具体来说,是使用名为 kNN 的搜索系统找到的 10 个示例,有时还会通过一种称为 MMR 的方法进行优化,以确保示例的多样性),它的工作表现得更出色了。在较大的数据集上,表现最好的小型模型——一个拥有 270 亿参数的 Qwen 3.5 版本——达到了 0.872 的准确率。这意味着它在超过 87% 的情况下都能诊断正确。在难度更大的较小数据集上,它仍实现了约 68% 的准确率。

研究还发现,机器人的规模很重要。较大的“小型模型”(如 27B 和 9B 版本)能够利用这些示例显著提高其猜测的准确性,通常甚至能击败仅根据最近匹配进行投票的标准计算机程序。然而,最小的模型则显得有些吃力,有时只是在机械地复制示例,而没有真正理解其中的细微差别。研究人员还发现,你并不需要一份庞大的“小抄”;添加超过 8 到 10 个示例并不会带来太多帮助,反而会让过程变慢。

至关重要的是,论文表明这种方法在不需要为每个新任务重新训练模型的情况下即可奏效。如果医生决定更改标签或观察的伤口类型,你只需更换提示词中的示例,模型就会立即适应。虽然性能并非完美,且高度依赖于优质的示例和足够规模的模型,但这项研究表明,小型、本地化的 AI 模型可以成为一种实用且注重隐私的伤口分类方式,为过去那些沉重且依赖大量数据的系统提供了一种灵活的替代方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →