BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model
本文介绍了 BEiTScore,这是一种无需参考的图像描述评估指标,它利用经对抗性大语言模型增强数据训练的轻量级交叉编码器模型,在保持计算效率的同时,实现了在敏感性和组合泛化方面的最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位艺术评论家,正在给一名学生对一幅画的描述打分。学生说:“一只红色的狗在追一个蓝色的球。”但在画中,狗实际上是蓝色的,正在追一个红色的球。
长期以来,试图给这些描述打分的计算机就像那些只看用词列表、而不看其所讲述故事的评论家。如果学生列出的词汇与画中出现的词汇(红、狗、蓝、球)相匹配,计算机就会给出高分,即使描述完全错误。这就像一位老师仅仅因为学生使用了正确的词汇,就给写下“蓝色的球在追红色的狗”的学生打了"A",而完全忽略了这句话毫无意义。
本文介绍了一种名为BEiTScore的新型、更智能的评分系统。其工作原理简要分解如下:
1. 问题:“词袋”陷阱
大多数当前用于检查图像描述(如基于 CLIP 的模型)的计算机程序,将句子视为一个弹珠袋。它们只计算袋子里有多少个“红”弹珠或“狗”弹珠。如果袋子里有正确的弹珠,它们就认为描述是好的。
- 缺陷:它们无法区分“狗追猫”和“猫追狗”。它们在处理长故事时也力不从心。如果描述过长(超过 77 个词),这些程序往往会停止阅读并随意猜测,从而遗漏末尾的细节。
2. 解决方案:“侦探”模型
作者构建了BEiTScore,它不像一个数词机器,而更像一名侦探。
- 思考方式:它不只是查看词汇列表,而是同时审视整幅图像和整句话。它会问:“这个特定的词是否适合这张特定图像中的这个特定位置?”
- 训练过程:为了训练这位侦探,作者不仅展示了正确的描述,还利用一个“反派”(一个强大的 AI)生成了棘手、虚假的描述。
- 示例:AI 会将正确的句子进行角色互换:“男人抱着女人”变成“女人抱着男人”。
- BEiTScore 模型被训练去识破这些细微的诡计,学会关注谁对谁做了什么,而不仅仅是存在哪些物体。
3. “长故事”挑战
想象一下试图读一本小说,但你的眼睛只能聚焦在前两句话上,随后就会疲劳。这就是旧模型处理长标题时的做法。
- BEiTScore 的超能力:它是在关于图像的长篇详细描述上训练出来的。它可以从头到尾阅读整个标题,而不会感到“疲劳”或失去焦点。它能够发现那些发生在长描述中间深处或最末端的错误,而这些错误是其他模型会遗漏的。
4. 结果:更智能、更快速
论文将 BEiTScore 与两类竞争对手进行了测试:
- “数词者”(编码器):它们速度快,但经常在细节上犯愚蠢的错误。
- “巨脑”(大语言模型,LLMs):这些是庞大、超级智能的模型,能够阅读长故事并发现细节,但它们运行缓慢且昂贵(就像用超级计算机去核对购物清单)。
BEiTScore 的成就:
- 它比“数词者”发现了更多的错误。
- 在发现复杂错误(如角色互换或物体计数)方面,它几乎和“巨脑”一样出色。
- 最棒的部分:它的运行速度比“巨脑”快 30 到 100 倍。这就像拥有一位像天才一样敏锐,但工作速度却像普通人一样的侦探。
5. 新测试(LongCapVLCP)
作者意识到旧的测试太容易了;它们只使用短句。因此,他们构建了一个新的、更难的测试,称为LongCapVLCP。
- 该测试使用非常长的描述,并包含棘手的错误,例如图像内部嵌入的文字(例如,背景中一个写着“营业中”的招牌)。
- 在这个新的、困难的测试中,BEiTScore 证明了它能够阅读长文本并发现错误,而旧的“数词者”则完全失败。
总结
BEiTScore 是一种用于给图像描述打分的新工具。它通过学会理解词汇与图像之间的关系,解决了计算机仅靠数词来评分的旧问题。它足够聪明,能捕捉长描述中细微的谎言;足够快速,可应用于成千上万张图像;而且不需要昂贵、缓慢的超级计算机来完成任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。