← 最新论文
🤖 AI

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

本文介绍了 Yuvion VL,这是一个专为内容与 AI 安全而构建的多模态基础模型家族,它利用对抗感知数据流水线、三阶段训练策略以及一种新颖的“先混淆后对比”微调框架(Confuse-then-Contrast Fine-Tuning framework),在识别现实世界多模态风险方面实现了行业领先的鲁棒性与性能。

原作者: Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Che
发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一座巨大的、繁忙的城市,每天都有数十亿人分享照片、视频和信息。在这座城市里,有一些“坏人”试图潜入并传播有害物品——比如危险武器、非法药物或冒犯性内容——但他们变得非常狡猾,擅长隐藏行踪。他们可能会把武器涂装成玩具的样子,或者在巨大的全家福照片中藏入一个微小的非法符号,亦或是将一条危险的信息伪装成一条无害的广告。

通用人工智能(General AI)模型就像是这座城市里新来的高学历警察。他们很聪明,几乎能理解任何事物。然而,面对这些巧妙伪装的“坏人”时,他们经常会被骗。他们可能会看着一张孩子玩耍的照片,却忽略了背景中隐藏的不当物品;或者他们会认为一把真枪只是一个色彩鲜艳的塑料玩具。

走进 Yuvion VL:专业的安全侦探

这篇论文介绍了一种名为 Yuvion VL 的新型 AI 模型,它被专门打造为一名“安全侦探”。与那些试图处理一切事务的通用警察不同,Yuvion VL 从底层构建起时,其核心任务只有一个:识别图像和文本中隐藏的危险,即使坏人试图进行欺骗。

以下是通过简单的类比来解释该团队是如何打造这位侦探的:

1. 训练场:向“坏人”学习

要培养一名优秀的侦探,不能只给他们看美好的事物。你必须向他们展示犯罪分子使用的诡计。

  • “对抗性”数据: 研究人员不仅仅收集普通的照片。他们构建了一个特殊的训练系统,可以自动生成“具有误导性”的案例。想象一下,一位老师不仅向学生展示一个真实的苹果,还会展示一个蜡制的苹果、一个塑料苹果,以及一个贴着改变其含义的小标签的真实苹果。Yuvion VL 在数百万个这样的“诡计”案例上接受了训练,学会了识别他人会忽略的微小细节,比如隐藏着不良信息的微小水印,或者为了看起来像假品牌而被轻微扭曲的标志。
  • “混淆后对比”法 (C2FT): 这是该论文的“秘密武器”。想象一下,你正在教一个人如何分辨一张真正的 100 美元钞票和一张非常逼真的假钞。如果你一次只展示一张钞票,他们可能会感到困惑。但如果你把真钞和假钞放在一起对比,并说:“看,注意看这处细微的油墨差异,”他们就会学得更快。Yuvion VL 使用了一种称为 C2FT 的技术,它被展示成对的图像,这些图像看起来几乎一模一样,但其安全含义却截然不同。这迫使 AI 盯着这些差异看,直到它无法再错过为止。

2. 三阶段教学

该模型并非一夜之间学会了安全规则。它经历了一场严格的三阶段教育:

  • 第一阶段:学习危险的词汇。 首先,它学习将视觉事物(如特定的旗帜或符号)与其危险含义联系起来。这就像是学习明白某个特定的红色圆圈不仅仅是一个形状;在特定语境下,它意味着“停止”或“危险”。
  • 第二阶段:学习城市的规则。 接着,它练习现实世界的安全任务。它学习如何判断“安全”或“不安全”,解释为什么某物是不安全的,并遵循关于不同国家或不同平台允许内容的复杂规则。
  • 第三阶段:学习“大声思考”。 最后,模型被教会了“大声思考”(思维链,Chain-of-Thought)。它不再只是猜测“这是坏的”,而是学习展示其推理过程:“我看到了一把枪,但手柄看起来很真实,且背景是战场,因此这很可能是一件真实武器,而非玩具。”这使得它的决策更容易被信任和检查。

3. 最终考试:Yuvion RiskEval

我们如何知道这位侦探是否真的优秀?研究人员创建了他们自己的“最终考试”,称为 Yuvion RiskEval。这不仅仅是一个测试,而是一系列 58 个不同的挑战。

  • 有些测试检查 AI 是否在处理正常事物(如数学或图表阅读)方面依然聪明,以免它变成一个“只会一招的专才”。
  • 其他测试则是“陷阱考试”,旨在用隐藏的风险、虚假标志或 AI 生成的图像来欺骗 AI。
  • 最后的测试基于现实世界的商业场景,例如检查产品照片是否实际上是在销售非法物品。

结果:小而强大

论文声称 Yuvion VL 非常有效:

  • 大赢家: 其 320 亿参数版本(大型模型)得分高于几乎所有测试过的其他模型,包括其他公司的巨型商业模型。它在识别安全风险方面以显著优势击败了它们。
  • 黑马: 即使是较小的版本(80 亿参数)也是一名明星。它在许多安全任务上表现出了超越许多更大、更昂贵模型的实力。这就像是一个训练有素的小型侦探,抓获的罪犯比一支庞大却分心的安保团队还要多。
  • AI 检测: 它也非常擅长识别由其他 AI 生成的图像,这在诈骗和虚假信息问题日益严重的今天正成为一个巨大的难题。

总结

Yuvion VL 是一个专门设计的工具,旨在解决一个特定且复杂的问题:在一个坏人不断试图隐藏行踪的世界里,寻找隐藏的危险。通过在“诡计”数据上进行训练、使用侧重对比的方法来学习细节,并强制要求其解释推理过程,它已成为目前最准确的“安全侦探”,能够洞察其他 AI 会错过的隐形风险。

注:作者提到,由于该模型涉及敏感且可能有害的内容,他们在发布方式上非常谨慎。他们计划仅分享特定部分,目前正在评估公开该模型的风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →