← 最新论文
💬 NLP

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

该论文介绍了 VectraYX-Vision-1B,这是一款专为网络安全工具设计的、参数量在 2B 以下的西班牙语视觉语言模型,其特点是具备原生的结构化推理和工具使用能力,但由于训练限制和检查点错误,目前存在视觉接地能力较差的问题,因此发布了消融研究和开源资源以解决这些问题。

原作者: Juan S. Santillana

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Juan S. Santillana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机就像是极其聪明的图书管理员,他们读过每一本书,却从未真正见过图片、图表或屏幕。在很长一段时间里,这些“仅限文本”的图书管理员可以根据描述回答关于图片可能包含什么内容的问题,但他们无法真正“看到”图像本身。接着,一种被称为“视觉语言模型”(VLM)的新型计算机大脑出现了。把它们想象成终于睁开了眼睛的图书管理员;它们可以观察一张照片并阅读其中的文字,将所见之物与所知之物联系起来。这在网络安全领域是一个巨大的进步,因为专家们每天都要盯着充满代码、网络地图和安全警报的复杂屏幕。然而,大多数这类“超级眼睛”都庞大且昂贵,且仅支持英语,这使得它们对于规模较小的团队或需要保持数据完全私密且离线运行的团队来说毫无用处。

本论文介绍了一种全新的、微型且专门化的计算机大脑,名为 VectraYX-Vision-1B。它是专为使用西班牙语的网络安全专家设计的,旨在分析安全屏幕,而无需将数据发送到云端。研究人员构建这个模型的初衷是使其足够小,能够在普通的笔记本电脑上运行(参数量低于 20 亿),同时仍能通过“大声思考”来表达它所看到的内容,甚至能调用外部工具寻求帮助。但转折在于:作者对一个重大的挫折表现得极其诚实。虽然该模型在说西班牙语和遵循指令方面表现出色,但它目前在实际“理解”它所观察的图片方面却很吃力。这就像是一个学生可以写出一篇完美的西班牙语论文,但在被要求描述一张图表时,却只是对着白纸发呆。论文并未声称已经解决了这个问题;相反,它发布了这个学生的蓝图、测试题以及关于其大脑是如何连接的一个特定的谜团,邀请他人来协助解开这个谜题。

关于这个微型、讲西班牙语的安全之眼的故事

问题所在:安全领域的盲点
安全分析师就像数字侦探。他们每天都在盯着充满代码、网络流量和错误日志的屏幕。有时,他们需要判断一段软件是否是病毒,或者一次网络扫描是否显示了隐藏的危险。直到现在,辅助他们的 AI 工具要么体积庞大,无法在本地计算机上运行(需要连接云端,这对于处理机密数据来说是禁忌),要么无法很好地理解西班牙语。现有的“超级眼睛”也过于通用;它们擅长描述一只猫或一场日落,但在阅读复杂的安全工具屏幕时却表现糟糕。

解决方案:定制化的侦探
作者构建了 VectraYX-Vision-1B,这是一个从底层开始为这项特定工作设计的模型。

  • 它很小: 仅有 10.4 亿参数,足以适配普通计算机,使其能够在“物理隔离”环境(即与互联网物理断开连接以保证安全的计算机)中工作。
  • 它会说西班牙语: 它经过专门训练以理解并使用西班牙语,使拉丁美洲的安全团队能够使用。
  • 它会“大声思考”: 在给出答案之前,该模型使用特殊的标记(如 <thought>)来写出它的推理过程,类似于人类侦探在破案前记录线索的方式。
  • 它能使用工具: 它甚至可以调用外部工具(如扫描器)来协助调查,并使用特殊的“工具调用”标记。

巨大的挫折:“盲视”的侦探
这就是故事变得真实的地方。研究人员使用约 1600 万个 token 的数据(结合了安全图像和文本)对该模型进行了训练。他们原本期望它能学会如何观察安全工具的截图并解释正在发生的情况。然而,他们发现了一个令人失望的结果:该模型在很大程度上忽略了图像。

在对 50 个不同的安全截图进行测试时,该模型仅在约 8% 的案例中(0.08 分)能正确识别所使用的工具。它可以写出流利的西班牙语句子,但如果你问它图中有什么,它经常只是在猜测或产生幻觉,完全忽略了视觉内容。作者称这是一个“负面结果”,这是一种高级说法,意为:“我们尝试了,但目前还没成功,而且我们在这里详细说明了为什么会发生这种情况。”

谜团:线路中的故障
论文深入探讨了为什么会发生这种情况。他们发现了两个主要原因:

  1. 练习不足: 该模型看到的安全图像示例实在太少了,导致它无法学会如何将两者联系起来。目前的训练量过低。
  2. 一个隐蔽的 Bug: 在早期阶段,一个软件错误导致模型加载的是随机的、未经训练的权重,而不是他们构建的智能大脑。这使得模型看起来像是完全“崩溃”或失败了,但一旦修复了该 Bug,模型实际上是在工作的——只是看东西还不够好。

核心问题:“NoPE”谜题
论文中最令人兴奋的部分不是失败,而是它留下的谜团。该模型的大脑使用了名为 NoPE(无位置编码)的特殊技巧,在每第四层应用。大多数 AI 模型使用一种系统来告诉它们单词或像素的顺序(例如“第一”、“第二”、“第三”)。NoPE 则试图隐式地学习这种顺序。

作者想知道:这个 NoPE 技巧在观察图像时是有利还是有害?

  • 假设 1: 也许 NoPE 是很好的,因为图像(如像素网格)没有严格的“从左到右”的顺序,强制设定顺序可能会让模型感到困惑。
  • 假设 2: 也许 NoPE 是有害的,因为模型是基于文本(具有严格顺序)进行训练的,所以在面对杂乱的图像像素网格时会感到困惑。

论文发布了这一谜题的“配方”和“测试”,邀请其他科学家进行实验,看看哪种假设才是正确的。他们还没有解决它,但他们已经把寻找答案的工具交到了大家手中。

下一步是什么?
作者明确表示:这不是一个完成品。 该模型功能完备且可以离线运行,但由于它还无法可靠地“看到”屏幕,因此尚未准备好取代人类分析师。他们计划通过更多的训练数据和不同的学习策略来解决视觉问题。

与此同时,他们发布了一切:代码、训练数据、基准测试以及模型本身。他们实际上是在说:“我们构建了一个酷炫的、微型的、讲西班牙语的安全侦探,但它目前是‘盲视’的。这是蓝图、测试题以及关于其大脑如何连接的具体问题。我们希望你们能帮助我们教会它如何观察。”

这种做法非常令人耳目一新,因为它优先考虑的是诚实而非炒作。作者并没有假装模型是完美的,而是承认了失败,解释了技术原因,并将问题转化为了一个开放性的挑战。这提醒我们,在科学领域,了解什么行不通与了解什么行得通同样重要,尤其当你试图构建某种对于守护数字秘密至关重要的工具时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →