← 最新の論文
💬 NLP

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

本論文は、ネイティブな構造化推論とツール利用機能を備え、サイバーセキュリティツールに特化した2B未満のスペイン語視覚言語モデルであるVectraYX-Vision-1Bを紹介するが、学習の制限とチェックポイントのバグにより現在は視覚的グラウンディングに課題を抱えているため、これらの問題に対処するためのアブレーション研究とオープンソースのリソースを公開するものである。

原著者: Juan S. Santillana

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Juan S. Santillana

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが、あらゆる本を読み尽くしたものの、写真や図表、あるいは画面を一度も見たことがない、驚異的に賢い司書のような世界を想像してみてください。長い間、これらの「テキストのみ」の司書は、記述に基づいた「画像に何が含まれているか」についての質問には答えられましたが、画像そのものを見ることはできませんでした。その後、「視覚言語モデル(VLM)」と呼ばれる新しいタイプのコンピュータの脳が登場しました。これらは、司書がついに目を開けた状態だと考えてください。彼らは写真を見て、その中のテキストを読み取り、見たものと知識を結びつけることができるようになりました。これは、専門家がコード、ネットワークマップ、セキュリティアラートで埋め尽くされた複雑な画面を凝視して過ごすサイバーセキュリティのような分野において、非常に大きな進歩です。しかし、これらの「スーパーアイ(超強力な目)」の多くは巨大で高価であり、しかも英語しか話せないため、小規模なチームや、データを完全にプライベートかつオフラインで保持する必要がある組織にとっては使い物になりません。

この論文は、VectraYX-Vision-1Bという、小さくて特化した新しいコンピュータの脳を紹介しています。これは、データをクラウドに送信することなくセキュリティ画面を分析する必要がある、スペイン語圏のサイバーセキュリティ専門家向けに設計されています。研究者は、このモデルが一般的なノートパソコン(20億パラメータ未満)で動作するほど小さく、かつ、見ているものについて「思考」を書き出し、外部ツールに助けを求めることさえできるように構築しました。しかし、ここにはひねりがあります。著者は、ある重大なつまずきについて、驚くほど正直に述べています。このモデルはスペイン語を話し、指示に従うことには非常に長けていますが、現在、見ている写真を実際に「理解する」ことに苦戦しています。それは、まるで完璧なスペイン語のエッセイを書けるのに、図解を描写するように求められると、白紙のページをただ見つめているだけの学生のようなものです。論文は、まだこれを解決したとは主張していません。代わりに、その学生の設計図、テスト問題、そしてその脳がどのように配線されているかという特定の謎を公開し、他の人々がこのパズルを解くのを助けてくれるよう呼びかけています。

小さな、スペイン語を話すセキュリティの目の物語

問題点:セキュリティにおける盲点
セキュリティアナリストは、デジタル探偵のようなものです。彼らはコード、ネットワークトラフィック、エラーログで埋め尽くされた画面を日々凝視しています。時には、あるソフトウェアがウイルスなのか、あるいはネットワークスキャンが隠れた危険を示しているのかを見極める必要があります。これまで、彼らを助けてきたAIツールは、ローカルコンピュータで動作するには大きすぎる(機密データの保護のためにクラウドへの接続が必要になる)か、あるいはスペイン語を十分に話せませんでした。既存の「スーパーアイ」は汎用性が高すぎました。猫や夕焼けを描写することには長けていましたが、複雑なセキュリティツールの画面を読み取ることは不得意だったのです。

解決策:カスタムメイドの探偵
著者は、この特定の仕事のためにゼロから設計されたモデル、VectraYX-Vision-1Bを構築しました。

  • 極めて小さい: わずか10.4億パラメータであり、一般的なコンピュータに収まるサイズであるため、セキュリティのために物理的にインターネットから切り離された環境(エアギャップ環境)でも動作可能です。
  • スペイン語を話す: ラテンアメリカのセキュリティチームが利用できるよう、スペイン語を理解し話すことに特化して訓練されています。
  • 思考を書き出す: 回答を出す前に、モデルは特別なトークン(<thought> のようなもの)を使用して、推理プロセスを書き出します。これは、人間の探偵が事件を解決する前に手がかりをメモする様子に似ています。
  • ツールを使える: 調査を助けるために、特別な「ツールコール」トークンを使用して、外部ツール(スキャナーなど)を呼び出すことさえできます。

大きなつまずき:「盲目の」探偵
ここからが現実的な話になります。研究者は、約1600万トークンのデータ(セキュリティ画像とテキストの混合)を用いてこのモデルを訓練しました。彼らは、モデルがセキュリティツールのスクリーンショットを見て、そこで何が起きているかを説明することを期待していました。しかし、期待に反する結果が得られました。モデルはほとんど画像を無視してしまうのです。

50種類の異なるセキュリティスクリーンショットでテストしたところ、モデルが使用されているツールを正しく特定できたのは、わずか約8%(0.08スコア)でした。流暢なスペイン語の文章を書くことはできても、画像の中に何があるかを尋ねると、しばしば推測したり、内容を捏造(ハルシネーション)したりして、視覚的な内容を完全に無視してしまうことがありました。著者はこれを「ネガティブな結果」と呼んでいます。これは、「やってみたが、まだうまくいかなかった。そして、なぜそうなったのかという理由を正確に提示する」という意味の、洗練された言い回しです。

謎:配線の不具合
論文は、なぜこのようなことが起きたのかを深く掘り下げています。彼らは主に2つのことを発見しました。

  1. 経験不足: モデルは、点と点を結びつける方法を学ぶためのセキュリティ画像の例を、単純に十分に見ていませんでした。現在の訓練量は少なすぎます。
  2. 巧妙なバグ: 初期段階において、ソフトウェアのバグにより、構築したスマートな脳ではなく、ランダムで未訓練の重みがロードされてしまいました。これにより、モデルが完全に「崩壊」または失敗したように見えましたが、バグを修正した後は、モデルは実際に機能していました。ただ、見る能力に関してはまだ不十分だっただけなのです。

大きな問い:「NoPE」のパズル
この論文で最もエキサイティングな部分は、失敗そのものではなく、それが残した謎です。モデルの脳は、4層ごとにNoPE(No Positional Encoding)と呼ばれる特別なトリックを使用しています。ほとんどのAIモデルは、単語やピクセルの順序(「最初」「二番目」「三番目」など)を伝えるシステムを使用しますが、NoPEは順序を暗黙的に学習しようと試みます。

著者はこう疑問を投げかけています。このNoPEのトリックは、モデルが画像を見る際に助けとなるのか、それとも妨げとなるのか?

  • 仮説1: 画像(ピクセルのグリッドのようなもの)には厳格な「左から右へ」という順序がないため、強制的に順序を課すことはモデルを混乱させる可能性があるが、NoPEは優れているのかもしれない。
  • 仮説2: モデルはテキスト(厳格な順序を持つもの)で訓練されているため、乱雑なピクセルのグリッドを見たときに混乱してしまう。そのため、NoPEは良くないのかもしれない。

論文は、この謎に対する「レシピ」と「テスト」を公開しており、他の科学者たちが実験を行い、どちらの仮説が正しいかを検証することを求めています。彼らはまだ解決していませんが、そのための道具をすべて提供しています。

次なるステップは?
著者は非常に明確に述べています。これは完成品ではありません。 モデルは機能しており、オフラインで動作可能ですが、画像を確実に「見る」ことがまだできないため、人間のアナリストに取って代わる準備はできていません。彼らは、視覚の問題を解決するために、より多くのデータを用いたさらなる訓練と、異なる学習戦略を実施する計画です。

その間、彼らはすべてを公開しています。コード、訓練データ、ベンチマーク、そしてモデルそのものです。彼らは実質的にこう言っているのです。「私たちは、小さくてスペイン語を話すセキュリティ探偵を作りましたが、現在は盲目です。ここに設計図、テスト問題、そしてその脳がどのように配線されているかについての特定の問いがあります。あなたが解決を手伝ってくれることを願っています。」

このアプローチは、ハイプ(過剰な宣伝)よりも誠実さを優先している点で、非常に新鮮です。モデルが完璧であると偽るのではなく、失敗を認め、技術的な理由を説明し、その問題をコミュニティへのオープンな挑戦へと変えています。これは、科学において、何がうまくいかないかを知ることは、何がうまくいくかを知ることと同じくらい価値があるということを思い出させてくれます。特に、デジタル上の秘密を守るためのツールを作るという、極めて重要なものに取り組んでいる場合には。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →