← 최신 논문
💬 NLP

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

이 논문은 네이티브 구조적 추론 및 도구 사용 기능을 특징으로 하며 현재 훈련 제한 및 체크포인트 버그로 인해 시각적 접지(visual grounding) 성능이 저하된 상태이지만, 이러한 문제를 해결하기 위해 절제 연구(ablation study)와 오픈 소스 리소스를 공개하도록 유도하는 사이버 보안 도구 특화 2B 미만 스페인어 시각-언어 모델인 VectraYX-Vision-1B를 소개한다.

원저자: Juan S. Santillana

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Juan S. Santillana

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 세상의 모든 책을 다 읽었지만 정작 사진이나 차트, 화면은 한 번도 본 적 없는, 믿기지 않을 정도로 똑똑한 사서와 같은 세상이 있다고 상상해 보십시오. 오랫동안 이 "텍스트 전용" 사서들은 묘사를 바탕으로 사진에 무엇이 있을 법한지에 대해서는 답할 수 있었지만, 이미지 자체를 실제로 수는 없었습니다. 그러다 "시각-언어 모델(Vision-Language Model, VLM)"이라는 새로운 유형의 컴퓨터 두뇌가 등장했습니다. 이것은 사서들이 마침에 눈을 뜬 것과 같습니다. 그들은 사진을 보고 그 안의 텍스트를 읽으며, 자신이 보는 것과 알고 있는 것을 연결할 수 있게 되었습니다. 이는 사이버 보안 분야에서 매우 중요한 일입니다. 전문가들은 복잡한 코드, 네트워크 지도, 보안 경고로 가득 찬 화면을 응시하며 하루를 보내기 때문입니다. 하지만 이러한 "슈퍼 아이"들의 대부분은 거대하고 비싸며 영어만 구사할 수 있어, 규모가 작은 팀이나 데이터를 완전히 비공개로 유지해야 하는 곳에서는 사용하기 어렵습니다.

이 논문은 VectraYX-Vision-1B라는 작고 특화된 새로운 컴퓨터 두뇌를 소개합니다. 이 모델은 데이터를 클라우드로 보내지 않고도 보안 화면을 분석해야 하는 스페인어 사용 사이버 보안 전문가들을 위해 설계되었습니다. 연구자는 이 모델이 일반적인 노트북에서도 실행될 수 있을 만큼 작으면서도(20억 파라미터 미만), 자신이 보고 있는 것에 대해 소리 내어 "생각"하고 외부 도구에 도움을 요청할 수 있도록 만들었습니다. 하지만 여기서 반전이 있습니다. 저자는 매우 솔직하게 큰 문제점을 고백하고 있습니다. 이 모델은 스페인어를 유창하게 구사하고 지시를 잘 따르지만, 현재 보고 있는 이미지를 실제로 이해하는 데 어려움을 겪고 있다는 점입니다. 이는 마치 완벽한 스페인어 에세이를 쓸 줄 알지만, 도표를 설명하라는 요청을 받으면 백지를 멍하니 바라보고 있는 학생과 같습니다. 저자는 이 문제를 아직 해결하지 못했다고 주장하지 않습니다. 대신, 그는 이 학생의 설계도와 시험 문제, 그리고 이 학생의 뇌가 어떻게 배선되어 있는지에 대한 특정 미스터리를 공개하며 다른 이들이 이 퍼즐을 풀 수 있도록 초대하고 있습니다.

작고 스페인어를 사용하는 보안의 눈 이야기

문제점: 보안의 사각지대
보안 분석가들은 디지털 탐정과 같습니다. 그들은 코드, 네트워크 트래ร픽, 오류 로그로 가득 찬 화면을 보며 하루를 보냅니다. 때때로 그들은 어떤 소프트웨어가 바이러스인지, 혹은 네트워크 스캔이 숨겨진 위험을 보여주는 것인지 파악해야 합니다. 지금까지 이들을 돕던 AI 도구들은 로컬 컴퓨터에서 실행하기에는 너무 커서(비밀 데이터를 위해 클라우드 연결이 불가능한 상황에서는 사용 불가), 혹은 스페인어를 잘 못 하는 경우가 많았습니다. 기존의 "슈퍼 아이"들은 너무 일반적이었습니다. 고양이나 노을을 묘사하는 데는 뛰어나지만, 복잡한 보안 도구 화면을 읽는 데는 형편없었습니다.

해결책: 맞춤 제작된 탐정
저자는 이 특정 업무를 위해 밑바닥부터 설계된 모델인 VectraYX-Vision-1B를 구축했습니다.

  • 매우 작습니다: 단 1.04 tỷ 파라미터로 구성되어 일반 컴퓨터에도 들어갈 수 있으며, 보안을 위해 인터넷과 물리적으로 분리된 환경(에어갭 환경)에서도 작동할 수 있습니다.
  • 스페인어를 구사합니다: 라틴 아메리카 보안 팀들이 접근할 수 있도록 스페인어를 이해하고 말하도록 특별히 훈련되었습니다.
  • 생각을 밖으로 내뱉습니다: 답변을 내놓기 전, 모델은 특수 토큰(예: <thought>)을 사용하여 인간 탐정이 사건을 해결하기 전 단서를 적는 것처럼 자신의 추론 과정을 글로 씁니다.
  • 도구를 사용할 수 있습니다: 조사를 돕기 위해 특수 "도구 호출(tool call)" 토큰을 사용하여 외부 도구(예: 스캐너)를 호출할 수도 있습니다.

큰 실수: "눈먼" 탐정
여기서 이야기는 현실적이 됩니다. 연구자는 약 1,600만 개의 토큰(보안 이미지와 텍스트의 혼합)으로 이 모델을 훈련시켰습니다. 저자는 모델이 보안 도구의 스크린샷을 보고 무엇이 일어나고 있는지 설명하는 법을 배울 것이라 기대했습니다. 하지만 결과는 실망스러웠습니다. 모델은 이미지를 거의 무시합니다.

50개의 서로 다른 보안 스크린샷으로 테스트했을 때, 모델은 사용 중인 도구를 정확히 식별하는 데 약 8%(0.08 점수)의 성공률만을 보였습니다. 모델은 유창한 스페인어 문장을 쓸 수 있었지만, 사진에 무엇이 있는지 물으면 종종 짐작하거나 환각(hallucination)을 일으키며 시각적 내용을 완전히 무시했습니다. 저자는 이를 "부정적 결과(negative result)"라고 부르는데, 이는 "우리가 시도해 보았으나 아직 작동하지 않았으며, 왜 그렇게 되었는지에 대한 이유를 정확히 밝힌다"는 뜻의 세련된 표현입니다.

미스터리: 배선의 결함
논문은 왜 이런 일이 발생했는지 깊이 파고듭니다. 그들은 두 가지 주요 원인을 발견했습니다.

  1. 연습 부족: 모델은 점과 점을 연결하는 법을 배우기에 보안 이미지의 사례를 충분히 보지 못했습니다. 현재의 훈련량은 너무 적습니다.
  2. 교활한 버그: 초기 단계에서 소프트웨어 버그로 인해 모델이 구축된 스마트한 두뇌 대신 무작위의 훈련되지 않은 가중치(weights)로 로드되었습니다. 이로 인해 모델이 완전히 "붕괴"하거나 실패한 것처럼 보였지만, 버그를 수정한 후 모델은 실제로 작동하고 있었습니다. 다만 아직 보는 능력이 충분하지 않을 뿐입니다.

거대한 질문: "NoPE" 퍼즐
이 논문에서 가장 흥격적인 부분은 실패가 아니라, 그 뒤에 남겨진 미스터리입니다. 모델의 두뇌는 매 네 번째 레이어마다 NoPE(No Positional Encoding)라는 특별한 기술을 사용합니다. 대부분의 AI 모델은 단어나 픽셀의 순서(예: "첫 번째", "두 번째", "세 번째")를 알려주는 시스템을 사용하지만, NoPE는 이를 암묵적으로 학습하려고 시도합니다.

저자는 의문을 제기합니다: 이 NoPE 기술이 모델이 이미지를 볼 때 도움이 될까요, 아니면 방해가 될까요?

  • 가설 1: 이미지는 (픽셀의 격자처럼) 엄격한 "왼쪽에서 오른쪽으로"의 순서가 없기 때문에, 순서를 강요하는 것이 모델을 혼란스럽게 할 수 있으므로 NoPE가 좋을 수도 있습니다.
  • 가설 2: 모델은 텍之处(엄격한 순서가 있음)에서 훈련되었기 때문에, 뒤섞인 픽셀 격자를 볼 때 혼란을 느낄 수 있으므로 NoPE가 나쁠 수도 있습니다.

저자는 이 미스터리를 위해 "레시피"와 "테스트"를 공개하며, 다른 과학자들이 실험을 수행하여 어떤 가설이 사실인지 확인하도록 초대하고 있습니다. 그들은 아직 해결하지 못했지만, 모두가 진실을 찾아낼 수 있도록 도구를 건네주었습니다.

다음 단계는?
저자는 매우 명확하게 밝힙니다: 이것은 완성된 제품이 아닙니다. 모델은 기능적이며 오프라인에서 실행할 수 있지만, 아직 이미지를 신뢰성 있게 "보는" 능력이 부족하여 인간 분석가를 대체할 준비가 되지 않았습니다. 그들은 시각 문제를 해결하기 위해 더 많은 데이터와 다른 학습 전략을 사용하여 추가 훈련을 진행할 계획입니다.

그동안 그들은 코드, 훈련 데이터, 벤치마크, 그리고 모델 자체를 모두 공개했습니다. 그들은 본질적으로 이렇게 말하고 있는 것입니다. "우리는 멋지고 작으며 스페인어를 구사하는 보안 탐정을 만들었지만, 현재는 눈이 먼 상태입니다. 여기 설계도와 테스트 문제, 그리고 두뇌 배선에 관한 특정 질문이 있습니다. 우리가 그것을 볼 수 있도록 도와주시길 바랍니다."

이러한 접근 방식은 과장보다는 정직함을 우선시하기에 매우 신선합니다. 모델이 완벽하다고 주장하는 대신, 실패를 인정하고 기술적인 이유를 설명하며, 그 문제를 하나의 열린 도전 과제로 전환했습니다. 이는 과학에서 무엇이 작동하지 않는지를 아는 것이, 특히 디지털 비밀을 안전하게 지키기 위한 도구를 만들 때 무엇이 작동하는지를 아는 것만큼이나 가치 있다는 것을 보여주는 사례입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →