← 최신 논문
💬 NLP

VectraYX-Nano: A 42M-Parameter Spanish Cybersecurity Language Model with Curriculum Learning and Native Tool Use

본 논문은 커리큘럼 학습과 네이티브 모델 컨텍스트 프로토콜 (MCP) 도구 통합을 통해 선별된 사이버보안 코퍼스로 처음부터 훈련된 42M 파라미터 스페인어 언어 모델인 VectraYX-Nano 를 소개하며, 이는 상용 하드웨어에서 효과적인 성능을 입증하고 나노 규모에서 코퍼스 밀도와 도구 사용 능력 간의 관계에 대한 새로운 통찰을 제공합니다.

원저자: Juan S. Santillana

게시일 2026-05-15
📖 5 분 읽기🧠 심층 분석

원저자: Juan S. Santillana

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

VectraYX-Nano 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 번역한 것입니다.

큰 그림: 작고 전문적인 스페인어 보안 도우미

컴퓨터 네트워크를 지키는 경비원이 있다고 상상해 보세요. 보통 이 경비원들은 거대하고 비싸며, 영어만 합니다. 하지만 라틴 아메리카의 특정 지역을 지키고, 스페인어를 말하며, 현지 은어를 이해하고, 인터넷 연결 없이도 라즈베리 파이 같은 작고 저렴한 기기에서 작동할 경비원이 필요하다면 어떨까요?

그것이 바로 VectraYX-Nano입니다. 이는 유명한 모델들 (수십억 개의 '뇌 세포'를 가진) 에 비해 단지 4200 만 개의 '뇌 세포'만을 가진 매우 작은 인공지능 (AI) 모델로, 스페인어권 지역의 사이버 보안 분석가들을 돕기 위해 특별히 설계되었습니다. 이 모델은 스페인어를 구사하고, 사이버 위협을 이해하며, 실시간 답변을 얻기 위해 도구를 사용하는 방법을 알도록 처음부터 만들어졌다는 점에서 독특합니다.

1. 뇌의 영양분: 어떻게 가르쳤는가 (코퍼스)

AI 를 가르치려면 데이터로 먹여야 합니다. 연구자들은 인터넷 텍스트를 무작위로 쏟아부은 것이 아니라, 커리큘럼 학습 (Curriculum Learning) 방식을 사용하여 특정한 '3 코스 식사'를 요리했습니다.

  • 1 코스: 대화의 시작. 먼저, 연구자들은 4200 만 개의 토큰 (단어 조각) 분량의 스페인어 자막과 채팅 로그를 모델에 공급했습니다.
    • 비유: 아이에게 수학 가르치기 전에 "안녕하세요", "어떻게 지내세요?", "안녕히 가세요"라고 말하는 법을 가르치는 것과 같습니다. 이를 건너뛰면 AI 는 바이러스에 대해 모든 것을 알 수 있지만, "안녕하세요"라는 인사말 대신 바이러스에 대한 기술 보고서를 답변할 수도 있습니다.
  • 2 코스: 기술적 심층 탐구. 다음으로, 연구자들은 1 억 1800 만 개의 토큰 분량의 사이버 보안 데이터 (취약점 보고서, 해킹에 대한 위키백과 기사, 보안 블로그) 를 공급했습니다.
    • 비유: 이제 아이가 말하는 법을 알았으니, 과목 내용을 가르치는 것입니다. "이것이 바이러스입니다", "해커들은 이렇게 침입합니다"라고요.
  • 3 코스: 도구 상자. 마지막으로, 연구자들은 보안 도구 사용법 (데이터베이스에서 위협 조회 등) 에 대한 1000 만 개의 토큰을 제공했습니다.
    • 비유: 이제 아이는 사전이나 지도를 사용하는 법을 배웁니다. 모든 사실을 외우는 대신, 답을 어떻게 요청할지 배우는 것입니다.

"리플레이 (Replay)" 트릭: AI 교육에서 흔히 발생하는 문제는 "파괴적 망각 (catastrophic forgetting)"입니다. 새로운 것을 가르치면 이전 것을 잊어버리는 현상입니다. 이를 해결하기 위해 연구자들은 **리플레이 버퍼 (Replay Buffer)**를 사용했습니다.

  • 비유: 학생에게 역사를 가르친다고 상상해 보세요. 20 세기에 대해 가르치기 시작할 때, 19 세기에 대한 이야기를 완전히 멈추지 않습니다. 새로운 것을 배우는 동안 (시간의 25% 정도) 옛 수업 내용을 계속 복습합니다. 이렇게 하여 AI 가 사이버 공격에 대해 배우는 동안 스페인어 구사 능력을 잊지 않도록 했습니다.

2. "레지스터 (Register)"의 놀라운 발견 (부트스트랩 교훈)

논문의 가장 흥미로운 발견 중 하나는 무엇을 먼저 가르치는지에 관한 것입니다.

연구자들은 서로 다른 두 가지 "1 코스" 옵션을 시도했습니다:

  1. 옵션 A: 자막과 채팅 로그 (OpenSubtitles).
  2. 옵션 B: 백과사전식 웹 기사 (mC4-ES).

놀랍게도, 옵션 B(백과사전식 기사) 로 훈련된 모델은 훈련 중 수학 점수 (낮은 '손실' 수치) 가 더 좋았습니다. 그러나 채팅을 요청했을 때, 그것은 지루한 백과사전처럼 들렸습니다. "안녕하세요"라고 물으면 여행 역사에 대한 단락으로 답변했습니다.

반면 옵션 A(자막) 로 훈련된 모델은 수학 점수는 약간 낮았지만, 실제 사람처럼 들렸습니다.

  • 교훈: 작은 AI 에게 있어 가장 먼저 배우는 것이 그 성격 (페르소나) 을 결정합니다. 만약 먼저 교과서처럼 말하도록 가르치면, 나중에 채팅을 가르치려 해도 영원히 교과서처럼 남습니다. 먼저 인간처럼 말하도록 가르쳐야 합니다.

3. 마법의 도구: MCP (모델 컨텍스트 프로토콜)

사이버 보안은 매일 변합니다. 매일 새로운 바이러스가 등장합니다. AI 가 모든 새로운 바이러스를 외울 수는 없습니다.

  • 문제: 표준 AI 에게 "이 새로운 바이러스는 위험한가요?"라고 물으면, 오늘의 뉴스를 알지 못하기 때문에 추측하거나 지어낼 (환각) 수 있습니다.
  • 해결책: VectraYX-Nano 는 도구를 사용하도록 훈련되었습니다. 답을 외우려 하지 않습니다. 대신 *"모르겠지만, 데이터베이스를 확인해 보겠습니다"*라고 말하도록 학습합니다.
  • 작동 원리: AI 는 MCP라는 시스템에 연결되어 있습니다. 정보가 필요할 때, 최신 데이터를 가진 서버로 구조화된 요청 (JSON 명령과 같은) 을 보내고, 답변을 받아 사용자에게 읽어줍니다.
  • 발견: 연구자들은 AI 가 "도움 요청" 행동을 배우려면 훈련 데이터가 **밀도 (dense)**가 있어야 한다는 것을 발견했습니다. 훈련 데이터의 99% 가 일반 채팅이고 도구 사용이 1% 에 불과하면 AI 는 너무 수줍어서 도구를 사용하지 않았습니다. 하지만 도구 사용 데이터를 전체 예시의 20 분의 1 정도로 늘리자, AI 는 갑자기 도구를 신뢰성 있게 사용하기 시작했습니다.

4. 크기가 중요하지만 (생각한 바와는 다르게)

이 모델은 작습니다 (4200 만 개의 파라미터).

  • 좋은 소식: 35 달러짜리 컴퓨터인 라즈베리 파이에서 1 초 미만으로 실행됩니다. 주머니에 들어갈 정도입니다.
  • 한계: 너무 작기 때문에 모든 것에 있어 "천재"가 될 수는 없습니다. 거대한 모델처럼 복잡한 다단계 논리를 추론하는 능력은 떨어집니다.
  • 트레이드오프: "사실 암기" 대신 "찾는 법 알기"를 택합니다. 사실을 확신 있게 거짓말하는 거대한 도우미보다, 사실을 확인하는 법을 아는 작은 도우미가 낫습니다.

5. 안전과 "레드 팀링 (Red Teaming)"

이 모델은 공격 방식을 이해하기 위해 해킹 데이터로 훈련되었기 때문에, 연구자들은 이것이 "악역"이 될까 봐 걱정했습니다.

  • 테스트: AI 를 파일 삭제나 데이터 탈취 같은 위험한 일을 하도록 속여 보았습니다.
  • 결과: AI 는 실제로 위험한 일을 하지 않았습니다. 대부분 모호한 답변을 하거나 거절했습니다. 하지만 명시적으로 "아니요"라고 말하는 내장된 "도덕적 나침반"은 없었습니다.
  • 해결책: 논문은 안전이 AI 의 뇌에만 의존해서는 안 된다고 제안합니다. 대신 AI 를 실행하는 **시스템 (런타임)**이 문지기 역할을 하여, 명령이 실행되기 전에 위험한 명령을 차단해야 합니다.

주요 교훈 요약

  1. 성격을 먼저 가르치세요: 작은 AI 모델에게 첫 번째로 공급하는 데이터가 그 목소리를 결정합니다. 챗봇을 원한다면 백과사전이 아닌 채팅 데이터로 시작하세요.
  2. 과거를 잊지 마세요: 새로운 주제를 가르칠 때 옛 내용을 복습 (리플레이 버퍼) 하여 AI 가 언어 능력을 잊지 않도록 하세요.
  3. 기억보다 도구: 작은 모델에게는 모든 것을 외우게 하는 것보다 도구를 사용하여 답을 찾는 법을 가르치는 것이 낫습니다.
  4. 밀도가 핵심입니다: AI 에게 도구 사용을 가르치려면 훈련 데이터에 도구 사용 예시가 많이 포함되어야 합니다. 너무 드물면 AI 는 그것을 배우지 못합니다.
  5. 에지 배포 (Edge Deployment): 이는 민감한 데이터를 인터넷으로 보낼 수 없는 보안 팀에게 유용하며, 클라우드 없이 값싼 로컬 하드웨어에서 실행되는 전문화된 AI 를 구축할 수 있음을 증명합니다.

공개된 내용: 연구자들은 논문만 쓴 것이 아니라, 누구나 자신의 버전을 만들 수 있도록 "레시피"(코드), "재료"(데이터 구성 가이드), 그리고 최종 "요리"(AI 모델 가중치) 를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →