← Últimos artículos
💬 NLP

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

El artículo presenta VectraYX-Vision-1B, un modelo de visión y lenguaje en español de menos de 2B especializado en herramientas de ciberseguridad que cuenta con razonamiento estructurado nativo y uso de herramientas, pero que actualmente sufre de una deficiente fundamentación visual debido a limitaciones de entrenamiento y un error en el checkpoint, lo que motiva la publicación de un estudio de ablación y recursos de código abierto para abordar estos problemas.

Autores originales: Juan S. Santillana

Publicado 2026-08-11
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Juan S. Santillana

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras son como bibliotecarios increíblemente inteligentes que han leído todos los libros jamás escritos, pero que nunca han visto realmente una imagen, un gráfico o una pantalla. Durante mucho tiempo, estos bibliotecarios de "solo texto" podían responder preguntas sobre lo que una imagen podría contener basándose en descripciones, pero no podían ver la imagen en sí. Entonces, llegó un nuevo tipo de cerebro de computadora llamado "Modelo de Lenguaje-Visión" (VLM, por sus siglas en inglés). Piensa en estos como bibliotecarios a los que finalmente se les abrieron los ojos; pueden mirar una foto y leer el texto dentro de ella, conectando lo que ven con lo que saben. Esto es algo trascendental para campos como la ciberseguridad, donde los expertos pasan sus días mirando pantallas complejas llenas de código, mapas de red y alertas de seguridad. Sin embargo, la mayoría de estos "superojos" son gigantes, costosos y solo hablan inglés, lo que los hace inútiles para equipos más pequeños o para aquellos que necesitan mantener sus datos completamente privados y fuera de línea.

Este artículo presenta un nuevo, pequeño y especializado cerebro de computadora llamado VectraYX-Vision-1B. Está diseñado específicamente para expertos en ciberseguridad de habla hispana que necesitan analizar pantallas de seguridad sin enviar sus datos a la nube. El investigador construyó este modelo para que sea lo suficientemente pequeño como para ejecutarse en una computadora portátil común (menos de 2 mil millones de parámetros) mientras es capaz de "pensar" en voz alta sobre lo que ve e incluso pedir ayuda a herramientas externas. Pero aquí está el giro: el autor está siendo increíblemente honesto sobre un gran contratiempo. Aunque el modelo es brillante hablando español y siguiendo instrucciones, actualmente tiene dificultades para entender realmente las imágenes que está mirando. Es como un estudiante que puede escribir un ensayo perfecto en español, pero se queda mirando fijamente una página en blanco cuando se le pide que describa un diagrama. El artículo no afirma haber solucionado esto todavía; en su lugar, publica el plano del estudiante, las preguntas de examen y un misterio específico sobre cómo está cableado el cerebro del estudiante, invitando a otros a ayudar a resolver el rompecabezas.

La historia del pequeño ojo de seguridad que habla español

El Problema: Puntos ciegos en la seguridad
Los analistas de seguridad son como detectives digitales. Pasan sus días mirando pantallas llenas de código, tráfico de red y registros de errores. A veces necesitan determinar si un fragmento de software es un virus, o si un escaneo de red muestra un peligro oculto. Hasta ahora, las herramientas de IA que los ayudaban eran o demasiado grandes para ejecutarse en una computadora local (requiriendo una conexión a la nube, lo cual es inaceptable para datos secretos) o no hablaban bien el español. Los "superojos" existentes también eran demasiado generales; eran excelentes describiendo un gato o un atardecer, pero terribles leyendo la pantalla de una herramienta de seguridad compleja.

La Solución: Un detective construido a medida
El autor construyó VectraYX-Vision-1B, un modelo diseñado desde cero para este trabajo específico.

  • Es diminuto: Con solo 1.04 mil millones de parámetros, es lo suficientemente pequeño como para caber en una computadora normal, lo que le permite trabajar en entornos "air-gapped" (computadoras que están físicamente desconectadas de internet por seguridad).
  • Habla español: Fue entrenado específicamente para entender y hablar español, haciéndolo accesible para equipos de seguridad latinoamericanos.
  • Piensa en voz alta: Antes de dar una respuesta, el modelo utiliza tokens especiales (como <thought>) para escribir su proceso de razonamiento, de forma similar a cómo un detective humano podría anotar pistas antes de resolver un caso.
  • Puede usar herramientas: Incluso puede llamar a herramientas externas (como un escáner) para ayudar en la investigación, utilizando un token especial de "llamada a herramienta".

El Gran Contratiempo: El detective "ciego"
Aquí es donde la historia se vuelve real. El investigador entrenó este modelo con unos 16 millones de tokens de datos (una mezcla de imágenes de seguridad y texto). Esperaban que aprendiera a mirar una captura de pantalla de una herramienta de seguridad y explicara lo que está sucediendo. En cambio, encontraron un resultado decepcionante: el modelo mayormente ignora las imágenes.

Al ser probado en 50 capturas de pantalla de seguridad diferentes, el modelo solo pudo identificar correctamente la herramienta utilizada en aproximadamente el 8% de los casos (puntuación de 0.08). Podía escribir frases fluidas en español, pero si se le preguntaba qué había en la imagen, a menudo simplemente adivinaba o alucinaba, ignorando el contenido visual por completo. El autor llama a esto un "resultado negativo", que es una forma elegante de decir: "Lo intentamos, y aún no funciona, y aquí explicamos exactamente por qué creemos que sucedió".

El Misterio: Un fallo en el cableado
El artículo profundiza en por qué sucedió esto. Descubrieron dos cosas principales:

  1. Falta de práctica: El modelo simplemente no ha visto suficientes ejemplos de imágenes de seguridad para aprender a conectar los puntos. El volumen de entrenamiento actual es demasiado bajo.
  2. Un error sigiloso: Al principio, un error de software causó que el modelo se cargara con pesos aleatorios y no entrenados en lugar del cerebro inteligente que habían construido. Esto hizo que pareciera que el modelo había "colapsado" o fallado por completo, pero una vez que arreglaron el error, el modelo estaba en realidad funcionando, solo que no era lo suficientemente bueno para ver todavía.

La Gran Pregunta: El rompecabezas "NoPE"
La parte más emocionante del artículo no es el fallo, sino el misterio que deja atrás. El cerebro del modelo utiliza un truco especial llamado NoPE (No Positional Encoding) en cada cuarta capa. La mayoría de los modelos de IA utilizan un sistema que les indica el orden de las palabras o los píxeles (como "primero", "segundo", "tercero"). NoPE intenta aprender el orden de forma implícita.

El autor se pregunta: ¿Este truco de NoPE ayuda o perjudica al modelo cuando mira imágenes?

  • Hipótesis 1: Tal vez NoPE es bueno porque las imágenes (como una cuadrícula de píxeles) no tienen un orden estricto de "izquierda a derecha", por lo que forzar un orden podría confundir al modelo.
  • Hipótesis 2: Tal vez NoPE es malo porque el modelo fue entrenado con texto (que tiene un orden estricto), por lo que se confunde al mirar una cuadrícula desordenada de píxeles de imagen.

El artículo publica la "receta" y la "prueba" para este misterio, invitando a otros científicos a realizar el experimento y ver qué hipótesis es cierta. No lo han resuelto todavía, pero han entregado a todos las herramientas para descubrirlo.

¿Qué sigue?
El autor es muy claro: este no es un producto terminado. El modelo es funcional y puede ejecutarse fuera de línea, pero no está listo para reemplazar a un analista humano porque aún no puede "ver" la pantalla de manera confiable. Planean realizar más entrenamiento con más datos y una estrategia de aprendizaje diferente para solucionar el problema de la visión.

Mientras tanto, han publicado todo: el código, los datos de entrenamiento, las evaluaciones de rendimiento y el propio modelo. Básicamente, están diciendo: "Construimos un detective de seguridad pequeño y genial que habla español, pero actualmente es ciego. Aquí está el plano, las preguntas de examen y una pregunta específica sobre cómo está cableado su cerebro. Esperamos que puedan ayudarnos a enseñarle a ver".

Este enfoque es refrescante porque prioriza la honestidad sobre la exageración. En lugar de pretender que el modelo es perfecto, admiten el fallo, explican las razones técnicas y convierten el problema en un desafío abierto para la comunidad. Es un recordatorio de que en la ciencia, saber lo que no funciona es tan valioso como saber lo que sí, especialmente cuando intentas construir algo tan crítico como una herramienta para mantener seguros los secretos digitales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →