← Últimos artículos
🤖 AI

ZAYA1-VL-8B Technical Report

El artículo presenta ZAYA1-VL-8B, un modelo compacto de visión y lenguaje basado en una mezcla de expertos con 9.2 mil millones de parámetros que aprovecha adaptadores LoRA específicos para visión y atención bidireccional para lograr un rendimiento competitivo o superior al de modelos más grandes de última generación en diversas pruebas de comprensión visual.

Autores originales: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: Un "Super-Cerebro" Compacto para Imágenes y Texto

Imagina que tienes a un bibliotecario brillante (el modelo de lenguaje) que lo sabe todo sobre los libros pero nunca ha visto una imagen. Ahora, imagina que quieres darle un par de gafas a este bibliotecario para que pueda entender fotos, gráficos y diagramas.

El equipo de Zyphra Technologies construyó ZAYA1-VL-8B, un nuevo tipo de "Modelo Visión-Lenguaje". Piensa en ello como un cerebro compacto y altamente eficiente que puede leer texto y observar imágenes simultáneamente. Aunque es relativamente pequeño (8 mil millones de parámetros), rinde tan bien o mejor que modelos mucho más grandes y costosos en tareas como contar objetos, leer texto dentro de imágenes (OCR) y resolver acertijos visuales.

Los Dos Ingredientes Secretos

El artículo destaca dos "trucos" específicos que el equipo utilizó para hacer que este modelo pequeño sea tan inteligente.

1. Las Gafas "Solo Visión" (Adaptadores LoRA Específicos de Visión)

  • El Problema: Por lo general, cuando un modelo mira una imagen y lee texto, utiliza exactamente los mismos "músculos" internos (parámetros) para ambas cosas. Es como intentar tocar el piano y los tambores con las mismas manos al mismo tiempo; las señales pueden mezclarse.
  • La Solución: El equipo añadió unas "gafas" especiales y ligeras (llamadas adaptadores LoRA) específicamente para la parte del cerebro que procesa imágenes.
  • La Analogía: Imagina que el bibliotecario tiene un escritorio principal para leer libros. En lugar de construir una oficina completa nueva para mirar imágenes, simplemente colgaron una lupa especializada y un filtro de color sobre el escritorio existente. Ahora, cuando el bibliotecario mira una foto, utiliza estas herramientas especiales para ver mejor los detalles, sin necesidad de contratar más personal ni construir un edificio más grande. Esto hace que el modelo sea "específico de modalidad" (bueno con imágenes) sin hacerlo enorme.

2. La "Vista Panorámica" (Atención Bidireccional)

  • El Problema: Los modelos de IA estándar leen el texto de izquierda a derecha, como una oración. Si los obligas a mirar una imagen de la misma manera, podrían mirar la esquina superior izquierda y nunca "volver la vista" a la esquina inferior derecha para ver cómo se conectan. Esto es como intentar entender un cuadro mirando solo un trazo de pincel a la vez sin nunca retroceder para ver el cuadro completo.
  • La Solución: El equipo cambió las reglas para que, cuando el modelo mira una imagen, cada parte de la imagen pueda "hablar" con cada otra parte instantáneamente.
  • La Analogía: En lugar de leer una imagen como una línea de texto (de izquierda a derecha), el modelo toma una vista panorámica. Puede ver el cielo, las montañas y el río todos a la vez y entender cómo se relacionan entre sí inmediatamente. Esto ayuda al modelo a comprender la estructura de "gran imagen" de una imagen mucho mejor.

Cómo lo Entrenaron: El "Plan de Estudios"

El equipo no simplemente arrojó datos al modelo; lo enseñó por etapas, como un estudiante que va a la escuela:

  1. Kinder (Alineación): Comenzaron enseñando al modelo a describir imágenes simples usando imágenes de baja resolución. Congelaron el "cerebro" y solo entrenaron las "gafas" (el adaptador) para asegurarse de que los datos de imagen hablaran el mismo idioma que el texto.
  2. Escuela Primaria (Preentrenamiento): Liberaron el modelo completo y le alimentaron 30 millones de ejemplos de imágenes y texto. Crucialmente, comenzaron con imágenes pequeñas e incrementaron gradualmente la resolución, enseñando al modelo a manejar todo, desde iconos diminutos hasta fotos masivas de alta definición.
  3. Escuela Secundaria (Expansión de Incrustaciones): Enseñaron al modelo un nuevo vocabulario específicamente para señalar cosas. Añadieron "palabras" especiales (tokens) que permiten al modelo decir: "Mira este punto específico" o "Dibuja un recuadro alrededor de ese objeto".
  4. Escuela de Posgrado (Ajuste de Instrucciones): Finalmente, dieron al modelo 20 millones de tareas complejas, como responder preguntas sobre un gráfico o encontrar un objeto específico en una habitación desordenada, para pulir sus habilidades de razonamiento.

Lo Que Puede Hacer (Los Resultados)

El artículo probó ZAYA1-VL-8B contra otros modelos principales. Aquí está en lo que destacó:

  • Leer Texto en Imágenes: Es muy bueno en el Reconocimiento Óptico de Caracteres (OCR), lo que significa que puede leer texto dentro de una foto, como un letrero de calle o un documento.
  • Contar: Si le muestras una foto de un rebaño de pájaros, puede contarlos con precisión.
  • Señalar y Cajas Delimitadoras: Si le pides que "señale el coche rojo", puede darte las coordenadas exactas de ese coche.
  • Eficiencia: Logra estos resultados utilizando significativamente menos potencia de cálculo (parámetros activos) que sus competidores. Es como un coche híbrido que obtiene el mismo rendimiento que un coche que consume mucha gasolina pero utiliza la mitad de combustible.

Resumen

ZAYA1-VL-8B es una demostración de que no necesitas un modelo masivo y abultado para entender imágenes y texto. Al darle al modelo herramientas especializadas para imágenes (las "gafas") y permitiéndole ver toda la imagen de una vez (la "vista panorámica"), el equipo creó una IA pequeña, eficiente y altamente capaz que ahora está abierta para que cualquiera la utilice.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →