← Últimos artículos
🤖 AI

Zamba2-VL Technical Report

Zamba2-VL es una suite de modelos de visión y lenguaje eficientes construida sobre una arquitectura híbrida Zamba2 que combina capas de espacio de estados Mamba2 con bloques de transformadores para lograr un rendimiento competitivo frente a los principales VLMs de pesos abiertos, al tiempo que ofrece un tiempo de primer token significativamente más rápido, particularmente en escalas menores adecuadas para el despliegue en el borde.

Autores originales: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Publicado 2026-06-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Un Cerebro más Inteligente y Rápido para las Imágenes

Imagina que tienes un asistente robot que necesita mirar una imagen y responder preguntas sobre ella. Normalmente, estos asistentes están construidos como una biblioteca con una pila masiva y creciente de fichas de índice. Cada vez que miran una parte nueva de la imagen, añaden una ficha a la pila. Si la imagen es enorme o compleja, la pila se vuelve tan alta que el robot tiene que pasar todo su tiempo buscando entre las fichas solo para encontrar la siguiente. Esto los hace lentos y costosos de ejecutar.

El equipo de Zamba2-VL construyó un tipo de robot diferente. En lugar de una pila creciente de fichas, le dieron a su robot un cuaderno de notas compacto y de alta velocidad que mantiene el mismo tamaño sin importar cuánto lea. Llaman a esto un modelo "híbrido" porque mezcla dos tipos de pensamiento:

  1. El Carril Rápido (Mamba2): Este se encarga del grueso del trabajo, leyendo largas listas de información (como una imagen completa) a una velocidad constante y vertiginosa sin estancarse.
  2. El Foco (Transformer): Esta es una herramienta pequeña y especializada que se usa solo cuando el robot necesita hacer zoom en un detalle específico para recordarlo perfectamente.

El Problema que Resolvieron

Los modelos de IA actuales (llamados Transformers) son excelentes entendiendo imágenes, pero son pesados. Cuando les entregas una foto de alta resolución, esta se divide en miles de piezas diminutas (tokens). El modelo tiene que mantener una "memoria" de cada pieza que ha visto hasta el momento. A medida que la imagen crece, el requisito de memoria se dispara, lo que hace que el modelo sea lento para arrancar y costoso de ejecutar en dispositivos comunes como teléfonos o computadoras portátiles.

Los intentos previos para solucionar esto utilizaron un sistema de memoria rápida "puro" (SSM), pero esos modelos eran malos para encontrar detalles específicos en una imagen (como señalar a una persona específica en una multitud). Eran rápidos pero "torpes" con los detalles.

La Solución de Zamba2-VL

El equipo de Zamba2-VL creó un modelo que obtiene lo mejor de ambos mundos.

  • El Motor: Utilizaron un nuevo motor llamado Zamba2. Es como un coche híbrido: la mayor parte del tiempo utiliza energía eléctrica (las capas Mamba2, rápidas y eficientes) para viajar, pero tiene un pequeño motor de gasolina (las capas Transformer) que entra en acción cuando necesita una ráfaga de potencia para manejar tareas complejas.
  • El Resultado: Este modelo es tan bueno entendiendo imágenes como los modelos grandes y pesados, pero es 10 veces más rápido al arrancar (Tiempo al Primer Token).

Cómo lo Entrenaron

Para que este modelo rápido sea inteligente, no solo le lanzaron imágenes aleatorias. Curaron una "dieta" específica de datos de entrenamiento:

  • La Dieta de "OCR": Notaron que el modelo era bueno con imágenes generales pero tenía dificultades con documentos cargados de texto (como gráficos o papeles escaneados). Así que le dieron porciones extra de datos de documentos y texto para "muscular" sus habilidades de lectura.
  • La Habilidad de "Señalar": Le enseñaron al modelo cómo señalar cosas en una imagen. Si preguntas "¿Cuántos ciclistas hay?", el modelo no solo dice "6"; puede señalar a cada ciclista con coordenadas. Esto es como enseñarle a un niño no solo a contar manzanas, sino a tocar cada una mientras las cuenta.

El Rendimiento: Rápido y Preciso

El artículo compara sus nuevos modelos (disponibles en tamaños pequeño, mediano y grande: 1.2B, 2.7B y 7B de parámetros) contra los modelos de alto nivel de otras empresas.

  • Precisión: En pruebas que involucran el conteo de objetos, la lectura de gráficos y la comprensión de escenas complejas, Zamba2-VL funcionó tan bien como los modelos líderes y pesados.
  • Velocidad: Aquí es donde brilla. Debido a su memoria de "cuaderno compacto", comienza a responder preguntas aproximadamente 10 veces más rápido que la competencia.
  • El Punto Óptimo: La ventaja de velocidad es más dramática en los modelos más pequeños (1.2B y 2.7B). Estos son los tamaños más útiles para ejecutarse en dispositivos personales (como una laptop o un teléfono) porque son ligeros pero increíblemente capaces.

Resumen

Piensa en Zamba2-VL como un velocista que también es un maestro del ajedrez. Los modelos rápidos anteriores eran como velocistas que no podían pensar con anticipación, y los modelos inteligentes anteriores eran como maestros del ajedrez que se movían demasiado lento. Zamba2-VL combina la velocidad de un velocista con la memoria estratégica de un maestro del ajedrez, permitiéndole procesar imágenes complejas rápidamente sin necesidad de una computadora enorme y costosa para funcionar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →