← Últimos artículos
💬 NLP

ZAYA1-8B Technical Report

El artículo presenta ZAYA1-8B, un modelo de razonamiento MoE de 8 mil millones de parámetros altamente eficiente, entrenado íntegramente en infraestructura AMD, que logra un rendimiento de vanguardia en benchmarks de matemáticas y programación mediante una cascada especializada de RL de cuatro etapas y el novedoso método de cómputo en tiempo de prueba Markoviano RSA, reduciendo eficazmente la brecha con modelos mucho más grandes.

Autores originales: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepal
Publicado 2026-05-08
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepalli, Skyler Szot, Srivatsan Rajagopal, Alex Ong, Bhavana Mehta, Beren Millidge

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Panorama General: Un Cerebro Pequeño con un Superpoder

Imagina que tienes un estudiante diminuto e increíblemente inteligente llamado ZAYA1-8B. Este estudiante tiene un cerebro con solo 700 millones de neuronas activas (un tamaño muy pequeño para una IA), pero forma parte de una "escuela" más grande con 8 mil millones de neuronas en total.

Por lo general, para resolver problemas matemáticos difíciles o escribir código complejo, necesitas un cerebro gigante (como una IA masiva con miles de millones de parámetros). ZAYA1-8B es especial porque, a pesar de ser pequeño, puede resolver estos problemas difíciles tan bien como, o incluso mejor que, estudiantes "genios" mucho más grandes.

¿Cómo? Usando tres armas secretas: una nueva forma de pensar, un campamento de entrenamiento especial y un método único para verificar su propio trabajo.


1. La Arquitectura: Un Equipo Especializado

La mayoría de los modelos de IA son como una sola persona intentando hacerlo todo sola. ZAYA1-8B está construido como un equipo especializado que utiliza una "Mezcla de Expertos" (MoE).

  • El Equipo: Imagina un aula con 16 maestros diferentes (expertos). Cuando llega una pregunta, un "enrutador" (el monitor de clase) decide qué maestro está mejor preparado para responderla.
  • El Nuevo Monitor (Enrutador ZAYA1): En los modelos antiguos, el monitor era un simple seguidor de reglas. ZAYA1-8B utiliza un monitor más inteligente y multicapa que toma mejores decisiones sobre quién debe enseñar, asegurando que el experto adecuado maneje el trabajo cada vez.
  • La Biblioteca Comprimida (CCA): Para leer libros largos o recordar historias extensas, el modelo utiliza un sistema de "biblioteca comprimida". En lugar de llevar cada página del libro en su cabeza, almacena una versión resumida y comprimida que ahorra espacio y energía, pero mantiene todos los detalles importantes. Esto le permite manejar conversaciones muy largas sin cansarse.

2. El Entrenamiento: Aprender a Pensar Antes de Hablar

El documento describe un proceso de entrenamiento único diseñado para convertir a este estudiante en una máquina de razonamiento.

  • El Recorte "Preservador de Respuestas": Los maestros a menudo tienen explicaciones largas y detalladas (rastros de razonamiento) que son demasiado extensas para caber en una sola página de un libro de texto. En lugar de cortar el medio de la historia (lo que arruinaría la lógica), ZAYA1-8B utiliza un truco especial: corta el final de la explicación pero mantiene la respuesta final. Esto enseña al modelo a planificar y pensar, incluso si el proceso de pensamiento completo es demasiado largo para caber de una sola vez.
  • El Campamento de Entrenamiento de Cuatro Etapas: Después de aprender lo básico, el modelo pasó por un riguroso campamento de "Aprendizaje por Refuerzo" (RL):
    1. Calentamiento: Resolver acertijos y problemas matemáticos fáciles para acostumbrarse a pensar intensamente.
    2. El Gimnasio: Un entorno personalizado con 400 generadores de acertijos diferentes que se vuelven más difíciles a medida que el modelo mejora.
    3. El Evento Principal: Enfrentar desafíos reales de matemáticas y programación, incluida una fase especial de "Cálculo en Tiempo de Prueba" (TTC) donde aprende a generar múltiples respuestas posibles y elegir la mejor.
    4. Pulido: Una etapa final para aprender a conversar educadamente y seguir instrucciones, como un buen asistente.

3. El Secreto: "Markovian RSA" (El Pensamiento de Grupo)

Esta es la parte más innovadora del documento. Por lo general, cuando una IA resuelve un problema difícil, intenta pensar la respuesta en un solo flujo largo y continuo. Si el flujo se vuelve demasiado largo, la IA se confunde.

ZAYA1-8B utiliza un método llamado Markovian RSA. Piénsalo como una carrera de relevos con un giro:

  • La Carrera: En lugar de que un solo corredor intente correr toda la maratón, el modelo envía 16 corredores (candidatos) al mismo tiempo.
  • El Cambio de Testigo: Cada corredor corre una distancia corta y segura (una "cola" de 4.000 palabras). No llevan toda la historia de la carrera; solo pasan sus últimos pasos (la cola) a la siguiente ronda.
  • La Agregación: Un "entrenador" observa los últimos pasos de los 16 corredores, combina las mejores ideas y los envía a otra ronda.
  • El Resultado: Al dividir el proceso de pensamiento en trozos pequeños y manejables y hacer que el equipo vote por el mejor camino, ZAYA1-8B puede resolver problemas matemáticos increíblemente difíciles (como las competiciones AIME y HMMT) que normalmente requieren cerebros mucho más grandes.

La Analogía: Imagina intentar resolver un rompecabezas gigante.

  • Antiguo Método: Una persona intenta sostener todo el rompecabezas en su cabeza a la vez. Se abruma.
  • Método ZAYA1-8B: Envías a 16 personas a trabajar en secciones pequeñas. Solo pasan unas pocas piezas de su sección al siguiente grupo. El grupo combina estas pequeñas piezas para construir la imagen completa. Es más rápido, usa menos memoria y obtiene un mejor resultado.

4. El Hardware: Construido sobre AMD

Todo el modelo fue entrenado utilizando chips de computadora AMD (específicamente las GPUs MI300X). Esto es un gran logro porque demuestra que no necesitas los chips más caros y propietarios para entrenar modelos de razonamiento de primer nivel. El equipo mostró que, con la configuración adecuada de software y hardware, los chips AMD pueden manejar el trabajo pesado de entrenar una IA compleja.

5. Los Resultados: Pequeño pero Poderoso

El documento afirma que con esta configuración:

  • ZAYA1-8B (con solo 0.7 mil millones de parámetros activos) supera o iguala a DeepSeek-R1 (que tiene 37 mil millones de parámetros activos) en pruebas de matemáticas y programación.
  • Al utilizar el método de pensamiento de grupo "Markovian RSA", obtiene puntuaciones en competiciones matemáticas difíciles que están muy cerca de modelos masivos y costosos como Gemini-2.5 Pro y GPT-5-High.

Resumen

ZAYA1-8B es una IA pequeña y eficiente que demuestra que no necesitas un cerebro gigante para ser un genio. Al utilizar una estructura de equipo inteligente, un método de entrenamiento especial que mantiene las respuestas seguras y una estrategia de "carrera de relevos de grupo" para pensar, puede resolver los problemas matemáticos y de programación más difíciles mientras utiliza una fracción de la potencia de cálculo de sus competidores más grandes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →