← Últimos artículos
💻 computer science

Triton for MTIA: Bridging the Programming Model Gaps for Custom AI Accelerators

Este artículo presenta el primer despliegue a escala de producción del lenguaje de programación Triton en el acelerador personalizado MTIA-2i de Meta, demostrando que un nuevo backend de compilador y extensiones de lenguaje mínimas permiten el desarrollo de kernels de alto rendimiento y eficientes que cierran la brecha entre los frameworks de ML y el hardware personalizado.

Autores originales: Haishan Zhu, Domi Yan, Michael Levesque-Dion, Changxu Zhang, Mitch Gamburg, Kirsten Lee, Giancarlo Colmenares, Aditya Bhagwat, Arnab De, Markus Le Roux, Victor Perez Carrasco, Xin Tong, Will Cromar, S
Publicado 2026-08-04
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Haishan Zhu, Domi Yan, Michael Levesque-Dion, Changxu Zhang, Mitch Gamburg, Kirsten Lee, Giancarlo Colmenares, Aditya Bhagwat, Arnab De, Markus Le Roux, Victor Perez Carrasco, Xin Tong, Will Cromar, Simran Barnwal, Andrew Uderian, Blaine Burton Rister, Jordan Fix, Jazlyn Li, Zejun Huang, Lite Ye, Nan Zhang, Xinchen Guo, Andiry Xu, Michael Roberts, Kunming Ho, Site Cao, Suryadev Sahadevan Rajesh, Tristan Trouwen, Mike Tsai, Jake Lee, Wayne Su, Yuhan Chen, Xiaolong Xie, David Eklov, Aaron Barnes, Max Bremer, Adam Belay, Shintaro Iwasaki, Roman Levenstein, Ajit Mathews

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando construir un sistema de trenes masivo y de alta velocidad para transportar pasajeros (datos) a través de un continente. Durante años, los únicos trenes disponibles eran los eléctricos estándar y de alta tecnología (GPUs) que todo el mundo sabía conducir. Tenían puertas automáticas, GPS integrado y un viaje suave. Pero recientemente, se ha inventado un nuevo tipo de motor de tren (aceleradores de IA personalizados). Estos nuevos motores son increíblemente potentes y están construidos específicamente para carga pesada, pero son extraños. No tienen puertas automáticas; tienes que abrirlas y cerrarlas manualmente. No tienen GPS; tienes que dibujar el mapa tú mismo. Y no circulan por las mismas vías que los trenes antiguos.

El problema es que los ingenieros que construyen los vagones del tren (los desarrolladores de software) están acostumbrados a los trenes eléctricos antiguos y fáciles de conducir. Si quieren usar los nuevos motores súper rápidos, tienen que aprender una forma completamente nueva y difícil de conducir, o tienen que construir un vagón de tren nuevo desde cero para cada ruta nueva. Esto lo ralentiza todo. La gran pregunta es: ¿Podemos enseñar el estilo de conducción antiguo y fácil de usar para que funcione en estos nuevos motores extraños sin perder la ventaja de velocidad? Este artículo explora exactamente eso, intentando cerrar la brecha entre el mundo familiar del software de IA estándar y el extraño hardware personalizado construido por empresas como Meta para ejecutar sus modelos de IA.


La historia: Enseñando a un nuevo motor a hablar un idioma antiguo

Meta, la empresa detrás de Facebook e Instagram, ha estado construyendo sus propios chips especiales llamados MTIA-2i para ejecutar sus modelos de IA de forma más rápida y económica. Piensa en el MTIA-2i como el motor de un coche de carreras construido a medida. Es increíble en lo que hace, pero está construido de forma diferente a los motores estándar (GPUs) con los que la mayoría de los programadores de IA están acostumbrados.

En el mundo de la IA, existe un lenguaje de programación popular llamado Triton. Puedes pensar en Triton como un "control remoto universal" para la IA. En lugar de escribir código complejo y desordenado para decirle a una GPU estándar cómo mover datos, los desarrolladores escriben código simple y limpio en Triton y un compilador inteligente lo traduce al lenguaje de máquina que la GPU entiende. Es como hablar inglés a un traductor que sabe cómo hablar con la máquina.

Sin embargo, Triton fue diseñado originalmente solo para motores de GPU estándar. Cuando Meta intentó usarlo en su motor de coche de carreras personalizado MTIA-2i, no funcionó. El "control remoto" no encajaba con los botones del nuevo motor. El motor MTIA-2i trabaja de forma asíncrona (recibe órdenes y las ejecuta después), gestiona su propia memoria de una forma extraña mediante un "buffer circular" y necesita instrucciones muy específicas para mantener todo fluyendo suavemente. El código estándar de Triton simplemente no podía manejar estas peculiaridades.

Lo que hace el artículo: Construyendo un nuevo adaptador

El equipo de Meta decidió solucionar esto. No se limitaron a forzar que el viejo control remoto funcionara; construyeron un nuevo backend de compilación específicamente para el MTIA-2i. Este nuevo sistema actúa como un adaptador superinteligente. Toma el código de Triton, simple y fácil de leer, que escriben los desarrolladores, y lo traduce perfectamente a las instrucciones complejas y de bajo nivel que necesita el motor MTIA-2i.

Así es como lo hicieron funcionar, utilizando algunas analogías divertidas:

  1. La línea de buffet "FIFO": En las GPUs estándar, la computadora gestiona la memoria automáticamente como un buffet inteligente donde los platos se toman y se reemplazan instantáneamente. En el MTIA-2i, es más como una línea de ensamblaje manual con un buffer de "Primero en entrar, primero en salir" (FIFO). El nuevo compilador aprendió a gestionar esta línea perfectamente, asegurando que los datos lleguen exactamente cuando la máquina los necesita, sin que el programador tenga que empujar manualmente cada uno de los platos.
  2. La cocina de dos chefs: El chip MTIA-2i tiene dos "núcleos" (como dos chefs en una cocina) que pueden trabajar al mismo tiempo. El compilador descubrió cómo dividir las tareas de cocina entre ellos para que no choquen entre sí ni se queden esperando. Incluso permite que los programadores expertos les digan a los chefs exactamente quién debe picar las cebollas y quién debe revolver la sopa si quieren ponerse sofisticados.
  3. La ruta de entrega en "zigzag": Imagina que tienes que entregar paquetes en 64 casas. Si solo vas por la calle en línea recta (lineal), las primeras casas se terminan rápido, pero las últimas esperan una eternidad. El equipo descubrió que una ruta de entrega en "zigzag" (yendo y viniendo) equilibraba mucho mejor el trabajo. Añadieron una función a Triton para que los programadores pudieran elegir fácilmente esta ruta más inteligente.

Los resultados: Rápido, flexible y listo para el mundo real

El equipo no solo construyó esto en un laboratorio; lo pusieron a trabajar en el mundo real. Implementaron con éxito estos nuevos kernels de Triton en producción en 60 tipos diferentes de modelos de IA.

Esto es lo que encontraron:

  • Velocidad: El código escrito en el sencillo lenguaje Triton funcionó tan rápido como el código escrito por expertos en C++ complejo de bajo nivel (el lenguaje "nativo" del chip). De hecho, para la multiplicación de matrices generales (GEMM) —una tarea matemática pesada—, el código de Triton alcanzó más del 80% de la velocidad máxima teórica del chip.
  • Adopción: En solo un trimestre, el número de tipos de modelos que utilizan Triton se triplicó.
  • Impacto: Triton ahora maneja el 50% de las capas y el 47% del tiempo de ejecución no-GEMM de estos modelos. ¡Eso es casi la mitad del trabajo realizado por este nuevo sistema de fácil uso!

Por qué esto es importante

El artículo sostiene que no tienes que elegir entre "fácil de escribir" y "súper rápido". Antes de esto, si querías usar un chip personalizado como el MTIA, tenías que ser un mago de la programación de bajo nivel y escribir todo desde cero. Si querías usar un lenguaje de alto nivel como Triton, estabas limitado a las GPUs estándar.

Al cerrar esta brecha, Meta demostró que los lenguajes de alto nivel pueden adaptarse para funcionar en casi cualquier hardware personalizado. Esto significa que, en el futuro, a medida que las empresas construyan chips de IA aún más extraños y especializados, los desarrolladores no necesitarán aprender un lenguaje nuevo y difícil para cada uno. Pueden seguir usando las herramientas familiares y potentes que ya conocen, mientras el compilador se encarga de los detalles complicados del nuevo hardware.

El artículo también señala que anteriormente probaron un lenguaje diferente y muy de bajo nivel llamado KNYFE, pero lo abandonaron porque era demasiado difícil de aprender para la mayoría de las personas. Demostraron que insistir en un lenguaje flexible y de alto nivel como Triton, incluso con algunos pequeños ajustes personalizados, es la estrategia ganadora para mantener el desarrollo de IA rápido y eficiente.

En resumen, el artículo demuestra que con la magia del compilador adecuado, podemos hacer que el "control remoto universal" funcione en casi cualquier "televisor", incluso en aquellos que son extraños y construidos a medida, sin sacrificar la calidad de la imagen.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →