← Últimos artículos
💻 computer science

NAS-Driven Hardware Accelerator Exploration for Edge AI and Quantization Effects on the Pareto Space

Este artículo propone un flujo de trabajo de tres etapas para la Búsqueda de Arquitecturas Neuronales consciente del hardware que integra la cuantificación post-entrenamiento y el mapeo de hardware evolutivo, mientras demuestra empíricamente que los sustitutos zero-shot de FP32 superan a los sustitutos dedicados entrenados en INT4 al caracterizar el espacio de Pareto de las arquitecturas cuantificadas.

Autores originales: Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas, Alexios Birbas

Publicado 2026-08-14
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Eleftherios Mylonas, Angelos Kouprizas, Michael Birbas, Alexios Birbas

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando construir el cerebro robótico definitivo, pero tienes una regla estricta: debe caber dentro de un dispositivo diminuto, como un reloj inteligente o un dron, alimentado por batería. Este es el mundo de la "IA en el borde" (Edge AI), donde la inteligencia artificial vive en dispositivos pequeños en lugar de en gigantescos y voraces servidores en la nube. Para que esto funcione, los ingenieros tienen que resolver un rompecabezas complicado: necesitan un cerebro que sea lo suficientemente inteligente como para reconocer rostros o sonidos, pero lo suficientemente pequeño y rápido como para funcionar sin agotar la batería en cuestión de minutos.

Para encontrar el diseño del cerebro perfecto, los científicos utilizan un método llamado Búsqueda de Arquitectura Neuronal (NAS, por sus siglas en inglés). Piensa en esto como un chef automatizado y superrápido que prueba millones de recetas diferentes (diseños de redes neuronales) para encontrar la que sabe mejor (mayor precisión) utilizando la menor cantidad de ingredientes (potencia de cómputo). Por lo general, estos chefs cocinan con ingredientes de "precisión completa", que es como usar medidas exactas y pesadas. Pero para dispositivos diminutos, tienes que cambiar a la "cuantización", que es como cambiar a tazas de medir más pequeñas y ligeras (usar menos bits para representar números). La gran pregunta es: si cambias las tazas de medir, ¿el sabor de la receta que parecía perfecta en la cocina sigue siendo el mismo en la carretera? Este artículo profundiza precisamente en esa cuestión, explorando cómo el cambio en el sistema de medición afecta la búsqueda del mejor cerebro robótico y cómo encajar ese cerebro en un chip especial y reconfigurable.


El viaje de tres etapas hacia un cerebro diminuto

Los autores de este artículo proponen un ingenioso proceso de tres pasos para resolver el problema de adaptar la IA al hardware. Lo llaman un enfoque de "NAS-luego-cuantizado", que es un poco como diseñar un coche en una computadora primero, luego probar cómo se comporta en un camino de tierra accidentado y, finalmente, construir el motor para que coincida con el terreno.

Etapa 1: El frente agnóstico al hardware
Primero, el equipo utiliza un modelo "subrogado" (surrogate)—un predictor inteligente que adivina qué tan bueno es un diseño sin necesidad de construirlo realmente. Entrenan este predictor en una biblioteca masiva de 15,625 diseños de redes neuronales diferentes (de un conjunto de datos llamado NAS-Bench-201). Esta etapa es "agnóstica al hardware", lo que significa que no le importa el chip específico todavía; solo busca los mejores diseños basándose en la precisión y en cuántas operaciones matemáticas (FLOPs) necesitan. Utilizan dos estrategias de búsqueda: una "Búsqueda Aleatoria" simple (elegir diseños al azar) y un "Algoritmo Evolutivo Multiobjetivo" (que imita la selección natural para evolucionar mejores diseños). Después de esta etapa, tienen una lista corta de diez candidatos principales.

Etapa 2: El puente de cuantización
Después viene la prueba de realidad. El equipo toma esos diez candidatos principales y los reduce de tamaño utilizando una técnica llamada Cuantización Post-Entrenamiento (PTQ), específicamente cambiando a INT4 (usando solo 4 bits por número en lugar de los 32 habituales). Esto es como tomar una foto de alta definición y comprimirla para que quepa en un teléfono viejo. Utilizan una herramienta llamada Brevitas para hacer esto.

Aquí es donde la cosa se pone interesante. Cuando comprimen los modelos, algunos diseños que parecían excelentes en la primera etapa podrían fallar o empeorar. El "Puente de Cuantización" actúa como un filtro. Reclasifica los diseños basándose en qué tan bien sobreviven a la compresión. Si un diseño se desmorona, se desecha. Si ningún diseño sobrevive, el sistema vuelve a la Etapa 1 para intentarlo de nuevo. Eligieron INT4 porque, aunque es muy agresivo, descubrieron que con un poco de entrenamiento adicional (solo dos épocas), los modelos podían recuperar su precisión significamente, saltando de un bajo 9.49% hasta un 83.53%, demostando que la información del modelo original se preservó en gran medida.

Etapa 3: El backend consciente del hardware
Finalmente, los diseños supervivientes necesitan un hogar. El equipo mapea estos cerebros comprimidos en un tipo específico de hardware llamado CGRA (Matriz de Arreglo de Grano Grueso). Piensa en un CGRA como una placa de LEGO donde puedes reorganizar los bloques para que se ajusten a cualquier forma. Utilizan un algoritmo evolutivo para explorar diferentes formas de organizar el hardware (cambiando el número de unidades de procesamiento, la profundidad de la memoria y las rutas de datos). No construyen el chip físico; en su lugar, utilizan un "oráculo analítico gratuito"—un simulador matemático—para predecir qué tan rápido y eficiente sería cada configuración. Eligen la configuración que minimiza el retraso y maximiza el uso de los recursos del hardware.

La gran sorpresa: No tires el mapa viejo

El descubrimiento más emocionante de este artículo no es solo el proceso de tres etapas; es lo que aprendieron sobre la relación entre el mundo de "precisión completa" y el mundo "comprimido".

Normalmente, cuando comprimes un modelo, podrías pensar que necesitas empezar tu búsqueda desde cero, entrenando un nuevo predictor específicamente para el mundo comprimido (INT4). Los autores probaron esta idea. Compararon dos enfoques:

  1. El Subrogado INT4 Dedicado: Un predictor entrenado específicamente con datos comprimidos.
  2. El Subrogado Zero-Shot de FP32: Un predictor entrenado en los datos originales de precisión completa, que luego utilizaron para adivinar el rendimiento de los modelos comprimidos sin necesidad de reentrenamiento.

Los resultados fueron sorprendentes. En las simulaciones, el subrogado zero-shot de FP32 funcionó mejor que el dedicado a INT32. Cuando ejecutaron sus estrategias de búsqueda, el predictor de FP32 encontró diseños que cubrían un rango más amplio de las mejores compensaciones posibles (el "espacio de Pareto") que el predictor específico de INT4.

¿Por qué? Los autores sugieren que los datos de precisión completa son "más limpios" y tienen menos ruido. Aunque el mundo comprimido es diferente, el orden de clasificación de qué diseños son "buenos" y cuáles son "malos" permanece sorprendentemente similar. El artículo señala que, aunque el orden exacto de los diseños cambia (el 21% de las veces, un diseño que era mejor que otro en precisión completa se vuelve peor tras la compresión), la estructura general de los "mejores" diseños permanece lo suficientemente estable como para que el mapa antiguo (el predictor de FP32) siga siendo una guía confiable.

La estabilidad del rompecabezas

El equipo no solo lo supuso; midieron el caos. Observaron los 15,625 arquitecturas para ver cuánto se desplazaba el "frente de Pareto" (la lista de los mejores diseños) cuando cambiaban a INT4.

  • El Desplazamiento: La lista de los mejores diseños se reorganizó por completo. Ninguno de los diseños originales sobrevivió como los mejores diseños en el mundo comprimido.
  • El Giro: Aproximadamente el 21.73% de las veces, la relación entre dos diseños se invirtió (el Diseño A era mejor que el Diseño B en precisión completa, pero el Diseño B se volvió mejor tras la compresión).
  • La Correlación: A pesar de este caos, la correlación de clasificación general seguía siendo moderada (0.6655), lo que significa que la "forma" general de los buenos diseños se preservó.

También descubrieron que los modelos más pequeños y simples (aquellos con menos operaciones matemáticas) eran mucho más sensibles a la compresión, perdiendo precisión con frecuencia. Los modelos más grandes y complejos fueron sorprendentemente robustos, probablemente porque su estructura suaviza naturalmente los errores introducidos por los números más pequeños.

Los resultados del hardware

Finalmente, tomaron tres de sus mejores diseños supervivientes y los mapearon en el hardware CGRA. Descubrieron que, a pesar de que los diseños eran diferentes, todos convergieron en la misma configuración de hardware óptima: una cuadrícula de 16 filas y 66 columnas de unidades de procesamiento con una profundidad de memoria específica. Esto sugiere que, para este tipo de tarea, el "punto ideal" del hardware es bastante consistente, independientemente del diseño específico de la red neuronal, siempre que el diseño utilice bloques de construcción similares.

Conclusión

Este artículo sugiere que no necesitamos reinventar la rueda cada vez que queremos reducir un modelo de IA para un dispositivo diminuto. Al utilizar un proceso de tres etapas —encontrar los mejores diseños en precisión completa, filtrarlos mediante una prueba de compresión y luego mapearlos en un hardware flexible— podemos encontrar eficientemente el equilibrio perfecto entre precisión y tamaño. Lo más importante es que sugiere que podemos confiar en nuestras herramientas de búsqueda de precisión completa para guiarnos incluso en el mundo comprimido, ahorrando tiempo y esfuerzo en la búsqueda de poner una IA poderosa en nuestros bolsillos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →