← Últimos artículos
🤖 machine learning

NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching

NeuroPrefetcher es un sistema de inferencia de LLM consciente del almacenamiento que logra aceleraciones significativas en dispositivos periféricos con restricciones de memoria al explotar la localidad temporal de la actividad de las neuronas MLP para precargar predictivamente solo los deltas de pesos necesarios desde el almacenamiento, en lugar de depender de la paginación reactiva bajo demanda.

Autores originales: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Publicado 2026-08-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos son los motores detrás de la inteligencia artificial moderna, capaces de escribir, razonar y traducir con una fluidez que antes parecía imposible. Estos sistemas funcionan procesando texto palabra por palabra, prediciendo la siguiente palabra en una secuencia basándose en los vastos patrones que aprendieron durante su entrenamiento. Para hacer esto, dependen de enormes bibliotecas digitales de números, llamados pesos, que se almacenan en la memoria de la computadora. Cuanto más grande y capaz sea el modelo, más memoria requiere. Sin embargo, ha surgido una brecha significativa: mientras estos modelos han crecido exponencialmente en tamaño, la memoria disponible en dispositivos portátiles como computadoras portátiles, tabletas y computadoras perimetrales especializadas no ha seguido el mismo ritmo. Esto crea un problema fundamental para ejecutar inteligencia avanzada fuera de los enormes centros de datos. Cuando un modelo es demasiado grande para caber en la memoria de un dispositivo, el sistema debe intercambiar constantemente datos entre la memoria rápida y la unidad de almacenamiento más lenta y grande, un proceso que usualmente detiene el rendimiento.

Investigadores de la Universidad Estatal de Kennesaw y Samsung han desarrollado un nuevo enfoque para este problema, creando un sistema llamado NeuroPrefetcher que permite que estos modelos sobredimensionados se ejecuten de manera eficiente en dispositivos con memoria muy limitada. En lugar de intentar encoger el modelo o forzarlo a caber, su sistema acepta que el modelo es más grande que la memoria disponible y trata a la unidad de almacenamiento como una parte activa del proceso de cálculo. La clave de su éxito reside en una observación simple sobre cómo piensan estos modelos. Cuando el modelo genera una palabra, activa un conjunto específico de vías internas. Cuando genera la palabra siguiente, utiliza casi exactamente las mismas vías nuevamente. Los investigadores descubrieron que entre el 82 y el 85 por ciento de las vías activas permanecen iguales de una palabra a la siguiente. Esto significa que, para la gran mayoría del trabajo, los datos necesarios ya están sentados en la memoria del dispositivo, esperando ser usados.

La innovación de NeuroPrefetcher reside en cómo gestiona la pequeña cantidad de datos que sí cambia. Los sistemas tradicionales esperan hasta que el modelo necesita una pieza de datos antes de ir a la unidad de almacenamiento para buscarla, un proceso reactivo que hace que la computadora se detenga y espere. NeuroPrefetcher funciona de manera diferente al mirar hacia adelante. Utiliza un predictor pequeño y especializado que analiza la palabra actual y adivina exactamente qué nuevas vías serán necesarias para la siguiente palabra. Debido a que sabe lo que viene, puede buscar únicamente las piezas específicas de datos faltantes desde la unidad de almacenamiento mientras la computadora está ocupada calculando la palabra actual. Esto convierte un proceso caótico de parada y arranque en un flujo suave y continuo. El sistema esencialmente precarga solo la diminuta fracción de la nueva información requerida, ignorando la enorme masa de datos que ya reside en la memoria.

Para probar esta idea, el equipo construyó un sistema completo y lo ejecutó en un potente dispositivo perimetral conocido como Jetson AGX Orin, que tiene una arquitectura de memoria unificada compartida entre su procesador y su unidad de gráficos. Probaron el sistema con modelos de lenguaje extensos como Mistral-7B y Llama-3-8B bajo límites de memoria estrictos, simulando condiciones donde el modelo era significamente más grande que la memoria disponible. En estas condiciones desafiantes, el método estándar de ejecutar estos modelos, que depende de que el sistema operativo gestione el intercambio de datos, funcionó mal, a menudo deteniendo el dispositivo. En contraste, NeuroPrefetcher mantuvo el movimiento del dispositivo, logrando una aceleración de casi ocho a doce veces más rápido que el método estándar. El sistema logró generar palabras a una tasa de más de tres por segundo, mientras que el enfoque estándar luchaba por producir incluso una palabra por segundo.

Los investigadores también examinaron cómo se comportaba el sistema a medida que la memoria disponible cambiaba. Descubrieron que el sistema podía adaptarse desplazando más del trabajo del modelo hacia la unidad de almacenamiento cuando la memoria era escasa, y desplazando más trabajo de vuelta a la memoria rápida cuando había más espacio disponible. Incluso en las condiciones de memoria más apretadas, el sistema mantuvo un alto rendimiento porque evitó las transferencias masivas de datos que usualmente ralentizan estas operaciones. En lugar de mover capas enteras del cerebro del modelo de ida y vuelta, movió solo las pequeñas y cambiantes porciones de datos. Este enfoque resultó tan efectivo que el sistema se mantuvo como la opción más rápida, incluso cuando se comparó con otras herramientas avanzadas, muchas de las cuales no pudieron ejecutarse en absoluto bajo estas restricciones específicas.

Una parte crítica de este trabajo fue asegurar que las ganancias de velocidad no vinieran a costa de la inteligencia. Los investigadores midieron la calidad del texto producido por el sistema y encontraron que permanecía muy cerca de la calidad del modelo completo y sin comprimir. El sistema preservó la precisión de las predicciones del modelo, reteniendo más del 90 por ciento del rendimiento original incluso cuando utilizaba los ajustes de ahorro de memoria más agresivos. Esto confirmó que la estrategia de mover solo los datos necesarios no degradó la capacidad del modelo para comprender y generar lenguaje. El sistema aprendió efectivamente a ignorar los datos que no eran necesarios para el siguiente paso inmediato, enfocando sus recursos solo en lo que importaba.

El estudio destaca un cambio en cómo podríamos pensar en la ejecución de la inteligencia artificial en los dispositivos cotidianos. Durante años, la solución para ejecutar grandes modelos en hardware pequeño ha sido hacer los modelos más pequeños o comprimirlos, lo que a veces puede reducir sus capacidades. NeuroPrefetcher sugiere un camino diferente: mantener el modelo completo intacto y gestionar el movimiento de sus datos con extrema precisión. Al predecir qué necesitará el modelo a continuación y buscar solo ese cambio específico, el sistema convierte a la unidad de almacenamiento de un cuello de botella en un socio útil. Este enfoque permite que la inteligencia poderosa opere en dispositivos que anteriormente eran demasiado pequeños para albergarla, abriendo la puerta para que la IA avanzada se ejecute localmente sin necesidad de una conexión a un servidor distante. Los resultados muestran que, con la gestión adecuada del flujo de datos, los límites físicos de la memoria pueden superarse sin sacrificar la potencia del propio modelo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →