TreeWY: Speculative Verification for Gated DeltaNet Hybrids
TreeWY introduce una transformación WY de estructura arbórea que elimina la necesidad de instantáneas de estado recurrente por nodo en la decodificación especulativa de modelos híbridos Gated DeltaNet, reduciendo significativamente la presión de memoria y mejorando el rendimiento o permitiendo árboles de borrador más amplios sin sacrificar la longitud de aceptación.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el mundo de la inteligencia artificial moderna, los grandes modelos de lenguaje actúan como potentes motores que generan texto palabra por palabra. Para hacer esto, deben recordar todo lo que han escrito hasta el momento para asegurar que la siguiente palabra encaje en el contexto. Durante muchos años, la forma más común de manejar esta memoria fue mantener una lista creciente de cada palabra previa y sus datos asociados, un método que funciona bien pero que requiere una cantidad masiva de memoria informática a medida que la conversación se alarga. Recientemente, ha emergido una nueva generación de modelos que mezcla este enfoque tradicional con un método diferente y más compacto. Estos modelos híbridos utilizan un tipo especial de capa que resume todo el historial en una instantánea única de tamaño fijo, en lugar de una lista creciente. Esto los hace increíblemente eficientes para tareas estándar de lectura y escritura, permitiéndoles ejecutarse en computadoras más pequeñas. Sin embargo, esta eficiencia crea un nuevo problema al intentar acelerar el proceso utilizando una técnica llamada decodificación especulativa.
La decodificación especulativa es una estrategia utilizada para hacer que estos modelos de IA sean más rápidos. En lugar de generar una palabra a la vez, un modelo de "borrador" más pequeño y económico adivina varias palabras por adelantado, y el modelo principal las verifica todas a la vez para ver cuáles de las suposiciones fueron correctas. Si el modelo principal puede verificar una larga cadena de suposiciones, puede emitir múltiples palabras en un solo paso, aumentando drásticamente la velocidad. El problema surge con los modelos híbridos mencionados anteriormente. Debido a que su memoria es una instantánea única de tamaño fijo que no se puede cortar o pegar fácilmente, los sistemas actuales tienen que tomar una copia completa de esta instantánea por cada palabra que el modelo de borrador adivina. Si el modelo de borrador adivina una larga lista de palabras, el sistema debe almacenar una copia de la memoria por cada suposición. Esto llena rápidamente la memoria de la computadora, obligando al sistema a detener las largas cadenas de suposiciones y limitando las ganancias de velocidad. Es un cuello de botella que impide que estos modelos eficientes funcionen tan rápido como teóricamente podrían.
Investigadores de Thomson Reuters, liderados por Sneha Murthy Ghantasala, han desarrollado un nuevo método llamado TreeWY para resolver este cuello de botella de memoria específico. Su trabajo se centra en una familia de modelos híbridos conocidos como Qwen3.5, que están diseñados para ser eficientes pero luchan con las demandas de memoria de la decodificación especulativa. El equipo se dio cuenta de que la forma en que estos modelos actualizan su memoria sigue un patrón matemático específico que podría reorganizarse. En lugar de guardar una copia completa del estado de la memoria por cada suposición, encontraron una manera de calcular los resultados de todas las suposiciones a la vez utilizando una operación matemática única y simplificada. Esta operación trata la secuencia de suposiciones no como una serie de instantáneas separadas, sino como un árbol estructurado donde la información necesaria se comparte y se calcula de manera eficiente.
El núcleo de su descubrimiento es que ya no necesitan almacenar el estado de memoria completo para cada token de borrador. En el método antiguo, si un modelo adivinaba diez palabras, tenía que guardar diez versiones completas de su memoria, lo que consumía un espacio enorme. Con TreeWY, el sistema solo guarda un resumen diminuto y comprimido de los cambios realizados durante la fase de suposición. Realiza un único cálculo para verificar todas las suposiciones simultáneamente. Si una suposición es aceptada, el sistema reconstruye el estado de memoria correcto. Si una suposición es rechazada, el sistema simplemente descarta el resumen sin haber necesitado almacenar la versión completa y pesada del estado de la memoria en primer lugar. Este enfoque elimina la necesidad del enorme gasto de memoria que anteriormente hacía imposibles las largas cadenas de suposiciones.
Los investigadores probaron este método en dos tamaños del modelo Qwen3.5, una versión de 35 mil millones de parámetros y una versión mucho más grande de 397 mil millones de parámetros, ejecutándolas en tarjetas gráficas de alto rendimiento. Compararon su nuevo método TreeWY contra el enfoque estándar utilizado en el software de IA popular. Los resultados mostraron que, cuando la memoria de la computadora estaba bajo una fuerte presión, el nuevo método permitía al sistema manejar significativamente más solicitudes a la vez. En algunos casos, la velocidad de generación de texto aumentó casi un cincuenta por ciento, y el tiempo para comenzar a generar una respuesta disminuyó drásticamente. Esto sucedió porque el espacio de memoria liberado permitió al sistema mantener más conversaciones activas simultáneamente sin colapsar o ralentizarse.
Sin embargo, el estudio también encontró que los beneficios dependen fuertemente de cuánta memoria haya disponible. Cuando la computadora tenía mucha memoria de sobra, el nuevo método era ligeramente más lento que el enfoque estándar, costando un pequeño porcentaje en velocidad. Esto se debe a que el nuevo cálculo, aunque ahorra memoria, toma un poco más de tiempo para realizarse que el método simple de solo copiar los datos. Los investigadores señalaron que la verdadera victoria ocurre cuando el sistema está limitado por la memoria, lo cual es una situación común para los modelos grandes. En estos escenarios, la capacidad de ejecutar más conversaciones simultáneamente supera con creces el pequeño costo del cálculo.
El equipo también exploró si este método podría soportar estrategias de suposición aún más ambiciosas, como una estructura de "árbol" donde el modelo adivina múltiples caminos diferentes al mismo tiempo, en lugar de solo una línea de palabras. El nuevo método hizo esto posible manteniendo el uso de memoria plano, independientemente de qué tan ancho fuera el árbol de suposiciones. Anteriormente, un árbol de suposiciones ancho habría requerido tanta memoria que sería imposible de ejecutar. Ahora, el sistema puede permitirse intentar muchos caminos diferentes a la vez. Aunque esto no resultó inmediatamente en un aumento masivo de la velocidad para los modelos probados, demostró que el método es lo suficientemente flexible como para manejar estructuras de suposición complejas y anchas que antes eran inasequibles.
Los investigadores enfatizaron que su solución es específica para las reglas matemáticas que gobiernan estos modelos híbricos. No depende de los detalles específicos del diseño del modelo, sino de la forma fundamental en que su memoria se actualiza a sí misma. Esto significa que el enfoque podría aplicarse potencialmente a otros modelos que utilicen estructuras de memoria similares. El trabajo fue implementado en un marco de software ampliamente utilizado para ejecutar modelos de IA, y los investigadores verificaron que el nuevo método produce resultados matemáticamente idénticos al enfoque estándar, asegurando que la calidad del texto permanezca inalterada.
Al final, esta investigación demuestra que, al repensar cómo se maneja la memoria durante la fase de suposición, es posible desbloquear todo el potencial de velocidad de los modelos híbricos eficientes. El estudio muestra que la limitación no estaba en los modelos mismos, sino en la forma en que el software gestionaba su memoria. Al cambiar de almacenar instantáneas completas a calcular un resumen compartido, los investigadores convirtieron un cuello de botella de memoria en una vía hacia un mayor rendimiento. Esto permite que estos modelos eficientes funcionen más rápido y atiendan a más usuarios, particularmente en situaciones donde la memoria de la computadora es la restricción más estricta. Los hallazgos sugieren que las mejoras futuras en la velocidad de la IA pueden provenir no solo de construir modelos más grandes, sino de formas más inteligentes de gestionar los datos que ya poseen.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.