← Últimos artículos
🤖 machine learning

On Subquadratic Architectures: From Applications to Principles

Este artículo evalúa las principales arquitecturas subcuadráticas (xLSTM, Mamba-2 y Gated DeltaNet) en tareas de código y series temporales, demostrando que xLSTM logra un rendimiento superior debido a que su esquema de compuerta permite una corrección de memoria y un seguimiento de estado más flexibles y estables.

Autores originales: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

Publicado 2026-06-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando construir un asistente superinteligente que pueda leer un libro masivo, escribir código informático complejo o predecir el clima para la próxima semana. Durante años, el estándar de la industria ha sido un tipo específico de motor llamado Transformer. Es increíblemente potente, pero tiene un fallo importante: a medida que la cantidad de información (la "secuencia") crece, el motor se vuelve exponencialmente más pesado y lento. Es como intentar cargar una mochila donde cada libro nuevo que añades hace que la bolsa pese el doble que la anterior.

Para solucionar esto, los científicos inventaron las Arquitecturas Subcuadráticas. Estos son nuevos diseños de motores destinados a ser más ligeros y rápidos, creciendo solo de forma lineal con la cantidad de información. Pero, ¿cuál de estos nuevos motores es realmente el mejor?

Este artículo pone a tres de los principales contendientes en una carrera: xLSTM, Mamba-2 y Gated DeltaNet. Los probaron en tres trabajos muy difíciles:

  1. Escribir Código: Una tarea llena de reglas estrictas y largas cadenas de lógica.
  2. Aprender de un Maestro: Tomar una IA grande y lista y enseñarle a una más pequeña y rápida a copiar sus habilidades.
  3. Predecir Series Temporales: Pronosticar cosas como los precios de las acciones o el clima, donde el pasado influye en el futuro de maneras complejas.

Los Resultados de la Carrera

En todos los ámbitos, xLSTM ganó. Fue el motor más consistente y preciso, especialmente cuando las tareas eran complejas y requerían recordar largas cadenas de eventos. Mamba-2 y Gated DeltaNet fueron buenos, pero tropezaron más a menudo en las partes más difíciles del trabajo.

¿Por qué ganó xLSTM? (La analogía de la "Memoria")

Para entender por qué, los autores miraron bajo el capó. Se dieron cuenta de que todos estos motores funcionan manteniendo un "estado" o una "memoria" de lo que han visto hasta ahora. Compararon cómo cada motor maneja dos habilidades de memoria críticas:

  1. Acumulación (El "Contador"): La capacidad de mantener un total acumulado o contar cosas durante un periodo largo (como contar cuántas veces aparece una palabra específica en un documento de 100 páginas).
  2. Seguimiento de Estado (El "Rastreador"): La capacidad de recordar detalles específicos y ordenados, y actualizarlos correctamente sin perder el hilo (como recordar que "si sucede A, entonces debe suceder B, a menos que haya ocurrido C primero").

Así es como los tres motores manejan estas habilidades:

  • Mamba-2 es como un bibliotecario estricto con la mano atada. Tiene una regla que dice: "Si olvido algo, también debo dejar de escribir cosas nuevas". Debido a que sus interruptores de "olvidar" y "escribir" están unidos, le cuesta actualizar su memoria de forma flexible. Es bueno en algunas cosas, pero a menudo pierde la cuenta o se confunde cuando la historia se vuelve demasiado larga.
  • Gated DeltaNet es como una pizarra con un borrador. Es muy bueno reemplazando la información vieja con información nueva. Si llega un dato nuevo, borra el viejo de la pizarra. Esto es excelente para la recuperación (encontrar el dato más reciente), pero terrible para contar. Si necesitas recordar que "A + B + C = 10", y la pizarra sigue borrando los números viejos para hacer espacio a los nuevos, pierdes el total.
  • xLSTM es como un cuaderno inteligente con un resaltador y una calculadora. Separa su memoria en dos partes:
    • Una parte actúa como una calculadora que puede mantener un total acumulado (Acumulación) sin borrar nada.
    • La otra parte actúa como un cuaderno que puede rastrear estados específicos y actualizarlos de forma flexible (Seguimiento de Estado).
    • Crucialmente, xLSTM tiene un "gate" (compuerta) especial que actúa como un borrador suave. En lugar de simplemente limpiar una página por completo (como DeltaNet) o ser incapaz de borrar (como Mamba), puede atenuar la información vieja si la nueva es más importante, o mantener la información vieja si sigue siendo relevante. Esta flexibilidad le permite hacer tanto el conteo como el seguimiento perfectamente al mismo tiempo.

La Prueba: El Test de la "Cadena Larga"

Para demostrar esta teoría, los autores realizaron una prueba simple con tareas inventadas:

  • La Prueba de Conteo: Pedir a la IA que cuente elementos en una lista que es mucho más larga de lo que fue entrenada para procesar.
  • La Prueba de Seguimiento: Pedir a la IA que recuerde un patrón específico de cambios entre "par" e "impar" a lo largo de una secuencia larga.

Los Resultados:

  • Mamba-2 falló casi de inmediato. A medida que la lista se hacía más larga, lo olvidó todo.
  • Gated DeltaNet pudo contar un poco, pero se confundió con las tareas de seguimiento. Incluso cuando se ajustó para mejorar el seguimiento, seguía teniendo dificultades para contar a distancias muy largas.
  • xLSTM fue el único que pudo hacer ambas cosas. Pudo contar perfectamente a largas distancias y también rastrear patrones complejos sin perder el hilo.

La Conclusión

El artículo concluye que xLSTM es actualmente la opción superior para tareas complejas porque combina lo mejor de ambos mundos: la capacidad de mantener un total acumulado (acumulación) y la capacidad de rastrear detalles específicos y cambiantes (seguimiento de estado) sin obligar al modelo a elegir entre ellos. Mientras que los otros motores son buenos en una cosa o en la otra, el mecanismo de "corrección de memoria" flexible de xLSTM le permite manejar las dependencias desordenadas y de largo plazo que se encuentran en el código y los datos del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →