← Últimos artículos
💻 computer science

One Vector Is All You Need for O(1) Self-Attention: The Ocean State

Este artículo presenta el "Ocean State", un método que reemplaza la autoatención estándar con un único vector persistente para lograr una complejidad de computación y memoria de O(1), demostrando al mismo tiempo una estabilidad de entrenamiento superior y sin signos de olvido incluso a los 10 millones de pasos de contexto.

Autores originales: SHUYUAN YU

Publicado 2026-09-04
📖 6 min de lectura🧠 Análisis profundo

Autores originales: SHUYUAN YU

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La inteligencia artificial moderna a menudo depende de un tipo específico de programa informático llamado Transformer, que se ha convertido en el estándar para tareas como escribir texto, traducir idiomas y responder preguntas. Estos programas funcionan mirando una secuencia de palabras y decidiendo qué palabra viene después. Para hacer esto con precisión, el programa debe recordar las palabras que ya ha visto. En el diseño actual, a medida que el programa lee una oración larga o un libro entero, mantiene una lista creciente de cada palabra que ha procesado hasta el momento. Esta lista actúa como un banco de memoria que se expande con cada nueva palabra. Si bien esto funciona bien para textos cortos, se convierte en una carga pesosa para textos muy largos. La computadora debe escanear constantemente esta lista en constante crecimiento para encontrar información relevante, lo que requiere una cantidad masiva de potencia de procesamiento y memoria. A medida que el texto se vuelve más largo, el tiempo y la energía necesarios para leerlo crecen mucho más rápido que el propio texto, haciendo que eventualmente sea imposible procesar documentos muy largos de manera eficiente.

Un investigador llamado Yu Shuyuan ha propuesto una forma diferente de manejar este problema de memoria. En lugar de mantener una lista creciente de cada palabra, el nuevo método sugiere mantener un solo vector de resumen, al que el autor llama "estado oceánico" (ocean state). Imagine este estado como un contenedor único y denso que contiene la esencia de todo lo que el programa ha leído hasta ahora. A medida que el programa lee una nueva palabra, actualiza este contenedor único para incluir la nueva información, reemplazando el resumen anterior con uno nuevo. El programa utiliza entonces este contenedor único para ayudar a predecir la siguiente palabra. Este enfoque cambia la matemática fundamental del problema: en lugar de que el esfuerzo crezca con la longitud del texto, el esfuerzo se mantiene igual sin importar cuán largo sea el texto. El programa puede leer un millón de palabras con la misma cantidad de trabajo por palabra, y utiliza una cantidad de memoria fija y diminuta independientemente de la longitud.

La idea central detrás de este trabajo es una pregunta simple: ¿qué pasaría si no desecháramos el resumen final de una oración después de usarlo para predecir la siguiente palabra? En los programas estándar, este resumen se calcula y luego se descarta. El nuevo método lo conserva, tratándolo como una memoria persistente que fluye de un paso al siguiente. El programa lee la palabra actual y este resumen único, los combina y produce un nuevo resumen. Este proceso se repite para cada palabra del texto. Crucialmente, el programa aprende a leer y actualizar este único vector por su cuenta. Nadie le dijo cómo comprimir la información en un solo lugar; simplemente aprendió a hacerlo durante el entrenamiento porque el diseño lo permitió. Los investigadores descubrieron que este vector único es sorprendentemente capaz. Puede contener información de una secuencia de diez millones de pasos sin perder nada de ella. En las pruebas, el programa podía recordar palabras específicas del principio de una secuencia de diez millones de pasos con la misma precisión con la que podía hacerlo de los primeros pasos, sin mostrar signos de olvido.

Los investigadores probaron esta idea contra el método estándar utilizando un gran conjunto de datos de texto. Entrenaron ambas versiones para predecir la siguiente palabra en una oración. Los resultados mostraron que el nuevo método, que utiliza solo un vector, funcionó consistentemente mejor que el método estándar que mantiene una lista creciente. Esta ventaja no fue una casualidad; apareció en muchos entornos diferentes, incluyendo diferentes tamaños de modelos y diferentes longitudes de texto. De hecho, el nuevo método fue tan estable que pudo procesar una secuencia de diez millones de pasos sin ningún aumento en el error, mientras que el método estándar se habría quedado sin memoria o habría tomado una cantidad de tiempo imposible para procesar incluso una fracción de esa longitud. Los investigadores también probaron una tarea específica donde el programa tenía que repetir una palabra tras un largo retraso. El nuevo método reprodujo la palabra con una pérdida de 0.0006, mientras que el método estándar falló por completo.

Una preocupación con tal memoria comprimida es que podría volverse ilegible o "borrosa" con el tiempo, perdiendo los detalles necesarios para hacer buenas predicciones. Sin embargo, los experimentos mostraron lo contrario. El vector único se mantuvo nítido y claro, capaz de recuperar información específica incluso después de millones de pasos. Los investigadores también exploraron cómo hacer este método más rápido en computadoras reales. Debido a que el nuevo método procesa las palabras una tras otra en una secuencia estricta, puede ser más lento de entrenar en una sola máquina en comparación con el método estándar, que puede procesar muchas palabras a la vez. Para solucionar esto, los investigadores desarrollaron una forma de dividir el trabajo a través de diferentes capas del programa, permitiendo que múltiples pasos se procesen simultáneamente. Este cambio de ingeniería redujo significamente el tiempo necesario para entrenar el modelo manteniendo el mismo alto rendimiento.

El estudio demuestra que es posible construir un sistema que recuerde una vasta cantidad de información utilizando una cantidad fija de memoria y potencia de procesamiento. Los investigadores demostraron que el programa aprende a organizar esta información eficientemente sin instrucciones especiales. Aunque los experimentos actuales se realizaron con un conjunto de datos específico y modelos relativamente pequeños, y el comportamiento en tamaños del mundo real aún no ha sido probado, los resultados sugieren que el principio subyacente es robusto. El método funciona reposicionando cómo el programa maneja su propio estado interno, convirtiendo un resumen descartado en una memoria persistente. Este cambio elimina el costo estructural que ha limitado la longitud de texto que los sistemas de IA pueden manejar. Los hallazgos indican que, con este enfoque, las limitaciones de la longitud del contexto pueden dejar de ser una barrera, permitiendo que los sistemas puedan leer y comprender documentos de cualquier tamaño con velocidad y precisión constantes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →