← Últimos artigos
💻 computer science

One Vector Is All You Need for O(1) Self-Attention: The Ocean State

Este artigo introduz o "Ocean State", um método que substitui a autoatenção padrão por um único vetor persistente para alcançar complexidade de computação e memória O(1), demonstrando simultaneamente uma estabilidade de treinamento superior e nenhum sinal de esquecimento mesmo em 10 milhões de passos de contexto.

Autores originais: SHUYUAN YU

Publicado 2026-09-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: SHUYUAN YU

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A inteligência artificial moderna frequentemente depende de um tipo específico de programa de computador chamado Transformer, que se tornou o padrão para tarefas como escrever textos, traduzir idiomas e responder a perguntas. Esses programas funcionam analisando uma sequência de palavras e decidindo qual palavra vem a seguir. Para fazer isso com precisão, o programa deve lembrar das palavras que já viu. Na configuração atual, conforme o programa lê uma frase longa ou um livro inteiro, ele mantém uma lista crescente de cada palavra processada até o momento. Esta lista atua como um banco de memória que se expande a cada nova palavra. Embora isso funcione bem para textos curtos, torna-se um fardo pesado para textos muito longos. O computador deve constantemente escanear esta lista em constante crescimento para encontrar informações relevantes, o que exige uma quantidade massiva de poder de processamento e memória. À medida que o texto fica mais longo, o tempo e a energia necessários para lê-lo crescem muito mais rápido do que o próprio texto, tornando impossível processar documentos muito longos de forma eficiente.

Um pesquisador chamado Yu Shuyuan propôs uma maneira diferente de lidar com este problema de memória. Em vez de manter uma lista crescente de cada palavra, o novo método sugere manter apenas um único vetor de resumo, que o autor chama de "estado oceânico" (ocean state). Imagine este estado como um contêiner único e denso que contém a essência de tudo o que o programa leu até agora. À medida que o programa lê uma nova palavra, ele atualiza este contêiner único para incluir a nova informação, substituindo o resumo antigo por um novo. O programa então usa este contêiner único para ajudar a prever a próxima palavra. Esta abordagem altera a matemática fundamental do problema: em vez de o esforço crescer com o comprimento do texto, o esforço permanece o mesmo, não importa o quão longo o texto se torne. O programa pode ler um milhão de palavras com a mesma quantidade de trabalho por palavra, e utiliza uma quantidade fixa e minúscula de memória, independentemente da extensão.

A ideia central por trás deste trabalho é uma pergunta simples: e se não descartássemos o resumo final de uma frase após usá-lo para prever a próxima palavra? Nos programas padrão, este resumo é calculado e depois descartado. O novo método o mantém, tratando-o como uma memória persistente que flui de um passo para o outro. O programa lê a palavra atual e este vetor de resumo único, combina-os e produz um novo resumo. Este processo se repete para cada palavra no texto. Crucialmente, o programa aprende a ler e atualizar este vetor único inteiramente por conta própria. Ninguém lhe disse como comprimir informações em um único lugar; ele simplesmente aprendeu a fazer isso durante o treinamento porque o design permitiu que acontecesse. Os pesquisadores descobriram que este vetor único é surpreendentemente capaz. Ele pode conter informações de uma sequência de dez milhões de passos sem perder nada. Em testes, o programa conseguiu recordar palavras específicas do início de uma sequência de dez milhões de passos com a mesma precisão com que poderia fazê-lo dos primeiros passos, não mostrando sinais de esquecimento.

Os pesquisadores testaram esta ideia contra o método padrão usando um grande conjunto de dados de texto. Eles treinaram ambas as versões para prever a próxima palavra em uma frase. Os resultados mostraram que o novo método, que utiliza apenas um vetor, desempenhou consistentemente melhor do que o método padrão que mantém uma lista crescente. Esta vantagem não foi uma casualidade; apareceu em muitas configurações diferentes, incluindo diferentes tamanhos de modelos e diferentes comprimentos de texto. De fato, o novo método foi tão estável que pôde processar uma sequência de dez milhões de passos sem qualquer aumento no erro, enquanto o método padrão teria ficado sem memória ou levado um tempo impossível para processar mesmo uma fração desse comprimento. Os pesquisadores também testaram uma tarefa específica onde o programa tinha que repetir uma palavra após um longo atraso. O novo método reproduziu a palavra com uma perda de 0,0006, enquanto o método padrão falhou completamente.

Uma preocupação com tal memória comprimida é que ela possa se tornar ilegível ou "nebulosa" ao longo do tempo, perdendo os detalhes necessários para fazer boas previsões. No entanto, os experimentos mostraram o oposto. O vetor único permaneceu nítido e claro, capaz de recuperar informações específicas mesmo após milhões de passos. Os pesquisadores também exploraram como tornar este método mais rápido em computadores reais. Como o novo método processa as palavras uma após a outra em uma sequência estrita, ele pode ser mais lento para treinar em uma única máquina comparado ao método padrão, que pode processar muitas palavras simultaneamente. Para resolver isso, os pesquisadores desenvolveram uma maneira de dividir o trabalho entre diferentes camadas do programa, permitindo que múltiplos passos fossem processados simultaneamente. Esta mudança de engenharia reduziu significativamente o tempo necessário para treinar o modelo, mantendo o mesmo alto desempenho.

O estudo demonstra que é possível construir um sistema que se lembre de uma vasta quantidade de informações usando uma quantidade fixa de memória e poder de processamento. Os pesquisadores mostraram que o programa aprende a organizar esta informação de forma eficiente sem instruções especiais. Embora os experimentos atuais tenham sido conduzidos em um conjunto de dados específico e com modelos relativamente pequenos, e o comportamento em tamanhos do mundo real permaneça não testado, os resultados sugerem que o princípio subjacente é robusto. O método funciona reposicionando a forma como o programa lida com seu próprio estado interno, transformando um resumo descartado em uma memória persistente. Esta mudança elimina o custo estrutural que tem limitado o comprimento de texto que os sistemas de IA podem manipular. As descobertas indicam que, com esta abordagem, as limitações do comprimento de contexto podem não ser mais uma barreira, permitindo sistemas que podem ler e compreender documentos de qualquer tamanho com velocidade e precisão consistentes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →