← Últimos artigos
💻 computer science

Training Transformers as a Universal Computer

Este artigo demonstra que um pequeno transformador treinado em programas MicroPy gerados aleatoriamente pode generalizar para executar algoritmos complexos escritos por humanos, fornecendo evidência empírica de que transformadores padrão podem funcionar como computadores universais.

Autores originais: Ruize Xu, Chenxiao Yang, Yanhong Li, David McAllester

Publicado 2026-04-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ruize Xu, Chenxiao Yang, Yanhong Li, David McAllester

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico muito inteligente, mas com uma memória de curto prazo um pouco limitada. Você quer ensiná-lo a executar programas de computador complexos. O problema é que o robô só consegue "pensar" sobre um número limitado de etapas por vez antes de esquecer o início da história. Se um programa for muito longo, o robô se perde.

Este artigo apresenta uma solução para esse problema. Os pesquisadores criaram uma linguagem de programação minúscula e simplificada chamada MicroPy e ensinaram um modelo de IA padrão (um Transformer) a atuar como um computador universal capaz de executar qualquer programa escrito nessa linguagem, mesmo aqueles que ele nunca viu antes.

Veja como eles fizeram isso, usando algumas analogias do cotidiano:

1. A Linguagem: MicroPy (O "Kit de Lego")

Pense no MicroPy não como uma linguagem de programação completa como Python ou C++, mas como um conjunto muito rigoroso e simplificado de instruções de Lego.

  • Ele possui blocos básicos para fazer coisas como "se isto, então aquilo", "consulte este valor" ou "altere este objeto".
  • Como é uma versão simplificada de uma linguagem "universal" (uma que teoricamente pode realizar qualquer cálculo), se a IA aprender a entender esses blocos específicos de Lego, ela pode teoricamente construir qualquer coisa.

2. O Problema: A Questão da "História Longa"

Geralmente, quando uma IA tenta resolver um problema matemático ou executar código passo a passo (um método chamado "Cadeia de Pensamento"), ela anota cada etapa individual.

  • A Analogia: Imagine que você está lendo um livro, mas só consegue manter as últimas 10 páginas em sua cabeça. Se o livro tiver 1.000 páginas, você esquecerá o início quando chegar ao fim. Você não consegue resolver o mistério porque esqueceu quem era o vilão no Capítulo 1.
  • Em termos de computação, a "janela de contexto" (a memória de curto prazo da IA) enche-se muito rápido com cálculos longos.

3. A Solução: PENCIL (A "Equipe de Limpeza")

Os pesquisadores usaram um truque especial chamado PENCIL. Pense no PENCIL como uma "Equipe de Limpeza" mágica que ajuda a IA a gerenciar sua memória.

  • Como funciona: Quando a IA conclui uma pequena subtarefa (como calcular um número ou finalizar uma função), a equipe PENCIL apaga instantaneamente as etapas intermediárias bagunçadas da memória da IA, mantendo apenas o resultado final.
  • A Analogia: Imagine que você está cozinhando uma refeição complexa. Em vez de manter cada panela suja, frigideira e embalagem de ingrediente na bancada (o que eventualmente encheria toda a cozinha), você lava a louça e guarda-a imediatamente após o uso. Você mantém apenas o prato pronto na bancada. Dessa forma, você pode cozinhar um banquete enorme em uma cozinha pequena sem ficar sem espaço.
  • Isso permite que a IA execute programas 60 vezes mais longos do que aqueles em que foi treinada, porque ela nunca deixa sua "bancada de cozinha" ficar desorganizada.

4. O Treinamento: Prática Aleatória vs. Testes Reais

Os pesquisadores não ensinaram a IA mostrando a ela código famoso escrito por humanos. Em vez disso, eles geraram milhões de programas aleatórios e sem sentido em MicroPy.

  • A Analogia: É como ensinar um aluno a jogar xadrez fazendo-o jogar contra um computador que faz movimentos aleatórios e sem sentido. O aluno aprende as regras de como as peças se movem e como capturar, em vez de memorizar jogos famosos específicos.
  • Assim que a IA aprendeu essas regras a partir da prática aleatória, eles a testaram em programas reais, escritos por humanos, que faziam coisas concretas, como:
    • Copiar e inverter bits (dados binários).
    • Adicionar e multiplicar grandes números binários.
    • Resolver quebra-cabeças lógicos (problemas SAT).

5. O Resultado: O Computador Universal

O resultado foi surpreendente e perfeito.

  • A IA alcançou 100% de precisão em todos os testes escritos por humanos.
  • Embora os programas de teste fossem muito mais longos e complexos do que qualquer coisa que a IA tenha visto durante o treinamento, ela os lidou perfeitamente.
  • O artigo afirma que isso prova que um modelo de IA padrão pode ser treinado para atuar como um computador universal. Ela não apenas memorizou respostas; aprendeu a lógica de como executar instruções, permitindo que ela se generalizasse para programas completamente novos e nunca vistos.

Resumo

Em resumo, o artigo mostra que, se você der a uma IA padrão uma linguagem simplificada para aprender e um "limpador de memória" (PENCIL) para ajudá-la a gerenciar tarefas longas, ela pode aprender a atuar como um computador universal. Ela pode receber instruções que nunca viu antes e executá-las perfeitamente, provando que esses modelos podem realmente aprender a "pensar" e calcular, e não apenas prever a próxima palavra.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →