← Últimos artigos
💬 NLP

Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL

Este artigo introduz o ORBIT, um framework de meta-aprendizado por reforço multitarefa que aumenta significativamente as capacidades de aprendizado online em contexto de grandes modelos de linguagem, permitindo que modelos de código aberto menores igualem o desempenho de modelos proprietários avançados como o GPT-5.2 em ambientes interativos não vistos.

Autores originais: Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezhou Zhang

Publicado 2026-02-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezhou Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O Gênio "Amnésico"

Imagine que você tem um aluno brilhante que leu todos os livros da biblioteca. Ele é um gênio para responder perguntas baseadas no que já leu. No entanto, se você o colocar em um videogame inédito ou em um labirinto que ele nunca viu, ele terá dificuldades.

Se ele cometer um erro na primeira rodada, ele não "aprende" de verdade com isso para a próxima rodada. Ele trata cada nova tentativa como se fosse a primeiríssima vez, esquecendo as lições das tentativas anteriores. Este é o estado atual de muitos Modelos de Linguagem de Grande Escala (LLMs). Eles são ótimos em tarefas estáticas (como escrever uma redação), mas ruins em aprendizado online — descobrir as coisas conforme avançam, interagindo com o mundo, cometendo erros e ajustando sua estratégia em tempo real.

A Solução: ORBIT (O Treinador "A Prática Leva à Perfeição")

Os autores criaram um novo método de treinamento chamado ORBIT. Pense no ORBIT não como um professor que dá as respostas ao aluno, mas como um treinador que força o aluno a jogar o mesmo jogo repetidamente, mas com um detalhe: o aluno tem permissão para manter um caderno de suas tentativas anteriores.

Neste treinamento:

  1. A Configuração: A IA joga um jogo (como um labirinto ou um quebra-cabeça) várias vezes.
  2. A Regra: Após a primeira tentativa falhar, a IA não recebe um "reset" onde esquece tudo. Em vez disso, ela vê todo o histórico de sua primeira tentativa (onde ficou presa, o que tentou) escrito em sua "janela de contexto" (sua memória de curto prazo).
  3. O Objetivo: A IA não é apenas recompensada por vencer na primeira vez. Ela é recompensada por aprender a aprender. Ela ganha pontos por usar seu caderno para descobrir uma estratégia melhor para a segunda e terceira tentativas.

A Analogia: Aprender a Jogar "Mastermind"

Imagine um jogo chamado Mastermind, onde você tem que adivinhar um código secreto de pinos coloridos.

  • Sem ORBIT: Você adivinha um código. Está errado. Você tenta de novo, mas adivinha exatamente o mesmo código porque não processou realmente por que o primeiro falhou. Você fica preso em um loop.
  • Com ORBIT: Você adinha um código. Está errado. Antes do seu próximo palpite, você olha para o seu "caderno" (o histórico do jogo). Você diz a si mesmo: "Ok, na minha primeira tentativa, coloquei Vermelho no primeiro lugar e estava errado. Na minha segunda tentativa, tentei Azul e também estava errado. Então, eu sei que o primeiro pino não é Vermelho nem Azul. Devo tentar Verde."

O ORBIT treina a IA para fazer esse tipo de reflexão automaticamente, sem precisar que um humano diga a ela para "pensar sobre seus erros".

Como Eles Testaram

Os pesquisadores pegaram um modelo de IA de código aberto relativamente pequeno (chamado Qwen3-14B) e o treinaram usando este método ORBIT em alguns jogos simples (como Campo Minado e Blackjack).

Depois, eles jogaram esse modelo em jogos completamente novos que ele nunca tinha visto antes (como um Labirinto complexo e Mastermind).

  • O Resultado: A IA treinada não apenas chutou aleatoriamente. Na primeira tentativa, ela pode falhar. Mas na segunda e terceira tentativas, ela usou o histórico de seus fracassos para navegar pelo labirinto ou decifrar o código muito melhor.
  • A Comparação: Ela teve um desempenho tão bom que igualou as capacidades de uma IA comercial massiva e de alto nível (GPT-5.2) e superou métodos de treinamento padrão que geralmente apenas ensinam a IA a resolver um problema específico sem aprender com os erros passados.

A Surpresa do "Escalonamento" (Scaling)

O artigo também descobriu algo interessante sobre o tamanho. Eles testaram versões menores e maiores da IA.

  • IA Pequena: Boa em resolver o quebra-cabeça imediatamente.
  • IA Grande: Surpreendentemente, a IA maior estava disposta a "desperdiçar" a primeira tentativa apenas para coletar informações (exploração). Ela tentaria algumas coisas para ver o que acontecia, anotaria e então usaria esse conhecimento para esmagar o quebra-cabeça na segunda e terceira tentativas.
  • A Conclusão: Modelos maiores treinados desta forma tornam-se ainda melhores nessa estratégia de "aprender conforme o processo avança".

O Que Isso Significa (Estritamente Baseado no Artigo)

O artigo afirma que:

  1. O treinamento funciona: Você pode ensinar uma IA a aprender com suas próprias interações sem mudar seu cérebro (pesos) durante a tarefa real. Ela aprende inteiramente através de sua memória de tentativas passadas.
  2. É generalista: Essa habilidade se transfere para novos ambientes não vistos. A IA não apenas memorizou o labirinto; ela aprendeu a habilidade de explorar e se adaptar.
  3. A simplicidade vence: Eles não precisaram de bancos de memória externos complexos ou prompts escritos por humanos para dizer à IA para "refletir". O próprio método de treinamento foi suficiente para fazer a IA naturalmente começar a resumir seus fracassos passados e planejar movimentos melhores.

Em resumo, o ORBIT transforma uma IA estática, "estudiosa", em um agente "esperto de rua" que consegue descobrir novas regras e ambientes através de tentativa, erro e lembrando do que aconteceu antes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →