← Últimos artigos
🤖 AI

OpenSkill: Open-World Self-Evolution for LLM Agents

Este artigo apresenta o OpenSkill, um framework que permite que agentes de LLM realizem o bootstrapping autônomo de sua autoevolução em implantações de mundo aberto, sintetizando habilidades transferíveis e sinais de verificação de recursos externos sem depender de supervisão da tarefa alvo.

Autores originais: Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

Publicado 2026-06-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contrata um aprendiz brilhante, mas inexperiente, para resolver um quebra-cabeça complexo. Normalmente, para ensiná-lo, você lhe daria um livro didático, uma lista de "o que fazer e o que não fazer" ou um professor por perto para dizer: "Bom trabalho!" ou "Tente novamente".

OpenSkill é uma nova maneira de treinar esses aprendizes de IA (chamados de agentes de LLM) quando você não tem nada disso. Você apenas fornece o comando do quebra-cabeça e a internet. Eles têm que ensinar a si mesmos, descobrir o que aprender e até construir seu próprio "professor" para verificar seu trabalho, tudo sem espiar a chave de respostas.

Aqui está como o artigo explica esse processo usando analogias simples:

O Problema: A "Sala Silenciosa"

A maioria dos métodos atuais de treinamento de IA assume que a IA possui um ciclo útil: ela tenta algo, recebe uma pontuação e tenta novamente. Mas no mundo real (o "mundo aberto"), você muitas vezes apenas recebe uma tarefa e um monte de recursos desorganizados (sites, manuais, repositórios de código). Você não tem uma chave de respostas e não tem um humano corrigindo o trabalho deles.

Se a IA tentar aprender com seus próprios palpites, ela pode acabar convencendo a si mesma de que está certa quando, na verdade, está errada. É como tentar aprender uma nova língua falando apenas consigo mesmo em uma sala sem um dicionário.

A Solução: OpenSkill

Os pesquisadores construíram um framework chamado OpenSkill que atua como um guia de sobrevivência autossuficiente para a IA. Ele funciona em três etapas principais:

1. A Fase do "Bibliotecário" (Aquisição de Conhecimento)

Em vez de depender do que a IA já lembra (que pode estar desatualizado ou incorreto), o OpenSkill envia a IA para o "mundo aberto" (a internet, documentação, repositórios de código).

  • A Analogia: Imagine que a IA é um detetive. Em vez de adivinhar o culpado, ela vai à biblioteca, lê todos os relatórios policiais, manuó de instruções técnicos e artigos de notícias relacionados ao caso. Ela reúne os fatos brutos necessários para construir um plano.

2. A Fase do "Dojo Virtual" (Evolução Sem Vazamento de Dados)

Esta é a parte mais inteligente. A IA precisa praticar, mas não pode usar a chave de respostas real. Então, o OpenSkill constrói um Verificador Virtual.

  • A Analogia: Pense nisso como um "Dojo" ou uma academia de prática. A IA escreve um conjunto de regras (habilidades) para resolver o quebra-cabeça. Então, uma IA separada e independente atua como um árbitro rigoroso.
  • Como o Árbitro funciona: O árbitro não conhece a chave de respostas. Em vez disso, ele verifica o trabalho da IA contra fatos concretos que encontrou na biblioteca anteriormente.
    • Exemplo: Se a tarefa é analisar um conjunto de dados, o árbitro verifica: "A IA contou as linhas corretamente? A soma dos números coincide com o total conhecido?"
    • É como um professor de matemática verificando se sua resposta é um número par ou se ela cai dentro de uma faixa realista, sem saber o número específico que você deveria ter encontrado.
  • Se a IA falha, o árbitro diz: "Você esqueceu um passo" ou "Você precisa pesquisar esta regra específica novamente". A IA então corrige suas regras e tenta novamente. Esse ciclo acontece até que a IA passe em todos os testes "virtuais".

3. A Fase do "Exame Final" (Avaliação Zero-Shot)

Uma vez que a IA poliu suas habilidades no Dojo Virtual, ela é enviada para o mundo real para resolver a tarefa real.

  • A Analogia: A IA faz o exame final. A chave de respostas real só é revelada depois que o exame termina. Os pesquisadores descobriram que a IA, tendo praticado com seu próprio "árbitro" autoconstruído, teve um desempenho incrível, muitas vezes superando outros métodos que dependiam de habilidades pré-escritas ou feedback humano.

Por que Isso Importa (Os Resultados)

O artigo testou isso em três tipos diferentes de desafios (codificação de software, raciocínio social e experimentos científicos) usando dois modelos de IA diferentes.

  • Funciona sem trapacear: A IA nunca viu as respostas reais durante seu treinamento. Ela construiu sua própria "verdade" a partir de fatos públicos.
  • É portátil: As "habilidades" que a IA aprendeu (as regras que ela escreveu) são como um livro físico. Você pode pegar o livro escrito por uma IA e entregá-lo a uma IA completamente diferente e mais fraca, e ele ainda funcionará. A IA não apenas "memorizou" a resposta; ela aprendeu um método.
  • Vence a competição: Em quase todos os testes, o OpenSkill obteve uma pontuação mais alta do que outros métodos que tentaram aprender sem essa configuração específica de "árbitro virtual".

A Conclusão

OpenSkill é um sistema que ensina agentes de IA a serem autossuficientes. Ele mostra que uma IA pode passar de não saber nada sobre uma tarefa específica para se tornar um especialista, simplesmente:

  1. Lendo o manual (Mundo Aberto).
  2. Construindo seu próprio teste de prática baseado em fatos (Verificador Virtual).
  3. Praticando até passar nesse teste.
  4. E então resolvendo o problema real.

Isso prova que você não precisa de um professor humano ou de uma chave de respostas oculta para ensinar uma IA a melhorar; você só precisa dar a ela as ferramentas certas para verificar o próprio trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →