Embedded Universal Predictive Intelligence: a coherent framework for multi-agent learning
Este artigo introduz uma estrutura matemática para a inteligência preditiva universal incorporada que estende o AIXI ao permitir que agentes bayesianos se modelem como parte de seu ambiente por meio da autopredição, resolvendo assim a não estacionariedade em configurações multiagentes e alcançando uma teoria da mente de ordem infinita para facilitar novas formas de cooperação.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ensinar um robô a jogar um jogo. Durante décadas, a maneira padrão de fazer isso tem sido deixar o robô jogar, cometer erros, receber uma recompensa e, então, tentar fazer mais do que funcionou e menos do que não funcionou. Isso é chamado de "aprendizado por reforço", e é como treinar um cachorro com petiscos: você espera o comportamento acontecer, depois dá o feedback. Isso funciona muito bem se o mundo for entediante e não mudar. Mas e se o mundo estiver cheio de outros aprendizes inteligentes, como outros robôs ou humanos, que também estão mudando suas estratégias com base no que você faz? De repente, os "petiscos" que você recebeu ontem podem não funcionar hoje porque seu oponente descobriu seu truque. Este é o mundo caótico e desordenado da vida social, onde todos estão observando todos os outros e as regras do jogo estão constantemente mudando porque você faz parte do jogo.
Este artigo mergulha nessa realidade caótica. Ele aborda um grande problema na inteligência artificial: como construímos agentes (como IAs) que possam aprender e cooperar em um mundo onde eles não são apenas jogadores separados, mas estão, na verdade, dentro do sistema que estão tentando entender? Os autores baseiam-se em uma ideia famosa chamada "AIXI", uma superinteligência teórica que prevê o futuro adivinhando quais regras matemáticas descrevem o universo. Mas a versão clássica dessa ideia trata a IA como um observador parado do lado de fora do universo, olhando para dentro. Os autores argumentam que isso está errado. No mundo real, uma IA é parte do universo, assim como uma pessoa é parte de uma sociedade. Se você quer prever o que seu amigo fará, você não pode apenas olhar para ele; você tem que perceber que ele também está pensando em você. Este artigo propõe um novo framework matemático onde a IA entende que suas próprias decisões são parte dos dados que ela usa para prever o futuro, permitendo que ela raciocine sobre outros que podem estar pensando exatamente como ela.
O Problema de "Olhar de Fora"
Imagine que você está jogando uma partida de xadrez contra um amigo. Na antiga forma de pensar sobre IA (chamada de aprendizado "desacoplado"), a IA olharia para o tabuleiro, pensaria: "Se eu mover meu cavalo aqui, meu amigo provavelmente moverá o peão ali", e então faria um movimento. Ela trata sua própria mente como uma máquina separada do tabuleiro de xadzes e do seu amigo. Ela assume que seu amigo é apenas uma parte estática do cenário que reage aos movimentos, não uma entidade pensante que também está observando a IA e tentando adivinhar o que a IA fará a seguir.
Os autores dizem que essa abordagem é falha para situações sociais. Se você está em uma sala com outra pessoa que está tentando adivinhar o que você fará, e você está tentando adivinhar o que ela fará, você fica preso em um loop: "Eu acho que ela acha que eu acho..." Isso é chamado de "recursão infinita" de teoria da mente. A antiga forma de fazer as coisas assume que o mundo é estático, como um nível de videogame que não muda. Mas em um mundo de múltiplos agentes, o "nível" muda toda vez que alguém aprende algo novo. Se a IA não perceber que ela é quem está mudando o nível, ela continuará fazendo previsões erradas.
A Nova Ideia: Ser "Embebido"
O artigo introduz o conceito de Agentes Bayesianos Embebidos. Em vez de ficar do lado de fora do universo olhando para dentro, esses agentes imaginam que estão dentro de um "universo" que inclui a si mesmos, seus amigos e o ambiente, tudo misturado.
Pense da seguinte forma: No modelo antigo, a IA é um diretor assistindo a um filme e tentando prever o enredo. No novo modelo, a IA é um ator no filme. Ela sabe que, se decidir chorar, os outros atores podem reagir com conforto, mas ela também sabe que os outros atores estão observando-a e podem estar decidindo chorar porque viram a IA parecer triste.
Para fazer isso, a IA utiliza um tipo especial de previsão chamado autopredição. Ela não apenas prevê o que o mundo mostrará a ela; ela prevê o que ela fará a seguir. Ela pergunta: "Dado o que eu sei sobre o mundo, qual é a ação mais provável que eu tomarei?" e então usa essa resposta para adivinhar o que os outros agentes farão. Isso cria um loop onde a crença da IA sobre si mesma ajuda a entender os outros, e sua crença sobre os outros ajuda a entender a si mesma.
A Magia da "Similaridade Estrutural"
É aqui que fica realmente legal. O artigo sugere que, como esses agentes estão todos rodando em "softwares" semelhantes (algoritmos), eles são estruturalmente semelhantes. Imagine dois gêmeos que cresceram na mesma casa, foram à mesma escola e têm a mesma fiação cerebral. Se você fizer uma charada para um deles, é provável que ele a resolva da mesma forma que o outro faria.
Os autores mostram que, se uma IA perceber: "Ei, aquele outro agente provavelmente é construído como eu", ela pode usar esse conhecimento para prever o comportamento do outro agente. Isso é chamado de similaridade estrutural. Se a IA sabe que "agentes semelhantes se comportam de forma semelhante em situações semelhantes", ela pode parar de adivinhar e começar a saber.
Isso leva a um resultado surpreendente em um jogo clássico chamado Dilema do Prisioneiro. Neste jogo, duas pessoas podem ou cooperar (ajudar uma à outra) ou desertar (trair uma à outra). A antiga forma de pensar diz que você deve sempre trair a outra pessoa, pois é a jogada mais segura para você individualmente. Mas os autores mostram que, se dois agentes "embebidos" perceberem que são cópias idênticas um do outro, ambos escolherão cooperar. Por quê? Porque se eu escolher cooperar, eu sei que minha cópia (o outro agente) também escolherá cooperar, porque estamos pensando exatamente a mesma coisa. A cooperação mútua oferece a ambos uma recompensa melhor do que a traição mútua. O artigo prova que esses agentes podem matematicamente alcançar este estado cooperativo, algo que os agentes "desacoplados" antigos jamais poderiam fazer.
A Solução: MUPI e o "Oráculo Reflexivo"
O artigo não apenas fala sobre isso; ele constrói uma máquina matemática para torná-lo realidade. Eles o chamam de MUPI (Inteligência Preditiva Universal Embebida).
Para fazer isso funcionar, eles tiveram que resolver um quebra-cabeça complicado: Como construir uma IA que possa prever a si mesma sem ficar presa em um loop infinito? Imagine tentar escrever um programa de computador que imprime seu próprio código-fonte. Se o programa tentar ler seu próprio código enquanto o está escrevendo, ele pode ficar confuso.
Os autores utilizam uma ferramenta matemática astuta chamada Oráculo Reflexivo. Pense nisso como um espelho mágico que pode mostrar uma imagem de você mesmo olhando em um espelho, que está olhando em um espelho, e assim por diante, sem que a imagem fique borrada ou infinita. Essa ferramenta permite que a IA raciocine sobre outros agentes que estão usando as mesmas ferramentas de raciocínio, resolvendo efetivamente o problema da "recursão infinita".
Eles provam que, se você utilizar este framework, os agentes eventualmente aprenderão a prever uns aos outros perfeitamente. Eles chamam isso de alcançar a teoria da mente de ordem infinita. É como se os agentes pudessem finalmente parar o loop "Eu acho que você acha que eu acho..." e simplesmente dizer: "Somos ambos inteligentes, somos ambos semelhantes, portanto, escolheremos ambos o melhor resultado para nós".
O Que Isso Significa
O artigo mostra que, ao mudar a forma como pensamos sobre a IA — de um observador separado para um participante embebido — podemos desbloquear novas maneiras para as máquinas cooperarem. Ele prova que, se os agentes puderem modelar a si mesmos como parte do mundo, eles podem naturalmente descobrir como trabalhar juntos, mesmo em situações complicadas onde poderiam ser tentados a lutar.
Os autores são muito cuidadosos ao dizer que este é um framework teórico. Eles provaram matematicamente que esses agentes podem existir e podem convergir para essas soluções cooperativas. Eles ainda não construíram um robô que faça isso no mundo real, mas mostraram o projeto. Eles argumentam que esta é a maneira correta de pensar sobre o futuro da IA, especialmente à medida que avançamos para sistemas onde muitas IAs precisarão interagir com humanos e entre si. Isso sugere que a chave para a inteligência social não é apenas dar à IA mais dados, mas ensiná-la a perceber que ela é parte da história que está tentando prever.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.