← Últimos artigos
🤖 AI

Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning

Este artigo apresenta o TAPAS, um framework multiagente que combina Grandes Modelos de Linguagem com planejamento simbólico para gerar e adaptar automaticamente modelos de domínio para planejamento de tarefas complexas sem exigir definições manuais de ambiente, demonstrando um forte desempenho tanto em benchmarks quanto em ambientes simulados do mundo real.

Autores originais: Harisankar Babu, Philipp Schillinger, Tamim Asfour

Publicado 2026-08-10
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Harisankar Babu, Philipp Schillinger, Tamim Asfour

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a cozinhar o jantar. Antigamente, os cientistas tinham que escrever um manual de instruções massivo e rígido para cada cenário possível: "Se o pote for vermelho, faça X. Se o pote for azul, faça Y." Se o robô encontrasse um pote verde, ou uma tarefa que não tinha visto antes, ele congelava porque o manual não cobria aquilo. Este é o mundo do planejamento simbólico, onde os computadores seguem regras estritas e pré-escritas. É poderoso, mas é como um GPS que só conhece estradas desenhadas em um mapa de 1990; se uma nova estrada abre, o GPS se perde.

Por outro outro lado, temos os Modelos de Linguagem de Grande Escala (LLMs), os cérebros de IA superinteligentes que podem conversar, escrever histórias e entender a linguagem humana. Eles são incrivelmente flexíveis e podem adivinhar o que você quer dizer mesmo se você falar de um jeito estranho. No entanto, eles também são um pouco como um artista brilhante, mas distraído: eles podem conceber um plano que soa ótimo, mas que é fisicamente impossível de um robô realmente executar, ou podem esquecer completamente as leis da física.

A grande questão para os cientistas é: Como combinamos a confiabilidade estrita dos antigos robôs que seguem regras com o cérebro flexível e criativo da nova IA? Precisamos de um sistema que possa entender um pedido bagunçado do mundo real como "Faça uma torre com o bloco maior na base", e então descobrir como construí-la, mesmo que o robô nunca tenha visto um "bloco maior" antes. É aqui que entra o artigo que você está prestes a ler, oferecendo uma nova maneira de permitir que os robôs aprendam sobre a hora.


Conheça o TAPAS: A Equipe de Arquitetos Criativos do Robô

Conheça o TAPAS (Task-based Adaptation and Planning using AgentS). Pense no TAPAS não como um único cérebro de robô, mas como uma pequena e altamente organizada equipe de construção trabalhando dentro de um computador. Em vez de uma única pessoa tentando fazer tudo, o TAPAS divide o trabalho entre três "agentes" especializados (pequenos trabalhadores de IA), cada um com um papel específico, que conversam entre si para construir um plano.

Aqui está como esta equipe funciona, usando uma analogia simples: Imagine que você quer construir uma torre de blocos, mas diz à equipe: "Eu quero o bloco vermelho em cima do azul".

1. O Gerador de Domínio (O Escritor do Livro de Regras)
Primeiro, o Gerador de Domínio ouve o seu pedido. Nos velhos tempos, se o robô não soubesse o que "vermelho" ou "azul" significava em seu livro de regras, ele apenas diria: "Erro! Eu não conheço essa palavra!" e pararia. Mas o TAPAS é diferente. Se o Gerador de Domínio perceber: "Ei, nosso livro de regras atual não tem uma forma de descrever cores", ele não entra em pânico. Ele diz: "Ok, precisamos adicionar uma regra de 'cor' ao nosso livro de regras". Ele literalmente reescreve o manual de instruções interno do robô na hora para incluir este novo conceito.

2. O Gerador de Estado Inicial (O Configurador da Cena)
Em seguida, o Gerador de Estado Inicial olha para a sala. Ele vê os blocos sobre a mesa. Se o livro de regras acabou de ser atualizado para incluir "cor", este agente pergunta: "Espere, qual é a cor de cada bloco?". Se você não o informou, ele pode pedir essa informação a você (ou à simulação). Ele prepara o palco, garantindo que o robô saiba exatamente onde cada bloco está e qual é a sua cor, combinando com as novas regras.

3. O Gerador de Estado de Objetivo (O Definidor de Metas)
Finalmente, o Gerador de Estado de Objetivo olha para o seu desejo: "Vermelho em cima do azul". Ele verifica o novo livro de regras e a cena. Ele diz: "Entendido. O objetivo é empilhar para que o vermelho fique em cima".

A Magia de "Chamar Ferramentas" (Tool-Calling)
A parte mais legal é como eles conversam. Eles não apenas adivinham; eles usam "ferramentas". Se o Gerador de Objetivo vê um problema (como, "Não podemos empilhar blocos por tamanho porque ainda não temos uma regra de 'tamanho'"), ele puxa uma ferramenta chamada missing_fluent e diz ao Gerador de Domínio: "Ei, precisamos de uma regra para tamanho!". O Gerador de Domínio então atualiza o livro de regras, e toda a equipe recomeça com as novas e melhores instruções. É como um grupo de amigos construindo um conjunto de Lego onde, se percebem que estão faltando uma peça específica, um amigo corre à loja para comprá-la e, então, todos continuam construindo juntos.

Do "O Quê" para o "Como": A Equipe de Execução

Uma vez que o plano é escrito, o TAPAS tem que realmente fazer o robô se mover. Isso é complicado porque o plano pode dizer "Coloque o bloco A sobre o bloco B", mas o braço físico do robô pode apenas saber como "Mover o gripper para as coordenadas X, Y, Z".

O TAPAS usa um Executor de Plano para fazer essa ponte. Ele atua como um tradutor.

  • O Tradutor: Ele pega o plano sofisticado e de alto nível e o transforma em instruções simples de linguagem natural, como "Mova seu braço para a esquerda" ou "Pegue o bloco vermelho".
  • O Agente ReAct: Este é o cérebro de "Raciocinar e Agir" do robô. Ele olha para a instrução, verifica quais ferramentas (habilidades) o robô realmente possui e escolhe a melhor. Se o robô tentar pegar um bloco e errar, o Agente Validador (o supervisor) diz: "Ops, isso não funcionou. Tente novamente, mas talvez mova seu braço mais devagar".

O Que Eles Descobriram?

Os autores testaram o TAPAS de duas maneiras principais: em quebra-cabeças lógicos clássicos e em uma casa 3D simulada chamada VirtualHome.

1. Os Quebra-Cabeças Lógicos (Os Benchmarks)
Eles testaram o TAPAS em sete desafios de planejamento diferentes, como o famoso "Blocksworld" (empilhamento de blocos) e "Barman" (mistura de bebidas).

  • O Resultado: O TAPAS foi incrivelmente bom. Ao usar um modelo de IA de alto nível (GPT-4o), ele resolveu 97% dos problemas de "Barman" e 100% dos problemas de "Blocksworld".
  • A Comparação: Isso foi muito melhor do que usar outros modelos de IA ou apenas tentar forçar a IA a fazer tudo sem um plano estruturado. Por exemplo, no teste "Blocksworld", o TAPAS resolveu 100% dos problemas, enquanto outros métodos tiveram dificuldades significativas.

2. O Teste de "Novas Regras" (Adaptabilidade)
É aqui que o TAPAS realmente brilha. Os pesquisadores deram ao robô tarefas que ele nunca tinha visto antes, como "Empilhe os blocos de modo que o maior esteja na base" ou "Mova os blocos, mas certifique-se de que o robô não fique sem bateria".

  • O Resultado: O TAPAS descobriu com sucesso que precisava adicionar regras de "tamanho" ou "bateria" ao seu livro de regras. Ele fez isso automaticamente.
    • Para a tarefa de "tamanho", ele atualizou as regras para dizer: "Você só pode empilhar um bloco sobre um maior". Ele resolveu 90% desses novos e complicados problemas.
    • Para a tarefa de "bateria", ele adicionou regras sobre consumo de energia. Ele resolveu 100% dos problemas de bateria de "Grippers" (mão robótica).
  • A Ressalva: Não foi perfeito. No teste "Floortile" (limpeza de azulejos) com restrições de bateria, ele resolveu apenas 70% dos problemas. O artigo sugere que isso ocorreu porque a IA às vezes adivinhava o nível inicial da bateria em vez de perguntar por ele, mostrando que o sistema ainda precisa ter cuidado com suposições.

3. A Simulação VirtualHome
Finalmente, eles colocaram o TAPAS em uma simulação 3D de uma casa. A tarefa era: "Pegue uma torta da geladeira e coloque-a na mesa" e "Aqueça um salmão e coloque-o na mesa".

  • O Resultado: O TAPAS gerou um plano com sucesso, traduziu-o em ações e guiou um robô virtual para abrir a geladeira, pegar a comida, usar o micro-ondas e colocar os itens na mesa.
  • O Truque de Memória: Eles também testaram se o TAPAS poderia aprender com os erros. Eles disseram ao sistema: "Da próxima vez que você usar a geladeira, certifique-se de fechá-la, mesmo que eu não diga". Mais tarde, quando o robô enfrentou uma tarefa semelhante, ele lembrou dessa regra e fechou a geladeira automaticamente. Isso mostrou que o TAPAS pode armazenar "memória procedural" para melhorar com o tempo.

Por Que Isso Importa (E O Que Não É)

O artigo sugere que o TAPAS é um passo importante à frente porque combina o melhor de dois mundos: a criatividade da IA que entende a linguagem e a confiabilidade das regras de planejamento estritas. Ele não apenas segue um roteiro; ele pode reescrever o roteiro quando a situação muda.

No entanto, os autores são cuidadosos ao notar que isto é uma simulação. Eles o testaram em um mundo de computador (VirtualHome) e em quebra-cabeças lógicos padrão, não em um robô real em uma cozinha bagunçada do mundo real. Embora os resultados sejam promissores, o artigo admite que a implementação no mundo real ainda enfrenta desafios, como evitar que a IA "alucine" (invente fatos) ou lidar com erros que são complexos demais para serem corrigidos automaticamente.

Em resumo, o TAPAS é como um robô que não apenas segue um mapa; ele pode desenhar um novo mapa quando encontra um bloqueio, pedir direções se estiver perdido e lembrar do atalho para a próxima vez. Não é um robô perfeito ainda, mas é um robético muito inteligente que está aprendendo a pensar rapidamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →