← Últimos artigos
🤖 AI

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

O artigo apresenta o AsyncTool, um novo benchmark projetado para avaliar as capacidades de chamada de ferramentas assíncronas de agentes baseados em LLM em cenários de múltiplas tarefas com latência simulada, revelando que os modelos atuais têm dificuldade com coordenação temporal e eficiência ao lidar com respostas de ferramentas atrasadas.

Autores originais: Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shiting Huang (University of Science and Technology of China), Avery Nie (Universit
Publicado 2026-05-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shiting Huang (University of Science and Technology of China), Avery Nie (University of Toronto), Zhen Fang (University of Science and Technology of China), Qiuchen Wang (University of Science and Technology of China), Lin Chen (University of Science and Technology of China), Huaian Chen (University of Science and Technology of China), Zehui Chen (University of Science and Technology of China), Feng Zhao (University of Science and Technology of China)

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O Problema do "Barista Ocupado"

Imagine que você é um barista mestre (o Agente de IA) trabalhando em uma cafeteria movimentada. Você tem uma lista de pedidos:

  1. Pedido A: Preparar um espresso complexo (leva 30 segundos).
  2. Pedido B: Moer grãos para um latte (leva 5 segundos).
  3. Pedido C: Limpar o balcão (leva 2 segundos).

O Jeito Antigo (Síncrono):
No passado, a maioria dos testes para baristas de IA verificava apenas se eles conseguiam fazer uma bebida perfeitamente. Se começavam o Pedido A, ficavam ali parados, encarando a máquina de espresso, sem fazer absolutamente nada mais, até que os 30 segundos passassem. Somente então passariam para o Pedido B. Isso é incrivelmente ineficiente.

A Nova Realidade (Assíncrona):
No mundo real, você não fica apenas parado. Enquanto o espresso está sendo preparado, um barista inteligente pega os grãos para o Pedido B e limpa o balcão para o Pedido C. Eles voltam para o espresso no momento em que ele está pronto. Isso é chamado de Chamada de Ferramenta Assíncrona.

O que é AsyncTool?

Os autores deste artigo perceberam que os testes atuais de IA são como o "Jeito Antigo". Eles verificam se uma IA pode usar ferramentas (como pesquisar na web ou executar código), mas fingem que as ferramentas dão respostas instantâneas. Na realidade, as ferramentas levam tempo para responder.

AsyncTool é um novo "exame" projetado para ver se uma IA consegue lidar com o cenário do Barista Ocupado. Ele testa três habilidades específicas:

  1. Aguardar: A IA consegue perceber que uma ferramenta está "pensando" e não apenas chutar a resposta?
  2. Alternar: A IA consegue pausar a Tarefa A, pular para a Tarefa B e depois lembrar de voltar para a Tarefa A quando a resposta chegar?
  3. Rastrear: A IA consegue acompanhar qual ferramenta pertence a qual tarefa sem se confundir?

Como Eles Construíram o Teste (A Receita)

Para criar este exame, os pesquisadores não apenas inventaram perguntas aleatórias. Eles seguiram uma receita cuidadosa:

  1. Recolheram Ingredientes: Eles pegaram dados existentes de alta qualidade de tarefas únicas (como "pesquisar um voo") de outros benchmarks.
  2. Reconstruíram o Caminho: Usaram uma IA poderosa (Gemini 2.5 Pro) para reescrever essas tarefas, garantindo que tivessem instruções claras, passo a passo.
  3. Revisão Humana: Humanos verificaram o trabalho para garantir que os passos faziam sentido e não estavam quebrados.
  4. A "Mistura": Combinaram essas tarefas únicas em grupos. Às vezes, deram à IA duas tarefas semelhantes (como duas pesquisas de voo), e às vezes duas tarefas muito diferentes (como uma pesquisa de voo e um trabalho de gerenciamento de arquivos).
  5. Simularam o Atraso: Programaram o teste para que, quando a IA fizesse uma pergunta, a "ferramenta" dissesse: "Estou trabalhando nisso, espere um momento", antes de dar a resposta.

Como Eles Avaliaram a IA

Eles não olharam apenas para o resultado final. Eles avaliaram a IA em três níveis, como um professor avaliando um aluno:

  • Nível de Passo: A IA fez a pergunta certa com as palavras certas? (Por exemplo: ela soletrou o nome da ferramenta corretamente?)
  • Nível de Sub-tarefa: Ela completou uma pequena parte do trabalho corretamente? (Por exemplo: ela encontrou o voo com sucesso?)
  • Nível de Tarefa: Ela completou a inteira atribuição, incluindo todas as diferentes ordens que estava equilibrando?

Eles também adicionaram uma "Pontuação de Eficiência" especial. Isso mediu com que frequência a IA alternava entre tarefas. Uma boa pontuação significa que a IA alternou o suficiente para ser eficiente, mas não tanto a ponto de ficar confusa.

O que Eles Encontraram (Os Resultados)

Os pesquisadores testaram 19 modelos de IA diferentes (tanto os comerciais grandes, como GPT-4.1, quanto os de código aberto). Eis o que aconteceu:

  • O Choque do "Tempo": Quando as ferramentas foram atrasadas, quase todas as IAs ficaram significativamente piores. Foi como fazer um teste enquanto alguém ficava batendo no seu ombro.
  • A Armadilha da "Alucinação": Muitas IAs mais fracas não conseguiam esperar. Quando pediam dados a uma ferramenta, não esperavam pela resposta. Em vez disso, apenas chutavam a resposta e continuavam. Isso levou a erros.
  • O Problema do "Esquecimento": Algumas IAs começavam a Tarefa A, mudavam para a Tarefa B e depois esqueciam completamente que a Tarefa A existia. Elas terminavam a Tarefa B e diziam: "Tudo pronto!", mesmo que a Tarefa A ainda estivesse esperando.
  • Os Vencedores: Os melhores modelos (como GPT-4.1) foram os que conseguiam equilibrar. Eles sabiam exatamente quando alternar tarefas e quando esperar. Eles não alternavam aleatoriamente; alternavam estrategicamente.

A Principal Conclusão

O artigo conclui que ser bom em usar ferramentas não é apenas sobre saber qual ferramenta usar. É sobre tempo.

Para ser um agente de IA verdadeiramente eficaz no mundo real, ele precisa ser um bom gerente de projetos. Ele precisa saber:

  • "Estou esperando por este resultado, então farei esta outra coisa enquanto espero."
  • "Ah, o resultado voltou! Preciso parar o que estou fazendo e terminar aquela primeira tarefa."

O artigo argumenta que os sistemas de IA futuros precisam ficar melhores nessa "coordenação temporal" (gerenciamento de tempo e espera) para serem verdadeiramente úteis em ambientes complexos e multitarefa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →