← Últimos artigos
💻 computer science

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling

O artigo apresenta o GenesisFunc, um pipeline automatizado multiagente que gera dados sintéticos de chamada de função de alta qualidade e diversificados para treinar um LLM de 8B, o qual alcança desempenho superior no domínio e generalização fora do domínio em comparação com modelos de código aberto de tamanho similar, ao mesmo tempo que rivaliza com sistemas avançados baseados em API.

Autores originais: Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente muito inteligente, mas inexperiente (um Modelo de Linguagem Grande, ou LLM). Você quer que esse assistente seja capaz de usar ferramentas — como verificar o clima, reservar um voo ou calcular um orçamento — exatamente como um humano faria. Mas há um problema: para ensinar o assistente a usar essas ferramentas, você precisa mostrar a ele milhares de exemplos de pessoas pedindo ajuda e do assistente escolhendo corretamente a ferramenta certa e preenchendo os detalhes.

No mundo real, coletar esses exemplos é como tentar encontrar uma agulha num palheiro. É caro, lento e, frequentemente, os exemplos encontrados são desorganizados ou incompletos. Tentativas anteriores de criar (sintetizar) esses exemplos frequentemente resultaram em "ferramentas" falsas que não funcionavam ou em conversas que pareciam robóticas e repetitivas.

Aí entra o GENESISFUNC. Pense nisso como um "campo de treinamento" de alta tecnologia e automatizado para o seu assistente de IA. Em vez de contratar uma equipe de humanos para escrever cada exemplo individual, os autores construíram um sistema onde uma equipe de agentes de IA trabalha em conjunto para criar dados de treinamento perfeitos.

Veja como o "campo de treinamento" do GENESISFUNC funciona, dividido em etapas simples:

1. A Caixa de Ferramentas Confiável (O Pool de Ferramentas)

Antes do treinamento começar, o sistema precisa de um conjunto de ferramentas para praticar. Em vez de inventar ferramentas falsas, o GENESISFUNC vai a uma biblioteca confiável e pública de ferramentas do mundo real (chamada de benchmark BFCL).

  • A Analogia: Imagine um chef que quer aprender a cozinhar. Em vez de inventar ingredientes falsos, ele vai a um supermercado de alta qualidade e verificado para escolher vegetais frescos e reais. Isso garante que o treinamento seja baseado na realidade, e não na fantasia.

2. A Versão do Diretor (Geração de Diálogo Multi-Agente)

Este é o coração do sistema. Os autores montaram uma equipe de quatro "agentes" de IA (programas especializados) que atuam como uma equipe de produção de cinema para escrever os roteiros de treinamento (conversas):

  • O Diretor de Elenco (Agente de Amostragem): Escolhe uma mistura de ferramentas para a cena. Ele seleciona os "atores principais" (as ferramentas necessárias para a tarefa) e os "figurantes" (ferramentas de distração que parecem semelhantes, mas não são a escolha certa) para fazer a IA aprender a distingui-las.
  • O Médico de Roteiro (Agente de Memória): Mantém o registro de todas as cenas escritas até então. Se a equipe continuar escrevendo sobre "reservar um voo", este agente diz: "Ei, já fizemos isso o suficiente; vamos escrever uma cena sobre 'planejar uma viagem' em vez disso". Isso garante que os dados de treinamento sejam diversos e não repetitivos.
  • O Ator (Agente de Função): Escreve o diálogo real. Ele cria um usuário fazendo uma pergunta e o assistente respondendo, escolhendo as ferramentas certas e preenchendo as lacunas (como datas ou locais). Ele garante que os detalhes sejam realistas, às vezes deixando alguns detalhes opcionais de fora para imitar a fala humana real.
  • O Crítico (Agente Juiz): Lê os rascunhos e escolhe o melhor. Ele descarta os roteiros fracos e mantém aqueles onde o assistente de IA cumpriu a tarefa perfeitamente.

3. A Verificação de Controle de Qualidade (Avaliação em Múltiplos Estágios)

Mesmo com uma ótima equipe, erros acontecem. Antes que os dados sejam usados para treinar o modelo, eles passam por uma rigorosa inspeção de três etapas:

  • A Polícia da Gramática (Verificador de Regras): Um programa de computador verifica se o formato está correto (por exemplo: "Eles usaram os colchetes corretos?").
  • O Juiz Lógico (Verificador de Modelo): Uma IA mais inteligente lê a conversa para ver se a lógica faz sentido (por exemplo: "O assistente realmente resolveu o problema do usuário?").
  • O Editor Humano (Validação Humana): Uma pequena equipe de humanos revisa os casos mais difíceis. Eles gastam apenas cerca de 15 horas no total, porque o computador já filtrou 95% dos erros.

Os Resultados: Um Super-Auxiliar

Após o sistema gerar esse conjunto de dados massivo e de alta qualidade, os autores o usaram para treinar um modelo de IA de 8 bilhões de parâmetros (um modelo de tamanho médio).

  • O Resultado: Este modelo treinado tornou-se um mestre no uso de ferramentas. Ele teve um desempenho melhor do que outros modelos de código aberto do mesmo tamanho e até competiu com modelos muito maiores e caros de grandes empresas de tecnologia.
  • A Magia da "Generalização": Como os dados de treinamento foram tão diversos (abrangendo muitos tipos diferentes de ferramentas e conversas complexas), o modelo não apenas memorizou os exemplos. Ele aprendeu a habilidade de usar ferramentas. Quando testado em ferramentas que nunca havia visto antes, ele ainda teve um desempenho incrivelmente bom.

Por Que Isso Importa

O artigo afirma que este método resolve o maior gargalo no ensino de IA para usar ferramentas: a falta de bons dados. Ao usar uma equipe de agentes de IA para gerar, diversificar e verificar os dados, eles criaram um pipeline que é:

  1. Confiável: Baseado em ferramentas reais e funcionais.
  2. Diverso: Abrange muitos cenários, desde solicitações simples de uma etapa até conversas complexas de múltiplas etapas.
  3. Escalável: Pode ser facilmente expandido para incluir novas ferramentas sem a necessidade de uma enorme equipe de anotadores humanos.

Em resumo, o GENESISFUNC é como uma fábrica que constrói automaticamente o "livro didático" perfeito para ensinar assistentes de IA a usar ferramentas, resultando em um auxiliar digital mais inteligente e capaz.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →