Small Reasoning Models are Instruction Followers in Function Calling
Este artigo introduz o Instruction-Followed Function Calling (IFFC), um framework que delega a lógica de chamada de função para um modelo menor de seguimento de instruções para alcançar precisão e robustez superiores sob quantização em comparação com abordagens nativas ou baseadas em prompts, particularmente para LLMs orientados ao raciocínio.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo da inteligência artificial, que evolui rapidamente, está ocorrendo uma mudança de computadores que simplesmente geram texto para sistemas capazes de tomar ações. Esses novos sistemas, frequentemente chamados de modelos "agênticos", são projetados para resolver problemas ao alcançar o mundo exterior. Eles fazem isso selecionando ferramentas, como aplicativos de clima ou calculadoras, e usando-as para coletar informações antes de responder a uma pergunta. Por muito tempo, os modelos de computador mais poderosos e caros eram os únicos confiáveis para realizar essas tarefas. Eles foram construídos com uma linguagem interna específica e rígida para falar com essas ferramentas, um método conhecido como chamada de função nativa. No entanto, à medida que a tecnologia amadureceu, pesquisadores começaram a olhar para modelos de computador muito menores e mais eficientes. Esses modelos compactos são mais fáceis de rodar em dispositivos cotidianos, como smartphones e laptops, oferecendo melhor privacidade e custos mais baixos, mas historicamente tiveram dificuldade com as regras estritas e complexas necessárias para usar ferramentas externas corretamente.
Uma equipe de pesquisadores de universidades do Irã desafiou a suposição de que esses modelos menores devem seguir as mesmas regras rígidas que os gigantes para ter sucesso. Em seu trabalho recente, eles descobriram que os modelos pequenos na verdade performam muito melhor quando são solicitados a usar ferramentas por meio de uma conversa simples, em vez de através de uma estrutura de comando técnica especializada. Eles descobriram que, quando um modelo pequeno é tratado como um assistente prestativo seguindo um conjunto claro de instruções em linguagem comum, ele comete muito menos erros do que quando é forçado a falar um código de máquina específico. Essa percepção levou à criação de um novo sistema que divide o trabalho entre dois modelos diferentes. Um modelo pequeno e rápido atua como um tomador de decisões, ouvindo o usuário e determinando se uma ferramenta é necessária. Se uma ferramenta for requerida, este modelo pequeno lida com a solicitação usando instruções de linguagem natural. O modelo principal, maior, então recebe essa informação e formula a resposta final para o usuário.
Os pesquisadores testaram essa abordagem usando uma variedade de modelos pequenos, alguns com apenas um bilhão de parâmetros, que é uma medida do tamanho e da complexidade do modelo. Eles compararam seu novo método contra as formas padrão pelas quais esses modelos são usualmente ensinados a usar ferramentas. Os resultados foram impressionantes. O novo sistema, que eles nomearam como Chamada de Função Seguindo Instruções (Instruction-Followed Function Calling), permitiu que modelos compactos maiores, como o Qwen-3 de 4 bilhões de parâmetros, superassem bases proprietárias massivas como o GPT-5.2 e o Claude 4.5 Sonnet, que são tipicamente considerados o padrão ouro. Por exemplo, o modelo Qwen-3 4B usando o novo método alcançou uma precisão de 94,1% em um subconjunto de avaliação Não-Live de um teste difícil de uso de ferramentas, superando significativamente o desempenho do mesmo modelo usando métodos tradicionais. Embora os modelos menores testados (0.6B) ainda ficassem atrás dos gigantes proprietários muito grandes em certas categorias, o framework demonstrou que modelos pequenos especializados e capazes de raciocínio poderiam igualar ou exceder o desempenho de sistemas massivos quando o fardo arquitetônico das definições de ferramentas rígidas era removido.
Uma parte fundamental de sua descoberta foi entender como esses modelos pensam. Os pesquisadores descobriram que modelos projetados para "pensar" através de um problema antes de responder eram muito mais confiáveis do que aqueles que apenas geram uma resposta imediata. Quando esses modelos de raciocínio recebiam a tarefa de decidir qual ferramenta usar, eles podiam corrigir seus próprios erros e seguir instruções complexas com alta precisão. Isso foi particularmente verdadeiro quando os modelos eram comprimidos para rodar em dispositivos menores. Normalmente, tornar um modelo menor ou rodá-lo em hardware menos potente faz com que seu desempenho caia drasticamente. No entanto, os pesquisadores descobriram que seu novo método era incrivelmente robusto. Mesmo quando os modelos eram encolhidos para usar muito pouca memória, aqueles que usavam o método de instrução por linguagem natural mantinham sua alta precisão. Isso sugere que a capacidade de raciocinar e seguir uma conversa é uma base mais estável para o uso de ferramentas do que memorizar um formato técnico rígido.
O estudo também destacou uma falha na forma como muitos sistemas são construídos atualmente. Frequentemente, um único modelo grande é solicitado a fazer tudo: entender o usuário, decidir qual ferramenta usar e escrever a resposta final. Os pesquisadores mostraram que essa abordagem frequentemente confunde o modelo, pois os detalhes complexos das ferramentas acabam se misturando com a conversa. Ao separar as tarefas, seu novo sistema mantém a conversa limpa. O modelo pequeno lida com o trabalho pesado de descobrir qual ferramenta usar, e o modelo principal foca exclusivamente em falar com o usuário. Essa separação evita que o sistema fique sobrecarregado com muita informação de uma só vez. Os pesquisadores demonstraram que este método funciona bem mesmo em cenários do mundo real onde velocidade e privacidade são críticas, como no painel de um carro ou em um assistente doméstico, onde enviar dados para um servidor distante não é uma opção.
Em última análise, este trabalho sugere um novo caminho para a inteligência artificial em dispositivos cotidianos. Ele mostra que não precisamos depender de computadores massivos e ávidos por energia para realizar tarefas complexas. Em vez disso, ao mudar a forma como pedimos aos modelos menores para trabalhar — tratando-os como assistentes inteligentes seguindo instruções, em vez de máquinas executando código — podemos alcançar resultados que são tanto altamente precisos quanto eficientes. As descobertas indicam que o futuro da inteligência artificial pessoal, privada e responsiva pode não residir na construção de modelos maiores, mas em formas mais inteligentes de usar os modelos menores que já possuímos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.