Influence of Prompt Engineering on Small Language Models for Guarded Query Routing
Este artigo demonstra que técnicas de engenharia de prompt, particularmente a otimização de poucos disparos (few-shot) e assinaturas DSPy, aumentam significativamente o desempenho do roteamento de consultas protegidas de Pequenos Modelos de Linguagem compactos, permitindo que eles se aproximem da precisão de modelos de fronteira maiores enquanto mantêm baixa latência.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está administrando um correio de alta tecnologia e muito movimentado para uma biblioteca gigante de conhecimento. Todos os dias, milhões de cartas (consultas) chegam, pedindo ajuda com tudo, desde contratos jurídicos até conselhos médicos. Mas aqui está o detalhe: algumas cartas são perigosas, algumas são sem sentido e outras estão apenas perguntando sobre coisas que a biblioteca não cobre. Se você enviar uma carta perigosa para um bibliotecário especializado em medicina, poderá obter uma resposta ruim ou até um risco de segurança. Assim, antes que qualquer carta chegue a um especialista, ela deve passar por um "Guardião" na porta da frente. Este Guardião tem dois trabalhos: primeiro, decidir se a carta é segura e se pertence à biblioteca; e segundo, se for segura, descobrir rapidamente qual especialista específico (Direito, Finanças ou Saúde) deve lê-la.
Por muito tempo, as pessoas pensaram que você precisaria de um robô massivo e superinteligente para ser este Guardião, porque o trabalho é complicado. Mas robôs massivos são lentos, caros e famintos por eletricidade. Este artigo faz uma pergunta divertida: Podemos usar "robôs de bolso" menores, mais baratos e rápidos (chamados de Modelos de Linguagem Pequenos) para fazer este trabalho de Guardião? O problema é que esses robôs menores às vezes se confundem. Eles podem ser ótimos em detectar absurdos, mas quando veem uma pergunta real, ficam tímidos demais para escolher um especialista específico ou esquecem as regras do jogo. Os pesquisadores queriam ver se poderíamos ensinar esses robôs menores a seguir as regras melhor apenas mudando as instruções que damos a eles, sem precisar reconstruir os próprios robôs.
O Dilema do Guardião
No mundo da inteligência artificial, temos esses "Modelos de Linguagem Grandes" que são como magos brilhantes e oniscientes. Eles podem escrever histórias, resolver problemas matemáticos e conversar sobre qualquer assunto. Mas eles são pesados e lentos. Para torná-los úteis para tarefas em tempo real, muitas vezes colocamos um "roteador" à frente deles. Pense neste roteador como um segurança na porta de uma boate. O segurança tem que decidir duas coisas instantaneamente: "Esta pessoa tem permissão para entrar?" (Segurança/Fora de Distribuição) e "Para qual área VIP ela deve ir?" (Intenção/Dentro de Distribuição).
Se o segurança for rigoroso demais, ele expulsa bons convidados (rejeitando perguntas válidas). Se for permissivo demais, ele deixa entrar encrenqueiros (perguntas inseguras). O artigo chama isso de "Roteamento de Consulta Guardado" (Guarded Query Routing). O objetivo é encontrar um segurança que seja rápido, barato e preciso o suficiente para manter a boate segura, enquanto leva as pessoas certas para as salas certas.
O Experimento: Treinando os Robôs de Bolso
Os pesquisadores reuniram 22 diferentes "robôs de bolso" (Modelos de Linguagem Pequenos) de vários tamanhos, variando de minúsculos com 270 milhões de "células cerebrais" (parâmetros) até maiores com 70 bilhões. Eles os testaram em um teste especial chamado GQR-Bench, que é como um circuito de obstáculos gigante preenchido com três tipos de perguntas válidas (Direito, Finanças, Saúde) e sete tipos de perguntas complicadas, fora de tópico ou perigosas.
Eles mediram os robôs usando uma pontuação especial chamada GQR-Score, que é um equilíbrio entre o quão bem eles capturaram as perguntas válidas e o quão bem eles rejeitaram as ruins. Se um robô rejeita tudo, ele recebe uma pontuação baixa porque é inútil. Se ele aceita tudo, também recebe uma pontuação baixa porque é inseguro.
A Grande Descoberta: Não é o Tamanho, é a Instrução
A primeira coisa que a equipe descobriu foi que tamanho não é tudo. O robô maior e mais poderoso (Gemma 3 27B) obteve uma pontuação fantástica de 96,01. Mas adivinhe só? Um robô muito menor (Qwen3.5 9B) obteve quase a mesma pontuação (94,55) apenas usando um conjunto padrão de instruções. Até um robô de tamanho médio (Mistral 7B) se saiu muito bem, pontuando 81,79.
No entanto, os robôs minúsculos tinham um problema estranho. Eles eram bons demais em dizer "Não!" para tudo. Por exemplo, o robô Granite 4 Tiny estava com tanto medo de errar que rejeitou 99,75% de todas as perguntas, incluindo as boas! Ele conseguiu identificar corretamente perguntas válidas apenas 37,29% das vezes. Era como um segurança que decidiu que a única maneira segura de administrar uma boate era trancar as portas e não deixar ninguém entrar.
A Solução Mágica: O Truque do "Exemplo"
Os pesquisadores se perguntaram: "Podemos consertar esses robôs tímidos apenas mudando as instruções?" Eles não treinaram novamente os robôs (o que seria como reconstruir seus cérebros); em vez disso, usaram uma técnica chamada Engenharia de Prompt. Isso é como dar ao robô uma folha de dicas ou um conjunto de exemplos antes de ele começar a trabalhar.
Eles tentaram alguns métodos, mas os resultados dependeram do robô. O método mais eficaz para o robô Granite 4 Tiny não foi o truque do "exemplo", mas sim um formato de instrução mais simples chamado DSPy Baseline. Este método removeu todo o excesso e deu ao robô um modelo estrito e básico. Ele passou de uma pontuação terrível de 54,29 para um ótimo 83,05. Ele parou de rejeitar tudo e começou a realmente classificar a correspondência.
Para outros robôs, como o Mistral 7B, o truque do "exemplo" (chamado de Few-Shot Prompting) foi a verdadeira magia. Imagine que você está ensinando um novo funcionário a separar o correio. Em vez de apenas dizer "Separe o correio", você mostra a ele três exemplos:
- "Esta carta é sobre um processo judicial -> Enviar para Direito."
- "Esta carta é sobre ações -> Enviar para Finanças."
- "Esta carta é sobre um gato -> Enviar para a caixa de 'Rejeitar'."
Quando deram esses exemplos ao robô Mistral 7B, ele saltou de 81,79 para 90,87. O robô Qwen3.5 9B também melhorou com este método, atingindo 95,74, o que é quase tão bom quanto o robô gigante, mas roda muito mais rápido.
O artigo sugere que o problema não era que os robôs pequenos não sabiam as respostas; eles apenas não sabiam como seguir as regras do jogo. Os exemplos (ou o modelo estrito) mostraram a eles exatamente o que uma resposta correta parecia, e eles entenderam instantaneamente.
O Compromisso: Velocidade vs. Precisão
Há um pequeno porém, no entanto. Quando você dá ao robô uma folha de dicas com exemplos, a mensagem que ele precisa ler fica mais longa. Isso torna o robô ligeiramente mais lento. O estudo descobriu que o uso desses exemplos fez os robôs levarem cerca de 2 a 6 vezes mais tempo para responder a uma única pergunta. No entanto, eles ainda eram incrivelmente rápidos (cerca de 0,05 a 0,28 segundos por pergunta), o que é rápido o suficiente para a maioria das aplicações do mundo real.
Os pesquisadores também tentaram um método mais complexo chamado GEPA, que é como ter um robô professor reescrevendo as instruções automaticamente. Mas isso não funcionou tão bem quanto apenas dar ao robô alguns exemplos claros. Na verdade, para os robôs menores, a reescrita complexa piorou as coisas, fazendo com que eles se confundissem novamente.
O Que Isso Significa para o Futuro
A principal conclusão é que você nem sempre precisa do maior e mais caro robô para ser um bom Guardião. Um robô menor e mais barato pode fazer o trabalho tão bem quanto se você lhe der as instruções certas. Especificamente, mostrar a ele alguns exemplos (Few-Shot) ajuda-o a superar sua timidez e a seguir as regras, enquanto para alguns robôs muito específicos, um modelo estrito e básico funciona melhor.
No entanto, o artigo também alerta que, se um robô for pequeno demais (como os de 0,8 bilhão de parâmetros), mesmo os melhores exemplos podem não ser suficientes para salvá-lo. E se um robô já estiver fazendo um ótimo trabalho, adicionar exemplos pode não ajudar muito e pode até atrasá-lo desnecessariamente.
Em resumo, para construir um sistema de IA seguro e rápido, o ingrediente secreto não é apenas comprar o maior cérebro; é saber como falar com o cérebro que você tem. Um pouco de "engenharia de prompt" pode transformar um robô confuso e excessivamente cauteloso em um guardião afiado e eficiente.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.