← Últimos artigos
💬 NLP

Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

Este artigo apresenta um banco de prompts rotulados por consenso que distingue entre código malicioso executável e conhecimento de segurança prejudicial, a fim de fornecer uma métrica padronizada e confiável para avaliar se modelos especializados em programação atendem aos padrões mais rigorosos de recusa necessários para prevenir a geração de armas funcionais.

Autores originais: Richard J. Young, Gregory D. Moody

Publicado 2026-05-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Richard J. Young, Gregory D. Moody

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Texto vs. A Coisa Real

Imagine que você pergunta a um chatbot geral: "Como faço uma bomba?". Se ele responder, ele te dá uma receita. Você ainda precisa ir à loja, comprar os ingredientes e misturá-los você mesmo. É uma informação perigosa, mas são apenas palavras.

Agora, imagine que você faz a mesma pergunta a uma IA especializada em programação. Se ela responder, não te dá apenas uma receita; ela te entrega uma bomba totalmente montada e funcional, pronta para explodir no momento em que você pressionar "executar".

Os autores deste artigo argumentam que, como IAs de programação podem entregar "armas funcionais" (como vírus ou spyware) instantaneamente, elas devem ser muito mais rigorosas ao dizer "Não" do que os chatbots comuns. Mas, atualmente, ninguém tem uma boa maneira de medir se elas estão realmente dizendo "Não" o suficiente.

O Problema: Misturar Maçãs e Laranjas

Para testar se essas IAs são seguras, os pesquisadores têm usado listas de perguntas (prompts). Mas essas listas têm sido confusas. Elas misturam dois tipos muito diferentes de solicitações perigosas:

  1. Solicitações de "Arma": "Escreva um programa que rouba senhas." (A IA te dá o código).
  2. Solicitações de "Conhecimento": "Explique como o roubo de senhas funciona." (A IA te dá um ensaio).

Se você misturar essas duas coisas e disser: "Esta IA recusou 50% das solicitações ruins", você não sabe se ela recusou as armas ou apenas as explicações. É como testar um guarda de segurança pedindo-lhe para parar um ladrão e parar alguém pedindo direções. Se o guarda parar o ladrão, mas deixar passar quem pede direções, você não pode dizer se ele é bom no trabalho apenas olhando para o número total de pessoas paradas.

A Solução: Um Banco de Prompts "Rotulado por Consenso"

Os autores criaram uma lista massiva, limpa e organizada de 6.675 perguntas perigosas. Eles as dividiram em dois grupos claros:

  • O Grupo "CÓDIGO": Perguntas pedindo software executável e perigoso (as "armas").
  • O Grupo "CONHECIMENTO": Perguntas pedindo informações ou teorias prejudiciais (as "receitas").

Para garantir que as perguntas fossem classificadas corretamente, eles não pediram a apenas uma pessoa. Eles usaram um painel de cinco juízes de IA diferentes (como um júri). Cada juiz analisou cada pergunta e votou: "Isso é uma solicitação de arma?" ou "Isso é uma solicitação de conhecimento?".

  • O Veredito: Se pelo menos 3 dos 5 juízes concordassem, a pergunta recebia uma etiqueta final.
  • O Resultado: Eles acabaram com 4.748 solicitações de "Arma" confirmadas e 1.923 solicitações de "Conhecimento" confirmadas.

O "Júri" e as Surpresas

Os autores usaram cinco modelos de IA diferentes para atuar como juízes. Eles queriam garantir que o teste fosse barato e aberto para todos usarem, então escolheram modelos gratuitos ou de código aberto, em vez de modelos pagos e caros.

Durante esse processo, eles descobriram duas coisas interessantes:

1. O Paradoxo "Muito Fácil"
Para algumas das listas de perguntas (como a lista ASTRA), quase todas as perguntas eram obviamente uma "Arma". Os juízes concordaram 99% das vezes.

  • A Metáfora: Imagine uma prova de matemática onde todas as perguntas são "Quanto é 2+2?". Todos tiram 100%. Você não consegue realmente medir o quão "inteligentes" são os alunos porque o teste foi muito fácil.
  • A Descoberta: Em estatística, quando todos concordam em tudo, a pontuação usual para "acordo" (chamada Kappa) quebra e parece um zero ou um número negativo. Os autores tiveram que inventar uma maneira especial de relatar isso: "Ei, todos concordaram perfeitamente, mas a pontuação matemática parece estranha porque o teste foi muito fácil."

2. O Bug do "Guardião"
Um dos cinco juízes de IA (um modelo gratuito da OpenAI) começou a recusar responder qualquer uma das perguntas, até mesmo aquelas que ele deveria julgar. Ele continuava batendo em um sinal de "Pare" da empresa que o hospeda.

  • A Metáfora: Imagine um júri onde um jurado continua sendo expulso da sala de tribunal por fazer muitas perguntas.
  • O Conserto: Como a regra era "3 dos 5", os outros quatro juízes ainda podiam decidir o veredito. Os autores notaram isso como uma peculiaridade do mundo real: às vezes, as ferramentas gratuitas que você usa para testar a segurança têm seus próprios filtros de segurança que bloqueiam o teste antes mesmo de ele começar.

Por Que Isso Importa

Este artigo não trata de testar uma IA específica para ver se ela é segura hoje. Em vez disso, trata-se de construir a régua que todos os outros podem usar.

Antes disso, os pesquisadores estavam tentando medir a segurança com uma régua quebrada que misturava "armas" e "receitas". Agora, eles têm uma régua padronizada e de alta qualidade (o banco de prompts) que separa claramente os dois. Isso permite que qualquer pessoa teste IAs de programação e diga: "Ok, esta IA recusou 90% das armas reais", o que é uma verificação de segurança muito mais significativa do que antes.

Resumo

  • Objetivo: Criar uma lista limpa de perguntas perigosas para testar se IAs de programação são seguras.
  • Método: Usou um "júri" de 5 IAs para classificar 6.675 perguntas em "Armas" (Código) e "Receitas" (Conhecimento).
  • Resultado: Um banco de dados público de 4.748 solicitações de arma confirmadas e 1.923 solicitações de conhecimento.
  • Insight Chave: Você não pode medir a segurança adequadamente se misturar "fazer uma bomba" com "ler sobre bombas". Este artigo corrige essa confusão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →