← Últimos artigos
💻 computer science

Beyond F1: A Study of LLM Reliability in Smart Contract Vulnerability Detection

Este estudo avalia 14 grandes modelos de linguagem na detecção de vulnerabilidades em contratos inteligentes, revelando que a seleção do modelo é mais crítica do que estratégias de prompting ou o aumento da computação em tempo de inferência, visto que modelos de fronteira maiores demonstram confiabilidade superior, enquanto modelos menores e técnicas de raciocínio estendido podem degradar o desempenho.

Autores originais: Durjoy Majumdar

Publicado 2026-08-25
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Durjoy Majumdar

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo digital das finanças descentralizadas, o dinheiro se move através de programas de execução automática chamados contratos inteligentes. Estes são como máquinas de venda automática digitais que dispensam ativos automaticamente quando condições específicas são atendidas, operando sem gestores humanos ou bancos. Como esses programas rodam em uma blockchain, uma vez que são implantados, eles são efetivamente permanentes; se uma falha for encontrada após a máquina ser construída, muitas vezes é impossível corrigi-la. Essa imutabilidade torna a segurança crítica, pois até mesmo um erro minúsculo pode levar à perda de bilhões de dólares. Durante anos, pesquisadores confiaram em ferramentas automatizadas para escanear esses contratos em busca de erros, mas essas ferramentas frequentemente têm dificuldade em entender o contexto do código, gerando falsos alarmes ou ignorando perigos sutis. Recentemente, um novo tipo de inteligência artificial conhecido como modelo de linguagem de grande escala surgiu, capaz de ler e compreender código de forma muito semelhante a um programador humano. Isso levantou uma questão esperançosa: podem esses sistemas inteligentes substituir ou melhorar os controles de segurança tradicionais para encontrar vulnerabilidades antes que elas causem danos?

Um estudo recente buscou responder a isso submetendo quatorze modelos diferentes de inteligência artificial ao teste. Os pesquisadores reuniram cinquenta e quatro contratos inteligentes do mundo real, incluindo alguns conhecidos por possuírem falhas de segurança e outros que estavam perfeitamente limpos, para ver o quão bem os modelos conseguiam distinguir entre os dois. Eles não apenas pediram aos modelos para olharem o código; eles tentaram quatro maneiras diferentes de perguntar, variando de uma pergunta direta simples a instruções complexas e passo a passo que forçavam os modelos a refletir sobre sua análise. Eles também testaram se dar aos modelos mais tempo para "pensar" durante o processo melhorava seus resultados, um recurso que alguns modelos modernos oferecem para raciocinar sobre problemas de forma mais profunda. O objetivo era determinar se essas ferramentas poderosas poderiam encontrar bugs de forma confiável sem acusar erroneamente códigos seguros de serem perigosos.

Os resultados revelaram uma divisão acentuada de desempenho que desafia algumas suposições comuns sobre como esses modelos funcionam. O estudo descobriu que simplesmente dar a um modelo mais tempo para pensar ou pedir que ele siga um processo de raciocínio detalhado nem sempre o tornava melhor. Na verdade, para um dos modelos com melhor desempenho, habilitar este modo de pensamento extra o tornou pior, fazendo com que ele perdesse vulnerabilidades genuínas e reduzisse sua precisão geral. Isso sugere que mais esforço computacional não se traduz automaticamente em uma melhor análise de segurança. Em vez disso, o fator mais importante era simplesmente qual modelo era escolhido. Os melhores modelos, que são grandes e desenvolvidos comercialmente, provaram ser altamente confiáveis, identificando corretamente vulnerabilidades enquanto raramente cometiam erros em códigos seguros.

Em forte contraste, os modelos menores e de código aberto testados no estudo comportaram-se de forma muito diferente. Embora esses modelos menores fossem excelentes em detectar potenciais problemas, eles sofriam de uma falha crítica: eram incapazes de distinguir entre um contrato vulnerável e um seguro. Eles sinalizavam cada contrato limpo como perigoso, efetivamente gritando "lobo" a cada passo. Os pesquisadores cunharam um termo específico para essa tendência de alucinar ameaças onde não existem, chamando-a de "Taxa de Basilisco". Um modelo com uma taxa alta é inútil para a segurança porque sobrecarregaria os engenheiros com falsos alarmes. O estudo mostrou que os seis modelos com melhor desempenho tiveram um registro perfeito de nunca sinalizar código limpo, enquanto os três modelos menores sinalizaram todos os contratos limpos como vulneráveis.

A investigação também destacou um limite específico no tamanho desses modelos que parece determinar sua confiabilidade. Os modelos que tiveram bom desempenho geralmente possuíam um número maior de parâmetros internos, que podem ser pensados como a complexidade de sua base de conhecimento interna. O estudo sugere que existe um ponto de transição em torno de um tamanho específico, onde modelos abaixo desse limite tendem a alucinar constantemente, enquanto aqueles acima dele tornam-se precisos e confiáveis. Curiosamente, um modelo de código aberto grande conseguiu fazer a ponte para esse hiato, performando quase tão bem quanto os principais modelos comerciais, mas os menores permaneceram não confiáveis.

Em última análise, o estudo conclui que, para a tarefa específica de encontrar falhas de segurança em contratos inteligentes, a escolha do modelo de inteligência artificial importa muito mais do que como ele é instruído ou quanto tempo lhe é dado para pensar. Embora essas ferramentas avançadas mostrem grande promessa, elas não são uma solução mágica que funciona da mesma forma para todos os sistemas. A abordagem mais eficaz envolve selecionar um modelo que tenha sido comprovado como preciso e evitar aqueles que são propensos a ver problemas que não existem. Para o futuro das finanças digitais, isso significa que as equipes de segurança devem verificar cuidadosamente quais ferramentas de inteligência artificial utilizam, garantindo que dependam de sistemas que consigam distinguir entre uma ameaça real e um pedaço de código inofensivo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →