← 최신 논문
💻 computer science

Beyond F1: A Study of LLM Reliability in Smart Contract Vulnerability Detection

이 연구는 14개의 대규모 언어 모델을 대상으로 스마트 계약 취약점 탐지를 평가하며, 프롬프트 전략이나 추론 시간 계산량의 증가보다 모델 선택이 더 결정적임을 밝혀냈는데, 이는 거대 프런티어 모델들이 우수한 신뢰성을 보이는 반면 작은 모델들과 확장된 추론 기법은 성능을 저하시킬 수 있음을 보여준다.

원저자: Durjoy Majumdar

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Durjoy Majumdar

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

탈중앙화 금융(DeFi)이라는 디지털 세계에서, 돈은 스마트 컨트랙트라고 불리는 자기 실행형 프로그램을 통해 이동합니다. 이들은 특정 조건이 충족되면 자동으로 자산을 지급하는 디지털 자판기와 같으며, 인간 관리자나 은행 없이 운영됩니다. 이러한 프로그램은 블록체인 위에서 실행되기 때문에, 한 번 배포되면 사실상 영구적입니다. 만약 기계가 만들어진 후에 결함이 발견된다면, 이를 수정하는 것은 종종 불가능합니다. 이러한 불변성은 보안을 매우 중요하게 만듭니다. 아주 작은 실수조차도 수십억 달러의 손실로 이어질 수 있기 때문입니다. 수년 동안 연구자들은 자동화된 도구를 사용하여 이러한 컨트랙트의 오류를 스캔해 왔지만, 이 도구들은 코드의 맥락을 이해하는 데 어려움을 겪는 경우가 많아 빈번하게 가짜 경보를 울리거나 미묘한 위험을 놓치곤 했습니다. 최근에는 대규모 언어 모델(LLM)로 알려진 새로운 유형의 인공지능이 등장했는데, 이는 인간 프로그래머처럼 코드를 읽고 이해할 수 있는 능력을 갖추고 있습니다. 이는 지능형 시스템이 전통적인 보안 점검을 대체하거나 개선하여, 해를 끼치기 전에 취약점을 찾아낼 수 있을지에 대한 희망적인 질문을 던집니다.

최근 한 연구는 14개의 서로 다른 인공지능 모델을 테스트하여 이 질문에 답하고자 했습니다. 연구진은 보안 결함이 있는 것으로 알려진 계약과 완벽하게 깨끗한 계약을 포함한 54개의 실제 스마트 컨트랙트를 수집하여, 모델들이 이 둘을 얼마나 잘 구별하는지 확인했습니다. 그들은 단순히 모델에게 코드를 살펴보라고 요청하는 것에 그치지 않고, 단순한 직접 질문부터 모델이 분석 과정을 스스로 생각하도록 강제하는 복잡하고 단계적인 지침에 이르기까지 네 가지 다른 방식의 질문법을 시도했습니다. 또한, 일부 현대적 모델들이 문제에 대해 더 깊이 추론하기 위해 제공하는 기능인, 과정 중에 모델에게 생각할 시간을 더 많이 주는 것이 결과의 개선으로 이어지는지도 테스트했습니다. 목표는 이러한 강력한 도구들이 안전한 코드를 위험하다고 잘못 비난하지 않으면서 버그를 신뢰성 있게 찾아낼 수 있는지 결정하는 것이었습니다.

결과는 모델이 어떻게 작동하는지에 대한 몇 가지 일반적인 가정을 뒤흔드는 극명한 성능 차이를 보여주었습니다. 연구 결과, 단순히 모델에게 생각할 시간을 더 많이 주거나 상세한 추론 과정을 따르도록 요청하는 것이 항상 성능을 향상시키는 것은 아니라는 사실이 밝혀졌습니다. 실제로 상위 성과를 낸 모델 중 하나는 이 추가적인 사고 모드를 활성화했을 때 오히려 성능이 저하되어, 실제 취약점을 놓치고 전반적인 정확도를 떨어뜨렸습니다. 이는 더 많은 계산 노력이 반드시 더 나은 보안 분석으로 직결되는 것은 아님을 시사합니다. 대신, 가장 중요한 요소는 단순히 어떤 모델을 선택하느냐였습니다. 규모가 크고 상업적으로 개발된 최상위 모델들은 취약점을 정확히 식별하면서도 안전한 코드에 대해서는 거의 실수를 하지 않아 높은 신뢰성을 입증했습니다.

이와 극명하게 대조적으로, 연구에서 테스트된 소규모 오픈 소스 모델들은 매우 다르게 행동했습니다. 이 작은 모델들은 잠재적인 문제를 포착하는 데는 탁월했지만, 결정적인 결함을 가지고 있었습니다. 바로 취약한 계약과 안전한 계약을 구분하지 못한다는 점이었습니다. 그들은 모든 깨끗한 계약에 대해서도 위험하다고 표시하며, 사실상 매 순간 "늑대"를 외쳤습니다. 연구진은 존재하지 않는 위협을 환각하는 이러한 경향을 두고 '바실리스크 비율(Basilisk Rate)'이라는 특정 용어를 만들었습니다. 이 비율이 높은 모델은 엔지니어들에게 가짜 경보를 쏟아부어 업무를 마비시키기 때문에 보안용으로는 무용지물입니다. 연구는 상위 6개의 모델이 깨끗한 코드를 잘못 표시하지 않는 완벽한 기록을 보인 반면, 가장 작은 3개의 모델은 모든 깨끗한 계약을 취약한 것으로 표시했음을 보여주었습니다.

또한 이번 조사는 모델의 크기가 신뢰성을 결정하는 특정 임계값이 존재함을 강조했습니다. 성능이 좋았던 모델들은 일반적으로 내부 지식 베이스의 복잡성이라고 볼 수 있는 내부 파라미터 수가 더 많았습니다. 연구는 모델의 크기에 따라 특정 전환점이 존재하며, 이 임계값 미만의 모델들은 끊임없이 환각 현상을 일으키는 반면, 임계값을 넘어서는 모델들은 정밀하고 신뢰할 수 있게 된다는 점을 시사합니다. 흥란하게도, 하나의 대규모 오픈 소스 모델은 이 격차를 메우며 상위 상업용 모델들과 거의 대등한 성능을 보여주었으나, 나머지 작은 모델들은 여전히 신뢰할 수 없는 상태였습니다.

궁극적으로, 이 연구는 스마트 컨트랙트의 보안 결함을 찾는 특정 작업에 있어서는 인공지능 모델의 선택이 프롬프트 방식이나 생각할 시간을 얼마나 부여하느냐보다 훨씬 더 중요하다는 결론을 내립니다. 이러한 첨단 도구들은 큰 가능성을 보여주지만, 모든 시스템에 동일하게 작동하는 마법 같은 해결책은 아닙니다. 가장 효과적인 접근 방식은 정밀함이 입증된 모델을 선택하고, 문제가 존재하지 않는데도 문제를 찾아내는 경향이 있는 모델을 피하는 것입니다. 디지털 금융의 미래를 위해, 보안 팀은 어떤 인공지능 도구를 사용할지 신중하게 검토해야 하며, 실제 위협과 무해한 코드 조각을 구분할 수 있는 시스템에 의존해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →