← 최신 논문
🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

본 논문은 9,000 개의 LLM 생성 솔리디티 스마트 계약을 코퍼스로 포함하고, 5 차원 평가 기준을 제시하며, 특징적인 실패 모드를 드러내면서도 LLM 생성 계약이 기능 준수 측면에서 실제 구현보다 우수할 수 있음을 입증하는 검증된 파이프라인을 갖춘 포괄적인 벤치마크인 SmartEval 을 소개합니다.

원저자: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 평범한 영어만 구사하는 상사이고, 디지털 은행(스마트 계약이라고 부름)의 규칙을 작성할 초지능이지만 문자 그대로 해석하는 로봇 팀을 고용하고 싶습니다. 당신은 로봇들에게 "누군가 돈을 입금하면 영수증을 발급하세요. 도둑질하려 하면 문을 잠그세요"라고 말합니다.

문제는 이 로봇들이 지시를 단어 그대로 따르는 데는 뛰어나지만, 규칙의 정신을 놓치거나 은행이 붕괴될 수 있는 사소한 실수를 저지를 때가 있다는 점입니다. 현실 세계에서는 디지털 은행이 일단 구축되면 패치할 수 없으며 영구적입니다. 따라서 로봇들이 업무를 수행하게 하기 전에 그들이 잘했는지 테스트할 방법이 필요합니다.

이 논문은 이러한 로봇이 작성한 디지털 계약을 평가하기 위해 설계된 거대한 "성적표" 시스템인 SmartEval을 소개합니다.

다음은 이 논문이 단순한 비유를 사용하여 설명하는 내용입니다:

1. 대규모 테스트 (벤치마크)

연구자들은 9,000 개의 서로 다른 디지털 계약을 포함하는 대규모 테스트 주행을 실시했습니다.

  • 출처: 그들은 "아파트 임대 계약이 필요하다"와 같은 평범한 영어로 작성된 9,000 세트의 지시를 가져왔습니다.
  • 로봇: 이러한 지시를 최상위 AI(GPT-4o-mini) 에 입력하여 실제 코드를 생성했습니다.
  • 전문가: 또한 인간 전문가들이 동일한 계약의 "완벽한" 버전을 작성하도록 했습니다.
  • 목표: 로봇의 작업과 전문가의 작업을 비교하여 누가 더 잘했는지 확인합니다.

2. 채점 시스템 (루브릭)

단순히 "합격" 또는 "불합격"이라고 말하는 대신 SmartEval 은 계약을 다음 다섯 가지 항목에 대해 5 점 만점의 별점 등급 시스템으로 채점합니다:

  1. 요청한 모든 것을 수행했는가? (기능적 완전성)
  2. 사물을 올바른 이름으로 사용했는가? (변수 충실도)
  3. 논리가 올바르게 흐르는가? (상태 머신 정확성) — 이는 신호등이 녹색에서 노란색을 거쳐 빨간색으로 바뀌지, 녹색에서 바로 빨간색으로 바뀌지 않도록 하는 것과 같습니다.
  4. 비즈니스 규칙을 올바르게 이해했는가? (비즈니스 논리 충실도) — 이 부분이 가장 중요하며, 실제로 임대료를 징수하는 것과 같습니다.
  5. 코드가 깔끔하고 잘 작성되었는가? (코드 품질)

3. "안전망" 파이프라인

연구자들은 AI 에게 코드를 작성하게 하고 운을 기대하는 데 그치지 않았습니다. 안전 검사관이 있는 공장 라인을 구축했습니다:

  • 1 단계: "번역기"가 영어 문장을 엄격한 설계도로 변환합니다.
  • 2 단계: "건설자" AI 가 그 설계도를 기반으로 코드를 작성합니다.
  • 3 단계: "검사관" AI 가 자물쇠를 따려는 도둑과 같은 보안 구멍을 점검합니다.
  • 마법 문: 검사관이 심각한 문제("중간" 또는 "높음" 심각도 문제) 를 발견하면 코드는 공장을 떠날 수 없습니다. 이는 오류를 수정하기 위해 "정제" AI 로 다시 보내지고, 그 후 다시 점검됩니다. 이 루프는 코드가 안전해질 때까지 반복됩니다.

4. 놀라운 결과

로봇이 작성한 계약과 인간 전문가가 작성한 계약을 비교했을 때 흥미로운 일이 발생했습니다:

  • 로봇이 승리했습니다 (종이 위에서는): AI 가 생성한 계약은 실제로 인간이 작성한 것보다 더 높은 점수(약 8 점) 를 받았습니다.
  • 이유는 무엇일까요? 로봇들은 매우 문자 그대로 해석했습니다. "버튼을 추가하라"고 하면 버튼을 추가했습니다. 지시를 완벽하게 따랐습니다.
  • 인간의 우위: 인간 전문가들은 때때로 코드를 더 빠르거나 저렴하게 만들기 위해 "구석"을 잘라내거나 (가스 요금 절약), 더 깔끔하게 보이도록 재구성했습니다. 테스트가 정확한 지시 따름에 엄격했기 때문에, 인간들은 너무 창의적이거나 효율적이라는 이유로 감점을 받았습니다.
  • 단점: 로봇들은 복잡한 작업에서 어려움을 겪었습니다. 지시가 매우 길고 복잡해지면 (8 개 이상의 서로 다른 규칙이 포함된 계약과 같이), 로봇들은 실수를 하기 시작했고 코드는 종종 컴파일에 실패했습니다 (고장).

5. 채점 시스템이 작동했는가?

연구자들은 걱정했습니다: "AI 가 스스로를 채점하는 것일까?" 사기를 치지 않았음을 증명하기 위해 그들은 세 가지 검사를 실시했습니다:

  1. 인간 점검: 컬럼비아 대학교의 박사 학위 소지자 3 명이 30 개의 계약을 채점했습니다. 그들의 점수는 AI 의 점수와 거의 완벽하게 일치했습니다 (0.34 점 이내).
  2. 도구 점검: 그들은 코드를 표준 비 AI 보안 스캐너 (Slither 라고 함) 를 통해 실행했습니다. AI 감시자와 도구가 보안 문제에서 79% 일치했습니다.
  3. "만약에" 테스트: 그들은 안전 검사관과 같은 공장 라인의 일부 기능을 끄고 품질이 하락하는지 확인했습니다. 이는 시스템의 모든 부분이 실제로 필요하다는 것을 증명했습니다.

결론

SmartEval은 AI 가 안전하고 작동하는 디지털 계약을 작성할 수 있는지 테스트하는 새로운 신뢰할 수 있는 방법입니다. 이 연구는 AI 가 지시를 문자 그대로 따르는 데는 놀라울 정도로 뛰어나지만, 매우 복잡하고 다단계인 논리에서는 여전히 어려움을 겪는다는 것을 발견했습니다. 또한 시스템은 "안전 검사관"과 "수정 루프"를 추가함으로써, 혼란스럽고 오류가 발생하기 쉬운 AI 를 인간 전문가 한 명이 혼자 일하는 것보다 안전한 신뢰할 수 있는 코드 생성자로 바꿀 수 있음을 증명했습니다.

중요 참고 사항: 이 논문은 코드가 올바르게 보이고 컴파일되기는 하지만, 실제 돈이 실시간 환경에서 이동할 때 계약이 실제로 올바르게 작동하는지 테스트하지는 않았다고 인정합니다. 또한 AI 는 아직 인간 전문가처럼 가스 요금을 절약하는 방법을 알지 못한다고 지적합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →