← 최신 논문
💬 NLP

VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

이 논문은 수학 중심의 기존 벤치마크와 달리 실제 소프트웨어 검증 프로젝트의 맥락과 의존성을 반영한 500 개의 Lean 4 증명 과제를 포함한 'VeriSoftBench'를 소개하고, 이를 통해 수학 특화 모델의 성능 한계와 의존성 범위에 따른 증명 성공률의 상관관계를 분석합니다.

원저자: Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig

게시일 2026-02-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📚 이야기의 배경: "수학 경시대회 vs. 거대 도시 건설"

지금까지 인공지능이 수학 증명을 할 때 사용했던 시험지들은 대부분 '수학 경시대회 (Putnam, Mathlib)' 스타일이었습니다.

  • 비유: 이 시험지는 **전 세계 모든 학생이 공유하는 거대한 '공통 교과서 (Mathlib)'**만 있으면 풀 수 있는 문제들입니다. 문제의 정의와 해결책이 모두 그 교과서에 명확히 적혀 있어서, AI 가 교과서만 뒤적이면 정답을 찾아낼 수 있었습니다.

하지만 이 논문은 **"실제 소프트웨어 개발 현장"**은 완전히 다르다고 말합니다.

  • 비유: 실제 소프트웨어 프로젝트는 수천 개의 건물이 들어선 거대한 도시와 같습니다.
    • 각 건물 (파일) 은 서로 다른 설계도 (프로젝트별 정의) 를 따릅니다.
    • A 건물의 벽돌을 B 건물의 기둥에 연결하려면, 도시 전체의 복잡한 도로망 (파일 간 의존성) 을 알아야 합니다.
    • 중요한 정보는 공통 교과서가 아니라, 그 도시만의 비밀스러운 설계도에 숨겨져 있습니다.

🔍 연구의 핵심: "VeriSoftBench"라는 새로운 시험지

연구팀은 AI 가 이 '거대 도시'에서도 잘 작동하는지 테스트하기 위해 **새로운 시험지 (VeriSoftBench)**를 만들었습니다.

  • 구성: 실제 오픈소스 프로젝트 23 개에서 가져온 500 개의 증명 문제입니다.
  • 특징: 문제를 풀려면 해당 프로젝트만의 고유한 용어를 이해하고, 여러 파일을 넘나들며 정보를 찾아야 합니다. 마치 특정 회사의 내부 문서만 보고 회계 장부를 정리하라는 과제와 같습니다.

🧪 실험 결과: AI 들의 반응

연구팀은 최신 AI 모델들과 전문 증명 프로그램들을 이 시험지에 투입해 보았습니다. 결과는 다음과 같았습니다.

1. 수학 천재는 현실에서는 당황한다

  • 상황: 수학 경시대회에서 만점을 받던 AI 들 (GPT-5, Claude 등) 은 이 '거대 도시' 시험지에서 점수가 뚝 떨어졌습니다.
  • 이유: 그들은 '공통 교과서'에 익숙해져 있어서, 각 프로젝트마다 다른 '사설 설계도'를 읽는 데 어려움을 겪었습니다.

2. 정보의 양이 많을수록 혼란스럽다 (의존성의 함정)

  • 상황: 증명하기 위해 필요한 정보가 너무 깊게 연결되어 있을수록 (A 를 증명하려면 B 가 필요하고, B 를 증명하려면 C 가 필요한 식) AI 는 더 많이 실패했습니다.
  • 비유: 길을 찾으려는데 지도가 너무 복잡하고, 갈아타야 할 역이 10 개나 된다면 AI 는 "어디로 가야 하지?"라며 헤매게 됩니다.

3. 힌트를 줘도 완벽하지는 않다

  • 상황: 연구팀은 AI 가 헷갈리지 않도록 정답에 필요한 정보만 골라서 (Curated Context) 주었습니다. 그래도 AI 는 여전히 많은 실수를 했습니다.
  • 교훈: 필요한 정보만 줘도 AI 는 그 정보를 어떻게 연결해야 할지 (논리적 추론) 를 잘 못합니다. 단순히 '정보를 찾아주는 것'만으로는 부족하다는 뜻입니다.

💡 이 연구가 우리에게 주는 메시지

이 논문은 **"AI 가 수학 문제를 잘 푼다고 해서, 실제 복잡한 소프트웨어 버그를 찾아내거나 시스템을 검증할 수 있는 것은 아니다"**라고 경고합니다.

  • 현재 상태: AI 는 '공통된 규칙'이 있는 수학 문제에는 강하지만, '각자 다른 규칙'이 있는 현실 세계의 소프트웨어 프로젝트에는 약합니다.
  • 미래 과제: 앞으로의 AI 는 단순히 정보를 찾아내는 것을 넘어, 수천 개의 파일로 이루어진 복잡한 도시의 지도를 스스로 이해하고, 여러 단계를 거쳐 논리를 연결할 수 있는 능력을 키워야 합니다.

🎯 한 줄 요약

"AI 가 수학 경시대회에서는 금메달을 땄지만, 실제 소프트웨어라는 거대하고 복잡한 도시에서는 길을 잃고 헤매고 있습니다. 이제 AI 는 '공통 교과서'가 아닌 '현실의 설계도'를 읽는 법을 배워야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →