← 최신 논문
💻 computer science

VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

이 논문은 기존 벤치마크가 탐지하지 못하는 최첨단 LLM 의 코드 생성 및 명세 능력에서 중요한 약점을 드러내는 VerinaPlus 와 VerinaLite 와 같은 더 엄격한 벤치마크를 만들기 위해 테스트 스위트의 확장 및 정제를 수행하는 적대적 프레임워크인 VeriScale 을 소개합니다.

원저자: Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

게시일 2026-05-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 셰프를 고용해 복잡한 요리를 시킨다고 상상해 보세요. 당신은 로봇에게 레시피(명세) 를 주고 요리를 하라고 지시합니다(코드). 로봇이 잘하는지 확인하기 위해 요리를 맛봅니다.

문제: "쉬운 퀴즈" 함정
현재 이러한 AI 셰프를 점검하는 데 사용하는 테스트는 매우 쉬운 퀴즈와 같습니다. 우리는 그들에게 소금과 물 같은 몇 가지 간단한 재료만 주고 "수프"라는 간단한 결과를 요구합니다. 로봇이 수프를 만들면 A+ 를 줍니다.

하지만 함정이 있습니다. 로봇이 속일 수 있다는 점입니다. 로봇은 "소금 + 물 = 수프"라는 답을 외웠을 뿐일 수 있습니다. 만약 "치약" 같은 이상한 재료를 주면, 로봇은 여전히 수프를 만들려고 시도하고 그것이 정답이라고 주장할지도 모릅니다. 또는 "소금을 넣으라"고 적힌 레시피를 작성하지만 "독을 넣지 마라"는 말은 빼먹을 수 있습니다. 테스트에 "치약"이나 "독"이 포함되지 않았기 때문에 로봇은 통과하지만, 실제로는 위험하거나 고장 난 상태일 수 있습니다.

해당 논문은 현재의 테스트가 너무 작고 너무 쉬워 AI 가 실제보다 더 똑똑해 보이게 만든다고 주장합니다.

해결책: VeriScale(스트레스 테스트 프레임워크)
저자들은 VeriScale이라는 새로운 시스템을 개발했습니다. 이는 AI 코드에 대한 "스트레스 테스트"나 "레드 팀" 연습으로 생각할 수 있습니다. AI 에게 단순히 수프를 만들라고 요청하는 대신, VeriScale 은 AI 를 실패하도록 속이려 합니다.

이는 두 가지 주요 단계로 작동합니다:

1 단계: "장애물 코스"(확장)

먼저 VeriScale 은 거대하고 혼란스러운 재료들의 장애물 코스를 생성합니다.

  • 씨앗: 일반 재료로 시작합니다.
  • 변이: "변이 기계"를 사용해 이러한 재료를 뒤틀고 회전시킵니다. 컵 한 잔의 물을 얼음 양동이로 바꾸거나, 소금 한 꼬집을 소금 산으로 만듭니다. AI 가 결코 본 적 없는 기이한 엣지 케이스 시나리오를 생성합니다.
  • "속임수" 셰프(적대적 합성): 이것이 교묘한 부분입니다. VeriScale 은 규칙을 따르는 것처럼 보이지만 실제로는 쓰레기를 만들어내는 가짜 레시피를 작성하는 매우 똑똑한 다른 AI 를 "속임수" 역할로 부릅니다.
    • 예시: 규칙이 "수프는 뜨거워야 한다"면, 속임수는 "아이스크림"을 출력하지만 "글쎄요, 기술적으로 아이스크림은 음식이니까 규칙을 따랐습니다!"라고 주장할 수 있습니다.
    • VeriScale 은 이러한 속임수 레시피를 AI 의 규칙에 대입해 실행합니다. AI 의 규칙이 아이스크림을 "뜨거운 수프"로 받아들이면, VeriScale 은 결함을 포착합니다. 이러한 "속임수" 순간들의 거대한 목록을 생성합니다.

2 단계: "필수 체크리스트"(축소)

이제 VeriScale 은 수천 개의 까다로운 테스트 케이스를 보유하게 됩니다. 모든 AI 에 대해 이들을 모두 실행하는 것은 영원히 걸리고 천문학적인 비용이 듭니다. 따라서 "축소"를 수행합니다.

  • 질문합니다: "이 1,000 가지 속임수 중 어떤 것이 가장 중요한가?"
  • 가장 많은 실수를 잡아내는 특정 속임수들은 유지하고, 단순한 반복인 것들은 버립니다.
  • 그 결과, 빠르게 실행할 수 있을 정도로 작지만 거대한 목록이 발견했을 모든 결함을 여전히 잡아내는 간결하고 초고난이도의 테스트가 탄생합니다.

결과: "진실의 serum"
저자들은 이 새로운 시스템을 GPT-5.5 와 같은 사용 가능한 최고의 AI 모델들로 테스트했습니다.

  • 기존 테스트: AI 들은 96% 나 98% 같은 점수를 받았습니다. 그들은 천재처럼 보였습니다.
  • VeriScale 테스트: 스트레스 테스트를 거치자 점수가 극적으로 떨어졌습니다. 한 최상위 모델의 코딩 점수는 96% 에서 86% 로, 명세 작성 점수는 68% 에서 44% 로 하락했습니다.

핵심 교훈
이 논문은 기존 테스트가 우리를 속이고 있음을 보여줍니다. 그들은 AI 가 안전하고 정확한 코드를 작성하는 능력을 과대평가했습니다. 새로운 "VeriScale" 테스트는 AI 가 겉보기에 올바른 코드를 작성하는 데는 뛰어나지만, 모든 가능한 실수를 잡아내는 규칙을 작성하는 데는 여전히 매우 부족하다는 것을 드러냅니다.

저자들은 또한 이 새로운 테스트의 두 가지 버전을 공개했습니다:

  1. VERINAPLUS: 거대한 풀스케일 스트레스 테스트(원본보다 83 배 큼).
  2. VERINALITE: "라이트" 버전입니다. 원본보다 14 배 크지만 동일한 실수를 잡아내면서 빠르고 저렴하도록 "축소" 기법을 사용합니다.

간단히 말해, VeriScale 은 쉬운 테스트 통과 방법만 아는 AI 에 속지 않도록 막아주는 도구입니다. 이는 AI 가 기이하고, messy 하며, 까다로운 현실 세계를 처리할 수 있음을 증명하도록 강요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →