← 최신 논문
💻 computer science

The Machine Proposes. The Proof Disposes: Neuro-Symbolic Synthesis of Formally Verified Markov Usage Models from Natural Language Requirements

본 논문은 L* 학습, 문법 제약 기반의 LLM, 그리고 볼록 최적화를 통합함으로써 자연어 요구사항으로부터 형식적으로 검증된 마르코프 사용 모델의 합성을 자동화하고, 이를 통해 순수 신경망 기반 베이스라인을 크게 상회하는 고충실도 결함 탐지 및 커버리지를 달 수 있도록 함으로써 안전 필수 시스템을 위한 수동 모델링 병목 현상을 제거하는 뉴로-심볼릭 MBST 프레임워크를 소개한다.

원저자: Nathan Ginting

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nathan Ginting

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 자동차를 운전하거나 웹사이트를 탐색하는 법을 가르치려 한다고 상상해 보십시오. 이를 안전하게 수행하기 위해서는 로봇이 할 수 있는 모든 움직임의 지도가 필요합니다. 소프트웨어 테스트의 세계에서 이 지도를 "사용 모델(usage model)"이라고 부릅니다. 이것은 시스템이 처할 수 있는 모든 상태(예: "브레이크를 밟는 중" 또는 "장바구니가 가득 참")와 한 상태에서 다른 상태로 이동할 확률(예: "사용자가 '구매'를 클릭할 확률 80%")을 보여주는 순서도와 같습니다.

수십 년 동안 전문가들은 이 지도를 사용하여 "통계적 테스트"를 수행해 왔습니다. 단순히 코드가 한 번 작동하는지 확인하는 대신, 그들은 지도를 사용하여 시스템을 통과하는 수천 번의 무작위 여정을 시뮬레이션합니다. 만약 지도가 정확하다면, 이 테스트는 드물고 까다로운 상황에서만 나타나는 숨겨진 버그들을 찾아낼 것입니다. 하지만 큰 문제가 하나 있습니다. 이러한 지도를 손으로 그리는 것은 느리고, 지루하며, 인간의 실수에 취약하다는 점입니다. 이는 눈을 가린 채 도시 전체의 상세한 지도를 그리려는 것과 같습니다. 최근에는 텍-트 기반의 새로운 도구가 등장했습니다. 바로 인공지능(AI)인데, 이 AI는 텍스트를 읽고 지도가 어떤 모습이어야 하는지 추측할 수 있습니다. 하지만 여기에는 함정이 있습니다. AI는 지도의 '형태'를 추측하는 데는 뛰어나지만, '숫자'를 정확히 맞추는 데는 서툽니다. 존재하지 않는 길을 그려내거나, 비가 올 확률이 150%라고 말하는 식(이는 불가능한 일입니다)의 오류를 범할 수 있습니다. 이 논문은 다음과 같은 질문을 던집니다. "우리는 AI의 창의성과 엄격한 수학적 '규칙집'을 결합하여 자동으로 완벽한 지도를 구축할 수 있을까?"

"The Machine Proposes. The Proof Disposes(기계가 제안하고, 증명이 결정한다)"라는 제목의 이 논문은 NeSy-MBST라고 불리는 새로운 시스템을 소개합니다. 이것은 창의적인 작가와 엄격한 수학 선생님의 팀워크라고 생각하면 됩니다. "작가"는 자연어 요구사항(예: "사용자는 장바구니에 아이템을 추가할 수 있어야 한다")을 읽고 시스템의 초안 지도를 제안하는 LLM(대규모 언어 모델)인 AI입니다. "수학 선생님"은 초안을 수학적 법칙에 따라 검증하는 컴퓨터 프로그램인 심볼릭 솔버(symbolic solver)입니다.

이 팀이 협력하는 방식은 다음과 같습니다:

  1. 제안(The Proposal): AI가 요구사항을 읽고 상태와 전이를 스케치합니다. 이는 빠르며 인간의 언어를 잘 이해합니다.
  2. 증명(The Proof): 수학 선생님이 즉시 스케치를 검토합니다. AI가 물리적으로 불가능한 전이를 만들어냈나요? 단계를 누락했나요? 선생님은 "아니, 그 길은 존재하지 않습니다"라거나 "길을 놓쳤습니다"라고 말합니다.
  3. 수정(The Fix): AI는 피드백을 받아 지도를 수정하고 다시 시도합니다.
  4. 숫자(The Numbers): 지도의 형태가 완벽해지면, 수학 선생님이 바통을 이어받아 확률을 할당합니다. AI가 숫자를 추측하게 하면(종종 오류로 이어짐) 대신, 선생님은 "볼록 최적화 도구(convex optimizer)"를 사용하여 확률의 합이 정확히 100%가 되고 실제 사용량을 반영하도록 계산합니다.

연구진은 이 시스템을 두 가지 유형의 과제, 즉 자율 주행 차량(자율 주행 시스템)과 두 개의 이커머스 웹사이트(사용자 쇼핑 페이지 및 관리자 대시보드)에 대해 테스트했습니다. 그들은 이 새로운 "팀업" 시스템을 AI 단독 사용 및 전통적인 수동 방식과 비교했습니다.

결과는 인상적이었습니다. AI만을 사용했을 때는 중요한 경로의 약 절반을 놓쳤고 지도 구조에서도 오류를 범했습니다. 하지만 NeSy-MBST 팀업을 사용했을 때, 시스템은 자율 주행차와 같은 핵심 시스템에 요구되는 안전 임계값인 0.90을 상회하는 0.9125의 점수를 달성했습니다. 이는 AI 단독으로는 충분하지 않았지만, 팀업은 안전 테스트를 통과했음을 의미합니다.

구체적으로, 새 시스템은 가능한 모든 전이(시스템이 취할 수 있는 경로)의 **85.7%**를 커버한 반애, AI 단독 버전은 **50%**만을 커버했습니다. 이는 35.7 퍼센트 포인트의 거대한 상승입니다. 쉽게 말해, 새 시스템은 AI 단독 버전이 환각을 일으켰던 "막다른 길"이나 "불가능한 도로"를 놓치지 않았기 때문에 훨씬 더 다양한 잠재적 버그를 찾아냈습니다.

또한 논문은 시스템이 숫자를 얼마나 정확하게 맞췄는지 살펴보았습니다. 연구진은 AI의 확률 추측이 실제 수학과 얼마나 가까운지 측정하기 위해 젠슨-섀넌 발산(Jensen–Shannon divergence)이라는 지표를 사용했습니다. 새 시스템은 완벽에 매우 가까운 0.012의 점수를 기록한 반면, AI 단독 버전은 0.157로 훨씬 더 멀리 떨어져 있었습니다. 이는 수학 선생님이 AI의 잘못된 수학을 성공적으로 바로잡았음을 입증합니다.

연구진은 어떤 부분이 팀의 핵심적인 역할을 했는지 알아보기 위해 "절제 연구(ablation study)"라는 특별한 실험을 수행했습니다. 그들은 심볼릭 검증 루프(지도 구조를 확인하는 수학 선생님)가 훨씬 더 많은 경로를 찾는 주요 원인이었다는 것을 발견했습니다. 또한 볼록 최적화 도구(확률 계산을 수행하는 수학 선생님)가 숫자의 정확도를 높인 주요 원인이었습니다. 테스트 실행을 통해 학습하는 폐쇄 루프 피드백은 약간의 도움을 주었지만, 핵심적인 마법은 초기 팀업 단계에 있었습니다.

결론적으로, 이 논문은 우리가 AI의 속도와 인간 전문가의 안전성 사이에서 하나를 선택할 필요가 없음을 시사합니다. AI가 아이디어를 제안하게 하고 엄격한 수학 시스템이 이를 검증 및 수정하게 함으로써, 빠르고 안전하게 구축할 수 있는 소프트웨어 테스트 지도를 만들 수 있습니다. 저자들은 이 시스템이 테스트한 시스템(최대 42개 상태)에는 매우 잘 작동하지만, 거대하고 복잡한 산업용 시스템으로 확장 가능한지에 대해서는 더 많은 연구가 필요하다고 언급했습니다. 하지만 현재로서는, 최종 지도로 사용되기 전에 "증명이 결정(The Proof Disposes)"함으로써 오류를 처리하는 한, "기계가 제안하는 것(The Machine Proposes)"은 훌륭한 시작임을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →