← 최신 논문
💻 computer science

SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition

이 논문은 결정론적 계산과 확률적 계산을 단일 명세 내에서 통합하여 모델 불가지론적 워크플로 오케스트레이션을 가능하게 하는 선언적 프레임워크인 SPL(Structured Prompt Language)을 소개하며, 솔버 기반 접근 방식이 검증되지 않은 LLM 전용 출력에 비해 현저히 높은 기계 검증 정확도를 달al성함을 광범위한 실험을 통해 입증한다.

원저자: Wen G. Gong

게시일 2026-07-10
📖 5 분 읽기🧠 심층 분석

원저자: Wen G. Gong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 숙제를 도와줄 수 있는 아주 똑똑한 로봇 비서 제작을 시도하고 있다고 상상해 보세요. 지금은 이런 비서를 만드는 것이 마치 엔진, 스티어링 휠, GPS를 서로 다른 회사가 만들었고, 각자 다른 언어를 사용하며, 지저hi한 맞춤형 테이프로 덕지덕지 붙여야 하는 자동차를 만드는 것과 같습니다. 이들을 서로 대화하게 만들려면 당신은 코딩의 마법사가 되어야만 합니다.

이 논문은 **SPL (Structured Prompt Language)**을 소개합니다. 이는 마치 로봇의 '창의적인' 부분과 '수학적인' 부분이 하나의 깔끔한 설명서를 통해 드디어 함께 작동할 수 있게 해주는 만능 리모컨과 같습니다.

두 개의 뇌: 몽상가와 계산기

논문은 현재의 AI 도구들이 한 가지 모드에 갇혀 있다고 주장합니다. 그들은 이야기를 쓰고, 답을 추측하고, 채팅하는 데는 뛰어나지만 때때로 사실을 지어내거나 수학 문제를 틀리는 **몽상가(LLMs)**이거나, 혹은 농담을 이해하거나 이야기를 쓸 수는 없지만 수학과 논리에는 완벽한 계산기(SymPy 또는 SageMath 같은 도구) 중 하나입니다.

저자들은 "둘 다 있으면 안 될 이유가 있을까?"라고 묻습니다. 그들은 **몽상가(시스템 1)**가 문제를 분해하고 설명하면, **계산기(시스템 2)**가 실제 힘든 계산을 수행하고 작업 내용을 확인하는 시스템을 제안합니다.

거대한 반전: 이 논문은 AI가 어느 한 쪽이 되기 위해 반드시 "빠르거나" 혹은 "느려야" 한다는 생각에 명시적으로 반대합니다. 이것은 속도의 문제가 아니라, 어떻게 생각하느냐의 문제입니다. 계산기는 매우 어려운 증명을 하고 있다면 느릴 수 있고, 몽상가는 단순히 추측을 하고 있다면 빠를 수 있습니다. 핵심은 어떤 작업에 어떤 뇌를 사용할지 아는 것입니다.

"한 번 설계하여 어디서나 배포한다(Design Once, Deploy Anywhere)"는 마법

여기 가장 멋진 부분이 있습니다. SPL을 사용하면, 당신은 특별한 .spl 파일에 지침을 단 한 번만 작성하면 됩니다. 만약 당신이 이 코드를 노트북에서 실행하든, 클라우드에서 실행하든, 혹은 거대한 슈퍼컴퓨터 그리드에서 실행하든 코드를 다시 작성할 필요가 없습니다.

이것은 레시피와 같습니다. 레시피를 한 번 작성합니다. 당신이 아주 작은 캠핑용 버너(당신의 노트북)에서 요리하든, 고급 주방(클라우드)에서 요리하든, 혹은 거대한 산업용 공장(분산 그리드)에서 요리하든 레시피는 동일하게 유지됩니다. 당신은 단지 시작할 때 어디에서 요리할지만 알려주면 됩니다. 논문에서는 이를 DODA라고 부릅니다.

"검증 사다리(Verifier Ladder)"

우리는 수학이 맞는지 어떻게 알 수 있을까요? 논문은 세 단계의 디딤돌이 있는 "검증 사다리"를 소개합니다.

  1. 1단계 (SymPy): 기초 대수학이나 미적분에 좋습니다. 빠르고 쉽습니다.
  2. 2단계 (SageMath): 정수론이나 기하학 같은 더 어려운 내용들을 위한 단계입니다.
  3. 3단계 (Lean 4): 궁극의 보스 레벨입니다. 이것은 컴퓨터에 의해 100% 수학적으로 참임이 확인되는 형식적 증명을 위한 것으로, 마치 수학을 위한 법적 계약서와 같습니다.

논문은 1단계(Sympy)를 먼저 시도하는 워크플로우를 작성할 수 있음을 보여줍니다. 만약 실패하면, 시스템은 자동으로 2단계(SageMath)로 올라가고, 거기서도 실패하면 3단계(Lean 4)로 올라갑니다. 당신은 "이것이 실패하면 저것을 시도하라"는 코드를 직접 작성할 필요가 없습니다. 언어가 알아서 처리해 줍니다.

실험: 실제로 어떤 일이 일어났는가?

저자들은 단순히 추측만 한 것이 아닙니다. 그들은 10개의 서로 다른 AI 모델20개의 서로 다른 수학 문제(쉬운 수준부터 전문가 수준까지)에 대해 테스트했으며, 각 테스트를 3번씩 실행했습니다. 총 1,200번의 실행이 이루어졌습니다.

그들은 문제를 해결하는 두 가지 방식을 비교했습니다:

  1. "LLM 전용" 팔: AI가 그냥 답을 추측하고 작성합니다.
  2. "솔버(Solver) 전용" 팔: AI가 문제를 분해하여 계산기로 수학 문제를 보내고, 검증된 답을 받은 다음, 설명을 작성합니다.

결과:

  • 좋은 소식: 솔버 팔은 믿을 수 없을 정도로 정확했습니다. gemma4:e2b와 같은 최고의 모델들의 경우, 계산기에 의해 검증되었을 때 **93%**의 정답률을 보였습니다. 심지어 sonnet-4-6도 **85%**의 정답률을 기록했습니다.
  • 주의할 점: "LLM 전용" 팔은 거의 항상 (100%에 가깝게) 어떤 답변이라도 내놓을 수 있었지만, 그것은 검증되지 않은 것이었습니다. 솔버 팔은 AI가 무언가를 말한다고 해서 그것이 반드시 사실은 아니라는 점을 입증했습니다.
  • 병목 현상: 솔버 팔이 실패한 주요 원인은 AI가 수학을 못 해서가 아니었습니다(계산기가 그 일을 했으니까요!). 이유는 AI가 자신의 답을 올바른 형식으로 작성하지 못했기 때문입니다. AI는 계산기가 이해할 수 있도록 매우 특정한 코드 형태(expr|op)로 수학을 작성해야 했습니다. 만약 AI가 형식을 틀리면, 계산기는 이를 거부했습니다.
  • 놀라운 점: gemma4:e2b라는 작은 오픈 소스 모델이 (거대하고 비싼 모델들보다 훨씬 작음에도 불구하고) 규칙을 따르는 데 있어 일부 거대 모델들보다 더 나은 성능을 보였습니다. 이는 이 특정 작업에 있어서는, 거대하고 초지능적인 뇌를 갖는 것보다 좋은 "형식 변환기"가 되는 것이 더 중요하다는 것을 시사합니다.

이 논문이 "아닌 것"에 대하여

이 논문은 자신이 무엇을 하지 않는지를 매우 명확히 밝히고 있습니다:

  • AI 모델이 이제 스스로 수학을 완벽하게 할 수 있다고 주장하는 것이 아닙니다. 실제로 실험 결과, 계산기 없이는 모델들이 그저 추측하고 있을 뿐이라는 점이 드러났습니다.
  • "생각하는(Thinking)" 모델(답하기 전에 오랫동안 생각하는 모델)이 더 낫다고 말하는 것도 아닙니다. 실제로 논문은 일부 "생각하는" 모델들이 너무 오래 생각하다가 계산기가 요구하는 특정 코드 형식을 작성하기도 전에 공간(space)이 부족해지는 바람에 제외했습니다.
  • 이것이 모든 문제를 해결한다고 주장하는 것도 아닙니다. 실험은 상징 수학(symbolic mathematics)에 특화되었습니다. 저자들은 이것이 코드 검사나 데이터 검증 같은 다른 분야에서도 작동할 수 있다고 제안하지만, 아직 그것을 증명하지는 않았습니다.

결론

이 논문은 AI의 '창의적인' 부분과 '수학적인' 부분을 분리하고, 컴퓨터가 수학을 확인하게 함으로써 훨씬 더 신뢰할 수 있는 결과를 얻을 수 있다는 것을 증명합니다. 가장 좋은 점은 무엇일까요? 당신은 코딩 천재가 될 필요가 없습니다. 계획을 한 번만 작성하면, 시스템이 당신의 노트북이든 슈퍼컴퓨터에서 실행되든 나머지를 알아서 처리합니다.

저자들은 이를 1,200번의 실행으로 측정했으며, 솔버 팔이 약간 더 느리긴 하지만(작업을 확인하는 데 몇 초를 더 사용함), "맞을지도 모르는" 답변을 "기계가 검증한" 답변으로 바꾼다는 것을 발견했습니다. 최고의 모델들의 경우, 이 검증 과정이 속도 측면에서 거의 비용이 들지 않았으며, 이는 이 두 가지 모드 병행 방식이 더 똑똑하고 안전한 AI 비서를 구축하는 실용적인 방법임을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →