← 최신 논문
🤖 machine learning

PPDL: LLM-Based Flows as Probabilistic Programs

이 논문은 개발자가 Rocq 증명기를 위한 정리 증명 에이전트를 통해 입증된 바와 같이, 핵심 로직을 수정하지 않고도 LLM 기반 애플리케이션 흐름 전반에 걸쳐 불확실성을 정량화 및 전파하고 추론 스케일링 기법을 실험할 수 있게 해주는 확률적 프로그래밍 언어인 PPDL을 소개한다.

원저자: Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

게시일 2026-08-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 까다로운 퍼즐을 풀려고 노력 중이라고 상상해 보세요. 하지만 혼자 푸는 대신, 당신과 대화할 수 있는 매우 똑똑하고 창의적인 친구가 있습니다. 이 친구는 거대 언어 모델(LLM)이라고 불리는 인공지능입니다. 이 친구는 이야기를 쓰거나, 수학 문제를 풀거나, 심지어 컴퓨터 코드를 작성하는 데도 능숙합니다. 하지만 완벽하지는 않습니다. 때때로 틀린 답에 대해 자신만만해하거나, 실제처럼 들리지만 사실은 아닌 정보를 지어내기도 합니다. 이것을 "불확실성(uncertainty)"이라고 부릅니다.

이제 당신에게 여러 단계를 거쳐야 하는 정말 어려운 문제를 풀어야 한다고 상상해 봅시다. 당신은 AI 친구에게 계획을 세워달라고 요청하고, 그 계획을 바탕으로 코드를 작성하라고 요청한 뒤, 그 코드를 검토하라고 요청하는 식입니다. 매번 질문을 할 때마다 AI는 답변을 내놓지만, 그 답변은 약간 불안정할 수 있습니다. 만약 이 열 개의 불안정한 답변을 하나로 엮는다면, 최종 결과는 엉망진창이 될 수 있습니다. 이는 마치 조금씩 흔들리는 젠가 블록으로 탑을 쌓는 것과 같습니다. 높이 올라갈수록 전체가 무너질 가능성이 커집니다. 개발자와 사용자들은 여기서 길을 잃곤 합니다. "이 답변이 맞는 걸까? 얼마나 확신할 수 있지? 이걸 믿어도 될까?"

이를 해결하기 위해 과학자들은 몇 가지 기술을 시도했습니다. 한 가지 인기 있는 아이디어는 "추론 스케일링(inference scaling)"입니다. 이것은 당신의 AI 친구에게 같은 퍼즐을 열 번 다르게 시도하게 한 뒤, 어떤 답이 가장 자주 나오는지 확인하는 것과 같습니다. 마치 친구들에게 수수께끼의 정답을 추측하게 하고 다수결로 결정하는 것과 비슷합니다. 하지만 여기에는 함정이 있습니다. 이를 수동으로 하는 것은 매우 번잡합니다. 열 번의 시도를 실행하고, 어떤 것이 괜찮은지 추적하며, 나쁜 것을 버리기 위한 특별한 컴퓨터 코드를 직접 작성해야 합니다. 이는 마치 쿠키 한 배치를 구울 때마다 맛이 제대로 나는지 확인하기 위해 매번 새로운 공장을 짓는 것과 같습니다. 복잡하고, 비용이 많이 들며, 다른 방식의 베이킹을 시도하고 싶을 때 변경하기 어렵습니다.

논문의 핵심 아이디어: "마법의 점수판"

이 논문은 PPDL(Probabilistic Prompt Declaration Language)이라는 새로운 도구를 소개합니다. PPDL은 AI 워크플로우를 위한 특별한 "마법의 점수판"이라고 생각하면 됩니다. 단순히 AI에게 질문을 던지고 하나의 답변을 얻는 대신, PPDL을 사용하면 AI가 불확실할 수 있다는 점을 자연스럽게 이해하는 프로그램을 작성할 수 있습니다.

작동 방식은 다음과 같습니다:

  1. 흐름(The Flow): 평소처럼 AI에게 지침을 작성합니다 (예: "코드를 계획하라", 그 다음 "코드를 작성하라", 그 다음 "코드를 검사하라").
  2. 마법 요소(The Magic Factor): factor라고 불리는 특별한 지침을 추가합니다. 이것은 점수판과 같아서, 당신은 AI에게 이렇게 말하는 것입니다. "이 계획이 논리적이라면 높은 점수를 주고, 코드에 오류가 있다면 낮은 점수를 줘."
  3. 결과(The Result): 프로그램을 실행하면 컴퓨터는 단 하나의 답변만을 내놓지 않습니다. 컴퓨터는 이 전체 과정을 병렬로 여러 번 실행합니다 (마치 수백 명의 다른 버전의 당신이 동시에 퍼즐을 푸는 것처럼 말이죠). 컴퓨터는 당신의 "점수판"을 사용하여 결과를 가중 처리합니다. 만약 어떤 경로가 정말 유망해 보인다면, 컴퓨터는 그 경로에 더 많은 에너지를 집중합니다. 만약 어떤 경로가 좋지 않다면, 그 경로는 버립니다.

가장 멋진 점은, "열 번 실행하는" 복잡한 코드를 직접 작성할 필요가 없다는 것입니다. PPDL이 이 모든 힘든 일을 백그리운드에서 처리합니다. 당신은 로직을 한 번만 작성하면 되고, 시스템이 가능한 모든 경우의 수를 탐색하는 최선의 방법을 자동으로 찾아냅니다.

연구 결과

저자들은 초등학교 수준의 수학 문제 풀기부터 복잡한 컴퓨터 코드 작성, 심지어 수학 정리 증명에 이르기까지 여러 가지 과제를 통해 이 아이디어를 테스트했습니다.

  • 더 높은 정확도: 테스트 결과, PPDL과 이러한 "점수판"을 사용했을 때는 AI의 정확도가 눈에 띄게 향상되었습니다. 예를 들어, GSM8k라는 수학 테스트에서 일반적인 AI는 약 83.8%의 정답률을 보였습니다. 하지만 "중요도 샘플링(Importance Sampling, 즉 가장 좋은 추측을 골라내는 스마트한 방법)"을 적용한 PPDL을 사용하자 정확도가 93.7%로 뛰어올랐습니다.
  • "스마트한" 방식의 승리: 그들은 점수판을 사용하는 다양한 방법을 비교했습니다. 때로는 단순히 "다수결(가장 흔한 답변)"을 따르는 것이 효과적이었습니다. 하지만 종종 더 스마트한 방법들(예: 중요도 샘플링 및 순차 몬테카를로 방식)이 훨씬 더 나은 성과를 보였습니다. 이 방법들은 단순히 투표수를 세는 것이 아니라, 왜 어떤 답변이 좋거나 나쁜지를 실제로 조사하여 나쁜 경로는 조기에 폐기하고 좋은 경로에 집중하는 탐정과 같습니다.
  • 정리 증명 사례 연구: 시스템을 극한까지 테스트하기 위해, 그들은 Rococ라는 도구를 사용하여 수학 정리를 증명하는 AI 에이전트를 구축했습니다. 이는 AI가 증명을 작성하고, 틀렸는지 확인하고, 반복해서 수정해야 하는 매우 어려운 작업입니다. 그들은 "스마트한" 방법(순차 몬테카를로)이 단순히 무작위로 계속 추측하는 것보다 올바른 증명을 찾는 데 훨씬 더 뛰어나다는 것을 발견했습니다. 이 방식은 동시에 여러 경로를 탐색하면서, 가망이 없는 경로를 빠르게 포기할 수 있었습니다.

언급하지 않은 부분 (한계점)

저자들은 이것이 모든 것을 해결하는 "마법의 탄환"이라고 주장하지 않도록 주의를 기울였습니다. 그들은 "점수판(factors)"은 당신이 입력하는 정보만큼만 유효하다는 점을 지적합니다. 만약 당신의 점수판이 형편없다면, 시스템이 마법처럼 이를 고칠 수는 없습니다. 또한, 이 방법이 AI를 더 신뢰할 수 있게 만들어 주기는 하지만, 그렇다고 해서 AI가 갑자기 완벽해진다는 뜻은 아닙니다. 단지 우리가 얼마나 확신할 수 있는지 측정하는 더 나은 방법을 갖게 된 것뿐입니다.

왜 중요한가

이 논문은 AI 워크플로우를 "확률적 프로그램(불확실성을 이해하는 프로그램)"으로 취급함으로써, 매우 복잡하게 만들지 않고도 AI 애플리케이션을 훨씬 더 신뢰할 수 있게 만들 수 있음을 시사합니다. 이는 개발자들에게 "다시 시도하고 또 시도하는" 번거로운 일을 자동으로 처리해 주는 새로운 도구 세트를 제공하여, 컴퓨터가 최선의 답을 찾는 방법을 알아내는 동안 개발자는 멋진 것들을 만드는 데 집중할 수 있게 해주는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →