← 최신 논문
⚛️ phenomenology

BootLoops: an LLM-driven toolkit for exact quantitative science

BootLoops는 에이전트 모델이 파인만 적분, 베이지안 증거, 구성 열거와 같은 엄밀한 정량적 분석을 다양한 과학 분야에서 보장된 정밀도로 수행할 수 있도록 물리학, 수학, 컴퓨터 과학의 고급 정밀 계산 방법론을 통합한 LLM 기반 툴킷입니다.

원저자: Matthew D. Schwartz

게시일 2026-10-05
📖 5 분 읽기🧠 심층 분석

원저자: Matthew D. Schwartz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

과학적 계산의 역사 대부분 동안, 인간은 프로그램이 무엇을 하는지 정확히 알고 프로그램을 작성했으며, 그 후 컴퓨터가 이를 수행했습니다. 이후 패러다임이 변화했습니다. 인간이 구조를 지정하면, 컴퓨터가 데이터에 적합한 신경망을 맞추고, 인간은 그 결과를 해석하는 방식입니다. 이제 새로운 변화가 일어나고 있습니다. 준자율적 에이전트로서 역할을 하는 대규모 언어 모델이 프로그램을 설계하고 작성하며, 실행하고, 스스로 결과를 검토하고 해석할 수 있게 된 것입니다. 이러한 시스템의 잠재력은 무한해 보이지만, 핵심적인 질문이 남아 있습니다. 어떻게 하면 인간이 이러한 에이전트를 사용하여 생산성을 극대화할 수 있는가 하는 점입니다. 그 답은 서로 떨어진 분야들을 연결하는 데 있습니다. 입자 물리학에서 개발된 방법론이 생태학의 문제를 해결할 수도 있고, 수치 해석의 도구가 공중 보건의 규제 임계치를 명확히 할 수도 있지만, 두 측면을 모두 잘 아는 사람은 거의 없습니다. 모든 것을 읽은 대규모 언어 모델은 양쪽 모두를 알고 있습니다.

본 논문은 이러한 지식의 폭을 활용하기 위해 설계된 툴킷인 BootLoops를 소개합니다. 이는 언어 모델이 운영하고 확장하여 정확하고 정량적인 과학을 수행할 수 있는 특화된 컴퓨터 프로그램들의 모음입니다. 이 툴킷은 콜라이더 물리학, 실험 수학, 그리고 컴퓨터 대수학의 방법들을 결합하여, 보통 근사치로 추정되거나 반올림 오차를 숨기는 부동 소수점으로 계산되는 문제들을 해결합니다. 추측하거나 추정하는 대신, BootLoops는 모델이 답을 정확한 유리수로 계산하고, 솔루션의 존재 여부를 증명하며, 보장된 오차 범위 내에서 계산을 수행할 수 있게 합니다. 목표는 인간 과학자를 대체하는 것이 아니라, 한 분야의 도구를 사용하여 다른 분야의 문제를 해결할 수 있는 방법을 제공함으로써, 인간이 연결하기 어려운 연결 고리들을 일상적인 작업으로 바꾸는 것입니다.

핵심 작업은 루프 내에서 실행되며, 프로그램 실행 명령을 내리고 그 출력을 읽는 대규모 언파 모델을 포함합니다. 어려운 계산에 직면했을 때, 모델은 단계를 계획하고, 툴킷에서 적절한 도구를 선택하여 실행합니다. 만약 도구가 없다면, 모델은 새로운 루틴을 작성하고, 테스트하고, 컬렉션에 추가합니다. 프로그램 자체는 모든 숫자와 기호를 계산하며, 모델은 절대로 숫자를 추측하지 않습니다. 툴킷은 서로 다른 문제들에 걸쳐 지속되며, 새로운 방법이 추가됨에 따라 성장합니다. 여기에는 복잡한 적분을 유한한 기저로 축소하고, 미분 방정식을 풀며, 고정밀 숫자에 정확한 상수를 맞추는 프로그램들이 포함됩니다. 이 중 일부는 물리학과 수학에서 채택된 공개 코드이며, 다른 것들은 이 프로젝트를 위해 처음부터 작성되었습니다. 총 약 100개의 새로운 프로그램이 이 논문에 기술된 계산을 처리하기 위해 작성되었습니다.

BootLoops의 첫 번째 주요 응용 분야는 입자들이 어떻게 산란하고 상호작용하는지를 설명하는 페인만 적분(Feynman integrals)의 계산입니다. 수십 년 동안 물리학자들은 직접 적분을 하거나 점 단위로 추정함으로써 이를 계산해 왔습니다. BootLoops는 '부트스트랩(bootstrap)'이라 불리는 방법을 사용하여 다른 접근 방식을 취합니다. 모델은 먼저 문제에 의해 정의된 기하학적 형태를 식별하는데, 이는 단순한 구(sphere), 타원 곡선(elliptic curve), 또는 칼라비-야우 다양체(Calabi-Yau manifold)라고 알려진 복잡한 형태일 수 있습니다. 이 기하학적 구조는 답을 기술할 수 있는 함수의 유형을 결정합니다. 그런 다음 모델은 미지의 계수를 가진 일반 공식을 구축하고, 고정밀 수치 샘플을 사용하여 이 계수들을 맞춥니다. 결과는 숫자의 목록이 아니라, 정밀한 수학적 표현식인 폐형식(closed-form) 답안입니다. 저자는 단순한 1-루프 다이어그램부터 복잡한 4-루프 구조에 이르기까지 30개의 이러한 적분을 계산했습니다. 이 중 15개는 문헌에 알려진 것이며, 나머지 15개는 이전에 계산된 바 없는 새로운 것이었습니다. 각 결과는 30자리 이상의 정밀도로 독립적인 수치 평가와 대조되어 검증되었으며, 이를 통해 모델의 직관에 의존하지 않고도 답이 정확함을 보장했습니다.

두 번째 응용 사례는 이러한 물리학 도구들이 어떻게 생물학 및 통계학 문제를 해결하는지를 보여줍니다. 진화 생물학과 같은 분야에서 과학자들은 어떤 종의 가계도가 DNA 데이터를 가장 잘 설명하는지 비교합니다. 이를 위해서는 특정 가계도 하에서의 데이터 확률을 나타내는 수치인 '베이지안 증거(Bayesian evidence)'를 계산해야 합니다. 전통적으로 이는 몬테카를로 방법을 사용하여 추정되는데, 이는 속도가 느리고 자체적인 추정 오차를 동반합니다. BootLoops는 이러한 생물학적 증거 적분의 수학이 페인만 적분의 수학과 동일하다는 점을 인식합니다. 동일한 축소 및 피팅 기술을 적용함으로써, 툴킷은 이러한 증거들을 정확한 유리수로 계산합니다. 단순한 경우, 답은 정밀한 분수 형태입니다. 더 복잡한 경우, 실제 값을 포함하는 보장된 범위를 제공합니다. 이를 통해 과학자들은 이전에는 부동 소수점 추정치로는 불가능했던, 절대적인 확신을 가지고 가계를 비교할 수 있습니다. 동일한 접근 방식이 혼합 모델(mixture models), 집단 유전학, 그리고 단일 세포 생물학에 적용되어, 대개 노이즈가 많은 시뮬레이션에 의존하는 문제들에 대해 정확한 답을 제공합니다.

세 번째 능력은 완결성의 증명을 동반한 전수 조사(exhaustive search) 수행 능력입니다. 많은 과학적 질문에서 답은 가능한 모든 경우를 확인하거나, 특정 종류의 사례가 존재하지 않음을 증명하는 것에 달려 있습니다. BootLoops는 끈 이론에서의 플럭스 배치나 품질 등급을 위한 데이터 그룹화의 최적 방법과 같이, 유한한 공간 내의 모든 구성을 열거할 수 있습니다. 모델은 아무것도 놓치지 않았다는 엄격한 증명과 함께 이를 수행합니다. 만약 탐색이 솔루션을 찾으면 전체 목록을 반환합니다. 만 만약 솔루션을 찾지 못하면, 그러한 객체가 존재하지 않음을 증명하는 정리를 제공합니다. 예를 들어, 툴킷은 무작위 보행(random walks)에 관한 유명한 수학 문제인 왓슨 적분(Watson integral)을 분석하는 데 사용되었습니다. 가능한 폐형식 해의 클래스를 전수 조사함으로써, 모델은 일반적인 경우에 대해 그러한 폐형식이 존재하지 않음을 증명했으며, 이는 수십 년간 미해결 과제로 남아 있던 결과였습니다. 이는 휴리스틱하거나 불완전할 수 있는 탐색을 수학적 확실성으로 변모시킵러다.

마지막으로, 툴킷은 표준 계산에서의 반올림 오차 문제를 다룹니다. 컴퓨터가 부동 소수점 산술을 사용할 때, 미세한 오차가 누적되어 특히 긴 계산 체인에서 잘못된 답을 초래할 수 있습니다. BootLoops는 모든 숫자를 보장된 반지름을 가진 중간값으로 취급하는 '볼 산술(ball arithmetic)'을 사용하여, 실제 값이 항상 범위 내에 있도록 보장합니다. 계산이 진행됨에 따라 이 반지름은 커지거나 작아집니다. 만약 오차가 유용할 만큼 커지면, 시스템은 잘못된 답을 주는 대신 답을 제공하기를 거부합니다. 이 방법은 발표된 수치들, 예를 들어 대기 질 규제 임계치나 의료 등급 등을 감사하는 데 사용되었습니다. 한 사례에서, 툴킷은 미국 오존 기준에 대한 계산을 정확한 산술로 재현하였고, 발표된 결과가 숫자가 어떻게 절삭되었는지에 따라 달라졌음을 발견했는데, 이는 부동 소수점 산술이 가려왔던 세부 사항이었습니다. 또 다른 사례에서는 메디케어(Medicare) 스타 등급의 정확한 값을 검증하여, 발표된 컷 포인트(cut points)가 실제로 최적임을 증명했습니다.

본 논문은 에이전트형 인공지능의 진정한 힘은 서로 다른 분야의 지식을 결합하는 능력에 있다고 결론짓습니다. BootLoops는 이러한 방법론들을 하나의 확장 가능한 툴킷으로 모으려는 첫 번째 시도입니다. 이는 단일 방향으로 인간 지식의 경계를 넓히는 것이 아니라, 기존 분야들 사이의 간극을 메우는 것입니다. 툴킷은 오픈 소스이며, 과학자들이 새로운 방법론을 발견함에 따라 성장하도록 설계되었습니다. 저자는 모델이 코드를 작성하고 도구를 실행하지만, 결과는 모델의 판단이 아닌 프로그램의 결정론적 실행에 기반한다는 점을 강조합니다. 이 연구는 콜라이더 물리학의 축소 알고리즘, 통계학의 증거 적분, 그리고 수치 해석의 엄격한 경계치를 결합함으로써, 이전에는 도달할 수 없었던 수준의 정밀도와 확실성으로 오래된 문제들을 해결할 수 있음을 보여줍니다. 툴킷과 그 문서들은 누구나 사용하고 확장할 수 있도록 공개되어 있으며, 이는 인간 과학 지식의 볼록 껍질(convex hull)이 완전히 탐구되는 미래를 향한 한 걸음을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →