← 최신 논문
⚛️ phenomenology

LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning

이 논문은 프런티어 대규모 언어 모델들이 제로샷(zero-shot) FORM 작업에 실패함을 입증함으로써 FORM 심볼릭 조작 언어에 대한 AI 지원의 부재를 다루고, 이어서 FORM 바이너리를 오라클로 사용하여 코드 실행 및 정확도 측면에서 훨씬 더 큰 프런티어 모델들을 능가하면서도 일반적인 추론 능력을 보존하는 소형 8B 파라미터 모델을 학습시키기 위한 검증 기반 미세 조정 파이프라인을 소개한다.

원저자: Bakar Chargeishvili

게시일 2026-09-22
📖 3 분 읽기🧠 심층 분석

원저자: Bakar Chargeishvili

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

입자가 충돌하고 찰나의 순간에 붕괴하는 아원자 세계에서, 이론 물리학자들은 자신들의 발견을 수학적으로 기술하기 위해 특화된 언어에 의존한다. 'Form'이라 불리는 이 언어는 일반적인 목적의 프로그래밍 도구가 아니라, 엄청난 복잡성을 가진 대수적 표현을 처리하기 위해 설계된 매우 특수한 시스템이다. 과학자들이 양자장론을 사용하여 입자의 거동을 계산할 때, 결과로 나오는 공식은 수백만 또는 수십억 개의 항을 포함할 수 있다. 일반적인 컴퓨터 프로그램은 이러한 거대한 계산에 직면하면 종종 충돌하여 멈추지만, Form은 계산 과정을 컴퓨터 메모리가 아닌 하드 드라이브에 저장함으로써 이를 관리하도록 구축되었다. 수십 년 동안 이 도구는 우주의 비밀을 밝혀내는 데 필수적이었으나, 배우기가 매우 어렵다. 그 문법은 독특하고 규칙은 가차 없으며, 지금까지는 인간이 이를 위한 코드를 작성하는 것을 도울 수 있는 인공지능이 존재하지 않았다.

이러한 기술적 공백은 카를스루에 공과대학교(Karlsruhe Institute of Technology) 연구진에게 독특한 과제를 안겨주었다. 그들은 근본적인 질문을 던졌다. 방대한 인터넷 데이터를 학습한 현대의 인공지능이, 데이터 속에 거의 존재하지 않는 언어를 위한 코드를 작성하는 법을 배울 수 있을 것인가? 그들이 찾아낸 답은 단호한 '아니오'였다. 수천억 개의 매개변수를 가진 일부 최첨단 거대 AI 모델들을 테스트했을 때, 이 인공지능의 거인들은 완전히 실패했다. 매뉴얼이나 가이드가 없는 상태에서, 그들은 유효한 Form 코드 한 줄조차 생성해내지 못했다. AI에게 이 언어는 사실상 보이지 않는 존재였으며, 모델의 규모가 얼마나 크냐보다는 특정 학습 데이터의 부재가 더 결정적인 제로 리소스 영역이었다.

이를 해결하기 위해 연구진은 다른 접근 방식을 취했다. 거대한 모델이 규칙을 추측하게 하는 대신, 그들은 특화된 소규모 AI를 구축하고 엄격한 자기 수정 방식을 통해 이를 교육했다. 그들은 강력한 AI가 간단한 영어 지시문에 기반하여 후보 프로그램을 생성하되, 이 프로그램들을 즉시 신뢰하지 않는 파이프라인을 만들었다. 대신, 생성된 프로그램들을 실제 Form 소프트웨어에 입력하여 제대로 실행되는지 확인했다. 만약 코드가 오류를 발생시키거나 잘못된 결과를 도출하면 폐기되었다. 구문, 실행, 그리고 논리적 일관성까지 모든 검사를 통과한 프로그램만이 남았다. 이 과정을 통해 기초적인 튜토리얼부터 복잡한 물리학 계산에 이르기까지 4,600개 이상의 검증된 사례가 담긴 라이브러리가 생성되었다.

이 고품질의 검증된 데이터를 사용하여, 연구진은 80억 개의 매개변수를 가진 소형 AI 모델을 미세 조정(fine-tuning)했다. 그 결과, 세계에서 가장 크고 비싼 모델들을 능가하는 전문가가 탄생했다. 664개의 특정 계산 작업 세트에서, 이 작은 특화 모델은 97.7%를 정확하게 해결했다. 반면, 구문 가이드를 읽을 수 있는 상태에서도 가장 거대한 프런티어 모델들은 동일한 작업 중 구문적으로 유효하고 오류 없이 실행되는 코드를 약 75% 정도만 생성했다. 목표는 설명되어 있지만 방법은 명시되지 않은 개방형 작업에서는 그 차이가 더욱 두드러졌는데, 특화 모델은 83%의 확률로 실행 가능한 코드를 생성한 반면, 최고의 거대 모델들은 65%의 성공률을 보였다.

가장 놀라운 점은, 이러한 특화 학습이 AI가 다른 일을 수행하는 능력을 '망각'하게 만들지 않았다는 것이다. 이 모델은 표준적인 수학 및 논리 테스트에서 아주 미미한 성능 저하만을 보이며 일반적인 추론 및 코딩 능력을 유지했다. 이는 AI에게 새로운 틈새 기술을 가르치는 것이 일반 지능을 희생할 필요가 없음을 시사한다. 이 연구는 고도로 전문화된 과학 언어의 경우, 성공의 열쇠가 모델의 규모가 아니라 학습하는 데이터의 품질과 검증에 있다는 것을 보여준다. 소프트웨어 자체를 스승으로 삼아 모든 수업 내용을 검증함으로써, 연구진은 이제 물리학자들이 자연의 근본 법칙을 탐구하는 데 필요한 복잡한 코드를 작성할 수 있도록 돕는 도구를 만들어냈으며, 이를 통해 고에너지 물리학에서 오랫동안 병목 현상이었던 언어의 진입 장벽을 낮추었다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →