← 최신 논문
🤖 AI

An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS

이 논문은 인간의 감독 하에 프롬프트에 특화된 세 가지 AI 에이전트와 엄격한 비트 단위 검증 오라클을 활용하여, GAMESS 양자 화학 패키지의 레거시 Fortran 77 코드 56,448행을 Fortran 2008로 성공적으로 현대화하고 612회의 테스트 실행에서 완벽한 검증을 달성한 에이전트 워크플로를 제시한다.

원저자: Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

슈퍼컴퓨터의 세계를 가장 중요한 책들이 포트란(Fortran)이라는 언어로 쓰여 있는 거대하고 오래된 도서관이라고 상상해 보십시오. 수십 년 동안 과학자들은 원자들이 어떻게 서로 결합하는지, 새로운 약물이 어떻게 작용할지, 그리고 날씨가 어떻게 변할지를 예측하기 위해 이 책들을 사용해 왔습니다. 하지만 이 책들 중 상당수는 전문가 몇 명만이 읽을 수 있는 누런 종이 위의 손글씨 메모처럼 구식 스타일로 작성되어 있습니다. 이러한 "구식 스타일"은 초고속 그래픽 카드나 새로운 유형의 프로세서와 같은 현대적인 도구를 사용하여 문제를 더 빠르게 해결하는 것을 어렵게 만듭니다. 과학자들이 직면한 큰 질문은 이것입니다: 수학 내부의 단 한 글자도 바꾸지 않고 이 고대의 책들을 현대적이고 읽기 쉬운 형식으로 다시 쓸 수 있을 것인가? 만약 계산 과정에서 단 하나의 작은 숫자라도 바꾼다면, 전체 예측이 틀려질 수 있으며, 이는 몇 년 후 실패한 실험이나 잘못된 과학적 발견으로 이어질 수 있습니다.

이 논문은 한 팀이 AI 에이전트라고 불리는 새로운 종류의 "디지털 조수"를 사용하여 이 문제를 해결하려고 시도한 이야기를 들려줍니다. 사람이 직접 수백만 줄의 코드를 다시 쓰는 대신, 그들은 AI 로봇 팀을 구성하여 힘든 일을 맡겼습니다. 이 로봇들은 단순히 단어를 무작정 바꾸는 것이 아니라, 엄격한 규칙과 완벽한 정밀도로 작업을 확인할 수 있는 "진실 탐지기"를 부여받았습니다. 연구팀은 전자들이 서로를 어떻게 밀어내는지 계산하는 GAMESS라는 유명한 화학 소프트웨어 패키지의 특정하고 중요한 부분에 집중했습니다. 그들은 물었습니다: 이 거대하고 위험한 재작성 작업 중 얼마나 많은 부분을 안전하게 AI에게 넘겨줄 수 있으며, 어디에서 여전히 인간의 검토가 필요한가?

로봇 재작성가들의 이야기

연구진은 세 가지 서로 다른 "로봇 역할"이 협력하며, 로봇들이 스스로 작성하고 업데이트하는 규칙서의 안내를 받는 영리한 시스템을 구축했습니다. 이것은 마치 한 명의 로봇은 시공업자(Builder), 다른 하나는 검사관(Inspector), 세 번째는 설계자(Architect) 역할을 하는 건설 현장과 같습니다.

  1. 시공업자: 이 로봇은 오래되고 지저분한 코드(Fortlet 77 스타일로 작성됨)를 가져와 현대적인 스타일(Fortran 2008)로 다시 썼습니다. 이 로봇은 수학을 바꾸는 것이 아니라, 단지 명령어가 작성되는 방식만을 바꾸는 데 주의를 기울여야 했습니다.
  2. 검사관: 이 로봇은 새로운 코드를 일련의 테스트 과정을 통해 검증했습니다. 이 로봇은 아주 미세한 차이라도 찾아내기 위해 새 코드의 결과와 기존 코드의 결과를 비교했습니다.
  3. 설계자: 이 로봇은 새로운 코드가 모든 스타일 규칙을 따르는지 확인했습니다. 예를 들어, 반드시 필요한 경우가 아니라면 오래된 방식인 "Go To" 점프 명령이 남아 있지 않은지 확인하는 식입니다.

가장 흥격적인 부분은 이 로봇들이 스스로 실수를 바로잡을 수 있었다는 점입니다. 문제가 발견되었을 때, 그들은 단순히 멈추는 것이 아니라, 똑같은 실수를 반복하지 않도록 규칙서에 새로운 규칙을 추가했습니다.

결과: 완벽한 점수

연구팀은 매우 어려운 목표를 선택했습니다: 56,448줄의 코드225개의 서브루틴을 포함하는 12개의 소스 파일입니다. 이것은 양자 화학을 위한 핵심적인 역할을 수행하는 GAMESS 소프트웨어의 "엔진" 부분입니다.

결과는 놀라울 정도로 성공적이었습니다. AI 에이전트들은 12개의 파일을 모두 재작성하는 데 성공했습니다. 테스트를 실행했을 때, 새 코드는 기존 코드와 비트 단위까지 동일한(bit-for-bit identical) 결과를 생성했습니다. 이는 만약 기존 코드가 에너지 레벨을 12.3456789012로 계산했다면, 새 코드 역시 정확히 12.3456789012로 계산했음을 의미합니다. 과학의 세계에서 소수점 열두 번째 자리의 차이는 실패로 간주되지만, 여기서는 그 차이가 제로였습니다.

612번의 테스트 실행 중, 화학적으로 유의미한 차이는 단 한 건도 없었습니다. 로봇들은 GAMESS 커뮤니티에서 사용하는 표준 49개 테스트와 팀이 추가한 2개의 테스트를 포함한 모든 테스트를 통과했습니다.

단 하나의 결함과 인간 안전망

하지만 이 이야기는 로봇이 완벽하다는 것에 관한 것이 아니라, 로봇이 인간과 어떻게 협력하는지에 관한 것입니다. 로봇들은 한 가지 특정한 종류의 실수를 저질렀습니다. 그들은 숫자들이 특정 방식으로 빽빽하게 모여 있는 까다로운 코드 조각을 만났습니다. 로봇들은 코드를 충실히 번역했지만, 원래의 코드가 매우 특정한 극한 상황에서만 나타나는 숨겨진 결함을 가지고 있다는 사실을 깨닫지 못했습니다. 로봇들은 규칙을 매우 엄격하게 따랐기 때문에, 그 결함까지 함께 복사해 버린 것입니다.

여기서 인간 안전망이 등장했습니다. 팀은 로봇들이 인간의 승인을 받기 전까지는 작업을 병합할 수 없다는 엄격한 규칙을 세웠습니다. 테스트가 실행되었을 때, 이 하나의 오류가 포착되었습니다. 로봇들은 (마치 용의자 목록을 좁혀가는 탐정처럼) "이분법(bisection)"이라는 영리한 기법을 사용하여 정확히 어느 줄이 잘못되었는지 찾아냈습니다. 그들은 이를 수정했고, 이후 어떤 미래의 로봇도 같은 실수를 하지 않도록 규칙서에 새로운 규칙을 작성했습니다.

이 논문은 로봇이 거의 모든 작업(코드 읽기, 재작성, 테스트, 심지어 자체 버그 수정까지)을 수행할 수 있지만, 결과가 수용 가능한지에 대한 최종 판단에는 여전히 인간이 필요하다는 것을 보여줍니다. 로봇은 양적인 부분을 처리했고, 인간은 판단력을 제공했습니다.

이것이 중요한 이유

이 연구는 우리가 거대한 고대 과학 코드베이스를 망가뜨리지 않고도 AI를 사용하여 현대화할 수 있음을 증证明합니다. 핵심은 단지 똑똑한 AI를 갖는 것이 아니라, 아주 미세한 오류까지 잡아낼 수 있는 엄격한 검증 시스템(즉, "진실 탐지기")을 갖추는 것이었습니다. 과학자들이 알려진 정확한 값과 비교할 수 있는 완벽한 확인 방법(골드 스탠다드)을 가지고 있었기 때문에, 그들은 로봇이 작업을 수행하도록 신뢰할 수 있었습니다.

이 논문은 이 접근 방식이 다른 대규모 과학 프로젝트에도 사용될 수 있음을 시사하지만, 또한 결과를 완벽하게 확인할 방법이 있을 때만 가능하다는 경고도 덧붙입니다. 만약 비교할 "골드 스탠다드"가 없다면, 로봇이 수학적 내용을 변경하지 않았다고 확신할 수 없습니다. 이 사례에서 로봇은 힘든 일을 처리했고, 인간은 안전망을 제공했으며, 두 주체는 함께 단 하나의 숫자도 놓치지 않고 과학적 역사의 한 조각을 성공적으로 업데이트했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →