← 최신 논문
💻 computer science

Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling

이 논문은 지속적인 엔지니어링 상태를 유지하고 시뮬레이션 증거를 Modelica의 물리 시스템 모델링을 위한 특정 후보와 연결하도록 설계된 에이전트 하네스인 Pufibara를 소개하며, 새로운 232개 태스크 벤치마크를 통해 Claude Code 대비 우수한 작업 성공률과 현저히 감소된 리소스 소비를 입증한다.

원저자: Zizhe Wang

게시일 2026-08-26
📖 6 분 읽기🧠 심층 분석

원저자: Zizhe Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

공학의 세계에서 교량, 전력망 또는 난방 시스템을 구축하는 것은 단순히 컴퓨터가 읽을 수 있는 코드를 작성하는 것 이상의 작업입니다. 그것은 디지털 모델이 그것이 나타내는 실제 물리적 대상과 정확히 똑같이 작동할 것을 요구합니다. 수십 년 동안 엔지니어들은 이러한 복잡한 시스템을 설명하기 위해 Modelica라고 불리는 특화된 언어를 사용해 왔습니다. 위에서 아래로 흐르는 엄격한 명령 목록을 따르는 표준 프로그래밍과 달리, Modelica는 압력이 유량과 어떻게 관계되는지, 또는 전압이 전류와 어떻게 관계되는지와 같이 양 사이의 관계를 기술함으로써 작동합니다. 그러면 컴퓨터는 이 관계들을 해결하기 위한 연산 순서를 찾아냅니다. 이러한 유연성은 강력하지만, 인공지능에게는 독특한 문제를 야기합니다. AI는 겉보기에 올바르고 심지어 오류 없이 실행되는 Modelica 코드를 쉽게 작성할 수 있지만, 여전히 물리 법칙을 위반하거나 프로젝트의 특정 요구 사항을 충족하지 못하는 물리 시스템을 기술할 수 있습니다. 기계는 구문의 규칙은 따랐지만, 공학의 본질은 놓친 것입니다.

단순히 작동하는 모델과 진정으로 올바른 모델 사이의 이 간극은 드레스덴 공과대학교(TU Dresden) 연구진의 새로운 연구가 다루는 핵심 과제입니다. 왕쯔처(Wang Zizhe)가 이끄는 연구팀은 사고하고, 행동하며, 도구를 사용할 수 있는 프로그램인 AI 에이전트가 스스로 이러한 물리적 시스템 모델을 수정, 구축 및 조정하는 것을 신뢰할 수 있는지 확인하고자 했습니다. 그들은 현재의 AI 도구들이 코드를 생성할 수는 있지만, 모델에 변경을 가할 때 원래의 공학적 목표를 놓치거나 더 이상 적용되지 않는 이전 버전의 모델로부터 얻은 테스트 결과에 의존하는 경우가 많다는 것을 발견했습니다. 이를 해결하기 위해 연구진은 Pufibara라는 새로운 시스템을 구축했습니다. 이 시스템은 프로젝트의 요구 사항을 영구적으로 기록하여, AI가 모델을 변경할 때마다 새로운 버전을 원래의 목표와 다시 대조하도록 보장하는 엄격한 감독관 역할을 합니다. 그들은 이 시스템을 방대한 232개의 다양한 공학 작업 컬렉션을 사용하여 선도적인 상용 AI 코딩 도구와 비교 테스트했습니다. 결과는 새로운 시스템이 더 많은 문제를 해결했을 뿐만 아니라 훨씬 적은 컴퓨팅 자원을 사용하여 해결했음을 보여주었으며, 이는 AI가 어떻게 안내되느냐가 그것이 사용하는 지능만큼 중요하다는 것을 증명합니다.

연구진은 물리적 공학이 일반적인 컴퓨터 프로그램을 작성하는 것과 다르다는 점을 인식함으로써 이 문제에 접근했습니다. 전형적인 소프트웨어 프로젝트에서는 프로그램이 오류 없이 실행되면 종종 성공한 것으로 간주됩니다. 물리적 모델링에서는 모델이 완벽하게 실행되더라도 틀릴 수 있습니다. 예를 들어, AI가 워터 펌프 모델을 생성하여 컴파일되고 시뮬레이션이 매끄럽게 진행될 수 있지만, 만약 그 모델이 펌프 없이 물이 위로 흐른다고 예측한다면, 그것은 공학적 테스트에서 실패한 것입니다. 핵심적인 어려움은 작업의 반복적인 성격에 있습니다. AI 에이전트가 모델을 수정하려고 시도할 때, 매개변수를 변경하고, 시뮬레이션을 실행하고, 결과를 보고, 다시 다른 매개변수를 변경할 수 있습니다. 세심한 메모리 시스템이 없다면, 에이전트는 첫 번째 변경이 왜 필요했는지 잊어버리거나, 이전 버전의 모델에서 나온 시뮬레이션 결과가 새 모델에도 여전히 적용된다고 잘못 믿을 수 있습니다. 이러한 혼란은 에이전트가 겉보기에는 좋아 보이지만 특정 물리적 요구 사항을 충족하지 못하는 최종 모델을 제출하게 만들 수 있습니다.

이를 방지하기 위해 연구진은 공학적 요구 사항을 지속적인 의무로 취급하는 특정 아키텍처를 갖춘 Pufibara를 설계했습니다. 건축가가 강철의 강도부터 공기의 흐름까지 건물이 따라야 하는 모든 규칙의 체크리스트를 보관하는 프로젝트 매니저를 상상해 보십시오. 건축가가 변경을 가할 때마다 매니저는 현재의 설계와 일치하지 않는 오래된 테스트 결과는 무시하고, 동일한 체크리스트를 기준으로 새 설계를 확인합니다. Pufibara는 AI 에이전트를 위해 정확히 이 작업을 수행합니다. 이 시스템은 전체 과정 동안 활성화되어 있는 공학적 요구 사항의 "원장(ledger)"을 유지합니다. 이는 모든 시뮬레이션 결과를 해당 결과를 생성한 특정 모델 버전에 직접 연결합니다. 모델이 변경되면 시스템은 이전 결과가 더 이상 유효하지 않음을 알고 에이전트가 새 버전을 재평가하도록 강제합니다. 결정적으로, 시스템은 에이전트가 최종 답변을 제출하기 위해 명시적인 결정을 내릴 것을 요구합니다. AI는 단순히 시간이 다 되었거나 코드가 컴파일되었다고 해서 멈출 수 없습니다. 모델이 모든 공학적 규칙을 충족한다는 증거를 충분히 수집했음을 입증하기 위해 능동적으로 선언해야 합니다.

이 접근 방식이 실제로 작동하는지 테스트하기 위해 연구진은 성능을 측정할 공정하고 현실적인 방법이 필요했습니다. AI가 훈련 과정에서 이미 보았을 가능성이 있는 기존의 공개 모델을 단순히 사용할 수는 없었습니다. 대신, 그들은 Modelica Agent Workflow Benchmark라는 새로운 벤치마크를 만들었습니다. 그들은 실제 작동하는 공학 모델에서 시작하여, 특정 결함, 새로운 설계 요구 사항 또는 튜닝 목표를 도입하여 232개의 고유한 과제를 생성했습니다. 이 작업들은 고장 난 모델을 수정하는 것부터 시작하여 새로운 모델을 처음부터 구축하고, 특정 성능 목표를 달eric 위해 매개변수를 조정하는 것에 이르기까지 다양했습니다. 벤치마크에는 독립적인 심판 역할을 하는 숨겨진 "평가자(evaluator)"가 포함되었습니다. 이 심판은 AI의 내부 사고 과정이나 중간 단계를 보지 않고, 오직 에이전트가 제출한 최종 모델만을 보고 그것이 엄격한 물리적 및 행동 테스트를 통과하는지 확인했습니다. 이를 통해 AI가 문제를 해결하는 능력에 대해 테스트되는 것이지, 테스트가 어떻게 생겼는지 추측하는 능력에 대해 테스트되는 것이 아님을 보장했습니다.

연구는 새로운 Pufibata 시스템을 두 가지 서로 다른 대규모 언어 모델을 "두뇌"로 사용하는 유명 상용 AI 코딩 어시스턴트인 Claude Code와 비교했습니다. 결과는 명확하고 일관되었습니다. 232개의 모든 작업에 걸쳐, Pufibara는 상용 도구보다 더 많은 문제를 성공적으로 완료했습니다. 특정 AI 두뇌를 사용할 때, Pufibara는 202개의 문제를 해결한 반면 다른 도구는 185개를 해결했습니다. 다른 AI 두뇌를 사용했을 때도 Pufibara는 202개, 경쟁사는 187개를 해결했습니다. 차이는 모델을 처음부터 구축해야 하는 작업에서 가장 두드러졌는데, 여기서 Pufibara는 다른 시스템보다 현저히 더 많은 문제를 해결했습니다. 더 많은 문제를 해결하는 것을 넘어, Pufibara는 훨씬 더 효율적이었습니다. Pufibata는 약 76%에서 82% 더 적은 컴퓨팅 토큰(AI가 처리하는 기본 정보 단위)을 사용했으며, 일부 실행에서는 경쟁사보다 최대 58% 적은 시간을 소요하며 작업을 훨씬 빠르게 완료했습니다.

아마도 가장 중요한 발견은 Pufibara가 단순히 더 많은 문제를 해결했다는 것이 아니라, 올바른 종류의 문제를 해결했다는 점일 것입니다. 연구진은 경쟁 도구가 실행 가능하고 기본적인 검사를 통과하지만 더 깊은 물리적 요구 사항은 충족하지 못하는 모델을 자주 생성한다는 것을 발견했습니다. 어려운 작업 세트에서, 상용 도구는 오류 없이 실행되지만 공학 규칙에 따라 올바르게 작동하지 않는 모델을 38개 중 21개 사례에서 제출했습니다. Pufibara는 이 실수를 단 4번만 저질렀습니다. 이는 상용 도구가 단순히 작동하기만 하면 만족하는 경 경향이 있는 반면, 증거를 현재 버전의 모델과 연결하고 모든 공학적 의무를 검증하도록 강제하는 Pufibara의 엄격한 요구 사항이 결함이 있는 솔루션을 제출하는 것을 방지했음을 시사합니다. 이 연구는 AI의 워크플로 구조, 즉 그것이 기억하고, 확인하고, 결정하는 방식이 언어 모델 자체의 지능만큼 중요하다는 것을 보여줍니다.

이 연구의 함의는 단 하나의 공학 언어에만 국한되지 않습니다. 이 연구는 AI가 물리 및 공학과 같은 복잡한 실제 분야에서 진정으로 유용해지려면 단순한 코드 생성기가 되어서는 안 된다는 점을 입증합니다. 그것은 프로그램이 실행되는 것과 시스템이 물리적으로 올바른 것 사이의 차이를 이해하는 에이전트가 되어야 합니다. 요구 사항에 대한 지속적인 기록을 유지하고 모델을 변경할 때마다 해당 요구 사항에 대해 작업을 재검증하도록 강제함으로써, 시스템은 최종 출력이 신뢰할 수 있음을 보장합니다. 연구진은 자신들의 결과가 강력하지만, 테스트된 작업과 조건에 국한된다고 언급했습니다. 그들은 AI의 공학 문제를 영원히 해결했다고 주장하는 것이 아니라, AI가 위험한 실수를 저지를 가능성을 낮추는 방법을 구축하는 명확한 청사진을 제공한 것입니다. 분야가 발전함에 따라, 초점은 아마도 이러한 방법들을 더욱 복합적인 산업 문제에 테스트하고 다양한 유형의 AI 모델과 어떻게 작동하는지 탐구하여, 미래의 도구들이 그것들이 설계된 시스템만큼 신뢰할 수 있도록 하는 데 맞춰질 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →