BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP
이 논문은 일반적인 벤치마크에서의 에이전트 엔지니어링 성능이 기업용 ERP 컨텍스트로 반드시 전이되지는 않는다는 점을 입증하고 도메인 특화 평가의 결정적인 필요성을 강조하기 위해, Microsoft Dynamics 365 Business Central을 위한 AL 도메인 특화 언어로 구성된 101개의 실제 작업이 포함된 새로운 벤치마크인 BC-Bench를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 소프트웨어의 세계에서 새로운 종류의 노동자가 등장했습니다. 코드를 작성하고, 오류를 수정하며, 스스로 프로그램을 구축할 수 있는 인공지능입니다. 흔히 '코딩 에이전트(coding agents)'라고 불리는 이 시스템들은 인간이 작성한 방대한 지침 라이브러리를 학습했으며, 파이썬(Python)과 같은 범용 프로그래밍 언어에서 놀라운 실력을 보여주었습니다. 이들은 과거 인간 엔지니어들이 해결하는 데 몇 시간이 걸렸던 퍼즐들을 풀어낼 수 있습니다. 하지만 실제 비즈니스 소프트웨어의 세계는 그렇게 단순하지 않습니다. 글로벌 상거래를 실행하는 핵심 인프라 중 상당수는 특정 산업을 위해 설계된 특화된 언어에 의존하며, 이곳에서는 규칙이 다르고, 도구가 독특하며, 이해관계가 매우 높습니다. 그중 하나가 기업이 재고부터 급여까지 모든 것을 관리하는 엔터프라이즈 리소스 플래닝(ERP)의 세계입니다. 여기서 소프트웨어는 마이크로소프트의 비즈니스 센트럴(Business Central) 시스템을 구동하는 데 사용되는 특화된 방언인 AL이라는 언어로 대화합니다. 수년 동안, 이 강력한 AI 에이전트들이 이 복잡하고 독점적인 환경을 탐색할 수 있을지, 아니면 일반적인 코딩에서의 성공이 실제 비즈니스 제약에 직면했을 때 사라지는 현상일지는 불분명했습니다.
이 질문에 답하기 위해, 마이크로소프트의 연구진은 BC-Bench라는 새로운 테스트 환경을 만들었습니다. 그들은 이론적인 퍼즐을 만들어낸 것이 아니라, 실제 비즈니스를 구동하는 두 개의 거대한 소프트웨어 저장소의 실제 살아있는 코드를 파고들었습니다. 이 디지털 아카이브로부터, 연구진은 엔지니어들이 과거에 해결했던 101개의 특정 과업을 신중하게 선정했습니다. 이것들은 가상의 예시가 아니라 실제 문제들이었습니다. 고객 기록이 실패하는 버그, 판매 보고서의 누락된 기능, 또는 오류를 잡아내기 위해 작성되어야 했던 테스트 등이었습니다. 연구진은 세계에서 가장 진보된 여러 AI 에이전트들에게 이 동일한 과업들을 시도하도록 요청했습니다. 에이전트들에게는 때때로 오류 화면 캡처가 포함된 원래의 문제 설명과, 수정 전의 코드 스냅샷이 제공되었습니다. 그들의 목표는 마치 인간 엔지니어처럼 문제를 해결하는 데 필요한 정확한 코드 변경 사항을 작성하는 것이었습니다. 그 후 시스템은 시뮬레이션된 환경에서 소프트웨어를 실행하여, 새로운 코드가 다른 부분을 망가뜨리지 않고 실제로 문제를 해결했는지 확인했습니다.
결과는 AI 모델의 정체성이 그 작업을 수행하기 위해 사용하는 특정 도구보다 훨씬 더 중요하다는 풍경을 드러냈습니다. 연구진이 서로 다른 버전의 에이전트들을 비교했을 때, 그들은 근본적인 '두뇌'인 대규모 언어 모델(LLM)의 선택이 그것을 안내하는 소프트웨어 래퍼(wrapper) 또는 '하네스(harness)'의 선택보다 성공에 훨씬 더 큰 영향을 미친다는 것을 발견했습니다. 예를 들어, 최신 모델 중 하나인 Claude Opus 4.6은 표준 도구와 결합되었을 때 버그 수정 과업의 거의 69%를 해결한 반면, 동일한 모델의 이전 버전은 약 58%만을 해결했습니다. 반대로, 모델은 동일하게 유지하면서 도구 자체를 교체했을 때는 통계적으로 유의미하지 않은 아주 작은 차이만을 보였습니다. 이는 이러한 복잡한 비즈니스 과업에 있어, 성공의 주요 동력은 코드를 사용하는 특정 인터페이스가 아니라 모델의 지능임을 시사합니다.
아마도 가장 놀라운 발견은 일반적인 코딩 테스트에서 보이는 개선이 이 특화된 세계로 자동적으로 전이되지 않는다는 점일 것입니다. 더 넓은 소프트웨어 공학의 세계에서, 새로운 모델들은 종종 이전 모델들에 비해 꾸준하고 예측 가능한 발전을 보여줍니다. 그러나 이 특정 비즈니스 환경에서는, 일반 벤치마크에서 이전 모델을 능가했던 모델이 이곳에서는 동일한 우위를 보여주지 못했습니다. 일반적인 과업에서 크게 향상되었던 한 모델은 이러한 비즈니스 로직 퍼즐에 직면했을 때 자신의 이전 모델보다 더 나은 성능을 보이지 못했습니다. 이는 일반적인 파이썬 스크립트를 수정하는 데 필요한 기술과, 특화된 비즈니스 시스템에서 금융 계산을 수정하는 데 필요한 기술이 서로 다르다는 것을 나타냅니다. 데이터가 어떻게 흐르고 비즈니스 로직이 어떻게 검증되는지에 대한 엄격한 규칙을 가진 특화된 언어의 성격은, 일반적인 학습만으로는 쉽게 극복할 수 없는 장벽을 만듭니다.
연구진은 또한 에이전트들이 실패했을 때 그 이유를 면밀히 살펴보았습니다. 그들은 기계가 소프트웨어를 구축하지 못하거나 코드가 컴파일되지 않아서 실패하는 경우는 드물다는 것을 발견했습니다. 그러한 기술적 장애물은 쉽게 해결되었습니다. 대신, 실패는 거의 항상 문제를 이해하는 데서 발생했습니다. 실패한 시도의 거의 절반에서, 에이전트는 오류와 전혀 상관없는 파일을 편집하며 엉뚱한 코드 부분을 살펴보았습니다. 또 다른 대규모 실패 그룹에서는, 에이전트가 올바른 파일과 올바른 코드 섹션을 찾았음에도 불구하고 여전히 잘못된 로직을 적용하여, 겉보기에는 올바르게 보이지만 실제로는 비즈니스 규칙을 해결하지 못하는 솔루션을 구현했습니다. 예를 들어, 에이전트는 고객의 주문 번호가 누락되었다는 점은 정확히 식별했지만, 정작 잘못된 유형의 번호를 할당하는 코드를 작성하여 시스템을 여전히 고장 난 상태로 남겨두었습니다. 이러한 오류들은 에이전트들이 기업이 운영되는 방식을 정의하는 깊고 상호 연결된 비즈니스 규칙의 그물을 탐색하는 데 어려움을 겪고 있으며, 인간 엔지니어가 즉각적으로 파악할 수 있는 미묘한 맥락을 놓치는 경우가 많음을 시사합니다.
과업의 복잡성 또한 결정적인 역할을 했습니다. 해결책이 단 하나의 파일이나 적은 수의 라인을 변경하는 것을 요구할 때는 에이전트들이 꽤 성공적이었습니다. 그러나 솔루션이 여러 파일을 수정하거나 수십 줄 이상의 코드를 작성해야 하는 경우, 성공률은 급격히 떨어졌습니다. 이 하락은 극적이었는데, 과업이 하나 이상의 파일을 포함할 때 정확도가 20퍼센트 포인트 이상 감소했습니다. 이는 이러한 에이전트들이 작고 고립된 수리는 처리할 수 있지만, 크고 상호 연결된 시스템 전체에 걸쳐 변화를 조율하는 데는 여전히 어려움을 겪고 있음을 보여줍니다. 또한, 비즈니스 영역의 유형도 중요했습니다. 에이전트들은 창고 물류보다 재고 관리의 문제를 해결하는 데 더 성공적이었으며, 이는 그들의 학습 데이터가 특정 비즈니스 도메인에 더 풍부했을 수 있음을 시사합니다.
연구는 인공지능이 일반적인 코딩 분야에서 놀라운 진전을 이루었지만, 특화된 비즈니스 환경에서 완전히 자율적인 엔지니어링으로 가는 길은 아직 명확하지 않다고 결론짓습니다. 도구는 존재하고 모델은 강력하지만, 일반적인 능력과 도메인 특화된 숙련도 사이의 간극은 여전히 넓습니다. 연구진은 앞으로 산업계가 일반적인 테스트에 의존하기보다 이러한 특화된 벤치마크에 집중해야 한다고 강조합니다. 또한 현재의 한계는 단순히 원시적인 지능의 문제가 아니라, 맥락을 이해하고, 복잡한 코드베이스를 탐색하며, 올-바른 비즈니스 로직을 적용하는 능력에 관한 것이라고 지적합니다. 이러한 시스템이 진화함에 따라, 그들이 일반 프로그래밍에서 보여주는 것과 같은 용이함으로 비즈니스 소프트웨어의 복잡한 규칙을 탐색할 수 있게 되기를 희망하지만, 현재로서는 인간 엔지니어가 현실 세계의 복잡성을 헤쳐나가는 데 필수적인 존재로 남아 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.