StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
StarHarness는 모델 가중치를 고정한 상태에서 층화 탐색을 통해 환경 특화형 하네스를 진화시킴으로써 엔터프라이즈 환경에서 에이전트 성능을 대폭 향상시키는 프레임워크로, 벤치마크 점수와 다양한 모델 제품군에 대한 일반화 성능에서 상당한 이득을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 컴퓨팅의 세계에는 단순한 명령을 따르는 도구를 넘어, 인간 직원처럼 복잡한 문제를 해결하기 위해 추론하고 정보를 살펴보고 행동을 취하도록 설계된 '에이전트'라고 불리는 지능형 프로그램이라는 새로운 계층이 성장하고 있습니다. 이 에이전트가 기능을 수행하려면 두 가지 뚜렷한 부분이 필요합니다. 첫 번째는 추론과 지식을 제공하는 '두뇌'인 거대 언어 모델입니다. 두 번째는 에이전트의 손, 눈, 귀 역할을 하는 '하네스(harness)'입니다. 하네스는 에이전트가 세상을 어떻게 보는지, 어떤 도구를 사용할 수 있는지, 그리고 자신의 작업을 어떻게 검증할지를 정의합니다. 수년 동안 과학자들은 거의 전적으로 두뇌를 더 크고 똑똑하게 만드는 데 집중해 왔습니다. 그러나 규칙이 엄격한 비즈니스 환경이라는 현실 속에서는, 아무리 뛰어난 두뇌를 가졌더라도 손이 서투르거나 자신이 일하는 사무실의 특정 규칙을 이해하지 못한다면 실패할 수 있습니다. 이는 실질적인 질문을 던집니다. 만약 우리가 두뇌를 바꿀 수 없다면, 에이전트를 더 잘 작동하게 만들기 위해 손과 규칙을 개선할 수는 없을까요?
ServiceNow의 연구진은 학술 기관의 협력자들과 함께 'StarHarness'라는 새로운 프레임워크를 통해 이 질문에 답하고자 했습니다. 그들은 IT 시스템, 재무 워크플로우, 고객 서비스 기록 등을 관리해야 하는 엔터프라이즈 환경에서 발견되는 특정 과제에 집중했습니다. 이러한 환경에서 소프트웨어는 엄격하고 종종 숨겨진 규칙을 가진 데이터베이스 및 도구와 상호작용해야 합니다. 연구진은 근본적인 두뇌를 전혀 건드리지 않고도 에이전트의 하네스를 자동으로 개선할 수 있는지 확인하고 싶었습니다. 그들은 하네스를 시행착오를 통해 진화시키거나 개선할 수 있는 하나의 코드 조각으로 취급했습니다. 목표는 모델의 내부 가중치를 완전히 고정한 상태에서, 에이츠가 작업을 구성하고, 도구를 사용하며, 결과를 검증하는 더 나은 방법을 찾는 것이었습니다.
이 아이디어를 테스트하기 위해 연구진은 통제된 방식으로 개선 사항을 검색할 수 있는 시스템을 구축했습니다. 먼저 에이전트가 일반적으로 어디에서 실패하는지 확인하기 위해 대규모 작업 세트에 에이전트를 실행했습니다. 그런 다음 이 작업들을 세 그룹으로 나누었습니다. 한 그룹은 변경 사항을 제안하는 데 사용되었고, 다른 한 그룹은 변경 사항이 실제로 효과가 있는지 테스트하기 위해 숨겨두었으며, 세 번째 그룹은 최종적이고 편향되지 않은 검증을 위해 저장되었습니다. 시스템은 도구를 호출하는 방식을 수정하거나 흔한 실수를 방 prevent하기 위한 규칙을 추가하는 등 하네스에 대한 작은 변화를 제안했습니다. 그런 다음 이 변화를 숨겨진 그룹에 대해 테스트했습니다. 만약 그 변화가 에이전트의 성능을 향상시킨다면 시스템은 이를 유지했고, 그렇지 않다면 폐기했습니다. 이 과정이 반복되면서 하네스는 점진적으로 더 유능한 버전으로 진화했습니다. 연구진은 이 방법을 컴퓨터 네트워크 장애 분석, IT 서비스 요청 관리, 재무 워크플로우 처리라는 세 가지 서로 다른 유형의 비즈니스 과제에 걸쳐 사용했습니다.
결과는 놀라웠습니다. 시스템이 단 몇 번의 수락된 변경 사항(일반적으로 환경당 4회에서 12회 사이의 조정)만을 거친 후에도 에이전트의 성능이 크게 뛰어올랐습니다. 벤치마크 전반에 걸쳐, 전체 벤치마크 성능은 기본 하네스보다 20~35%포인트 향상되었습니다. 구체적으로, 성공률은 네트워크 분석 작업에서 35%포인트, IT 서비스 관리 테스트에서 20%포인트, 재무 워크플로우에서 26%포인트 상승했습니다. 결정적으로, 이러한 개선은 시스템이 학습 과정에서 본 특정 문제들을 단순히 암기한 결과가 아니었습니다. 연구진이 진화된 하네스를 새로운 미지의 작업에 테스트했을 때도, 에이전트는 이전보다 훨씬 더 우수한 성능을 보였습니다. 더욱 놀라운 점은 이러한 개선 효과가 서로 다른 유형의 AI 모델로도 전이되었다는 것입니다. 특정 모델 제품군을 사용하여 진화된 하네스는 추가적인 훈련이나 조정 없이도 완전히 다른 모델 제품군에 적용했을 때 똑같이 잘 작동했습니다.
연구진은 시스템이 실제로 무엇을 배웠는지 이해하기 위해 변경 사항을 분석했습니다. 그들은 개선 사항이 세 가지 명확한 범주로 나뉜다는 것을 발견했습니다. 첫째, 시스템은 에이전트와 도구 사이의 인터페이스를 수리하여 에이전트가 도구를 잘못 호출하는 오류를 수정했습니다. 둘째, 특정 단계가 수행되어야 하는 특정 순서나 날짜 및 우선순위를 올바르게 처리하는 방법과 같은 환경의 숨겨진 관례를 학습했습니다. 셋째, 운영 지식을 추가함으로써 탐색 과정을 압축하여 에이전트가 불필요한 단계를 건너뛰고 문제의 가장 가능성 높은 원인에 집중할 수 있도록 했습니다. 예를 들어, 재무 작업에서 진화된 하네스는 변경을 수행하기 전에 안전 위반 사항을 확인하는 법을 배웠으며, 이는 오류의 수를 획기적으로 줄였습니다. 네트워크 분석 작업에서는 에이전트가 더 많은 증거를 찾는 데 시간을 낭비하는 대신, 가능한 원인을 찾으면 탐색을 멈추는 법을 배웠습니다.
이러한 결과는 많은 실제 비즈니스 애플리케이션에서 가장 큰 장벽은 모델의 지능이 아니라, 모델을 안내하는 시스템의 설계라는 점을 시사합니다. 하네스를 진화시킴으로써 연구진은 오진 횟수를 줄이고, 작업 완료 시간을 단축하며, 에이전트 운영 비용을 낮출 수 있었습니다. 이 연구는 고정되고 변하지 않는 두뇌라도 그것이 작동하는 특정 환경에 맞춰 도구와 규칙을 정교하게 조정한다면 놀라울 정도로 더 효과적일 수 있음을 보여줍니다. 이는 차세대 대규모 모델이 개발되기를 기다리지 않고도, 오늘날 신뢰할 수 있는 AI 에이전트가 필요한 조직들에게 실질적인 경로를 제시합니다. 이 연구는 때때로 가장 강력한 업그레이드는 새로운 마음이 아니라, 더 나은 작업 방식이라는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.