Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
Harness-Bench 는 다양한 시스템 계층 구성 (하네스) 이 LLM 에이전트 성능에 미치는 영향을 평가하기 위해 106 개의 현실적이고 샌드박스화된 작업으로 구성된 진단 벤치마크로, 실행 결과가 모델 - 하네스 조합에 따라 크게 달라진다는 점을 드러내며 에이전트 능력을 기본 모델에만 귀속시키는 것이 아니라 구성 수준에서 보고해야 할 필요성을 강조합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 천재적인 세계적 수준의 셰프 (AI 모델) 가 있다고 상상해 보세요. 이 셰프는 올바른 지시만 있다면 어떤 요리든 할 수 있습니다. 하지만 현실 세계에서 셰프는 진공 상태에 서 있는 것이 아니라, 특정 도구와 규칙 세트를 갖춘 주방에서 일하며, 주문을 확인하는 매니저와 실수를 처리하는 시스템을 운영합니다.
이 논문인 Harness-Bench 는 셰프뿐만 아니라 그 주방 시스템 (하네스) 을 테스트하는 것에 관한 것입니다.
문제: 우리는 주방을 무시해 왔습니다
지금까지 사람들이 AI 에이전트를 테스트할 때 주로 묻는 것은 "셰프가 얼마나 훌륭한가?"였습니다. 그들은 최종 요리 (AI 가 작업을 완료했는가?) 를 보았지만 주방이 어떻게 구성되어 있는지는 무시했습니다.
- 셰프에게 올바른 칼 (도구) 이 있었습니까?
- 셰프는 타는 팬을 어떻게 처리할지 (복구) 알고 있었습니까?
- 주방 매니저 (시스템) 가 셰프가 잘못된 재료 (권한) 를 사용하는 것을 막았습니까?
저자들은 모델만 보고 AI 의 능력을 판단할 수 없다고 주장합니다. 모델 + 주방 시스템을 함께 봐야 합니다. 훌륭하지만 지저분하고 고장 난 주방에 있는 셰프는 실패할 것이고, 완벽하고 잘 정리된 주방에 있는 좋은 셰프는 성공할 수 있습니다.
해결책: AI 를 위한 "주방 시뮬레이터"
연구자들은 106 가지의 다양한 요리 과제 (작업) 를 갖춘 거대한 테스트 장인 Harness-Bench를 구축했습니다. 이들은 단순한 질문이 아니라 코드 수정, 재무 데이터 분석, 프로젝트 관리와 같은 복잡한 업무입니다.
다음과 같이 테스트했습니다:
- 같은 재료, 다른 주방: 그들은 동일한 106 가지 작업을 다양한 AI 모델에 제공했습니다.
- 변수: 작업을 정확히 동일하게 유지하면서 각 실행마다 "주방 시스템" (하네스) 을 교체했습니다. 어떤 주방은 첨단 기술이 적용되고 엄격했고, 다른 주방은 느슨하고 단순했습니다.
- 결과: 그들은 5,000 건 이상의 실험을 수행했습니다.
발견한 것
결과는 놀랍고 명확했습니다: 주방은 셰프만큼이나 중요합니다.
- 엄청난 차이: 동일한 AI 모델을 사용했지만 다른 "주방"에 배치했을 때 성공률은 극적으로 달라졌습니다. 한 주방 시스템은 76% 의 성공률을 보인 반면, 다른 시스템은 동일한 모델로 52% 만 달성했습니다.
- "똑똑한" 주방이 승리합니다: 가장 우수한 성능을 보인 시스템은 가장 똑똑한 AI 모델을 가진 시스템이 아니었습니다. 대신 시스템이 AI 가 길을 잃지 않도록 돕고, 실수에서 복구하며, 도구를 올바르게 사용하도록 한 시스템이었습니다.
- "드리프트 (Drift)" 문제: 연구자들은 AI 가 종종 좋은 계획으로 시작하지만 그 후 "길을 잃는다"는 사실을 발견했습니다. 논리적으로 생각하지만 실제로 파일을 저장하는 것을 잊거나, 도구 오류를 무시하고 같은 일을 계속 시도할 수 있습니다. 가장 좋은 "주방 시스템"은 이러한 드리프트를 포착하고 수정했습니다.
핵심 교훈
이 논문은 "이 AI 모델은 90% 훌륭하다"라고 말하는 것을 멈춰야 한다고 결론 내립니다. 대신 "이 AI 모델은 이 특정 시스템과 짝을 이루었을 때 90% 훌륭하다"라고 말해야 합니다.
신뢰할 수 있는 AI 에이전트를 구축하려면 가장 똑똑한 두뇌만 선택해서는 안 되며, 그에 맞는 최고의 몸과 신경계 (하네스) 를 구축해야 합니다. Harness-Bench는 엔지니어들이 그 몸체를 측정하고 개선하는 데 도움이 되도록 그들이 만든 도구입니다.
요약하자면
경주용 자동차를 테스트하는 것처럼 생각하세요. 엔진 (AI 모델) 만 보고 빠르다고 말할 수는 없습니다. 엔진을 다른 트랙에서 다른 타이어와 드라이버 (하네스) 와 함께 테스트해야 합니다. Harness-Bench는 자동차의 속도가 엔진뿐만 아니라 트랙과 타이어에 크게 의존한다는 것을 입증하는 새로운 트랙입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.