기술 요약: Co-Harness: LLM 에이전트를 위한 하네스(Harness)와 모델 가중치의 공동 진화
1. 문제 정의
자동화된 AI 연구를 위한 사후 학습(Post-training) 에이전트는 전통적으로 런타임 시스템인 "하네스(Harness)"를 고정된 정적 스캐폴드(Scaffold)로 취급하면서 모델 파라미터를 최적화하는 과정을 포함합니다. 하네스는 프롬프트, 도구, 기술, 미들웨어, 메모리 정책 및 재시도 로직을 포괄합니다. 현재의 파이프라인은 근본적인 불일치를 야기합니다. 즉, 모델은 정적인 하네스에서 생성된 궤적(Trajectory)을 바탕으로 지도 미세 조정(SFT) 또는 강화 학습을 통해 업데이트되지만, 하네스 자체는 훈련 중에 관찰된 실패를 바탕으로 결코 최적화되지 않습니다.
이러한 비대칭성은 병목 현상을 초래합니다. 부적절한 스캐폴딩(예: 모호한 프롬프트, 잘못된 도구 스키마, 누락된 재시도 훅, 또는 메모리 오버플로)이 고품질의 훈련 궤적 생성을 방해할 수 있기 때문입니다. 결과적으로 모델은 이러한 환경적 한계를 극러내는 법을 배울 수 없으며, 고정된 하네스는 특히 단 한 번의 스키마 오류가 전체 멀티 턴 세션을 중단시킬 수 있는 복잡한 도구 통합 추론(Tool-Integrated Reasoning, TIR) 설정에서 에이전트 성능의 천장이 됩니다.
2. 방법론: Co-Harness 프레임워크
저자들은 에이전트 하네스(ϕ)와 모델 파라미터(θ)를 교대로 최적화하는 이중 루프 프레임워크인 Co-Harness를 제안합니다. 핵심 가설은 더 나은 하네스가 더 깨끗하고 정보가 풍부한 궤적을 생성하여 더 강력한 모델을 훈련시키며, 이 더 강력한 모델은 이전에 보이지 않았던 고차원적인 하네스 병목 현상을 드러내어 추가적인 스캐폴딩 개선을 가능하게 한다는 것입니다.
이 프레임워크는 매 라운드 t마다 두 개의 교차하는 루프로 작동합니다.
A. Co-Harness 루프 (하네스 최적화)
이 단계에서는 모델 θt를 고정시킨 채 하네스 ϕt를 진화시킵니다.
- 실패 수집: 에이전트가 (θt,ϕt) 하에서 작업을 실행하여 실패한 궤적 집합 Ft−를 수집합니다.
- HarnessCritic 분석: LLM 기반 구성 요소인 HarnessCritic(C)이 이러한 실패를 분석하여, 이를 하네스 설정 내의 구조화된 근본 원인(예: 프롬프트 모호성, 도구 스키마 오류, 누락된 기술, 미들웨어 불일치, 또는 메모리 오버플로)으로 귀인합니다.
- Diff 생성 및 검증: HarnessCritic은 하네스에 대한 로컬 패치(차이점)를 제안합니다. 이러한 패치는 대상 실패 모드를 개선하면서도 홀드아웃(held-out) 동작에서 회귀(regression)를 일으키지 않는지 확인하기 위해 "롤아웃(rollout)" 테스트를 통해 검증됩니다.
- 레지스트리 업데이트: 검증된 패치는 버전 관리되는 하네스 레지스트리에 커밋되어 활성 구성인 ϕt∗로 업데이트됩니다.
B. 모델 정렬 루프 (모델 최적화)
이 단계에서는 진화된 하네스 ϕt∗를 고정시킨 채 모델을 업데이트합니다.
- 고품질 궤적 수집: 현재 모델 θt를 개선된 하네스 ϕt∗ 하에서 실행하여 새로운 고품질 궤적 데이터셋 Dt를 생성합니다.
- 지도 미세 조정 (SFT): 모델을 Dt에 대해 미세 조정하여 개선된 스캐폴딩에 의해 가능해진 행동을 내재화함으로써 업데이트된 모델 θt+1을 생성합니다.
- 반복: 새로운 모델 θt+1과 진화된 하네스 ϕt∗는 다음 라운드의 시작점이 되며, 여기서 더 강력해진 모델은 이전에 보이지 않았던 더 복잡한 하네스 한계를 드러낼 수 있습니다.
실패 귀인 분류 체계 (Failure Attribution Taxonomy)
HarnessCritic은 실패를 다섯 가지 실행 가능한 하네스 차원과 하나의 기권 레이블로 분류합니다:
- 프롬프트 모호성 (P): 지시사항의 미비 또는 상충하는 목표.
- 도구 스키마 오류 (T): 잘못된 도구 호출, 부적절한 인자 스키마, 또는 백엔드 불일치.
- 기술 누락 (S): 재사용 가능한 루틴이나 분해 프리미티브(decomposition primitives)의 부재.
- 미들웨어 불일치 ($Mid$): 결함이 있는 루프 프로토콜, 훅(hook) 동작, 또는 컨텍스트 관리 로직.
- 메모리 오버플로 (M): 지속적인 상태 오버플로, 오래된 메모리, 또는 검색 실패.
- 에이전트 오류: 실패가 하네스가 아닌 모델의 추론 자체에 내재된 경우.
3. 주요 기여
- 결합 최적화 정식화: 본 논문은 에이전트 사후 학습을 모델 가중치와 런타임 하네스에 대한 결합 최적화 문제로 정식화하여, 프롬프트와 도구를 고정된 인프라로 취급하던 기존 패러다임을 넘어섰습니다.
- HarnessCritic: 실패를 특정 하네스 구성 요소로 구조화하여 귀인하고, 수정을 위한 검증된 로컬 diff를 제안하는 실패 기반 절차를 도입했습니다.
- 복합 이득 메커니즘: 하네스 진화와 모델 정렬을 교대로 수행함으로써 발생하는 양의 피드백 루프(하네스 개선이 더 나은 훈련 데이터를 생성하고, 이것이 더 강력한 모델을 만들어 더 정교한 하네스를 활용할 수 있게 함)를 입증했습니다.
4. 실험 결과
이 프레임워크는 수학적 벤치마크(AIME 2024, AIME 2025, HMMT 2025)와 두 가지 모델 규모(Qwen3-8B 및 Qwen3-32B)를 사용하는 도구 통합 추론(TIR) 작업에서 평가되었습니다.
- 성능 향상: 두 라운드의 Co-Harness 공동 진화는 베이스라인(모델 SFT 없이 하네스만 1회 진화시킨 경우) 대비 벤치마크 및 모델 규모 전반에서 평균 **+20.4 퍼센티지 포인트(pp)**의 정확도 향상을 가져왔습니다.
- 가장 어려운 벤치마크인 HMMT 2025에서 Qwen3-32B 모델을 대상으로 +27.2 pp라는 가장 큰 향상이 관찰되었습니다.
- 시스템은 정교하게 설계된 정적 하네스 구성을 평균 +24.7 pp 상회했습니다.
- 자율 사례 연구: AIME 2024에 대한 200시간 이상의 자율 실행에서 시스템은 다음을 수행했습니다:
- 초기 시스템 크래시(vllm KV 캐시 에러)로부터 복구되었습니다.
- 글로벌 배치 추론(global-batched inference)을 통해 추론 효율성을 8.7배 개선했습니다 (벽시계 시간 기준 3.78시간에서 1.11시간으로 단축).
- 인간의 개입 없이도 시간 예산 내에서 최고 정확도(63.3%)를 달면하는 다이버스한 시드들의 앙상블 전략(다수결 투표)을 발견했습니다.
- 강건성: 시스템은 버전 관리되는 레지스트리를 사용하여 모델의 내부 추론과 충돌하는 도메인 특화 프롬프트와 같은 회귀 현상을 성공적으로 감지하고 롤백했습니다.
5. 의의 및 주장
본 논문은 Co-Harness가 현재 에이전트 개발의 결정적 한계인 모델 훈련과 훈련 데이터를 생성하는 환경 간의 결합 해제 문제를 해결한다고 주장합니다. 하네스를 고정된 스캐폴드가 아닌 학습 가능한 변수로 취扱함으로써, Co-Harness는 **복합적 자기 개선(compounding self-improvement)**을 가능하게 합니다.
저자들은 다음과 같은 "양의 피드백 나선(positive feedback spiral)"을 실현한다고 주장합니다:
- 더 나은 하네스는 더 깨끗한 도구 사용과 불필요한 크래시 감소를 생성합니다.
- 이러한 깨끗한 궤적은 더 강력한 모델을 훈련시킵니다.
- 더 강력한 모델은 이전에는 사용할 수 없었던 더 풍부하고 복잡한 하네스 구성을 활용할 수 있습니다.
이는 고정된 하네스를 위해 모델을 최적화하거나(표준 SFT/RL), 고정된 모델을 위해 하네스를 최적화하는(추론 시 탐색) 기존 연구와 대조됩니다. Co-H harness는 둘 모두를 공동 진화시키는 첫 번째 프레임워크로 제시되며, 이는 스캐폴딩과 모델 가중치의 상호 의존성이 고정된 하네스 사후 학습을 넘어 에이전트 능력을 향상시키는 주요 축임을 시사합니다.
저자들이 언급한 한계점: 이 접근 방식은 유능한 비평가(critic) LLM, 콜드 스타트(cold-start)를 위한 충분한 양의 실패 궤적, 그리고 다회차 SFT를 위한 상당한 컴퓨팅 자원을 필요로 합니다. 또한, 복잡한 반사실적 추론(counterfactual reasoning)이 필요한 실패 모드에 대해서는 귀인 정확도가 저하될 수 있으며, 하네스의 구조적 재설계는 여전히 인간의 책임 영역으로 남습니다.