Stop Comparing LLM Agents Without Disclosing the Harness
이 위치 논지는 장기 과제의 경우 기반 언어 모델보다 에이전트 실행 하네스가 성능을 더 크게 결정하므로, 인프라 개선 효과를 모델 향상으로 체계적으로 오인하지 않도록 하네스를 고려한 평가 프로토콜을 커뮤니티가 채택해야 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.
핵심 아이디어: 엔진만이 전부가 아닙니다, 차 전체입니다
어떤 자동차 엔진이 가장 좋은지 판단하려고 한다고 상상해 보세요. 당신은 녹이 슬고 고장 난 세단, 펑크 난 타이어, 작동하지 않는 스티어링 휠이 달린 차에 페라리 엔진을 장착합니다. 그다음, 약간 덜 강력한 엔진을 완벽한 타이어와 GPS 내비게이션 시스템이 갖춰진 최신 하이테크 레이싱카에 장착합니다.
두 번째 차가 경주에서 이겼다면, 그것이 엔진이 더 좋아서 이긴 것일까요? 아닙니다. 그것은 차(섀시, 타이어, 내비게이션) 가 더 좋아서 이긴 것입니다.
이 논문은 우리가 현재 인공지능 (AI) 에 대해 정확히 이러한 실수를 저지르고 있다고 주장합니다.
AI "에이전트"(코드 작성이나 소프트웨어 버그 수정과 같은 작업을 수행할 수 있는 AI 프로그램) 를 테스트할 때, 우리는 보통 단일 점수를 보고 "와, 모델 A 가 모델 B 보다 낫네"라고 말합니다. 저자들은 이것이 오해의 소지가 있다고 말합니다. 그들은 복잡하고 장기적인 작업의 경우, 점수가 AI 모델 자체보다는 AI 를 둘러싼 소프트웨어 인프라인 "하네스 (Harness)"에 훨씬 더 의존한다고 주장합니다.
"하네스": AI 의 몸과 신경계
이 논문은 인프라를 **"하네스"**라고 부릅니다. AI 모델("뇌") 을 파일럿이라고 생각하세요. 하네스는 조종석, 오토파일럿 시스템, 연료 게이지, 통신 라디오입니다.
- 모델 (뇌): 생각하고 텍스트를 생성하는 부분일 뿐입니다. 이는 "개방 루프 (open-loop)" 방식으로, 답변을 내뱉고 다음 프롬프트를 기다립니다. 누군가 알려주기 전까지는 실수를 했는지 알지 못합니다.
- 하네스 (컨트롤러): 이는 다음과 같은 소프트웨어 계층입니다.
- AI 에게 어떤 정보를 보여줄지 결정합니다 (컨텍스트).
- AI 의 답변이 타당한지 확인합니다 (검증).
- 실패할 경우 AI 에게 다시 시도하도록 지시합니다 (재시도 로직).
- 너무 많은 정보로 인해 AI 가 혼란스러워지지 않도록 관리합니다 (메모리 관리).
이 논문은 길고 어려운 작업의 경우, 하네스가 "결정적 제약 조건 (binding constraint)"이라고 주장합니다. 이는 하네스가 병목 현상이라는 뜻입니다. 하네스가 나쁘면 가장 똑똑한 AI 도 실패합니다. 반면 하네스가 훌륭하면 조금 덜 똑똑한 AI 도 성공할 수 있습니다.
"결정적 제약 조건 논제"
저자들은 **"결정적 제약 조건 논제 (Binding Constraint Thesis)"**라는 이론을 제안합니다. 쉽게 말해 다음과 같습니다.
"고난이도 장기 작업에서 최상위 AI 모델을 비교할 때, 점수 차이는 어떤 모델을 사용했기 때문보다는 하네스가 어떻게 구축되었기 때문에 발생합니다."
그들은 하네스를 변경하면 점수가 15 퍼센트 포인트까지 변동될 수 있는 반면, 모델을 변경하면 보통 2~4 포인트만 변동된다는 사실을 발견했습니다.
비유: 두 명의 달리기 선수를 상상해 보세요. 한 명은 올림픽 스프린터 (모델 A) 이고, 다른 한 명은 매우 건강한 아마추어 (모델 B) 입니다.
- 올림픽 스프린터에게 진흙 투성이 부츠와 무거운 배낭을 주면 (나쁜 하네스), 완벽한 신발을 신은 아마추어에게 질 수 있습니다.
- 이 논문은 현재의 리더보드처럼, 모두가 다른 신발을 신은 경주를 하는데 우리는 신발을 무시한 채 누가 이겼는지만 보고 있다고 말합니다.
왜 현재 리더보드가 "불완전한가"
현재 벤치마크 (SWE-bench 나 Terminal-Bench 등) 는 마치 "뇌"만 테스트하는 것처럼 행동합니다. 하지만 실제로는 뇌 + 하네스를 테스트하고 있는 것입니다.
연구자들이 하네스를 어떻게 구축했는지 (조종석의 "레시피") 정확히 공개하지 않기 때문에, 모델이 실제로 더 똑똑한지, 아니면 팀이 단순히 그 주위에 더 좋은 하네스를 구축했는지 알 수 없습니다.
논문의 증거:
- 실제 사례: 그들은 동일한 AI 모델 (Claude Opus) 이 한 하네스에서는 45.9% 점수를, 다른 하네스에서는 55.4% 점수를 받았음을 보여주었습니다. 모델을 변경한 것이 아니라 소프트웨어 래퍼만 변경했을 때의 엄청난 점수 상승입니다.
- 통제된 실험: 그들은 세 가지 다른 최상위 모델을 세 가지 다른 하네스 (최소, 개선, 완전) 를 통해 실행했습니다.
- 결과: 모델을 변경하는 것보다 하네스를 변경하는 것이 점수에 훨씬 더 큰 영향을 미쳤습니다.
- 반전: 때로는 "더 나쁜" 하네스를 가진 "더 좋은" 모델보다 "더 좋은" 하네스를 가진 "더 나쁜" 모델이 이기기도 했습니다. 순위가 뒤집힌 것입니다!
해결책: "공개"와 "분산 분해"
이 논문은 모델 사용을 중단하라고 말하지 않습니다. 하네스가 존재하지 않는 것처럼 가장하는 것을 중단해야 한다고 말합니다. 그들은 AI 를 평가하는 새로운 방식을 제안합니다.
- "하네스 카드": 식품 라벨이 성분을 나열하듯, 모든 AI 벤치마크 제출물은 "하네스 카드"를 나열해야 합니다. 이 카드는 컨텍스트가 어떻게 구축되고, 오류가 어떻게 처리되며, AI 가 어떻게 검증되는지 정확히 상세히 기술합니다.
- 분산 분해 (Variance Decomposition): 단순히 하나의 점수를 주는 대신, 연구자들은 다음을 보고해야 합니다.
- 점수 차이의 얼마가 모델 때문입니까?
- 얼마가 하네스 때문입니까?
- 얼마가 그들 사이의 상호작용 때문입니까?
결론
연구자, 투자자, 또는 AI 리더보드를 보는 사용자라면 이 논문은 경고합니다: 순위표를 맹신하지 마십시오.
"하네스 카드"를 볼 때까지, 리더보드 순위는 누가 어떤 차를 운전했는지 모른 채 경주를 판단하는 것과 같습니다. "승자"는 더 좋은 운전자가 아니라 더 좋은 차를 가졌을 뿐일 수 있습니다. AI 의 진보를 진정으로 이해하려면 뇌만 비교하는 것을 중단하고, 뇌가 머무는 몸 전체를 비교해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.