← 최신 논문
💻 computer science

Rethinking the Evaluation of Harness Evolution for Agents

이 논문은 동일한 예산 하에서의 단순 테스트 시간 스케일링(test-time scaling)과 비교했을 때, 하네스 진화(harness evolution)가 일관된 성능 향상을 제공하지 못하며 제한적인 일반화 능력을 보인다는 점을 입증함으로써, LLM 에이전트의 자동 하네스 진화에 대한 현재의 평가 프로토콜을 비판한다.

원저자: Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 로봇 비서(AI 에이전트)가 있고, 이 로봇이 까다로운 컴퓨터 퍼즐을 풀어야 한다고 상상해 보세요. 로봇을 돕기 위해, 당신은 '하네스(harness)'—로봇에게 컴퓨터와 대화하는 법, 어떤 버튼을 눌러야 하는지, 그리고 자신의 작업물을 어떻게 확인해야 하는지를 알려주는 정교한 지침, 도구, 규칙의 세트—를 제공합니다.

한동안 연구자들은 이 로봇을 더 발전시키는 가장 좋은 방법이 하네스를 자동으로 수정하고 업그레이드할 '로봇 정비사'를 만드는 것이라고 생각했습니다. 이 정비사는 로봇이 실패하는 것을 지켜보고, "흠, 이 규칙을 바꾸면 어떨까?"라고 생각하며 새로운 하네스를 시도하고, 완벽한 설정을 찾을 때까지 이 과정을 반복할 것입니다. 그들은 이를 **자동 하네스 진화(Automatic Harness Evolution)**라고 불렀습니다.

하지만 이 새로운 논문에서, 한 연구팀은 이 '로봇 정비사'가 실제로 무언가 특별한 일을 하고 있는 것인지, 아니면 단지 우리를 속이고 있는 것인지 다시 한번 검토해 보기로 했습니다. 그들은 정비사가 정말로 더 나은 도구를 설계하고 있는 것인지, 아니면 단순히 많은 추측을 시도해서 운 좋게 맞히고 있는 것인지 확인하기 위해 공정한 경주를 설정했습니다.

거대한 경주: 진화인가, 아니면 그냥 열심히 노력하는 것인가?

연구진은 89개의 서로 다른 터미널 작업을 포함하는 Terminal-Bench 2.1이라는 유명한 퍼즐 세트를 사용하여 경쟁을 설정했습니다. 그들은 현존하는 가장 똑똑한 세 가지 AI 모델인 Claude Opus 4.6, GPT-5.4, GPT-5.4 mini를 사용했습니다.

그들은 동일한 양의 "생각 시간"(컴퓨팅 예산)을 부여받은 네 가지 전략을 비교했습니다:

  1. 병렬 샘플링(Parallel Sampling): 로봇에게 퍼즐을 푸는 시도를 동시에 5번 하게 한 뒤, 가장 좋은 답을 고르는 것을 상상해 보세요. 이는 주사위를 5번 굴려서 6이 나오기를 바라는 것과 같습니다.
  2. 순차적 정교화(Sequential Refinement): 로봇이 한 번 시도한 뒤, 어디서 실수했는지 확인하고, 생각을 교정하여 다시 시도하는 것을 상상해 보세요. 이는 에세이 초안을 수정하는 것과 같습니다.
  3. 하네스 진화(Harness Evolution): 이것이 바로 '로봇 정비사'입니다. 이 정비사는 과거의 실패를 바탕으로 로봇의 지침서를 다시 작성하여, 모두를 위한 더 나은 도구를 만들고자 합니다.
  4. 하네스 스케일링(Harness Scaling): 이것은 정비사가 로봇이 퍼즐을 푸는 동안 이 특정 퍼즐만을 위해 지침을 다시 쓰는 것과 같습니다.

충격적인 결과

연구 결과, '로봇 정비사'(하네스 진화)는 이 경주에서 일관되게 승리하지 못했습니다. 사실, 그것은 더 단순한 방법들에게 자주 패배했습니다.

"정답지"(유닛 테스트)가 없을 때:
만약 로봇이 자신이 맞았는지 틀렸는지를 스스로 판단해야 한다면, '로봇 정비사'는 오히려 상황을 악화시켰습니다.

  • 단순히 "5번 시도하기" 방식(병렬 샘플링)은 평균 점수를 68.2에서 72.3으로 높였습니다.
  • '로봇 정비사'(하네스 진화)는 겨우 67.4를 기록했는데, 이는 원래의 지침을 아무런 변경 없이 그대로 사용하는 것보다도 낮은 수치였습니다!
  • 저자들은 명확한 "정답지"가 없으면 정비사가 로봇의 성능을 해치는 노이즈가 섞인 혼란스러운 변화를 만들기 시작한다고 제안합니다.

"정답지"(유닛 테스트)가 있을 때:
로봇이 완벽한 솔루션에 대조하여 자신의 작업을 확인할 수 있는 경우에도, 정비사는 빛을 발하지 못했습니다.

  • "5번 시도하기" 방식은 평균 점수 86.0에 도달했습니다.
  • '로봇 정비사'는 75.8에 그쳤습니다.
  • 저자들은 이상한 점을 발견했습니다: 정비사의 개선은 **5번의 시도 중 최적의 답을 고르는 방식(pass@5)**을 허용했을 때만 나타났습니다. 첫 번째 시도에서 바로 성공해야 하는 방식(pass@1)에서는 정비사가 거의 아무런 개선을 이루지 못했습니다. 이는 정비사가 실제로 더 나은 도구를 설계한 것이 아니라, 단지 로봇이 더 많은 추측을 할 수 있도록 도와준 것뿐임을 시사합니다.

"과적합(Overfitting)"의 함정

가장 놀라운 결과는 연구진이 '로봇 정비사'가 새로운 퍼즐에도 적용될 수 있는 교훈을 배우는지 테스트했을 때 나왔습니다. 그들은 정비사가 45개의 훈련 작업에서 연습하게 한 뒤, 한 번도 본 적 없는 34개의 새로운 작업으로 테스트를 진행했습니다.

결과는 다음과 같았습니다: 정비사는 거의 변화를 만들어내지 못했습니다.

  • 새로운 작업에서 점수는 평균적으로 0.6점 상승하는 데 그쳤습니다.
  • 한 모델(GPT-5.4)의 경우, 점수가 전혀 변하지 않았습니다 (72.1에서 72.1로).

논문은 정비사가 좋은 로봇이 되기 위한 일반적인 규칙을 배우는 것이 아니라, 자신이 연습했던 특정 퍼즐에 대한 "지름길을 암기"하고 있다고 제안합니다. 이는 마치 연습 시험의 답을 통째로 외워버려서, 실제 시험에서는 제대로 배우지 못해 낙제하는 학생과 같습니다.

그래서 결론은 무엇인가?

이 논문은 '자동 하네스 진화'가 연습했던 동일한 퍼즐에서 높은 점수를 낸다고 해서, 그것을 마법의 해결책처럼 찬양하는 것을 멈춰야 한다고 주장합니다.

  • 부정하는 것: 이 논문은 이러한 진화 방식이 단순히 더 열심히 노력하는 것(테스트 시간 컴퓨팅 스케일링)보다 현재 더 우월하다는 생각을 부정합니다.
  • 시사하는 것: 우리가 보는 이 성과들이 하네스 설계가 더 똑똑해졌기 때문이 아니라, 단지 로봇이 더 많이 시도한 결과일 수 있음을 시사합니다.
  • 핵서(Takeaway): 저자들은 하네스 진화가 진정으로 유용해지려면, 도구의 실질적인 업그레이드가 필요할 만큼 어려운 퍼즐에서 테스트되어야 하며, 단순히 오래된 것들을 암기해서 속임수를 쓰는 것이 아닌지 확인하기 위해 반드시 새로운 퍼즐에서도 테스트되어야 한다고 제안합니다.

요약하자면, '로봇 정비사'는 여전히 완성되어 가는 과정에 있습니다. 현재로서는, 이 정비사가 보편적인 도구를 발명하기보다는 단일 퍼즐에 맞춰 지침을 미세하게 조정하는 데 더 특화되어 있는 것으로 보입니다. 이 논문은 우리가 이 방식의 승자로 선언하기 전에 더 공정한 테스트가 필요하다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →