← 최신 논문
💬 NLP

Self-Harness: Harnesses That Improve Themselves

이 논문은 LLM 기반 에이전트가 자신의 실패 패턴을 반복적으로 식별하고, 인간의 개입 없이 성능을 크게 향상시키기 위해 모델 특화된 하네스 수정을 자율적으로 생성, 검증 및 구현하는 새로운 패러다임인 Self-Harness를 소개한다.

원저자: Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하지만, 당신의 사무실이 어떻게 생겼는지는 전혀 모르는 아주 유능한 신입 사원(AI 모델)이 있다고 상상해 보세요. 당신은 그에게 업무를 주지만, 그는 계속해서 똑같은 어리석은 실수를 저지릅니다. 작업 내용을 저장하는 것을 잊어버리거나, 도움을 요청하는 과정에서 끝없는 루프에 빠지거나, 당신의 파일 정리 시스템을 오해하곤 합니다.

보통의 인간 매니저라면 이 직원이 실패하는 모습을 지켜본 뒤, 문제를 해결하기 위해 직원의 "규칙집(harness)"을 수동으로 다시 작성해야 할 것입니다. 이 과정은 시간이 매우 많이 걸리며, 만약 내일 다른 유형의 직원을 채용한다면 그 직원의 습관에 맞춰 규칙집을 처음부터 다시 써야 합니다.

Self-Harness는 직원이 스스로 자신의 규칙집을 수정하는 새로운 아이디어입니다.

이 논문은 간단한 비유를 사용하여 이 내용을 설명합니다.

3단계 "자기 개선(Self-Improvement)" 루프

논문은 AI가 인간의 도움이나 더 뛰어난 AI 상사 없이도 스스로를 개선할 수 있도록, 스스로의 매니저 역할을 수행하며 세 가지 뚜렷한 단계를 거치는 과정을 설명합니다.

1. 약점 채굴 (탐정 역할)
단순히 한 번의 실수만을 살펴보는 것이 아니라, AI는 여러 작업을 수행하며 "사건 현장 보고서(실패한 시도들)"를 수집합니다. 그리고 이러한 실패들을 함께 그룹화합니다.

  • 비유: AI는 "잠깐, 나는 주의가 산만해지기 전에 파일을 저장하지 않아서 서로 다른 세 가지 작업에서 실패했구나"라고 알아차립니다. 단순히 "실패했다"라고 말하는 것이 아니라, 실패의 구체적인 패턴을 식별하는 것입니다.

2. 하네스 제안 (설계자 역할)
그러한 패턴을 바탕으로, AI는 자신의 규칙집에 적용할 작고 구체적인 변화를 제안합니다.

  • 비유: AI는 이렇게 말합니다. "좋아, 내가 자꾸 저장을 잊어버리는구나. 내 지침서에 작은 규칙 하나를 추가하자: '새로운 작업을 시작하기 전에 반드시 현재 작업 내용을 저장할 것'."
  • 결정적으로, AI는 매뉴얼 전체를 다시 쓰는 것이 아닙니다. 오직 그 특정 문제를 해결하는 데 필요한 가장 작고 정밀한 변화만을 만듭니다. 또한 어떤 것이 가장 효과적인지 확인하기 위해 몇 가지 다른 아이디어를 제안합니다.

3. 제안 검증 (엄격한 판사 역할)
이것은 가장 중요한 안전 단계입니다. AI는 자신이 아직 보지 못한 새로운 작업들에 대해 새로운 규칙집을 테스트합니다.

  • 비류: 이것은 "회귀 테스트(regression test)"와 같습니다. AI는 스스로에게 묻습니다. "내가 이 새로운 규칙을 따른다면, 내가 이미 잘하고 있던 작업들을 더 잘하게 될까? 그리고 새로운 실수들을 고칠 수 있을까?"
  • 만약 새로운 규칙이 AI를 기존보다 못하게 만든다면, 그 아이디어는 거부됩니다. 만약 아무런 해를 끼치지 않으면서 도움이 된다면, 그 새로운 규칙은 공식적으로 규칙집에 추가됩니다.

실험에서는 어떤 일이 일어났나요?

연구진은 Terminal-Bench-2.0(AI가 퍼즐을 풀기 위해 컴퓨터 터미널을 사용하는 비디오 게임과 같은 벤치마크)을 사용하여 세 가지 매우 다른 AI 모델(MiniMax, Qwen, GLM)을 테스트했습니다.

  • 시작점: 연구진은 세 가지 AI 모두에게 매우 기초적이고 "뼈대만 있는" 규칙집을 제공했습니다.
  • 결과: 이 자기 개선 루프를 실행한 후, 세 가지 AI 모두 퍼즐을 해결하는 능력이 눈에 띄게 향상되었습니다.
    • 한 AI는 작업 해결률 약 40%에서 60% 이상으로 올라갔습니다.
    • 또 다른 AI는 23%에서 38%로 향상되었습니다.
    • 세 번째 AI는 42%에서 57%로 향상되었습니다.

"아하! 모먼트(Aha! Moment)": AI마다 필요한 해결책이 다르다

논문은 흥ente로운 사실을 발견했습니다. "해결책"은 모두에게 동일하지 않았습니다. AI들은 각기 다른 "성격"이나 사고방식을 가지고 있기 때문에, 서로 다른 규칙집 수정이 필요했습니다.

  • MiniMax는 탐색 능력은 뛰어나지만 마무리 능력이 부족했습니다. 해결책은? "최종 파일을 조기에 생성하기"와 "도움을 너무 많이 요청했다면 루프를 중단하기"라는 규칙이었습니다.
  • Qwen은 시작은 잘하지만 실수로 자신의 작업물을 삭제하곤 했습니다. 해결책은? "의존성을 먼저 확인하기"와 "확실하지 않으면 절대 파일을 삭제하지 않기"라는 규칙이었습니다.
  • GLM은 긴 연구 단계에 갇혀 실제로 무언가를 구축하지 못했습니다. 해결책은? "일정 시간이 지나면 탐색 모드에서 구축 모드로 전환하기"라는 규칙이었습니다.

핵심 요점

논문은 우리가 이러한 시스템을 고치기 위해 항상 인간 전문가나 "초지능" AI를 필요로 하는 것은 아니라고 결론짓습니다. 만약 AI에게 자신의 실패를 관찰할 수 있는 적절한 도구와, 증명된 변화만을 수용하는 절제력을 준다면, AI는 자신의 운영 체제를 스스로 진화시킬 수 있습니다.

이것은 마치 비디오 게임 캐릭터가 몇 번 죽고 난 뒤, 레벨을 클리어하기 위한 완벽한 전략을 찾아내고, 다음 라운드를 위해 스스로 자신의 "치트 시트(cheat sheet)"를 업데이트하는 것과 같습니다. 이 논문은 매우 단순한 시작점에서도 이것이 가능하다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →