← 최신 논문
🤖 AI

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

HarnessX는 모델 스케일링에만 의존하지 않고도 다양한 벤치마크에서 상당한 성능 향상을 달성하며, 치환 대수(substitution algebra)와 추적 기반 다중 에이전트 진화를 통해 AI 에이전트 런타임 인터페이스를 체계적으로 진화시키는 결합 가능하고 적응적인 파운드리를 도입합니다.

원저자: Tingyang Chen, Shuo Lu, Kang Zhao, Weicheng Meng, Hanlin Teng, Tianhao Li, Chao Li, Xule Liu, Jian Liang, Zhizhong Zhang, Yuan Xie, Heng Qu, Kun Shao, Jian Luan

게시일 2026-06-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tingyang Chen, Shuo Lu, Kang Zhao, Weicheng Meng, Hanlin Teng, Tianhao Li, Chao Li, Xule Liu, Jian Liang, Zhizhong Zhang, Yuan Xie, Heng Qu, Kun Shao, Jian Luan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하지만 경험이 부족한 인턴(AI 모델)이 있다고 상상해 보십시오. 당신은 이 인턴에게 여행 계획 짜기, 고장 난 웹사이트 고치기, 또는 비디오 게임 플레이하기와 같은 복잡한 문제를 해결하도록 시키고 싶습니다.

현재 대부분의 사람들은 더 똑똑한 인턴(더 크고 비싼 AI 모델)을 고용함으로써 인턴을 똑똑하게 만들려고 노력합니다. 하지만 이 논문, HarnessX는 진정한 비결이 단순히 더 나은 인턴을 고용하는 것이 아니라, 그들이 일할 수 있는 더 나은 사무실, 도구 세트, 그리고 규칙서를 구축하는 것이라고 주장합니다.

이들은 이 "사무실 설정"을 **하네스(Harness)**라고 부릅니다.

문제점: "수작업으로 만든" 사무실

현재, 만약 당신이 AI에게 새로운 일을 시키고 싶다면, 인간 엔지니어가 직접 맞춤형 사무실을 구축해야 합니다. 그들은 특정 지침(프롬프트)을 작성하고, 특정 도구를 연결하며, 메모리 시스템을 설정합니다.

  • 문제점: 이러한 사무실은 정적입니다. 만약 인턴이 바뀌거나 업무가 바뀌면, 사무실 전체를 처음부터 다시 구축해야 합니다.
  • 낭비: 인턴이 실패했을 때, 우리는 실수를 살펴보고 사무실을 수동으로 수정하며 다시 시도합니다. 우리는 그 실수를 통해 사무실을 자동으로 개선하거나, 심지어 다음 시도를 위해 인턴을 더 잘 훈련시키는 데 거의 사용하지 않습니다.

해결책: "하네스 파운드리(Harness Foundry)"

HarnessX는 이러한 사무실을 자동으로 구축하는 공장("파운드리")입니다. 이는 사무실 설정을 스스로 조립되고, 적응하며, 진화할 수 있는 살아있는 유기체로 취급합니다.

작동 방식은 다음과 같습니다. 세 가지 간단한 부분으로 나누어 설명합니다.

1. 구성(Composition): 레고 사무실

엉망진창으로 얽힌 사무실 대신, HarnessX는 타입이 지정된 교체 가능한 레고 블록인 "프로세서(Processor)"를 사용하여 사무실을 구축합니다.

  • 비유: 사무실에 "도구", "메모리", "규칙", "컨텍스트"를 위한 특정 슬롯이 있다고 상상해 보십시오.
  • 작동 방식: "웹 검색" 블록을 도구 슬롯에 끼우거나 "장기 기억" 블록을 메모리 슬롯에 끼울 수 있습니다. 이들은 표준화된 블록이기 때문에, 전체 건물을 망가뜨리지 않고도 서로 교체할 수 있습니다. 이를 통해 사무실은 모듈화되고 변경하기 안전해집니다.

2. 적응(Adaptation): 자기 개선형 매니저 (AEGIS)

이것은 시스템의 두뇌입니다. HarnessX는 AEGIS라는 특별한 매니저를 사용하여 인턴이 일하는 것을 관찰하고 사무실을 자동으로 수정합니다.

  • 거울: AEGIS는 사무실을 하나의 비디오 게임 캐릭터처럼 취급합니다. AEGIS는 "트레이스(trace, 인턴이 수행한 단계별 로그)"를 살펴보고 질문합니다: "왜 실패했는가? 도구 때문인가? 규칙 때문인가? 아니면 프롬프트 때문인가?"
  • 4단계 루프:
    1. 소화(Digest): 지저분한 로그를 읽고 실패 사례를 요약합니다.
    2. 계획(Plan): 어떤 종류의 변화가 필요한지 결정합니다 (예: "새로운 도구가 필요함" vs "지침을 다시 써야 함").
    3. 진화(Evolve): 실제로 새로운 사무실 구성을 구축합니다.
    4. 비평(Critic): 엄격한 안전 검사관 역할을 합니다. 새로운 사무실이 기존에 작동하던 것들을 망가뜨리지 않는지 테스트합니다.
  • 결과: 사람이 매번 코드를 다시 쓸 필요 없이, 사무실은 스스로 점점 더 좋아집니다.

3. 공동 진화(Co-Evolution): 양방향 통로

보통 우리는 사무실을 고치거나, 혹은 인턴을 훈련시키거나 둘 중 하나를 합니다. HarnessX는 이 두 가지를 동시에 수행합니다.

  • 비유: 사무실이 좋아지면 인턴이 새로운 기술을 배우는 데 도움이 됩니다. 그러면 인턴이 더 똑똑해지고, 이는 사무실이 더 복잡한 작업을 시도할 수 있게 해줍니다.
  • 루프: 시스템은 인턴의 실패를 사용하여 사무실을 업그레이드하고, 동시에 새로운 사무실을 사용하여 인턴의 두뇌를 업그레이드하기 위한 더 나은 훈련 데이터를 생성합니다. 이들은 서로를 끌어올립니다.

실험에서는 어떤 일이 일 있었나요?

연구팀은 웹 쇼핑에서 소프트웨어 엔지니어링에 이르는 다섯 가지 서로 다른 "게임(벤치마크)"에서 이를 테스트했습니다. 또한 작은 규모부터 큰 규모까지 세 가지 유형의 AI 모델을 사용했습니다.

  • 큰 승리: 평균적으로 시스템 성능이 14.5% 향상되었습니다.
  • 압도적 승리: 성능이 낮은 AI 모델의 경우, 향상 폭이 매우 컸습니다—최대 **44%**에 달했습니다.
    • 이유: 논문은 약한 모델들이 더 많은 "행동 격차(behavioral gaps, 하는 방법을 모르는 상태)"를 가지고 있다고 언급합니다. 더 나은 사무실(하네스)은 이러한 격차를 즉각적으로 메워줄 수 있습니다. 강력한 모델은 이미 충분히 뛰어나기 때문에 사무실의 도움을 덜 받습니다.
  • "정체" 문제: 매우 혼란스러운 테스트인 GAIA에서, 단일 사무실은 모든 것을 해결할 수 없었습니다. 왜냐하면 어떤 작업들은 서로 상반되는 규칙을 필요로 했기 때문입니다. 시스템은 이를 해결하기 위해 여러 버전의 사무실(변형)을 만들고, 각 작업에 가장 적합한 버전으로 경로를 지정했습니다. 이를 통해 시스템이 이전 작업을 수행하는 방법을 "잊어버리는" 현상을 방-지했습니다.

핵심 요점

이 논문은 우리가 더 나은 결과를 얻기 위해 AI 모델이 무한히 똑똑해질 때까지 기다릴 필요가 없다고 결론짓습니다. **구성 가능하고 스스로 진화하는 런타임 환경(하네스)**을 구축함으로써, 특히 작거나 능력이 낮은 모델에서 엄청난 성능 향상을 끌어낼 수 있습니다.

요약하자면: 단순히 더 똑똑한 인턴을 사는 것이 아니라, 그들을 위한 더 똑똑하고 스스로 수리하는 사무실을 구축하십시오. 그리고 그들이 자신의 실수로부터 배워서 사무실을 더욱 개선할 수 있도록 하십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →