← 최신 논문
💬 NLP

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

HarnessForge는 결함 유도형 맞춤화(fault-guided tailoring)와 하네스 조건부 정렬(harness-conditioned alignment)을 통해 LLM 에이전트의 외부 실행 하네스와 내부 추론 정책을 공동으로 진화시키는 메타 적응형 프레임워크로, 다양한 작업 체제 전반에 걸쳐 실행 가능 호환성을 최적화함으로써 고립된 적응 방식들을 유의미하게 능가한다.

원저자: Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 HarnessForge 논문을 쉬운 언어와 창의적인 비유를 사용하여 번역한 내용입니다.

거대한 문제: "경직된 로봇"

당신이 다양한 일을 수행하기 위해 똑똑하지만 경험이 부족한 로봇 조수(LLM 에이전트)를 고용했다고 상상을 해보세요.

  • 업무 A: 항공권을 예약해야 합니다. 이 로봇에게는 엄격한 체크리스트와 달력이 필요합니다.
  • 업무 B: 추리 소설을 써야 합니다. 이 로봇에게는 창의적인 흐름과 줄거리 요점을 기억하는 능력이 필요합니다.
  • 업무 C: 시뮬레이션 속에서 새는 파이프를 고쳐야 합니다. 이 로봇은 정확히 어떤 도구를 어떤 순서로 집어야 하는지 알아야 합니다.

문제는 대부분의 로봇 조수가 고정된 지침서(이를 Harness라고 부릅니다)를 가지고 온다는 점입니다. 이 지침서는 로봇이 어떻게 생각하고 행동해야 하는지를 알려줍니다.

  • 만약 지침서가 너무 경직되어 있다면, 로봇은 창의적인 업무에서 실패합니다.
  • 만약 지침서가 너무 느슨하다면, 로봇은 복잡하고 단계적인 업무를 수행할 때 혼란에 빠집니다.

전통적으로 연구자들은 이를 두 가지 별개의 방식으로 해결하려고 노력했습니다:

  1. 지침서 다시 쓰기: 로봇은 그대로 두고, 새로운 업무마다 더 나은 지침서를 쓰려고 노력합니다. (이는 느리고 종종 목표를 놓칩니다.)
  2. 로봇 훈련시키기: 지침서는 그대로 두고, 시행착오를 통해 로봇이 더 똑똑해지도록 "가르칩니다". (이는 비용이 많이 들며, 나쁜 지침서 때문에 로봇이 여전히 혼란을 겪을 수 있습니다.)

HarnessForge는 이렇게 말합니다: "왜 하나만 선택하나요? 둘 다 함께 진화시키면 됩니다."


해결책: "함께 추는 춤"

저자들은 HarnessForge라는 시스템을 제안합니다. 에이전트 시스템을 하나의 **댄스 페어(Dance Pair)**라고 생각해 보세요:

  • Harness (안무가): 이것은 외부 구조입니다. 춤의 단계, 음악, 규칙, 그리고 무용수가 사용할 수 있는 도구를 결정합니다.
  • Policy (무용수): 이것은 로봇의 두뇌입니다. 안무를 따라 하기 위해 실제로 발을 어떻게 움직일지 결정합니다.

과거에는 사람들은 안무가를 고치거나 무용수를 훈련시키는 일을 따로 시도했습니다. 하지만 HarnessForge는 이들이 결합되어 있음을 깨달았습니다. 훌륭한 안무도 무용수가 그 동작을 수행할 수 없다면 무용지물입니다. 재능 있는 무용수도 안무가 터무니없다면 소용이 없습니다.

HarnessForge는 루프(loop)를 통해 이 둘을 함께 진화시킵니다:

1단계: "결함 진단" (발을 헛디디는 이유 찾기)

시스템은 이 댄스 페어를 일련의 과업들에 투입합니다. 이들이 실수할 때(실패할 때), "메타 에이전트"(매우 똑똑한 심판)가 영상을 검토합니다.

  • 무용수가 피곤해서 발을 헛디뎠는가? (Policy 문제)
  • 안무가가 물리적으로 불가능한 동작을 지시해서 무용수가 넘어졌는가? (Harness 문제)
  • 음악이 적절하지 않은 타이밍에 멈춰서 넘어졌는가? (Memory/Structure 문제)

2단계: Harness 맞춤 제작 (안무 다시 쓰기)

진단 결과에 따라, 시스템은 자동으로 Harness를 다시 작성합니다.

  • 만약 로봇이 계획을 계속 잊어버린다면, Harness는 "포스트잇" 시스템(Memory)을 추가하도록 업데이트됩니다.
  • 만약 로봇이 계속 잘못된 도구를 집는다면, Harness는 사용 전 도구를 확인하는 "안전 가드"를 추가하도록 업데이트됩니다.
  • 비유: 이는 마치 축구팀이 경기에서 패배하는 것을 보고, 특정 약점을 고치기 위해 즉시 포메이션이나 플레이북을 변경하는 코치의 모습과 같습니다.

3단계: Policy 정렬 (무용수 훈련시키기)

새로운 Harness(안무)가 준비되면, 시스템은 단순히 기존의 로봇을 그대로 투입하지 않습니다. 이 새로운 규칙에 맞춰 **로봇을 미세 조정(Fine-tuning)**합니다.

  • 시스템은 이전 라운드의 성공적인 시도들을 가져와 로봇에게 가르칩니다: "자, Harness가 '도구를 확인하라'고 말하면, 너는 이 특정 동작을 해야 해."
  • 비유: 이는 마치 무용수에게 특정 루틴을 가르쳐서, 그들의 근육 기억이 새로운 스텝과 완벽하게 일치하도록 만드는 무용 강사의 수업과 같습니다.

4단계: "적자생존"

시스템은 가장 좋은 페어(Harness + Robot)를 남기고, 여전히 실패하는 것들은 버립니다. 이 과정을 여러 라운드에 걸쳐 반복합니다. 매 라운드마다 안무는 더 똑똑해지고, 무용수는 그 특정 안무를 따르는 데 더 능숙해집니다.


왜 이것이 효과적인가 (결과)

이 논문은 퍼즐 해결을 위한 도구 사용, 웹 검색, 영화 데이터를 얻기 위한 API 호출 등 다섯 가지 다른 "댄스 플로어"(벤치마크)에서 이를 테스트했습니다.

연구 결과:

  1. 함께할 때 더 좋다: Harness와 Policy를 모두 함께 진화시킨 시스템이 하나만 바꾼 시스템보다 훨씬 더 뛰어난 성능을 보였습니다.
  2. 효율성: 이 방식은 작동하기 위해 수백만 번의 추가 시도(rollout)를 필요로 하지 않습니다. 시스템이 실패의 구조로부터 학습하기 때문에 더 빠르게 배웁니다.
  3. 호환성이 핵심이다: "완벽한" 로봇은 진공 상태에서 존재하지 않는다는 것이 가장 큰 교훈입니다. 로봇은 오직 자신이 작동하는 시스템만큼만 훌륭할 수 있습니다. 로봇과 그 시스템을 함께 진화시킴으로써, 그들은 완벽하게 호환됩니다.

요약 비유

당신이 궁극의 **맥가이버 칼(Swiss Army Knife)**을 만들려고 한다고 상상해 보세요.

  • 기존 방식: 손잡이(Harness)를 완벽하게 만들거나, 칼날(Policy)을 더 날카롭게 만들거나 둘 중 하나를 시도하지만, 두 가지를 동시에 바꾸지는 않습니다.
  • HarnessForge 방식: 당신은 만약 왼손잡이 목수를 위해 인체공학적인 손잡이를 만든다면, 반드시 칼날의 각도도 조정해야 한다는 것을 깨닫습니다. 당신은 손잡이와 칼날이 함께 단련되고, 테스트되고, 서로에게 완벽하게 맞을 때까지 루프를 돌며 정교하게 다듬어지는 작업실을 구축합니다.

그 결과, 특정 작업에 완벽하게 적응된 도구가 탄생합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →