← 최신 논문
💻 computer science

From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws

이 논문은 실행 트레이스와 하네스 코드를 분석하여 타겟팅된 검증된 패치를 생성함으로써 LLM 에이전트의 신뢰성을 여러 벤치마크에 걸쳐 크게 향상시키는 트레이스 유도형 프레임워크인 HarnessFix를 소개한다.

원저자: Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Qing Wang

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Qing Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 퍼즐(고장 난 컴퓨터 프로그램을 고치거나 여행 계획을 세우는 일 등)을 해결하려고 노력하는, 똑똑하지만 때때로 혼란스러워하는 유능한 비서(LLM 에이전트)를 가지고 있다고 상상해 보십시오. 이 비서는 혼자 일하지 않습니다. 엔지니어들이 만든 '제어실' 안에서 일합니다. 이 제어실을 **하네스(Harness)**라고 부릅니다.

하네스는 비서에게 다음과 같이 지시하는 규칙, 도구, 그리고 안전 점검 장치들의 집합입니다:

  • 사용할 수 있는 도구 (예: 드라이버 또는 검색 엔진).
  • 볼 수 있는 정보 (예: 지도 또는 매뉴얼).
  • 진행 상황을 보고하는 방법.
  • 언제 멈추고 "다 끝났습니다"라고 말할 것인지.

문제점: "블랙박스" 형태의 실패

때때로 비서는 실패합니다. 과거에 엔지니어들은 문제가 발생했을 때 다음과 같은 방식으로 이를 해결하려 했습니다:

  1. 비서의 지침 수정: "헤이, 좀 더 주의 깊게 행동해 봐!" (이는 이는 마치 브레이크가 고장 난 자동차 운전자에게 "운전을 더 잘해봐"라고 말하는 것과 같습니다).
  2. 추측하기: 최종 결과만을 보고 무작위적인 변화가 도움이 되기를 바라며 요행을 바라는 것입니다.

문제는 이러한 방법들이 실제 원인을 놓치는 경우가 많다는 점입니다. 실패의 원인이 비서의 잘못이 아닐 수도 있기 때문입니다. 하네스가 비서에게 잘못된 도구를 주었거나, 결정적인 오류 메시지를 숨겼거나, 혹은 비서가 일을 마치기도 전에 그만두게 했을 수도 있습니다. 비서의 행동은 길고 복잡한 사건의 사슬 속에서 일어나기 때문에, 제어실의 어느 부분이 고장 났는지 정확히 짚어내기가 어렵습니다.

해결책: HARNESSFIX (탐정)

이 논문의 저자들은 HARNESSFIX라는 새로운 시스템을 만들었습니다. 이것을 제어실을 위한 법의학 탐정이라고 생각하십시오. 단순히 추측하는 대신, 이 탐정은 범죄 현장(실패한 시도)을 단계별로 조사하여 하네스의 정확히 어느 부분이 고장 났는지 찾아냅니다.

HARNESSFIX가 작동하는 방식은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.

1. "번역기" (HTIR)

먼저, 탐정은 발생한 일들에 대한 무질서하고 혼란스러운 기록(트레이스)과 제어실의 코드를 가져와서, HTIR이라 불리는 깨끗하고 체계적인 지도 형태로 번역합니다.

  • 비유: 흩어진 단서들이 가득한 혼란스러운 범죄 현장을 상상해 보십시오. 탐정은 이를 명확한 타임라인으로 정리합니다: "10:00에 에이전트가 도구를 요청함. 10:01에 도구가 에러를 반환함. 10:02에 에이전트가 에러를 무시함." 이 지도는 에이전트의 행동을 그들을 규제했던 규칙들과 직접 연결합니다.

2. "진단" (범인 찾기)

다음으로, 탐정은 지도를 살펴보고 사슬이 끊어진 정확한 지점을 찾습니다.

  • 비유: 탐정은 질문합니다: "에이전트가 비밀번호를 몰라서 실패했는가? 아니면 보안 시스템(하네스)에 의해 문이 잠겨 있었기 때문인가?"
  • HARNESSFIX는 문제가 도구 인터페이스(잘못된 지침), 라이프사이클(에이전트가 너무 빨리 종료되도록 허용함), 또는 관측 가능성(에러 메시지를 숨김) 중 어디에 있는지 식별합니다. 그리고 반복되는 문제들에 대해 구체적인 "결함 보고서"를 작성합니다.

3. "수리점" (범위가 지정된 수정)

결함이 확인되면, HARNESSFIX는 아무나 제어실 전체를 다시 쓰도록 내버려 두지 않습니다. 그것은 위험하며 다른 것을 망가뜨릴 수 있기 때문입니다. 대신, 이 시스템은 일련의 **수리 연산자(Repair Operators)**를 사용합니다.

  • 비유: 이것들을 정비사의 도구 상자에 있는 특정 도구들이라고 생각하십시오. 만약 문제가 느슨한 볼트라면 정비사는 렌치를 사용합니다. 만약 타이어가 펑크 났다면 잭을 사용합니다. HARNESSFIX는 오직 해당 결함에 필요한 특정 "렌치"만을 사용합니다. 이 시스템은 엔진을 실수로 망가뜨리지 않도록, 오직 그 고장 난 부분만을 고치기 위해 작고 정밀한 패치를 작성합니다.

4. "안전 검사관" (검증)

새로운 패치가 설치되기 전, 안전 검사관이 이를 점검합니다.

  • 비례: 검사관은 두 가지 질문을 던집니다:
    1. "이 수정 사항이 우리가 발견한 특정 문제를 해결했는가?"
    2. "이 수정 사항이 정상적으로 작동하던 다른 것을 실수로 망가뜨리지는 않았는가?"
  • 두 번째 질문에 대한 답이 "예"라면, 그 패치는 거부됩니다. 이는 시스템을 개선하려다 오히려 악화시키는 것을 방지합니다.

무엇을 발견했는가?

연구진은 네 가지 다른 유형의 어려운 작업(소프트웨어 수정, 커맨드 라인 사용, 연구 수행, 앱 자동화)에 대해 이 탐정 시스템을 테스트했습니다.

  • 결과: HARASSFIX는 기존 설정에 비해 에이전트의 성공률을 15%에서 50%까지 향상시켰습니다.
  • 비교: HARNESSFIX는 다음의 성능을 능가했습니다:
    • 제어실을 수동으로 설계한 인간 전문가.
    • 단순히 지침을 바꾸거나 추측을 통해 스스로를 고치려 했던 다른 AI 시스템들.
  • 발견: 그들은 많은 실패가 AI가 "멍청해서" 발생하는 것이 아니라, 에러 메시지를 숨기거나 AI를 너무 빨리 종료하게 만드는 것과 같은 "제어실"의 숨겨진 결함 때문에 발생한다는 것을 발견했습니다. HARNESSFIX는 이러한 숨겨진 결함을 찾아내고 해결했습니다.

요약하자면

HARNESSFIX는 실패한 AI의 시도를 범죄 현장처럼 다루는 시스템입니다. 이 시스템은 단순히 AI를 탓하는 것이 아니라, AI가 작업하던 환경을 조사하고, 구체적으로 어떤 규칙이나 도구가 고장 났는지 찾아내어, 정밀하고 안전한 수정을 적용합니다. 이를 통해 AI의 뇌를 다시 훈련하거나 무엇이 잘못되었는지 추측할 필요 없이, AI를 훨씬 더 신뢰할 수 있게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →