← 최신 논문
🤖 machine learning

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

본 논문은 대규모 실행 추적 코퍼스를 체계적으로 분석하여 증거 기반의 자연어 통찰력을 생성함으로써 LLM 에이전트 실패 진단을 자동화하는 다중 에이전트 시스템인 인사이트 생성기 (IG) 를 소개하며, 이는 에이전트 성능을 크게 향상시키고 심도와 범위 측면에서 수동 진단 방법보다 우수한 것으로 입증되었습니다.

원저자: Akshay Manglik (Emily), Apaar Shanker (Emily), Kaustubh Deshpande (Emily), Jason Qin (Emily), Yash Maurya (Emily), Veronica Chatrath (Emily), Vijay S. Kalmath (Emily), Levi Lentz (Emily), Yuan (Emily
게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Akshay Manglik (Emily), Apaar Shanker (Emily), Kaustubh Deshpande (Emily), Jason Qin (Emily), Yash Maurya (Emily), Veronica Chatrath (Emily), Vijay S. Kalmath (Emily), Levi Lentz (Emily), Yuan (Emily), Xue

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 매우 똑똑하지만 때로는 혼란스러워하는 로봇 어시스턴트 팀의 관리자입니다. 이 로봇들은 스프레드시트 정리나 어려운 과학 질문 답변과 같은 복잡한 퍼즐을 해결하려고 노력합니다. 때로는 정답을 맞추지만, 다른 때는 실패하기도 합니다.

문제: "건초더미 속의 바늘" 디버깅
현재 로봇이 실패할 때, 인간 관리자는 로봇 작업의 몇 가지 구체적인 예시를 살펴보고 그 원인을 파악하려고 합니다. 이는 마치 한 대의 자동차가 지나가는 소리만 듣고 엔진이 왜 이상한 소음을 내는지 이해하려는 것과 같습니다. 여러분은 덜컹거리는 소리를 들을 수는 있지만, 모든 자동차가 비 오는 날 왼쪽으로 회전할 때 덜컹거리는 패턴은 놓치게 됩니다.

로봇들은 매 작업마다 수천 페이지에 달하는 방대한 양의 데이터(생각과 행동)를 생성하기 때문에, 인간은 이를 모두 읽을 수 없습니다. 결국 인간은 아주 작은 표본을 기반으로 추측하게 됩니다. 이는 로봇이 충돌 없이 작업을 완료하지만 잘못된 방식으로 수행하는 "침묵의 실패"를 놓치게 만든다는 것을 의미합니다.

해결책: "인사이트 생성기 (IG)"
저자들은 **인사이트 생성기 (Insights Generator, IG)**라는 새로운 시스템을 구축했습니다. IG 를 단일 탐정으로 생각하지 말고, "건초더미 속의 바늘" 문제를 해결하기 위한 특정 워크플로우를 가진 전문 탐정 사무소로 생각하세요.

다음은 간단한 비유를 통해 이 사무소가 어떻게 작동하는지 설명한 것입니다:

  1. 오케스트레이터 (사무소 관리자): 이는 보스입니다. 직접 파헤치는 일을 하지 않습니다. 대신 큰 그림을 보고 어떤 종류의 조사가 필요한지 결정합니다.
  2. 스카우트 (탐험가): 이 에이전트들은 로봇 작업의 작고 무작위적인 표본을 살펴보도록 파견됩니다. 그들의 임무는 광범위하고 호기심 있게 행동하는 것입니다. 이상한 패턴을 찾고 가설을 세웁니다.
    • 가설 예시: "저는 로봇이 수학 문제를 실패하는 경우의 80% 에서 공식을 잘못 작성하지만 충돌하지는 않는다는 것을 발견했습니다. 이는 '침묵의 실패'입니다."
  3. 수사관 (감식 감사관): 스카우트가 가설을 세우면 수사관이接手합니다. 그들은 몇 가지 예시만 보는 것이 아니라 로봇 작업의 전체 방대한 데이터베이스(코퍼스) 를 검토합니다. 강력한 도구를 사용하여 전체 그룹에 대해 가설이 참인지 아닌지 계산하고, 비교하고, 입증합니다.
    • 결과: 추측 대신 다음과 같은 보고서를 작성합니다: "우리는 1,000 건의 실패 시도를 확인했습니다. 그중 84% 에는 이 특정 침묵 수학 오류가 있었습니다. 이것이 발생한 정확한 페이지는 여기 있습니다."

왜 이것이 다른가요?
대부분의 다른 시스템은 한 번에 하나의 로봇을 수정하거나 "도구 오류"나 "논리 오류"와 같은 미리 만들어진 목록으로 오류를 분류하려고 시도합니다. IG 는 다른 점은 아무도 존재하지 않는다고 알지 못했던 새로운 패턴을 발견한다는 것입니다. 이는 "추측"(스카우트) 과 "입증"(수사관) 을 분리하여 데이터의 압도적인 크기에 압도되지 않도록 합니다.

테스트했을 때 어떤 일이 발생했나요?
연구자들은 이 시스템을 두 가지 방식으로 테스트했습니다:

  1. "심판" 테스트: 그들은 초지능 AI 심판에게 IG 가 만든 보고서와 다른 시스템이 만든 보고서를 비교하게 했습니다. IG 의 보고서는 더 나은 증거와 더 깊은 설명을 포함하고 있어 더 높은 평가를 받았습니다. 이는 "자동차가 고장 났다"라고 말하는 보고서 (다른 시스템) 와 "자동차는 느슨한 전선 때문에 비 오는 날 왼쪽으로 회전할 때 특히 고장 나며, 여기는 영상 증거입니다"라고 말하는 보고서 (IG) 를 비교하는 것과 같습니다.
  2. "인간 수리공" 테스트: 이것이 가장 중요한 부분입니다. 연구자들은 실제 인간 엔지니어 (이러한 로봇을 구축하는 전문가) 에게 IG 와 다른 시스템의 보고서를 제공했습니다. 그런 다음 엔지니어들은 로봇을 수리하려고 시도했습니다.
    • 결과: IG 보고서를 사용한 엔지니어들은 다음으로 가장 좋은 시스템을 사용한 엔지니어들보다 로봇을 30% 더 잘 수리했습니다. IG 보고서는 모호한 힌트 대신 올바른 변경 사항을 수행하는 데 필요한 정확한 "어디"와 "왜"를 제공했습니다.

핵심 요약
이 논문은 "스카우트와 수사관" 팀 접근법을 사용하면 AI 에이전트가 실패하는 숨겨진 패턴을 마침내 볼 수 있다고 주장합니다. 이를 통해 인간 전문가들은 근본적인 문제를 훨씬 더 효과적으로 수정할 수 있으며, 혼란스러운 오류 로그 더미를 명확하고 증거 기반의 개선 로드맵으로 바꿀 수 있습니다.

이 논문이 주장하지 않는 것:

  • 이 시스템이 인간의 도움 없이 로봇을 자동으로 수리한다고 말하지 않습니다 (비록 자동화된 "패치" 루프를 테스트했지만, 주요 성공은 인간 전문가와 함께 이루어졌습니다).
  • 이 시스템이 세상 모든 유형의 AI 문제에 작동한다고 주장하지 않으며, 오직 AI 에이전트의 "추적"(로그) 을 분석하는 경우에만 해당합니다.
  • 모든 오류를 제거할 것이라고 약속하지는 않지만, 오류를 찾고 수정하는 과정을 훨씬 더 효율적이고 정확하게 만든다고 약속합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →