LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents
이 논문은 복잡한 LLM 에이전트 워크플로우를 검증하는 데 있어 커지는 과제를 해결하기 위해, 가공되지 않은 에이전트 실행 이벤트를 주장과 이를 뒷받침하는 행동, 산출물 및 검증 단계들을 연결하는 구조화되고 감사 가능한 경로로 변환하는 계층적 증거 및 결정 그래프를 구축하는 추적 및 검토 시스템인 LEDGER를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: LEDGER – LLM 에이전트 감사를 위한 주장-증거 추적 그래프 (Claim-to-Evidence Trace Graphs)
문제 정의
대규모 언어 모델(LLM) 에이전트가 단발성 질의응답 시스템에서 도구 사용, 코드 실행, 파일 편집, 아티팩트 생성을 포함하는 장기적인 기술 워크플로우를 수행할 수 있는 상호작용형 작업자로 진화함에 따라, 생산성의 주요 병목 현상은 출력 생성에서 **감사 가능성(auditability)**으로 이동했습니다. 기존의 관측성(observability) 시스템(예: LangSmith)은 실행 이벤트(프롬프트, 도구 호출, 오류, 중간 출력)에 대한 세밀한 가시성을 제공하지만, 이러한 가시성이 곧 감사 가능성을 의미하지는 않습니다.
검토자들은 현재 "평면적 기록(flat record)" 문제에 직면해 있습니다. 즉, 특정 결론을 뒷받침하는 행동, 아티팩트, 검증 단계가 무엇인지 판단하기 위해 세션의 논리적 구조를 수동으로 재구성해야 합니다. 이러한 수동 재구성은 노동 집약적이며, 세션의 복잡성에 따라 확장성이 떨어지고, 최종 주장과 그 근거가 되는 실제 증거 사이의 직접적인 계보를 모호하게 만듭니다. 본 논문은 효과적인 감사를 위해서는 검토자가 선형적인 로그를 읽는 것이 아니라, 보고된 결과로부터 그 결과를 생성한 구체적인 행동과 아티팩트로 역추적할 수 있는 증거 중심(evidence-centered) 접근 방식이 필요하다고 주장합니다.
방법론: LEDGER 시스템
저자들은 수정되지 않은 상호작용형 에이전트 세션과 함께 작동하는 사이드카 트레이싱 및 검토 시스템인 LEDGER(Layered Evidence and Decision Graphs for Execution Review)를 소개합니다. LEDGER는 기존의 관측성을 대체하는 것이 아니라, 캡처된 기록을 인간의 검토를 위해 설계된 계층적 시맨틱 트레이스 그래프로 재구성합니다.
1. 캡처 및 트레이스 기록 (Capture and Trace Records)
LEDGER의 기초는 캡처된 세션 데이터의 안정적이고 비해석적인 기질인 **트레이스 기록(Trace Record)**입니다.
- 메커니즘: 시스템은 라이프사이클 훅(예:
SessionStart,PreToolUse,PostToolUse)과 트랜스크립트 재구성을 사용하여 메시지, 도구 호출, 결과 및 파일 상호작용을 포함하는 JSON 페이로드를 캡처합니다. - 무결성: 이러한 기록은 소스 트랜스크립트와의 연결을 포함하여 세션의 원래 순서와 내용을 보존합니다. 이는 추론된 구조와 구별되는 "진실의 원천(source of truth)" 역할을 합니다.
2. 계층형 그래프 구축 (Layered Graph Construction)
LEDGER는 트레이스 기록을 세 가지 계층의 그래프 구조로 조직합니다.
- 증거 노드 (Evidence Nodes): 밀접하게 연관된 트레이스 기록(예: 도구 호출과 그 결과)을 검사 가능한 작업 단위로 그룹화합니다. 이들은 유형(Type)(Action vs. Artifact)과 카테고리(예:
user_message,tool_call,control,artifact)에 따라 분류됩니다. 아티팩트 노드는 코드 패치, 플롯, 테이블 또는 명령 출력과 같이 검사 가능한 객체를 구체적으로 나타냅니다. - 워크플로우 노드 (Workflow Nodes): 관련 증거 노드들을 더 높은 수준의 작업 단계(예:
context,plan,inspect,execute,validate,claim)로 그룹화합니다. 이 추상화는 검토자가 이벤트 단위가 아닌 단계(phase) 수준에서 세션을 볼 수 있게 합니다. - 시맨틱 엣지 (Semantic Edges): 유형화된 방향성 엣지는 노드를 연결하여 관계를 정의합니다. 주요 엣지 유형은 다음과 같습니다.
uses: 작업 단위가 아티팩트를 소비함.produces: 작업 단위가 아티팩트를 생성하거나 수정함.checked_by: 변경 사항이 특정 단계에 의해 검증됨.supports: 증거가 주장을 뒷받침함.informs: 결과가 후속 계획을 형성함.frames: 요구사항이 작업의 맥락을 설정함.
3. 인터페이스 및 검토 워크플로우
시스템은 다음을 통합하는 로컬 대시보드를 제공합니다.
- 그래프 뷰 (Graph Views): 두 단계의 시각화(워크플로우 및 증거 레이어)를 통해 검토자가 높은 수준의 단계에서 특정 증거로 내려가며 탐색할 수 있도록 합니다.
- 아티팩트 검사 (Artifact Inspection): 그래프에 연결된 특정 플롯, 패치 또는 테이블과 같은 하위 아티팩트로 직접 인덱싱하여 접근합니다.
- 트레이스 구축 감사 (Trace-Construction Audit): 원시 트레이스 기록과 그래프 업데이트를 보여주는 뷰를 통해, 검토자가 에이전트의 오류와 트레이싱 오류(즉, 그래프가 원시 데이터로부터 어떻게 구성되었는지)를 구분할 수 있게 합니다.
주요 기여
- 주장-증거 추적 그래프 구축 (Claim-to-Evidence Trace Graph Construction): 수정되지 않은 에이전트 세션을 아티팩트 노드가 검사 가능한 증거를 나타내고 유형화된 엣지가 주장과 이를 뒷받침하는 행동 및 검증 단계를 명시적으로 연결하는 계층적 시맨틱 그래프로 파싱하는 방법론.
- 증거 중심 검토 인터페이스 (Evidence-Centered Review Interface): 그래프 수준의 감사 경로와 소스 기록 및 아티팩트를 통합하여, 검토자가 워크플로우의 논리적 구조와 원시 증거 사이를 유연하게 이동할 수 있게 하는 대시보드.
- 캡처와 해석의 분리 (Separation of Capture and Interpretation): 결정론적인 소스 기록(트레이스 기록)과 추론된 구조(증거/워크플로 노드)를 엄격히 분리하여, 그래프가 불투명한 진실의 원천이 아닌 감사 보조 도구로 남을 수 있도록 하는 설계.
결과 및 사례 연구
본 논문은 실시간 트레이싱이 활성화된 Codex 에이전트를 사용하여 두 가지 사례 연구를 통해 LEDGER를 검증합니다.
- 사례 연구 1: 표 형식 데이터 분석 (Tabular Data Analysis): 에이전트가 일일 패턴 보고서를 생성하기 위해 대기 질 데이터를 분석했습니다. 트레이스 그래프는 최종 주장이 생성된 플롯과 요약 테이블을 거쳐 소스 데이터 정제 단계로 연결되는 **아티팩트 계보(artifact lineage)**를 성공적으로 드러냈습니다. 또한, 누락된 종속성으로 인한 스크립트 실행 실패가 어떻게 추적되고, 패치되었으며, 재검증되었는지를 보여줌으로써 **오류 및 복구 시퀀스(error-and-repair sequence)**를 강조하여 복구 과정을 투명하게 만들었습니다.
- 사례 연구 2: 코드베이스 내 기능 추가 (Feature Addition in Codebase): 에이전트가 NetworkX 라이브러리에 최단 경로 유틸리티를 추가했습니다. 그래프는 초기 구현과 후속 **회귀 테스트 및 가드 패치(regression testing and guard patches)**를 구분했습니다. 검토자는 특정 모듈에 함수를 배치한 설계 선택을 저장소 조사 및 문서 읽기로 역추적할 수 있었고, 동작을 검증하는 특정 테스트로 순방향 추적할 수 있었습니다.
두 사례 모두에서 시스템은 "감사 경로"를 명시적으로 만들어, 검토자가 단순히 주장이 이루어졌는지뿐만 아니라, 그 주장이 특정 아티팩트와 검증에 의해 어떻게 뒷받침되었는지 확인할 수 있음을 입증했습니다.
의의 및 주장
본 논문은 LEDGER를 에이전트 관측성의 필수적인 진화 단계로 위치시킵니다. LEDGER의 의의는 패러다임을 가시성(무슨 일이 일어났는지 보는 것)에서 감사 가능성(왜 결론이 신뢰할 수 있는지 이해하는 것)으로 전환하는 데 있습니다.
- 완곡한 주장 (Modest Claims): 저자들은 그래프 구축이 완전히 결정론적이지 않음을 명시적으로 밝힙니다. 즉, 트레이서가 어떤 기록이 서로 연결되는지 해석하고 시맨틱 엣지를 할당합니다. 따라서 그래프는 진실의 원천이 아니라 감사 보조 도구로 제시됩니다. 인터페이스는 원시 기록을 계속 노출하여 검토자가 그래프의 구축 과정을 검증할 수 있도록 설계되었습니다.
- 향후 방향 (Future Direction): 본 논문은 향후 연구가 모델 기반의 구조를 결정론적이거나 독립적으로 검증 가능한 구조(예: 더 강력한 계측 또는 프로비넌스 인식 백엔드 활용)로 대체하고, 결정론적 관계와 추론된 관계를 더 잘 구분할 수 있도록 시각적 어휘를 개선하는 것을 목표로 해야 한다고 제안합니다.
궁극적으로 LEDGER는 소스 기록에 대한 접근성을 유지하면서 행동, 아티팩트, 결론 사이의 연결을 검사 가능하고 탐색 가능하게 만듦으로써, 복잡한 에이전트 워크플로우에 대한 인간의 감독 필요성을 지원하고자 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.