← 최신 논문
💻 computer science

Semantic Tracing in LLM-Based Multi-Agent Systems Using LangChain, LangGraph, and LangSmith for AI Governance

본 논문은 SHADOWAI-RISK 프로토타입 내에서 LangChain, LangGraph 및 LangSmith를 사용하여 LLM 기반 멀티 에이전트 시스템을 위한 시맨틱 트레이싱 프레임워크를 제시하며, 시맨틱 평가를 통합하는 것이 적절한 수준의 지연 시간 증가와 제로의 로컬 비용만을 발생시키면서 시맨틱 드리프트와 제약 조건 위반을 유의미하게 감소시킨다는 것을 입증한다.

원저자: Audrey Rahimi

게시일 2026-07-28
📖 1 분 읽기☕ 가벼운 읽기

원저자: Audrey Rahimi

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: LLM 기반 멀티 에이전트 시스템에서의 시맨틱 트레이싱(Semantic Tracing)

문제 정의
대규모 언어 모델(LLM) 기반의 멀티 에이전트 시스템을 도입하는 조직들은 "섀도우 AI(Shadow AI)", 환각 전파(hallucination propagation), 지시문 드리프트(instruction drift), 그리고 의사결정 생성 과정에 대한 가시성 결여를 포함한 심각한 거버넌스 과제에 직면해 있다. LangSmith와 같은 관측성 플랫폼은 실행 트레이스(execution traces)를 캡처하지만, 에이전트 간의 핸드오프(handoff) 과정에서 원래의 지시사항이 가진 시맨틱한 의미, 제약 조건, 그리고 증거에 대한 약속을 보존했는지 여부를 본질적으로 측정하지는 못한다. 현재의 프레임워크들은 "의미 보존(meaning preservation)"을 일급 측정 대상(first-class measurand)으로 취급하고, 이러한 측정을 기업용 AI 거버넌스 통제 항목(예: NIST AI RMF, EU AI Act)에 결합하는 통합된 방법을 결여하고 있다.

방법론
본 연구는 기업용 AI 거버넌스 및 리스크 인텔리전스를 위한 학술 연구 도구인 SHADOWAI-RISK 프로토타입의 로컬 실험적 확장을 중심으로 한 혼합 방법론을 채택한다. 방법론은 기존의 결정론적 베이스라인(deterministic baseline)과 새로운 실험적 조건을 구분한다:

  1. 실험 아키텍처:

    • 오케스트레이션(Orchestration): 상태 기반 노드(재고, 증거, 거버넌스, 인간 검토) 및 조건부 라우팅, 필수적인 인간 검토 게이트를 관리하기 위해 LangGraph(StateGraph)를 사용하여 구현되었다.
    • 추론 및 도구(Reasoning & Tools): 실제 LLM 호출, 도구 래핑(예: NVD CVE 조회), 그리고 재시도 메커니즘을 포함한 구조화된 출력 파싱을 위해 LangChain(ChatOpenAI, ChatPromptTemplate, JsonOutputParser)을 사용하여 구현되었다.
    • 관측성(Observability): LangSmith는 오직 프라이빗 트레이싱, 스팬(span) 캡처, 메타데이터 로깅을 위해서만 사용된다. 이는 시맨틱 지표를 계산하거나 거버넌스 결정을 내리지 않는다.
    • 시맨틱 평가(Semantic Evaluation): 별도의 규칙 기반 레이어가 핸드오프 패킷을 비교하여 드리프트, 제약 조건 누락, 근거 없는 주장 등을 탐지한다.
  2. 핸드오프 메커니즘:

    • 에이전트들은 목표 식별자, 제약 조건 세트, 증거 출처, 신뢰 수준, 잔여 리스크를 포함하는 구조화된 핸드오프 패킷(Handoff Packets)(Pydantic으로 검증됨)을 교환한다.
    • 이 패킷들은 시맨틱 충실도(semantic fidelity)를 측정하기 위한 분석 단위로 기능한다.
  3. 실험 설계:

    • 450회의 워크플로 실행(종단 실패 0건)이 완료된 통제된 매트릭스를 활용하였다.
    • 조건:
      • 결정론적 베이스라인 (기존 프로토타입에서 보존됨).
      • 시맨틱 평가가 없는 LLM 멀티 에이전트 (160회 실행).
      • LangSmith 트레이싱 + 시맨틱 평가가 포함된 LLM 멀티 에이전트 (160회 실행).
      • 변동성 및 절제 연구 (Ablation studies, 140회 실행).
    • 지표: 시맨틱 보존 점수(SPS), 에이전트 핸드오프 충실도(AHF), 지시문 드리프트율(IDR), 트레이스 완결성 점수(TCS), 도구 사용 정확도(TUA), 거버넌스 준수율(GCR), 환각 전파율(HPR), 워크플로 신뢰도 점수(WRS)를 포함한 공식적인 지표 세트를 정의하였다.

주요 기여
본 논문은 구현된 기능과 제안된 아키텍처를 구분하여 8가지 구체적인 요소를 기여한다:

  • C1: 시맨틱 트레이싱을 위한 개념적 구조 및 핸드오프 패킷 표현.
  • C2: LangSmith 중심의 관측성 파이프라인 및 공식 지표 세트 (인간에 의한 캘리브레이션은 미결 상태임).
  • C3: 4개의 에이전트 역할과 인간 검토 게이트를 갖춘 작동 가능한 로컬 프로토타입.
  • C4–C5: LangChain LLM 호출 및 LangGraph 오케스트레이션(상태 기반 라우팅 포함)의 실제 구현.
  • C6: 오케스트레이션, 추론, 결정론적 안전장치, 트레이스 캡처, 시맨틱 평가, 인간 의사결정의 명시적 분리.
  • C7: 변경되지 않은 SHADOWAI-RISK 프로토타입에 대한 베이스라인 대비 실험적 비교.
  • C8: 시맨틱 트레이싱 신호를 거버넌스 통제(NIST, ISACA, EU 등)에 대한 해석적 매핑.

결과
완료된 실험 매트릭스(450/450 실행)는 시맨틱 평가가 활성화된 LLM 조건과 그렇지 않은 LLM 조건 사이의 다음과 같은 비교 결과를 도출하였다:

  • 트레이스 완결성 (TCS): 평가 활성화 조건에서 유의미하게 낮았다 (0.624 vs. 0.912; Holm-조정 p < 0.001, Cliff's δ ≈ −0.33). 평가 레이어는 원시 트레이스가 포착하지 못한 누락된 스팬/필드를 식별하였다.
  • 워크플로 신뢰도 (WRS): 동일한 가중치 및 전문가 가중치 체계 모두에서 시맨틱 평가 시 유의미하게 낮았다 (작은 효과 크기).
  • 시맨틱 및 거버넌스 지표: 두 LLM 조건 사이에서 SPS, AHF, IDR, TUA, GCR, HPR, HEP에 대해 통계적으로 유의미한 차이가 발견되지 않았다.
  • 의사결정 정확도: 의사결정 유형의 정확도는 유사했다 (59/160 vs. 57/160; p ≈ 0.91).
  • 지연 시간 (Latency): 평가 활성화 조건에서 유의미하게 높은 지연 시간이 발생했다 (~126.2s vs. ~101.7s; Cliff's δ ≈ 0.67, 큰 효과 크기).
  • 비용: 두 조건 모두 로컬 모델 실행을 사용하여 $0의 로컬 비용이 발생했다.
  • 드리프트 탐지: 통제된 섭동(perturbation) 시나리오에서, 멀티 에이전트 조건은 지시문 드리프트와 증거 누락을 성공적으로 탐지한 반면, 결정론적 베이스라인은 홉 레벨(hop-level)의 제약 조건 드리프트를 탐지할 수 없었다 (단, 결정론적 규칙을 통해 누락된 데이터는 올바르게 처리함).

의의 및 주장
본 논문은 멀티 에이전트 확장의 주요 가치가 최종 의사결정의 우월성이 아니라 프로세스 투명성과 감사 가능성에 있다고 겸허히 주장한다.

  • 거버넌스 가치: 본 프레임워크는 에이전트들이 정보를 어떻게 교환하는지, 어디에서 제약 조건이 손실되는지, 그리고 어디에서 거버넌스 통제가 개입해야 하는지를 조사하는 메커니즘을 제공한다. 이는 에이전트 행동의 감사 가능한 증거를 생성함으로써 NIST AI RMF의 "측정(Measure)" 및 "거버넌스(Govern)" 기능을 지원한다.
  • 운영 현실: 본 연구는 제안된 개념적 아키텍처가 실제 운영 배포를 수정하지 않고도 LangChain, LangGraph, LangSmith를 사용하여 운영 가능함을 입증한다.
  • 한계점: 저자들은 시맨틱 보존의 효과성이 생산 환경에서 아직 증명되지 않았음을 명시적으로 밝힌다. 지표 가중치에 대한 인간의 캘리브레이션, 평가자 간 일치도 연구, 주석이 달린 코퍼스에 대한 외부 검증 등이 향후 과제로 남아 있다. 결과는 생산 규모의 배포가 아닌 로컬 실험적 확장에 기반한다.
  • 결론: 최종 권고만을 필요로 하는 고정된 규칙 기반 거버넌스 작업의 경우, 결정론적 베이스라인이 여전히 충분하다. 그러나 중간 추론 과정, 에이전트 간 통신, 그리고 시맨틱한 책임 소재에 대한 가시성이 필요한 설정의 경우, 멀티 에이전트 아키텍처는 지연 시간과 구현 복잡성의 비용을 감수하더라도 결정론적 워크플로가 갖지 못한 역량을 제공한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →