A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns
이 논문은 장기적 에이전트가 양호한 조건 하에서 이전 턴에 명시된 안전 제약 조건을 간과하는 "GHOST" 실패 모드를 식별 및 분석하고, 이러한 위험을 이론적 및 경험적으로 제거하기 위한 2계층 STAR-Guard 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: 장기적 관점 에이전트의 유령 (GHOST)
문제 정의: 간과된 안전 제약 조건으로 인한 거버넌스 위험
본 논문은 장기적 관점의 도구 사용 대규모 언어 모델(LLM) 에이전트에서 발생하는 **'대화 턴 전반에 걸친 간과된 안전 제약 조건에 의한 거버넌스 위험(GHOST)'**이라는 특정 실패 모드를 식별한다.
기존의 안전 연구가 적대적 공격(예: 프롬프트 인젝션)이나 즉각적인 유해 요청에 집중하는 것과 달리, GHOST는 양호한 상호작용 조건 하에서 발생한다. 이는 에이전트가 작업을 성공적으로 완료했음에도 불구하고, 대화 기록의 이전 턴에서 명시적으로 언급되었던 안전 제약 조건을 위반할 때 발생한다. 에이전트는 현재 작업과 제약 조건 사이의 긴 상호작용 이력으로 인해 해당 제약 조건을 "망각"하거나 불러오지 못하며, 이로 인해 돌이킬 수 없는 피해(예: 승인 없이 이메일 삭제, 데이터베이스 레코드 파괴)를 초래한다.
저자들은 이를 일반적인 지시 이행 실패와 구분한다. GHOST 이벤트에서는 다음과 같은 현상이 나타난다:
- 작업 목표는 성공적으로 완료된다.
- 안전 제약 조건은 여전히 유효하며 요구되는 상태이다.
- 제약 조건은 전체 컨텍스트 창 내에 존재하지만, 현재의 작업 재개 프롬프트에는 다시 명시되지 않았다.
- 제약 조건이 전체 컨텍스트에 존재함에도 불구하고, 에이전트는 안전하지 않게 작업을 실행한다.
이론적 프레임워크: 해저드 영역 도달 가능성 (Hazard-Region Reachability)
본 논문은 안전 제약 조건을 행동 공간에서의 해저드 영역()으로 모델링하여 이론적 분석을 제공한다. 저자들은 안전한 히스토리 접두사가 주어졌을 때, 안전이 중요한 기회 에서 에이전트가 해저드 영역에 진입할 확률을 나타내는 잔여 조건 진입 해저드 를 정의한다.
핵심 이론적 통찰:
조건부 해저드 프레임워크를 사용하여, 저자들은 만약 안전한 접두사를 따르는 잔여 조건 해저드가 비가산 수열(즉, )에 의해 하한이 결정된다면, 에이전트는 거의 확실하게(almost surely) 해저드 영역에 진입하게 됨()을 증명한다.
또한 저자들은 **컨텍스트 조건 부사리(Context-Conditioned Corollary)**를 확립한다: 상호작용 이력이 증가함에 따라(컨텍스트 길이 증가), "주의력 희석(attention dilution)" 효과가 역사적 제약 조건에 대한 거버넌스를 약화시켜, 결과적으로 잔여 해저드의 하한을 높일 수 있다. 만약 이 해저드 하한이 무기한의 기회 동안 비가산 상태로 유지된다면, GHOST 발생 확률은 1에 수렴한다. 이는 이는 단순히 성능을 선형적으로 감소시키는 것이 아니라, 개입 없이는 안전 역학을 근본적으로 변화시켜 위반을 필연적으로 만든다는 것을 시사한다.
방법론: SCARBench 및 STAR-Guard
1. SCARBench: 재활성화 시 안전 제약 가용성 벤치마크
GHOST를 실증적으로 검증하기 위해 저자들은 실행 가능하고 환경 기반인 SCARBench를 도입한다.
- 구조: 6개의 도구 사용 도메인(장치/캘린더, 금융, 이메일, 파일 시스템, 네트워크 요청, 스크립트 실행)에 걸친 103개의 고유한 기본 시나리오와 총 412개의 매칭된 인스턴스로 구성된다.
- 조건: 각 시나리오는 히스토리 길이(Short vs. Long)와 제약 조건 가용성(Explicit vs. Implicit)에 따라 변하는 네 가지 조건 하에서 테스트된다:
- SE/SI: 짧은 히스토리와 명시적(Explicit)/암묵적(Implicit) 제약 조건.
- LE/LI: 긴 히스토리(6,000+ 토큰, 56–160 턴)와 명시적(Explicit)/암묵적(Implicit) 제약 조건.
- 지표: 벤치마크는 Strict GHOST를 측정하며, 이는 에이전트가 명시적 조건(LE) 하에서는 안전하게 작업을 완료하지만, 제약 조건이 히스토리에 존재함에도 불구하고 암묵적 조건(LI) 하에서는 안전하지 않게 작업을 완료하는 인스턴스를 의미한다.
2. STAR-Guard: 2계층 방어 체계
GHOST를 완화하기 위해 저자들은 제약 조건에 대한 오라클(Oracle) 지식에 의존하지 않는 방어 메커니즘인 STAR-Guard(Safety-Constraint Tracking, Activation, and Runtime-Audit Guard)를 제안한다.
계층 1: 의미론적 제약 조건 복원 (Semantic Constraint Restoration)
- 추출: 온라인 인제스션(Ingestion) 모듈이 들어오는 사용자 메시지를 파싱하여 지속 가능한 안전 제약 조건을 감지하고, 그 범위, 트리거, 규칙을 추출한다.
- 저장: 추출된 제약 조건은 외부 라이브러리에 구조화된 "생애주기 규칙 객체(lifecycle rule objects)"로 저장된다.
- 복원: 작업이 재개될 때, 시맨틱 게이트(Semantic Gate)가 현재 작업과 라이브러리를 매칭한다. 적용 가능한 제약 조건은 에이전트의 제안 생성을 가이드하기 위해 현재 컨텍스트 프롬프트에 의미론적으로 복원(렌더링)된다.
- 한계: 이 계층은 확률적이며, 불량한 제안의 가능성을 줄여주지만 안전을 보장할 수는 없다.
계층 2: 결정론적 실행 전 감사 (Deterministic Pre-Execution Audit)
- 개입: 제안된 행동이 환경에 도달하기 전, 결정론적 규칙 감사기가 에이전트의 제안을 활성 제약 조건과 대조하여 검사한다.
- 집행: 감사기는 "금지 우선(prohibition-first)" 정책을 적용한다. 제안이 금지 규칙을 위반하면 즉시 차단된다. 만약 전제 조건 규칙(예: "삭제 전 백업")을 위반하는 경우, 시스템은 전제 조건(수리)을 실행하려고 시도하고 재감사를 수행한다. 수리가 불가능한 경우 해당 행동은 차단된다.
- 보장: 이 계층는 활성 제약 조건을 위반하는 어떤 행동도 환경에 도달하지 않도록 보장하며, 해저드 축적 메커니즘을 차단한다.
실험 결과
저자들은 SCARBench를 사용하여 7개의 모델(API 서비스 모델 5개, 로컬 배포 모델 2개)에 대해 STAR-Guard를 평가하였다.
GHOST의 유병률:
- GHOST는 광범위한 문제이다. GPT-5.5의 경우, 양호한 롱 컨텍스트 조건에서 Strict GHOST 비율은 **11.5%**였다.
- 다른 모델들은 6.8%(Kimi-K2.6)에서 27.8%(Qwen3.5-4B) 사이의 비율을 보였다.
- "차이의 차이(Difference-in-Differences)" 지표는 긴 히스토리가 짧은 히스토리에 비해 제약 조건 회복 실패율을 유의미하게 증폭시킨다는 것을 확인해주었다.
STAR-Guard의 효과:
- GPT-5.5: STAR-Guard는 불완전 완료(Unsafe Completion, UC)율을 12.4%에서 **0.0%**로, Strict GHOST 비율을 11.5%에서 **0.0%**로 낮추었으며, 동시에 안전 완료(Safe Completion, SC)를 76.3%에서 94.0%로 높였다.
- Qwen3.5-4B: SC는 47.0%에서 81.2%로 증가했고, GHOST는 27.8%에서 1.9%로 감소했다.
- 절제 연구(Ablation Studies): 결과는 "복원 전용(Restoration Only)"이나 "감사 전용(Audit Only)" 중 어느 것도 단독으로는 충분하지 않음을 보여준다. 복원은 안전성을 개선하지만 잔여 위험을 남기며, 감사는 위험을 차단하지만 시맨틱 가이드 없이 사용될 경우 작업 수행을 방해할 수 있다. 두 방식의 결합이 최적의 트레이드오프를 달성한다.
베이스라인과의 비교:
- 표준 검색 방법(BM25), 요약, 또는 지시 이행 개선 기법(예: DeCRIM, Prompt Reminder)은 GHOST 비율을 유의미하게 줄이는 데 실패했으며, 높은 불완전 완료율을 유지하는 경우가 많았다.
- 오라클 기반 방법(제약 조건을 이미 알고 있다고 가정하는 방식)은 성능이 좋았으나, 제약 조건을 온라인으로 캡처해야 하는 실제 배포 환경에서는 실용적이지 않다. STAR-Guard는 오라클 접근 권한 없이도 유사한 수준의 안전성을 달성했다.
의의 및 주장
본 논문은 GHOST가 단순히 컨텍스트 창 크기를 늘리거나 표준적인 지시 이행 능력을 활용하는 것만으로는 해결할 수 없는, 장기적 관점의 에이전트에서 발생하는 중요하고도 미개척된 안전 격차임을 주장한다.
- 이론적 기여: 시간 경과에 따른 안전 거버넌스 저하의 위험을 정식화하였으며, 개입이 없다면 비가산 해저드 조건 하에서 안전 위반 확률이 확실성에 도달함을 보여주었다.
- 실무적 기여: 역사적 안전 제약 조건의 회복을 평가하기 위한 엄격한 표준으로서 SCARBench를 도입하였고, 비-오라클(non-oracle) 방어 메커니즘으로서 STAR-Guard를 제안하였다.
- 핵심 결론: 장기적 관점의 에이전트에서 안전을 유지하기 위해서는 에이전트의 의도를 가이드하는 **의미론적 복원(semantic restoration)**과 하드 제약 조건을 강제하는 **결정론적 감사(deterministic auditing)**라는 이중적 접근 방식이 필요하다. 왜냐나 확률적 모델만으로는 확장된 상호작용 이력 전반에 걸쳐 안전을 신뢰성 있게 관리할 수 없기 때문이다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.