Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly
본 논문은 잘라내기 및 요약과 같은 결정 시 컨텍스트 구성으로 인해 지시 사항을 담고 있는 상태가 실수로 누락되어 언어 모델 에이전트에서 발생하는 '정책 운반 실패'를 식별하고 정량화하며, 중요한 상태를 고정하고 알림을 주입함으로써 이러한 위험을 부분적으로 완화하는 SafeContext 라는 제어 계층을 평가하지만 그 효과는 제한적이며 정책에 따라 달라진다는 점을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"Ghost in the Context" 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 제시합니다.
핵심 아이디어: 기계 속의 "유령"
법정에서 판사를 맡고 있다고 상상해 보세요. 당신은 방대한 증거 더미 (대화 기록) 와 따라야 할 엄격한 규칙 (정책) 을 가지고 있습니다. 하지만 최종 결정을 내리기 전에 그 더미의 상위 10 페이지만 읽을 수 있습니다.
이 논문은 AI 에이전트도 비슷한 문제를 겪고 있다고 주장합니다. AI 가 질문에 답하기 전에, "중개인" 시스템 (Decision-Time Context Assembly 라고 함) 이 대화 기록을 잘게 자르고 요약하여 AI 모델에게 보내기 위해 작은 상자에 넣습니다.
무서운 점은 무엇일까요? 만약 중간인이 실수로 규칙을 버리거나, 더 이상 의미가 없도록 다시 쓰면, AI 자체가 똑똑하고 규칙이 명확히 명시되어 있었더라도 AI 가 규칙을 위반할 수 있습니다. 논문은 이를 **"정책 운반 실패 (Policy-Carriage Failure)"**라고 부릅니다. 규칙은 존재했지만, 결정의 순간까지 "운반"되지 못했습니다.
규칙이 사라지는 세 가지 방법
저자들은 이러한 규칙들이 "중개인" 단계 동안 사라지거나 왜곡되는 세 가지 구체적인 방식을 발견했습니다.
추방 (The "Lost in the Shuffle" 문제):
- 비유: 긴 전화 통화 시작 시 친구에게 "문 잠그는 거 잊지 마"라고 말한다고 가정해 보세요. 통화 끝에 다다를 때쯤이면 친구는 너무 많은 다른 이야기 때문에 그 지시를 잊어버립니다.
- 발생 상황: 메모리의 작은 "상자"에 공간이 부족해 규칙이 밀려납니다. AI 가 행동할 때 규칙을 전혀 보지 못하게 됩니다.
별칭화 (The "Bad Translation" 문제):
- 비유: 통역사에게 "빨간 열매는 먹지 마"라고 말한다고 가정해 보세요. 통역사는 이를 "열매에 주의하세요"라고 요약합니다. "빨간"과 "먹지 마"라는 단어가 사라집니다. AI 는 경고는 보지만, 열매를 먹는 것을 막기에는 너무 약합니다.
- 발생 상황: 규칙은 살아남지만, 너무 느슨하게 요약되거나 다시 쓰여 더 이상 나쁜 행동을 엄격히 금지하지 않게 됩니다. 규칙의 "정신"이 깨집니다.
결합 불안정성 (The "Wrong Target" 문제):
- 비유: 경비원에게 "A 씨의 출입을 막으세요"라고 말한다고 가정해 보세요. 나중에 경비원은 "B 씨의 출입을 막으세요"라는 요약을 봅니다. 규칙은 여전히 존재하지만, 잘못된 사람을 가리키고 있습니다.
- 발생 상황: 규칙 텍스트는 살아남지만, 잘못된 대상, 사람, 또는 조건에 연결됩니다.
실험: "중개인" 테스트
연구진은 Llama, Qwen, Mistral 등 여러 AI 모델을 대상으로 이를 테스트했습니다. 그들은 AI 가 도구 출력, 채팅 로그, 요약 등 많은 다른 정보에 폭격당하면서도 "데이터 삭제 금지"나 "외부 도구 사용 금지"와 같은 엄격한 규칙을 따라야 하는 시나리오를 만들었습니다.
결과:
- 문제는 현실적입니다: 어떤 도움도 없이 AI 는 "중개인" 시스템이 지시 사항을 떨어뜨리거나 약화시켰기 때문에 규칙을 자주 위반했습니다.
- 해결책 (SafeContext): 연구진은 SafeContext라는 안전 계층을 구축했습니다. 이를 규칙을 위한 VIP 패스라고 생각하세요.
- 규칙이 목록 상단에 "고정"되어 버려지지 않도록 강제합니다.
- 규칙을 효율적으로 재사용하여 공간을 너무 많이 차지하지 않도록 합니다.
- 대화가 너무 혼잡해지면 AI 가 답변하기 직전에 규칙에 대한 빠른 리마인더를 주입합니다.
해결책이 작동했을까요?
- 네, 하지만 한계가 있습니다. 이 해결책은 특히 대화가 매우 혼잡할 때 AI 가 규칙을 더 자주 따르도록 도왔습니다.
- 마법은 아닙니다. 해결책이 있더라도 AI 는 완벽한 점수를 받지 못했습니다. "중개인"이 매우 공격적인 요약기를 사용했다면, 해결책이 규칙을 완전히 구할 수는 없었습니다.
- 더 큰 모델이 답은 아닙니다. 훨씬 더 똑똑하고 큰 AI 를 사용하는 것이 자동으로 문제를 해결하지는 않았습니다. 문제는 AI 가 얼마나 똑똑한가가 아니라 컨텍스트가 어떻게 조립되었는지에 있었습니다.
안전의 비용
논문은 또한 이 안전의 "가격"을 살펴보았습니다.
- 토큰 비용: 규칙을 안전하게 유지하는 것은 때때로 AI 에게 더 많은 텍스트 (예: 리마인더 메모 추가) 를 보내는 것을 필요로 했습니다.
- 좋은 소식: 그들의 "스마트 재사용" 방법 (캐싱) 은 실제로 일부 경우 비용을 절감했습니다. 규칙을 매번 다시 쓰는 대신 이전 버전을 가리키기만 하여 공간을 절약했습니다.
결론
이 논문은 보안이 AI 모델 자체에만 관한 것이 아님을 결론지었습니다. 이는 AI 의 메모리를 준비하는 "조립 라인"에 관한 것입니다. 만약 그 조립 라인이 규칙을 떨어뜨린다면, AI 가 얼마나 똑똑하든 실패할 것입니다.
AI 를 더 안전하게 만들기 위해서는 규칙을 단순한 공간 절약을 위해 요약되거나 삭제될 수 있는 일반 텍스트로 취급하는 것이 아니라, AI 의 뇌로 가는 여정에서 살아남아야 하는 특별하고 보호받는 항목으로 취급해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.