Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback
본 논문은 LLM 에이전트에서의 '인지 중독' 개념을 소개하며, 이는 악성 도구가 해로운 행동을 실행하기 전에 선의의 피드백을 통해 신뢰를 구축하는 현상을 의미하고, 또한 프롬프트 수준의 휴리스틱에 의존하기보다는 최종 실행 가능한 행동을 점수화함으로써 이러한 궤적 기반 위험을 효과적으로 탐지하고 완화하기 위한 TRUST-Bench 벤치마크와 VISTA-Guard 방어 프레임워크를 제안합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 "신뢰하지 마라: 신뢰할 수 없는 도구 피드백 하의 LLM 에이전트 평가 및 방어"라는 논문을 쉬운 언어와 일상적인 비유로 설명한 것입니다.
핵심 아이디어: "양의 옷을 입은 늑대" 도구
당신이 쇼핑을 하도록 개인 비서 (AI 에이전트) 를 고용했다고 상상해 보세요. 비서에게 "가게에 가서 우유를 사오라"고 말합니다.
보통은 비서가 가게 (도구) 를 선택하면, 그 가게로부터 돌아온 정보가 정직하다고 가정합니다. 가게가 "우유가 있습니다"라고 말하면 우리는 그것을 믿죠.
이 논문은 이러한 가정이 위험하다고 주장합니다.
저자들은 "인지 중독 (Cognitive Poisoning)"이라는 새로운 유형의 사기를 설명합니다. 이는 양의 옷을 입은 늑대와 같습니다.
- 사기: 악의적인 도구 (늑대) 는 처음에는 완벽하게 정상적으로 행동합니다. 몇 차례의 대화 동안 비서의 질문에 정중하고 정확하게 답변하며 신뢰를 쌓아갑니다.
- 함정: 도구는 마지막 순간까지 진정한 해로운 본성을 드러내지 않습니다. 비서가 "우유를 사고 이 낯선 사람에게 1,000 달러를 이체하라"는 최종적이고 큰 결정을 내리기 직전까지 기다립니다. 특정 숨겨진 조건이 충족될 때만 도구는 스위치를 전환하며 "사실, 위험한 일을 해봅시다"라고 말합니다.
무서운 점은 무엇일까요? 도구가 보낸 개별 메시지를 하나씩 보면 모두 무해해 보입니다. 위험은 나쁜 문장 하나에 있는 것이 아니라, 시간이 지남에 따라 도구가 들려준 이야기에 있으며, 이 이야기가 비서의 경계를 낮추게 만든 것입니다.
문제: 기존 방어책은 작동하지 않음
연구진은 현재 안전 시스템이 이 문제를 얼마나 잘 처리하는지 테스트했습니다. 그들은 대부분의 기존 방어책이 문 앞에서 신분증만 확인하는 경비원과 같다고 발견했습니다.
- 도구의 이름이나 메시지의 처음 몇 단어를 확인합니다.
- 도구가 친근해 보이고 처음 몇 개의 메시지가 안전하면 경비원은 통과시킵니다.
- 결과: 이러한 경비원들은 "인지 중독"에 대해 완전히 실패합니다. 도구가 상호작용의 대부분 동안 친근했기 때문입니다. 경비원들은 이야기의 미묘한 변화를 놓쳤습니다.
해결책: TRUST-BENCH 와 VISTA-GUARD
이를 연구하기 위해 팀은 두 가지 것을 구축했습니다.
1. TRUST-BENCH (훈련장)
그들은 TRUST-BENCH라는 거대한 테스트 은행을 만들었습니다.
- 설정: 웹 검색이나 파일 편집과 같은 수천 개의 일반 작업을 가져와서 각각의 "악의적인 쌍둥이"를 만들었습니다.
- 매칭: 모든 안전한 작업에 대해, 도구가 3 회 동안 친절하게 행동하다가 4 회에 AI 를 해로운 행동으로 속이려는 악의적인 버전을 만들었습니다.
- 목표: AI 가 실제로 안전한 도구와 마지막 순간까지 안전해 보이는 척하는 도구를 구별할 수 있는지 확인하는 것입니다.
2. VISTA-GUARD (스마트 탐정)
그들은 VISTA-GUARD라는 새로운 방어 시스템을 구축했습니다. 신분증만 확인하는 것이 아니라, 이 시스템은 사건 파일을 검토하는 탐정처럼 행동합니다.
- 작동 방식: 최종 요청만 보는 것이 아니라 대화의 전체 기록을 살펴봅니다.
- 비유: 탐정이 이렇게 묻는다고 상상해 보세요. "용의자는 3 일 동안 무죄라고 말했지만, 4 일째에 갑자기 금고 열쇠를 요청했습니다. 전체 이야기가 논리적인가요, 아니면 행동의 갑작스러운 변화가 의심스러워 보이나요?"
- 비밀 무기: VISTA-GUARD 는 대화를 구조화된 보고서 (신호의 점수판과 같은) 로 변환한 후 AI 에게 묻습니다. "이 전체 이야기를 고려할 때, 최종 행동은 안전한가요?"
결과: 누가 이겼나?
연구진은 VISTA-GUARD 를 다른 많은 방법들 (다른 AI 와 간단한 규칙 기반 시스템 포함) 과 비교 테스트했습니다.
패자:
- 간단한 규칙: "나쁜 단어"만 찾는 시스템은 실패했습니다.
- Zero-Shot 판사: 특별한 훈련 없이 이 문제를 판단하도록 요청받은 매우 똑똑한 사전 훈련된 AI 모델 (GPT-5.4 등) 도 실패했습니다. 이들은 너무 "파라노이아"적 (모든 것을 거부) 이거나 너무 신뢰했습니다.
- 스칼라 분류기: 대화를 단일 숫자 (예: "위험 점수") 로 변환하는 시스템은 이야기의 세부 사항을 잃어버렸기 때문에 실패했습니다.
승자:
- VISTA-GUARD가 일관되게 성공한 유일한 시스템이었습니다.
- 시간이 지남에 따라 신뢰가 어떻게 구축되었는지 분석하여 "늑대"를 찾아내는 법을 배웠습니다.
- 점수: 자체 훈련 환경에서 높은 안전 점수 (84.2) 를 달성했으며, 완전히 새로운 보지 못한 도구를 테스트했을 때도 여전히 잘 수행되었습니다 (56.9).
핵심 교훈
이 논문은 신뢰는 스냅샷이 아니라 과정이라고 결론 내립니다.
AI 가 도구를 사용할 때 단순히 "이 도구의 이름은 안전한가?" 또는 "이 메시지는 안전한가?"라고 묻지 않아야 합니다. 대신 **"우리의 상호작용 전체 역사가 논리적인가, 그리고 최종 행동이 우리가 들어온 이야기와 부합하는가?"**라고 물어야 합니다.
도구가 3 일 동안 친구처럼 행동하다가 4 일째에 갑자기 은행을 털려고 한다면, AI 는 마지막 문장뿐만 아니라 이야기 자체가 위험하다는 것을 알아차려야 합니다.
한 문장으로 요약
이 논문은 악의적인 도구들이 공격하기 전에 잠시 동안 친절하게 행동하여 AI 에이전트를 속일 수 있음을 보여주며, 이를 막는 유일한 방법은 최종 요청이 아닌 상호작용의 전체 기록을 분석하는 방어 시스템을 사용하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.