← 최신 논문
🤖 AI

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

이 논문은 공격자가 영향을 미친 콘텐츠가 다양한 캐리어와 시스템 경계를 가로질러 지속됨으로써 발생하는 지연된 안전 위험을 현대적인 에이전트 하네스가 어떻게 완화하는지를 평가하는 종합적인 벤치마크이자 다단계 평가 프레임워크인 HarnessSafe를 소개하며, 이를 통해 격리 효과가 특정 캐리어 유형 및 하네스-모델 구성에 따라 크게 달라진다는 점을 밝혀낸다.

원저자: Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

게시일 2026-08-10
📖 5 분 읽기🧠 심층 분석

원저자: Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 단순히 질문에 답하는 것을 넘어 실제로 무언가를 수행할 수 있는 초지능 로봇 비서가 있다고 상상해 보세요. 이 로봇은 코드를 작성하거나, 항공권을 예약하거나, 디지털 파일을 정리할 수 있습니다. 이를 위해 로봇은 '두뇌'(AI 모델)와 '배낭'(기억, 도구, 기술을 담는 소프트웨어 시스템)이 필요합니다. 이 배낭은 매우 중요한데, 왜냐하면 로봇이 어제 했던 일을 기억하여 오늘 큰 프로젝트를 마칠 수 있게 해주기 때문입니다. 하지만 여기서 까다로운 문제가 발생합니다. 만약 누군가 그 배낭 속에 아주 작고 보이지 않는 바이러스를 몰래 집어넣는다면 어떻게 될까요? 이 바이러스는 즉시 아무 일도 하지 않을 수도 있습니다. 대신, 메모나 도구 설정 속에 숨어 있다가 몇 주 후 로봇이 완전히 무해한 작업을 수행할 때까지 기다립니다. 갑자기, 그 무해한 작업이 바이러스를 촉발하고, 로봇은 실수로 당신의 파일을 삭제하거나 비밀 메시지를 보내게 됩니다. 이것이 바로 AI 에이전트의 "지속적 위험(persistent risk)"의 세계입니다. 즉, 적절한 순간을 노리며 시간과 다양한 작업 속에서 살아남아 기다리는 위험입니다.

HarnessSafe라는 제목의 이 논문은 이러한 로봇 배낭에 대한 거대하고 첨단적인 스트레스 테스트와 같습니다. 연구진은 현재의 AI 시스템이 이 "잠자고 있는" 공격을 문제가 발생하기 전에 잡아낼 수 있는지 확인하고 싶었습니다. 그들은 7가지 인기 있는 로봇 시스템에 걸쳐 7가지 서로 다른 유형의 "배낭"(메모리, 기술, 공유 도구 등)에 이 숨겨진 바이러스를 심어보는 328개의 서로 다른 시나리오를 갖춘 놀이터를 구축했습니다. 연구진은 단순히 "로봇이 해킹당했습니까? 예/아니오"라고 묻는 대신, 공격 과정을 단계별로 추적했습니다. 그들은 바이러스가 심어지는 즉시 발견되었는지, 경계(예: 새로운 날 또는 새로운 사용자)를 넘을 때 생존했는지, 아니면 결국 재앙을 일으키는 데 성공했는지를 관찰했습니다.

결과는 일종한 경종을 울렸습니다. 연구진은 안전이 단지 로봇의 두뇌나 배낭만의 문제가 아니라, 그 둘의 특정 조합에 관한 문제라는 것을 발견했습니다. 어떤 로봇 시스템은 메모리 속의 바이러스를 잡는 데는 뛰어나지만, 도구 속의 바이러스를 찾아내는 데는 형편없었습니다. 다른 시스템은 그 반대였습니다. 실제로 두 시스템의 "실패율(해킹당하는 빈도)"이 같을 수도 있지만, 한 시스템은 공격을 초기에 차단한 반면, 다른 시스템은 재앙이 일어나기 전까지 며칠 동안 바이러스가 돌아다니도록 방치했을 수도 있습니다. 이는 단순히 시스템이 얼마나 자주 해킹당하는지를 세는 것만으로는 부족하며, 우리는 어디에서, 언제 방어가 실패했는지 알아야 한다는 것을 의미합니다. 이 연구는 이러한 숨겨진 지연 공격이 실재하며 위험하다는 것을 증명했고, 이를 해결하려면 단순히 최종 폭발만을 보는 것이 아니라 위험의 전체 여정을 살펴봐야 한다는 것을 보여주었습니다.

"잠자는 스파이" 이야기

연구진이 무엇을 했는지 이해하기 위해, AI 에이전트를 거대한 사무실에서 일하는 매우 정리 정돈을 잘하는 인턴이라고 상상해 봅시다. 이 인턴에게는 할 일 목록, 도구(계산기나 파일 폴더 같은), 그리고 자신이 한 일에 대한 노트가 들어있는 배낭(하네스)이 있습니다.

보통 이 인턴은 매우 유능합니다. 하지만 어떤 스파이(공격자)가 사무실을 방해하려고 한다고 가정해 봅시다. 스파이는 단순히 "나쁜 짓을 해!"라고 소리치지 않습니다. 왜냐하면 인턴이 거절할 것이기 때문입니다. 대신, 스파이는 인턴의 배낭 속에 **잠자는 명령(sleeping instruction)**을 몰래 집어넣습니다. 아마도 "메모리" 섹션에 이상한 노트를 적어두거나, "기술" 파일을 정상적으로 보이게 만들면서도 숨겨진 함정을 심어둘 수 있습니다.

스파이는 떠납니다. 인턴은 평소처럼 일상적이고 지루한 업무를 수행합니다. 아무 일도 일어나지 않습니다. 이것이 "지속성(persistence)" 부분입니다. 나쁜 것들이 그저 거기 앉아서 기다리고 있는 것입니다.

그러다 며칠 후, 상사(사용자)가 인턴에게 "이 보고서를 요약해 줘"와 같이 완전히 무해한 일을 요청합니다. 이것이 "무해한 트리거(benign trigger)"입니다. 하지만 인턴의 배낭에는 여전히 스파이가 남긴 잠자는 명령이 들어있기 때문에, 인턴이 보고서를 여는 순간 함정이 작동합니다. 인턴은 자신이 그저 정상적인 일을 하고 있다고 생각하면서도, 실수로 상사의 파일을 삭제하거나 비밀 이메일을 보낼 수 있습니다.

거대한 배낭 스트레스 테스트

논문의 저자들은 어떤 사무실 시스템이 안전한지 확인하기 위해 스파이 역할을 직접 맡기로 했습니다. 그들은 이 "잠자는 스파이"를 심을 수 있는 328가지의 서로 다른 방법을 갖춘 거대한 테스트 키트인 HarnessSafe를 만들었습니다. 그들은 이 스파이들을 7가지 서로 다른 유형의 배낭에서 테스트했습니다:

  1. 메모리(Memory): 인턴의 노트 속에 숨기기.
  2. 기술(Skills): 작업을 수행하는 방법에 대한 지침 속에 숨기기.
  3. 도구/MCP(Tools/MCP): 인턴이 사용하는 도구의 설정 속에 숨기기.
  4. 메모리-기술(Memory-to-Skill): 노트를 새로운 기술로 변환하기.
  5. 하위 에이전트 위임(Subagent Delegation): 스파이를 보조 로봇에게 전달하기.
  6. 세션 요약(Session Summary): 과거 대화의 요약본 속에 숨기기.
  7. 공유된 결과물(Shared Artifacts): 여러 작업자 간에 공유되는 파일 속에 숨기기.

그들은 이 테스트를 7가지 서로 다른 실제 로봇 시스템(Claude Code, Codex CLI 등)에서 실행하여, 이 시스템들이 공격을 어떻게 처리하는지 확인했습니다.

"스테이지" 점수: 단순한 예/아니오가 아니다

여기서 이 논문은 정말 영리합니다. 대부분의 안전 테스트는 "로봇이 해킹당했습니까? 예/아니오"라고만 말합니다. 하지만 연구진은 그것이 자동차 사고가 시속 10마일에서 브레이크가 고장 난 것인지, 시속 100마일에서 고장 난 것인지 구분하지 못하는 것과 같다는 것을 깨달았습니다.

대신, 그들은 스파이가 정확히 어디까지 갔는지를 추적하기 위해 7단계 스코어보드(N0부터 N5b까지)를 만들었습니다:

  • N0: 스파이가 아예 발견되지 않았습니다. 배낭이 꽉 잠겨 있었습니다.
  • N1: 스파이가 들어오려고 하자마자 발견되었습니다.
  • N2: 스파이가 들어와서 무언가를 변경했지만, 실제 피해를 입히기 전에 차단되었습니다.
  • N3: 스파이가 "밤"(새로운 세션)을 버텨내고 인턴에 의해 다시 읽혔습니다.
  • N4: 스파이가 나쁜 행동을 시도했지만, 시스템이 그 동작을 막았습니다.
  • N5a/N5b: 스파이가 성공했습니다! 피해가 발생했습니다.

이 스코어보드를 사용함으로써, 그들은 어떤 시스템은 문 앞에서 스파이를 잡는 데(N1)는 좋지만, 일단 내부로 들어온 스파이를 막는 데(N3)는 서툴다는 것을 알 수 있었습니다. 다른 시스템은 그 반대였습니다.

발견한 점: 핵심은 페어링(Pairing)이다

가장 큰 발견은 안전이 로봇의 두뇌(AI 모델)와 그 배낭(하네스) 사이의 구체적인 팀워크에 달려 있다는 것이었습니다.

  • 완벽한 것은 없다: 모든 면에서 가장 뛰어난 단일 시스템은 없었습니다. 예를 들어, 한 시스템(Codex CLI)은 도구와 메모리에서의 스파이를 잡는 데는 놀라웠지만, "기술"에서의 스파이를 잡는 데는 최악이었습니다. 또 다른 시스템(Claude Code)은 기술에는 강했지만 다른 곳에서는 약했습니다.
  • 두뇌도 중요하다: 동일한 배낭에 다른 AI 두뇌를 넣으면 안전 점수가 극적으로 변합니다. 어떤 두뇌는 매우 신중하여 스파이를 잡아내는 반면, 어떤 두뇌는 너무 신뢰하여 스파이를 통과시켜 버릴 수도 있습니다.
  • "같은 점수"의 함정: 두 시스템의 "공격 성공률(Attack Success Rate)"이 같을 수 있습니다(즉, 둘 다 실패한 횟수가 같음). 하지만 단계를 살펴보면, 한 시스템은 초기에 실패(N1)한 반면, 다른 시스템은 실패하기 전까지 며칠 동안 스파이가 돌아다니도록 방치(N3)했을 수 있습니다. 이는 단순한 "합격/불합격" 점수가 많은 위험한 세부 사항을 숨기고 있음을 의미합니다.

결론

이 논문은 우리가 로봇을 보고 단순히 "안전하다" 혹은 "안전하지 않다"라고 말해서는 안 된다고 결론짓습니다. 안전은 기억을 담는 소프트웨어와 생각하는 AI 사이의 복잡한 춤입니다. 만약 우리가 이러한 "잠자는 스파이" 공격을 막고 싶다면, 우리는 단순히 최종 결과만을 보는 것이 아니라 위험의 전체 여정을 감시하는 시스템을 구축해야 합니다. 우리는 방어가 정확히 어디에서 무너졌는지 알아야 하며, 그래야 그 특정 배낭 부분을 고칠 수 있습니다.

요약하자면, 연구진은 AI 에이전트의 세계에서 숨겨진 위험은 오랫동안 잠복할 수 있으며, 이를 잡기 위해서는 로봇이 여전히 작동하는지를 확인하는 것보다 훨씬 더 세밀한 관찰이 필요하다는 것을 보여주었습니다. 그들은 어디에 균열이 있는지 정확히 찾을 수 있도록 지도와 스코어보드를 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →