← 최신 논문
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

본 논문은 AI 에이전트 기술의 선언된 능력과 실제 능력 간의 불일치를 탐지하기 위해 결정적 코드 분석과 LLM 지원 추출을 결합한 행동 무결성 검증 (BIV) 프레임워크를 소개하며, 대부분의 편차가 악의가 아닌 개발자의 oversight 에서 비롯되지만 해당 시스템이 악성 위협을 효과적으로 식별하고 대규모 벤치마크에서 기존 베이스라인을 능가함을 밝힌다.

원저자: Yuhao Wu, Tung-Ling Li, Hongliang Liu

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuhao Wu, Tung-Ling Li, Hongliang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 어시스턴트(AI 에이전트)가 이메일 확인, 파일 관리, 소셜 미디어 게시와 같은 작업을 대신 수행한다고 상상해 보세요. 이 어시스턴트를 더 똑똑하게 만들려면 '스킬'을 설치할 수 있습니다. 이는 새로운 능력을 부여하는 작은 서드파티 앱이나 플러그인입니다.

이러한 스킬을 집안 일을 맡기 위해 계약직 근로자를 고용하는 것과 같다고 생각하세요.

문제: "이력서 대 현실"의 격차

계약직 근로자를 고용할 때, 그들은 "거실 벽을 칠하겠습니다"라고 적힌 이력서(메타데이터)를 제시합니다. 하지만 일을 시작하면, 그들은 몰래 금고에 침입해 보석을 복사하고 온라인에 판매하는 것(실제 코드)을 비밀리에 결정할 수 있습니다.

AI 세계에서도 이는 엄청난 문제입니다. 어떤 스킬은 해로운 '날씨 도구'라고 주장할 수 있지만, 숨겨진 코드가 비밀번호를 훔치거나 해커에게 개인 데이터를 전송할 수 있습니다. 기존 안전 도구는 AI 를 속이려는 해커를 잡는 데는 탁월하지만, 스킬 자체가 자신의 기능을 거짓으로 말하고 있는지 확인하지는 못합니다.

해결책: BIV('진실 탐정')

이 논문의 저자들은 **행동 무결성 검증 (Behavioral Integrity Verification, BIV)**이라는 시스템을 개발했습니다. BIV 는 계약직 근로자를 집안으로 들이기 전에 그들의 이력서와 실제 도구상자를 모두 살펴보는 초지능의 이중 점검 검사관과 같습니다.

간단한 비유를 들어 BIV 가 작동하는 방식을 설명하겠습니다.

  1. "메뉴" 대 "주방":

    • 메뉴 (선언된 행동): 스킬이 한다고 말하는 것 (예: "파일을 읽을 수 있습니다").
    • 주방 (실제 행동): 스킬이 실행될 때 실제로 하는 것 (예: "파일을 읽고, 삭제하고, 낯선 사람에게 이메일로 보냅니다").
    • 점검: BIV 는 메뉴를 주방과 비교합니다. 주방에 메뉴에 없는 숨겨진 비밀 통로가 있다면 BIV 가 이를 포착합니다.
  2. "보편적 번역기":
    두 가지를 비교하기 위해 BIV 는 29 개 항목의 체크리스트(분류 체계) 를 사용합니다. 복잡한 컴퓨터 코드와 자연어 지시를 "내 은행 계좌에 접근할 수 있는가?" 또는 "비밀 메시지를 보낼 수 있는가?"와 같은 간단한 범주로 번역합니다. 이를 통해 검사관이 계약직 근로자와 같은 언어로 소통하도록 보장합니다.

  3. "2 인 팀":
    BIV 는 함께 작동하는 두 가지 유형의 검사관을 사용합니다.

    • 로봇 (결정론적 코드 분석기): 코드를 줄 단위로 읽는 엄격한 로봇입니다. 정확한 매칭을 찾는 데 탁월하지만, 교묘한 위장에는 혼란을 겪을 수 있습니다.
    • 인간 (LLM 어시스턴트): 스킬의 작성된 지시사항과 설명을 읽는 똑똑한 AI 입니다. 맥락과 숨겨진 의미를 이해하는 데 뛰어나지만 때로는 '환각'(사실을 만들어냄) 을 일으킬 수 있습니다.
    • 팀워크: 그들은 서로를 교차 검증합니다. 로봇은 확실한 사실을 찾고, 인간은 교묘한 지시사항을 찾아냅니다. 함께 그들은 스킬이 실제로 무엇을 하고 있는지에 대한 완전한 보고서를 작성합니다.

발견된 내용 ("감사 결과")

연구자들은 공개 레지스트리 (OpenClaw) 의 거의 50,000 개 스킬에 대해 이 시스템을 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  • 대부분의 스킬은 '부주의'할 뿐 '범죄적'이지 않음:
    약 **80%**의 스킬이 선언한 것과 실제 수행한 것 사이에 격차가 있었습니다. 그러나 연구자들은 이러한 격차의 **81%**가 단순한 실수나 나쁜 문서화(소홀함) 였음을 발견했습니다. 개발자들이 악의가 아니라 부주의해서 이력서를 업데이트하는 것을 잊은 것입니다.
  • 실제 위험은 숨겨져 있음:
    나머지 **19%**는 실제로 악의적이었습니다. 이들은 데이터를 훔치거나 장악을 시도하는 스킬들이었습니다.
  • "복합 위협" 발견:
    가장 위험한 스킬들은 한 가지 나쁜 일만 한 것이 아니라, 나쁜 일들의 연쇄를 수행했습니다.
    • 비유: 단일 나쁜 행동은 도둑이 자물쇠를 따는 것과 같습니다. '복합 위협'은 자물쇠를 따고, 경보 코드를 변경한 후 도주용 차량을 호출하는 도둑과 같습니다.
    • BIV 는 "자격증명 도용 → 암호화 → 외부 전송"과 같은 이러한 '연쇄'의 네 가지 새로운 유형을 발견했습니다. 이러한 연쇄는 한 번에 한 단계만 보면 찾기 어렵지만, BIV 는 전체 영화를 봅니다.

결과: 더 나은 보안 요원

저자들은 이 시스템을 사용하여 '악성 스킬 탐지기'를 구축했습니다. 알려진 나쁜 스킬 목록에 대해 테스트했을 때:

  • 나쁜 스킬의 **94.6%**를 포착했습니다 (매우 높은 점수).
  • 좋은 스킬에 대해 실수를 거의 하지 않았습니다 (낮은 오경보).
  • 규칙에만 의존하거나 AI 에만 의존하는 이전 방법들보다 훨씬 더 잘 작동했습니다.

결론

이 논문은 AI 스킬이 진실을 말하고 있는지 자동으로 감사할 수 있음을 입증합니다. '이력서'(말하는 것) 와 '작업'(하는 것) 을 비교함으로써, 서류 작업을 수정하기만 하면 되는 부주의한 개발자와 우리의 데이터를 훔치려는 실제 해커를 분리할 수 있습니다.

이 시스템은 단순히 "이것은 나쁘다"라고 말하는 것을 넘어, 나쁜지 설명합니다 (예: "문서화 오류"대 "데이터 도난 연쇄"). 이를 통해 보안 팀은 스킬을 즉시 금지할지, 아니면 업데이트를 요청할지 결정하는 데 도움을 받습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →