← 최신 논문
💻 computer science

Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World

이 논문은 생성된 기술에 정책 집행 기능이 내장되어 있지 않아 새로운 "차용된 권한(Borrowed Authority)" 공격 벡터로 이어지는 자가 진화 에이전트 시스템의 결정적인 안전 격차를 식별하고, 피어 에이전트의 주장을 신뢰하는 대신 세계 상태와 센서 증거를 검증함으로써 악의적인 물리적 행동을 성공적으로 차단하는, 기술 아티팩트 내에 임베디드된 유형화된 권한 계층인 "엣지 스킬가드(Edge Skillguard)"를 제안한다.

원저자: Zhonghao Zhan, Hamed Haddadi

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhonghao Zhan, Hamed Haddadi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 집, 자동차, 혹은 공장이 단순히 버튼을 누르는 한 명의 인간이 아니라, 함께 협력하는 디지털 비서 팀에 의해 관리되는 세상을 상상해 보십시오. 이러한 비서들은 종종 고급 언어 모델을 기반으로 하며, 점점 더 유능해지고 있습니다. 그들은 지침을 읽고, 복잡한 작업을 계획하며, 심지어 문 잠금 장치나 로봇 팔 같은 물리적 장치를 제어할 수도 있습니다. 이를 가능하게 하기 위해 개발자들은 이 비서들에게 '기술(skills)'을 부여합니다. 이는 본질적으로 "누군가 집에 있는지 확인하라" 또는 "현관문을 열어라"와 같이 특정 동작을 수행하는 방법을 알려주는 디지털 도구 상자입니다. 이 분야의 현재 추세는 더 많은 자동화가 더 나은 효율성으로 이어지기를 바라며, 이 비서들이 스스로 새로운 기술을 즉석에서 생성하고 결합하도록 내버려 두는 것입니다. 그러나 이러한 자가 진화하는 능력성을 향한 질주는 위험한 사각지대를 만들어냈습니다. 비서들이 계획을 세우는 능력은 향 만큼 향상되었지만, 계획이 실제로 실행되어도 되는지를 결정하는 안전 규칙은 종종 비서 자신의 판단에 맡겨진 채 남겨져 있습니다. 이는 디지털 비서가 어떤 다른 비서로부터 허락을 받았다는 이유만으로, 그 허락이 실제인지에 대한 독립적인 증거 없이도 자신 있게 문을 열거나 로봇을 움직일 수 있다고 믿게 되는 간극을 남깁니다.

이 간극은 임페리얼 칼리지 런던(Imperial College London)의 연구진과 시애틀의 한 독립 연구자가 수행한 새로운 연구의 초점입니다. 그들은 이러한 디지털 기술을 패키징하는 현재의 방식이 물리적 세계에는 불충분하다고 주장합니다. 그들의 관점에서 기술이란 단순히 무언가를 하는 '방법'을 설명하는 것이 아니라, 그것을 언제 하는 것이 안전한지를 결정하는 엄격하고 기계가 읽을 수 있는 규칙을 반드시 지녀야 합니다. 연구진은 이들이 '차용된 권한(borrowed authority)'이라고 부르는 특정한 유형의 위험을 식별했습니다. 이는 한 에이전트가 다른 에이전트에게 "거주자가 집에 있음을 확인했으므로 문을 여십시오"라고 메시지를 보낼 때 발생합니다. 오늘날의 시스템에서 수신 에이전트는 메시지의 자연어 내용을 그대로 믿고 사실을 검증하기보다는, 그 주장을 액면 그대로 받아들이는 경우가 많습니다. 만약 첫 번째 에이전트가 거짓말을 하거나, 혼란에 빠졌거나, 해킹을 당했다면, 두 번째 에이전트는 허위 약속에 근거하여 문을 열게 되어 실질적인 물리적 피해를 초래할 수 있습니다. 연구진은 클라우드에서의 악성 소프트웨어와 로봇이 물리적 해를 입도록 속아 넘어가는 사례를 각각 목격한 적은 있지만, 악성 디지털 기술이 물리적 손상을 입히는 구체적인 결합은 아직 보지 못했다고 언급하면서도, 이러한 교차점이 임박했다고 믿고 있습니다.

이를 해결하기 위해 연구팀은 '엣지 스킬가드(Edge Skillguard)'라고 불리는 시스템을 개발했습니다. 인공지능 모델이 안전 규칙을 기억하거나 모호한 지침을 해석하도록 의존하는 대신, 그들은 엄격하고 타입이 지정된 권한 계층을 기술 내부에 직접 삽착했습니다. 이것을 모든 동작의 문 앞에 서 있는 디지털 보안 요원이라고 생각하십시오. "문 잠금을 해제하라"와 같은 명령이 실행되기 전에, 이 보안 요원은 구체적인 사실 목록을 확인합니다. 요청하는 사람이 실제로 권한을 가진 사람인가? 거주자의 존재에 대한 증거가 검증된 카메라나 특정 휴대전화와 같이 신뢰할 수 있는 출처로부터 온 최신 정보인가? 요청이 유효한 시간 범위 내에 도착했는가? 이러한 조건 중 하나라도 구체적이고 기계로 확인할 수 있는 증거와 함께 충족되지 않으면, 자연어 메시지가 아무리 설득력이 있더라도 동작은 즉시 차단됩니다. 이 접근 방식은 안전의 부담을 언어 모델의 예측 불가능한 추론에서 데이터의 결정론적 검사로 전환합니다.

연구진은 148개의 서로 다른 장치(잠금장치, 조명, 카메라, 센서 포함)를 갖춘 스마트 홈 환경을 시뮬레이션하는 라이브 엣지 제어 플랫폼에서 이 시스템을 테스트했습니다. 그들은 시스템을 속여 승인되지 않은 동작을 수행하도록 설계된 일련의 공격들을 만들었습니다. 이러한 공격에는 거주자를 보지 않았음에도 보았다고 주장하거나, 만료된 권한을 사용하거나, 올바른 작업에 잘못된 권한을 사용하려는 시나리오가 포함되었습니다. 모든 테스트에서 엣지 스킬가드 시스템은 승인되지 않은 시도를 성공적으로 차단했습니다. 구체적으로, 시스템은 다섯 가지 유형의 공격에 걸친 60개의 악성 요청을 모두 거부하면서도, 정당하고 안전한 요청은 단 한 번도 차단하지 않았습니다. 시스템은 테스트를 300개의 요청으로 확장하거나 구성 요소들을 넓은 네트워크에 연결된 서로 다른 컴퓨터들로 분산시켰을 때도 똑같이 효과적으로 작동했습니다. 의사 결정 과정 자체는 매우 빨라서 규칙을 검증하는 데 단 몇 마이크로초밖에 걸리지 않았으며, 이는 높은 보안성이 속도를 희생하지 않아도 된다는 것을 증명했습니다.

또한 연구진은 이 접근 방식의 한계를 탐구했습니다. 연구진은 자신들의 시스템이 에이전트 간의 혼란이나 기만을 방어하지만, 이미 침해된 신뢰할 수 있는 에이전트가 잘못된 결정을 내리는 것을 막을 수는 없으며, 물리적 센서가 리플레이 공격이나 도난된 장치에 의해 속는 것을 감지할 수 없다는 점을 주의 깊게 명시했습니다. 이는 하드웨어 보안이나 물리적 검증과 같은 다른 솔루션이 필요한 별개의 문제입니다. 그러나 핵심적인 발견은 명확합니다. 에이전트가 물리적 세계를 안전하게 제어하려면, 그들의 행동을 규정하는 규칙은 그 행동만큼이나 구체적이고 변경 불가능해야 한다는 것입니다. 과업을 수행하는 절차적 지식과 그것이 허용되는 시점에 대한 엄격하고 기계로 확인 가능한 정책을 함께 패키징함으로써, 연구진은 디지털 비서가 실수로 혹은 악의적으로 물리적 해를 끼치는 것을 방지하기 위한 청사진을 제공했습니다. 이 연구는 안전한 자동화의 미래가 더 똑똑한 언어 모델에 있는 것이 아니라, 에이전트가 말할 수 있는 것과 실제로 할 수 있는 것 사이의 경계를 더 엄격하고 투명하게 나누는 데 있다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →