Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction
이 논문은 직접적인 정보 공개 방어 기제가 작동 중인 상황에서도 정상적인 작업 상호작용을 통해 작업을 적응적으로 설계함으로써 숨겨진 다중 파일 에이전트 기술을 식별하고 재구성하여 높은 충실도의 복구를 달계하는 블랙박스 공격인 "Daydreaming"을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 디지털 경제에서 전문 지식은 점점 더 서비스의 형태로 패키징되어 판매되고 있습니다. 소프트웨어 기업들이 과거에 물리적 디스크를 판매하던 방식에서 클라우드 기반 애플리케이션을 제공하는 방식으로 전환했던 것처럼, 인공지능 에이전트가 전문 지식을 전달하는 새로운 모델이 등장했습니다. 이 에이전트들은 단순한 일반 챗봇이 아닙니다. 이들은 법률 분석, 의료 코딩 또는 보안 모니터링과 같은 복잡하고 실제적인 과업을 수행할 수 있도록 하는 명령어, 참조 문서, 그리고 보조 스크립트의 묶음인 '기술(skills)'을 갖추고 있습니다. 제공업체는 실제 파일과 비밀 로직을 숨긴 채 유지하며, 고객에게는 오직 결과에 대해서만 비용을 청구합니다. 이러한 계약 구조는 소스 코드와 지침이 비밀로 유지된다면 전문 지식의 가치도 안전하게 유지될 것이라는 단순한 가정에 의존합니다.
그러나 한 새로운 연구는 기술의 가치가 단순히 작동 방식을 관찰하는 것만으로도 도난당할 수 있음을 입증하며 이 가정을 반박합니다. 연구진은 숨겨진 기술을 읽어야 할 비밀 문서가 아니라, 관찰을 통해 역설계해야 할 블랙박스로 취급하는 '데이드리밍(Daydreaming, 백일몽)'이라는 방법을 개발했습니다. 공격자는 일반적인 업무 요청을 제출하고 그 답변을 면밀히 분석함으로써, 원래의 파일을 보거나 제공업체에 공개를 요청하지 않고도 독점적인 기술의 기능적인 복사본을 재구성할 수 있습니다. 이 연구 결과는 소스 코드를 숨기는 것만으로는 그 기술이 만들어내는 행동을 관찰하고 복제할 수 있다면 디지털 자산을 보호하기에 충분하지 않다는 점을 시사합니다.
연구진은 간단한 질문에서 시작했습니다. 만약 벤더가 특화된 AI 기술을 판매하면서 그 기저에 있는 파일들을 비밀로 유지한다면, 고객이 여전히 작동하는 복사본을 만드는 법을 배울 수 있을까? 이를 테스트하기 위해 연구진은 공격자가 유료 고객 역할을 하는 시나리오를 설정했습니다. 공격자는 기술의 공적인 이름과 설명(예: "보안 경보 분류")만을 알 뿐, 해당 기술을 작동시키는 숨겨진 지침, 데이터 파일 또는 스크립트에는 접근할 수 없습니다. 공격자의 목표는 벤더의 시스템에 일련의 과업을 제출하고, 결과를 관찰하며, 그 정보를 사용하여 동일한 작업을 수행하는 독립적인 버전의 기술을 구축하는 것입니다.
이 공격은 숨겨진 기술을 상호작용을 통해 조각들이 하나씩 드러나는 퍼즐처럼 취급함으로써 작동합니다. 공격자는 전체 기술을 한 번에 추측하려고 시도하는 대신 제거법을 사용합니다. 먼저, 기술이 가질 수 있는 특정 행동(예: 경보를 심각도 순으로 우선순위를 두는지, 아니면 시간 순으로 두는지)에 대해 가설을 세웁니다. 그런 다음, 어떤 가설이 참인지에 따라 다른 결과를 낼 수 있도록 설계된 특정한 과업을 구성합니다. 예를 들어, 낮은 심각도의 이벤트가 높은 심각도의 이벤트보다 먼저 발생하는 배치 형태의 경보들을 제출할 수 있습니다. 만약 벤더의 시스템이 높은 심각도의 이벤트를 먼저 나열한다면, 공격자는 기술이 심각도에 따라 우선순위를 정한다는 것을 배웁니다. 만약 시스템이 도착 순서대로 나열한다면, 공격자는 그 반대의 경우임을 알게 됩니다.
이 과정은 세 가지 뚜렷한 단계로 반복됩니다. 첫 번째 단계에서 공격자는 수치 임계값이나 계산 방법과 같은 기술의 기본적인 규칙과 행동을 식별합니다. 두 번째 단계에서 공격자는 이러한 규칙들을 사용하여 기술의 서로 다른 가능한 구조들을 초안으로 작성하고, 여러 후보 버전을 만들어 벤더의 행동과 일치하는지 확인하기 위해 서로 대조합니다. 마지막으로 세 번째 단계에서 공격자는 지침의 정확한 문구나 스크립트의 정밀한 값과 같은 구체적인 콘텐츠를 정교화하여, 재구성된 기술이 원본과 거의 동일하게 작동할 때까지 반복합니다. 이 모든 과정 동안 공격자는 벤더에게 파일을 보여달라고 하거나 시스템이 어떻게 작동하는지 설명해 달라고 요청하지 않습니다. 그저 업무를 수행해 달라고 요청할 뿐입니다.
연구진은 이 방법을 7가지의 서로 다른 기술과 4가지의 서로 다른 AI 모델을 대상으로 테스트했습니다. 연구진은 벤더가 텍스트를 직접 탈취하려는 시도를 차단하기 위한 능동적인 방어책을 갖추고 있음에도 불구하고, 데이드리밍 공격이 매우 효과적임을 발견했습니다. 공격자가 중간 단계의 과정은 볼 수 없고 최종 답변만 볼 수 있는 가장 제한적인 시나리오에서도, 재구성된 기술은 원래 기술의 과업 수행 능력을 거의 87%까지 회복했습니다. 이는 내부 작동 방식을 볼 수 없을 때 자주 실패했던 기존 방식들보다 훨씬 뛰어난 성과였습니다. 이 공격은 기술 전체를 재구성하는 데 중간값 약 32회의 호출이라는 비교적 적은 수의 상호작용을 필요로 했습니다.
이 연구의 핵심적인 발견은 탈취된 기술이 원본과 완벽한 텍스트 복사본일 필요는 없다는 점입니다. 연구진은 성공 여부를 탈취된 파일이 원본과 얼마나 유사한지가 아니라, 탈취된 기술이 새로운 문제들을 원본만큼 잘 해결할 수 있는지로 측정했습니다. 연구진은 정확한 문구나 파일 구조는 종종 다르지만, 기능적인 행동은 거의 동일하다는 것을 발견했습니다. 이는 경쟁자가 독점적인 소스 코드를 전혀 보지 못하더라도, 원본과 동일한 고품질의 작업을 수행하는 제품을 구축할 수 있음을 의미합니다. 또한 연구는 AI가 사용한 도구나 참조한 데이터와 같은 내부 '흔적(traces)'을 벤더가 숨기더라도 이러한 탈취가 가능하다는 것을 보여주었습니다. 최종 결과물만으로도 로직을 역설계하기에 충분한 정보가 포함되어 있습니다.
이 연구의 함의는 단순히 코드를 훔치는 것을 넘어섭니다. 이는 현재 특화된 AI 서비스가 어떻게 보호되고 있는지에 대한 근본적인 취약성을 드러냅니다. 벤더들은 자신들의 지침이 직접 유출되는 것을 막는 데 집중해 왔지만, 본 연구는 서비스를 사용하는 행위 자체가 능력을 재구축할 수 있는 충분한 정보를 유출한다는 것을 보여줍니다. 연구진은 의심스러운 요청을 필터링하거나 보호된 텍스트를 차단하도록 설계된 방어책이 있더라도, 정상적인 업무 흐름이 재구성을 위한 경로를 제공한다는 것을 입증했습니다. 연구는 이러한 디지털 자산을 보호하기 위해서는 소스 파일을 숨기는 것을 넘어, AI가 주는 답변의 정밀도를 제한하거나 고객이 시스템과 상호작용하는 패턴을 모니터링하는 등의 새로운 전략이 필요할 것이라고 결론지었습니다.
결국, 이 연구는 AI 시대에 디지털 소유권을 어떻게 생각해야 하는지에 대한 인식의 변화를 강조합니다. 기술이 무엇을 말하느냐가 아니라 무엇을 하느냐에 의해 정의될 때, 행동 자체가 자산이 되며, 그 행동은 관찰되고 복제될 수 있습니다. 데이드리밍 공격은 독점적인 기술이 단순히 파일이 잠겨 있다고 해서 안전한 것이 아님을 증명합니다. 시스템이 일반적인 사용에 열려 있다면, 그 비밀은 주의 깊은 관찰과 추론을 통해 학습될 수 있습니다. 이것이 모든 AI 서비스가 도난당할 운명이라는 뜻은 아니지만, 현재의 보호 방식은 불충sufficient하다는 것을 의미합니다. 이러한 전문화된 에이전트들이 법률, 의료, 보안 분야에서 더욱 흔해짐에 따라, 업계는 인간의 전문 지식이 AI로 인코딩되었을 때 그것이 관찰을 통해 복제되지 않도록 보장할 새로운 방법을 개발해야 할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.