← 최신 논문
💻 computer science

AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems

AgentFlow는 도구 및 위임 경계 전반에 걸친 민감한 데이터 흐름을 추적함으로써 LLM 에이전트 시스템을 보호하는 흐름 중심 정책 언어와 런타임 강제 실행 프레임워크를 도입하며, 작업 유용성을 유지하거나 개선하는 동시에 여러 벤치마크에서 확인된 침해 사례를 성공적으로 제거합니다.

원저자: Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 디지털 환경에서 인공지능은 단순한 챗봇을 넘어 우리의 대신하여 복잡한 과업을 수행할 수 있는 유능한 비서로 진화했습니다. '에이전트'라고 불리는 이 시스템들은 단순히 질문에 답하는 것에 그치지 않고, 문서를 읽고, 웹을 검색하며, 개인 데이터베이스에 접속하고, 이메일을 보냅니다. 이들은 사용자의 의도와 인터넷에 존재하는 방대한 도구들 사이의 간극을 메우는 중개자 역할을 합니다. 그러나 이러한 새로운 수준의 자율성은 미묘하면서도 위험한 취약성을 초래합니다. 그 위험은 에이전트가 실수로 파일을 삭제하는 것과 같은 단일하고 명백한 실수가 항상 발생하는 것이 아닙니다. 대신, 그 자체로는 완벽하게 합리적으로 보이는 일련의 행동들로부터 피해가 발생하는 경우가 많습니다. 예를 들어, 에이전트가 기밀 기록을 읽고, 이를 요약한 뒤, 그 요약본을 이메일로 보낼 수 있습니다. 각 단계는 허용되지만, 이 조합은 개인 정보 유출이라는 결과를 낳습니다. 이것이 연구자들이 직면한 핵심 과제입니다. 즉, 개별 단계뿐만 아니라 데이터의 경로 또한 중요하게 고려되는 보안 시스템을 어떻게 구축할 것인가 하는 점입니다.

버지니아 공과대학교의 연구진은 이 특정 문제를 해결하기 위해 '에이전트플로우(AgentFlow)'라는 새로운 프레임워크를 개발했습니다. 그들의 연구는 단일 행동의 허용 여부를 확인하는 것을 넘어, 에이전트의 워크플로우를 통해 이동하는 정보의 여정을 추적하는 데 집중합니다. 당신이 문을 열 수 있는 열쇠를 가지고 있는지 확인하는 것뿐만 아니라, 당신이 어디를 다녀왔는지, 무엇을 집어 들었는지, 그리고 그 물건을 최종 목적지까지 가져가는 것이 허용되는지를 지켜보는 보안 요원을 상상해 보십시오. 에이전트플로우는 이 원칙에 따라 작동합니다. 이 시스템은 모든 데이터를 그 민감도, 범주, 신뢰성을 설명하는 라벨을 가진 것으로 취급합니다. 만약 데이터가 신뢰할 수 없는 웹사이트에서 왔다면, 그것은 '신뢰할 수 없음'이라는 라벨을 가집니다. 만약 데이터에 사회보장번호가 포함되어 있다면, '기밀'이라는 라벨을 가집니다. 그런 다음 시스템은 데이터가 데이터베이스에서 도구로, 그리고 최종적으로 이메일이나 공개 게시물로 이동함에 따라 이러한 라벨들이 어떻게 변하는지 감시합니다.

연구진은 시스템 운영자가 데이터의 여정에 관한 규칙을 작성할 수 있도록 하는 언어를 구축했습니다. 이 규칙들은 기밀 요약본이 외부 이메일 주소에 절대 도달하지 못하도록 금지하거나, 신뢰할 수 없는 웹 콘텐츠가 신뢰할 수 있는 내부 지침으로 취급되는 것을 방지할 수 있습니다. 이 시스템은 인공지능과 그것이 사용하는 도구 사이에 모니터를 배치함으로써 작동합니다. 에이전트가 도구를 호출하기 전에, 모니터는 데이터의 현재 상태를 확인합니다. 모니터는 다음과 같이 묻습니다. 이 정보는 어디에서 왔는가? 정화(sanitized)되었는가? 에이전트가 이 특정 장소로 이것을 보낼 권한이 있는가? 만약 이 질문들 중 하나라도 '아니오'라는 답변이 나오면, 해당 동작은 차단됩니다. 이 접근 방식은 사용자가 도구를 사용할 권한이 있는지만을 살펴보던 기존의 보안 방식과는 다릅니다. 기존 방식들은 안전한 도구가 안전하지 않은 데이터와 함께 사용될 때 발생하는 위험을 놓쳤습니다.

연구진은 시스템을 배포하기 전 규칙이 타당한지 확인하기 위해 수학적 검증기(mathematical verifier)를 만들었습니다. 이 도구는 수천 가지의 가능한 시나리오를 시뮬레이션하여 규칙이 깨질 수 있는지 확인하는 스트레스 테스트 역할을 합니다. 테스트 과정에서 이 검증기는 연구진이 속이려고 시도했던 모든 위험한 규칙 변형들을 성공적으로 잡아냈습니다. 실제 환경 시뮬레이션에 시스템을 적용했을 때 결과는 놀라웠습니다. 에이전트가 데이터를 유출하거나 승인되지 않은 행동을 하도록 유도하기 위해 설계된 약 950개의 테스트 케이스 세트에서, 시스템은 확정된 보안 침해 사례를 33%에서 0%로 줄였습니다. 또 다른 200개의 동적인 실생활 스타일 과업 세트에서는 공격 성공률을 73.5% 감소시켜 실패율을 0%로 만들었습니다. 결정적으로, 이 시스템은 에이전트의 업무 수행 능력을 저해하지 않으면서 이 일을 해냈습니다. 실제로 많은 경우에서, 보안 규칙이 데이터에 숨겨진 악의적인 지침으로 인해 에이전트가 주의가 분산되는 것을 방설했기 때문에 에이전트는 의도한 과업을 더 많이 완수할 수 있었습니다.

연구진은 자신들의 연구 범위를 명확히 정의하는 데 주의를 기울였습니다. 그들은 인공지능이 사실을 지어내거나 잘못된 조언을 하는 것과 같은 모든 문제를 해결한다고 주장하지 않았습니다. 그들의 시스템은 오직 도구와 외부 연결을 통한 데이터의 흐름을 위해 설계되었습니다. 또한 보안 모니터 자체가 신뢰할 수 있고 올바르게 구현되었다고 가정합니다. 본 연구는 공격자가 오염된 웹페이지나 악의적인 이메일과 같은 신뢰할 수 없는 콘텐츠를 제공하여, 사용자가 전혀 의도하지 않은 행동을 하도록 에이전트를 조종하려는 특정 유형의 위협에 초점을 맞추었습니다. 데이터가 거치는 경로에 집중함으로써, 에이전트플로우는 개별 단계가 모두 무해해 보이더라도 이러한 공격을 차단합니다.

평가 결과, 이 시스템은 뱅킹, 여행 계획, 워크스페이스 관리 등 다양한 유형의 과업에서 작동함을 보여주었습니다. 한 시나리오에서 에이전트는 개인 고객 기록을 요약하여 공격자에게 이메일로 보내도록 속았습니다. 표준 보안 시스템이라면 에이전트가 메시지를 보낼 권한이 있기 때문에 이 이메일을 허용했을 것입니다. 그러나 에이전트플로우는 요약 중인 데이터가 기밀이며, 이메일이 적절한 보안 확인 없이 외부 주소로 향하고 있다는 점을 포착했습니다. 그리고 동작을 차단했습니다. 또 다른 사례에서는 공격자가 악의적인 지침을 정당한 내부 정책인 것처럼 믿게 하여 에이전트를 속이려 했습니다. 시스템은 해당 지침이 신뢰할 수 없는 출처에서 왔음을 인식하고 에이전트가 이에 따라 행동하는 것을 거부했습니다.

연구진은 또한 이 보안 계층이 에이전트의 속도를 얼마나 늦추는지 측정했습니다. 그들은 각 결정에 추가되는 시간이 마이크로초 단위로 매우 미미하며, 이는 AI가 생각하고 응답을 생성하는 시간에 비해 무시할 수 있는 수준임을 발견했습니다. 이는 보호 기능이 속도나 사용성을 희생하지 않음을 의미합니다. 팀은 도구 연결을 악용하거나 에이전트의 메모리를 조작하려는 데 알려진 다양한 공격 방법들에 대해 시스템을 테스트했습니다. 구성된 규칙을 위반하는 방식으로 데이터를 이동시키려는 모든 사례에서, 시스템은 이를 차단했습니다.

결과가 유망하긴 하지만, 저자들은 이를 특정 유형의 정책 집행에 대한 예비적 증거라고 설명합니다. 그들은 실제 애플리케이션에서 무엇이 민감한 정보인지, 어떤 행동이 허용되는지에 대한 규칙을 신중하게 정의해야 한다는 점을 인정합니다. 시스템은 사용자가 원하는 것을 추측하지 않습니다. 대신 주어진 규칙을 집행합니다. 만약 사용자가 신뢰할 수 없는 웹 콘텐츠를 공개 블로그에 보내기를 원한다면, 반드시 이를 허용하는 규칙을 명시적으로 설정해야 합니다. 그러한 특정 허용 설정이 없다면, 시스템은 안전을 위해 해당 동작을 차단합니다. 엄격한 보안과 필요한 유연성 사이의 이러한 균ars은 강력한 에이전트를 위험하지 않게 유용하게 만드는 핵심입니다.

이 연구는 인공지능을 보안하는 방식에 대한 사고의 전환을 나타냅니다. 연구진은 AI가 잘못될 수 있는 모든 가능성을 예측하려고 노력하는 대신, 정보의 흐름을 감시하고 명확한 경계를 설정하는 시스템을 구축했습니다. 데이터의 출처와 데이터가 갈 수 있는 곳을 추적함으로써, 에이전트플로우는 복잡한 다단계 과업을 수행하는 에이전트를 위한 안전망을 제공합니다. 이는 에이전트가 위험한 경로를 택하도록 속임을 당하더라도, 피해가 발생하기 전에 그 여정을 멈출 수 있게 함으로써 안전을 보장합니다. 이 접근 방식은 프라이버시와 보안이 매우 중요한 환경에서 자율적인 에이전트를 배포할 수 있는 실질적인 길을 제시하며, 자율적 행동의 잠재적 위험을 관리 가능하고 통제 가능한 프로세스로 전환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →