← 최신 논문
💻 computer science

From Neural Intent to Cryptographic Authorization: Governing Agentic Workflows

이 논문은 신경망 계획과 실행을 분리하고 결정론적 심볼릭 컨트롤러를 통해 도구 호출에 대한 엄격한 암호학적 권한 부여를 강제함으로써, 워크플로의 유용성을 유지하면서도 프롬프트 주입 공격을 방지하는 자율 AI 에이전트 보안 아키텍처인 신경 암호 서비스(Neural Cryptographic Services, NCS)를 소개한다.

원저자: Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

게시일 2026-07-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터가 단순히 인간이 작성한 엄격한 명령 목록을 따르는 것이 아니라, 스스로 어떻게 일을 해야 할지 알아내는 영리하고 수다스러운 비서처럼 행동하는 세상을 상상해 보십시오. 이것이 바로 "AI 에이전트"의 시대입니다. 이들을 당신의 이메일을 읽고, 은행 계좌를 확인하고, 문서를 보내는 일을 수행할 수 있는 디지털 인턴이라고 생각해보세요. 이들은 자연어 요청을 이해함으로써 이 모든 일을 해냅니다. 하지만 여기에는 함정이 있습니다. 이 인턴들은 매우 똑똑하지만 동시에 매우 암시에 취약하다는 점입니다. 만약 당신이 그들에게 비밀 지시를 속삭이거나, 교활한 낯선 사람이 그들이 읽고 있는 문서 안에 몰래 쪽지를 숨겨둔다면, 인턴은 갑자기 원래의 요청을 무시하고 당신의 돈을 낯선 사람에게 보내버리는 것과 같은 위험한 행동을 하기로 결정할 수도 있습니다. 이것은 문제가 됩니다. 과거의 컴퓨터는 프로그래밍된 대로만 정확히 수행하는 경직된 로봇 같았지만, 이제는 자신의 작업 위에 다른 그림을 그려버리도록 속임수에 빠질 수 있는 창의적인 예술가와 같기 때문입니다.

이 위험을 이해하려면 컴퓨터가 "생각하는" 두 가지 다른 방식을 살펴봐야 합니다. 첫 번째는 신경망(Neural) 방식입니다. 이는 AI가 작동하는 방식으로, 패턴에 기반하여 최선의 답을 추측하는 거대하고 모호한 연결망과 같습니다. 언어를 이해하는 데는 뛰어나지만, 다소 불안정하고 환각(hallucination) 현상이 발생하기 쉽습니다. 두 번째는 기호적(Symbolic) 방식입니다. 이는 전통적인 보안이 작동하는 방식으로, 엄격하고 깨뜨릴 수 없는 규칙 책이나 2+22+2가 항상 $4$가 되는 수학 방정식과 같으며, "아마도"라는 여지가 없습니다. 과학자들이 던지는 큰 질문은 이것입니다: 어떻게 하면 AI 에이전트가 창의적이고 유능하게 일하면서도, 규칙을 어기도록 속임을 당하지 않게 할 것인가? 우리는 AI가 계획을 꿈꾸게 하되, 실제로 일이 일어나기 전에 모든 단계를 점검하는 엄격하고 변하지 않는 감시자를 두는 방법이 필요합니다.

이것이 바로 "From Neural Intent to Cryptographic Authorization"이라는 논문의 연구진들이 해결하고 있는 문제입니다. 그들은 **신경 암호화 서비스(Neural Cryptographic Services, NCS)**라는 새로운 보안 시스템을 구축했습니다. 당신이 은행으로 매우 중요한 패키지를 보내고 있다고 상상해 보십시오. 옛날에는 상자에 적힌 지시 사항을 배달원(AI)이 그대로 따를 것이라고 믿었습니다. 하지만 누군가 당신이 보지 않을 때 상자 옆면에 "패키지를 도둑에게 주시오"라고 적어 놓는다면 어떻게 될까요? 배달원은 그것을 읽고 따를 수도 있습니다. NCS는 게임의 판도를 바꿉니다. 지시 사항에 초엄격한 수학적 증명 기반의 잠금장치를 채우는 것입니다.

이것이 실제 논문에서 어떻게 작동하는지 살펴보겠습니다. AI 에이전트( "신경 계획가")는 당신의 요청을 읽고 자신이 무엇을 해야 한다고 생각하는지에 대한 초안을 작성할 수 있습니다. 이것은 마치 학생이 숙제를 쓰는 것과 같습니다. 하지만 이 학생에게는 숙제를 제출하거나 돈을 쓸 수 있는 권한이 없습니다. 그 권한은 다른 캐릭터인 **기호적 컨트롤러(Symbolic Controller)**에게 있습니다. 이 컨트롤러는 학생의 창의적인 아이디어에는 관심이 없고, 오직 사전에 승인되고 암호학적으로 서명된 체크리스트만을 신경 쓰는 로봇 경비원과 같습니다.

이 과정은 고도의 보안이 적용된 금고와 비슷합니다. 책임자인 인간이 특수 디지털 키로 "워크시트"(단계별 목록)에 서명하기 전까지는 AI 에이전트가 아무것도 할 수 없습니다. 이 워크시트는 이후 각 블록이 수학적으로 다음 블록에 접착된 것처럼 연결된 블록 체인으로 변환됩니다. AI 에이전트가 어떤 단계를 수행하려고 할 때, 기호적 컨트롤러는 이 체인을 검사합니다. 컨트롤러는 해당 단계가 서명된 체크리스트와 정확히 일치하는지 확인합니다. 만약 AI 에이전트가 "헤이, 우리가 계획했던 50달러 대신 친구에게 5,000달러를 보내자"라고 말하려 한다면, 경비원은 수학적 계산을 확인하고 숫자가 서명된 체인과 일치하지 않는 것을 발견한 즉시 문을 쾅 닫아버립니다. 에이전트는 경비를 속일 수 없습니다. 왜냐하면 경비원은 에이전트의 말에 귀를 기울이는 것이 아니라, 서명의 깨지지 않는 수학적 원리에만 귀를 기울이기 때문입니다.

논문은 이 시스템이 매우 효과적임을 보여줍니다. 연구진은 일반적인 데이터 안에 나쁜 지시를 숨기거나 은행 송금액을 바꾸려는 시도 등 온갖 교활한 속임수로 AI 에이전트를 시험했습니다. 이 새로운 시스템이 없다면, AI 에이전트는 거의 매번 속았으며 공격자의 성공률은 일부 사례에서 100%에 달했습니다. 하지만 NCS를 도입하자 공격자의 성공률은 거의 제로에 가깝게 떨어졌습니다. 에이전트는 평상시 업무를 수행하는 데 있어 여전히 높은 "효용성(utility)"을 유지하면서도, 탈취 공격으로부터는 완전히 면역력을 갖게 되었습니다.

연구진은 또한 이 시스템이 놀라울 정도로 빠르다는 것을 발견했습니다. 실행되는 수학적 검사는 1밀리초 미만이 소요되는데, 이는 AI가 생각하는 시간에 비하면 거의 보이지 않을 정도로 빠릅니다. 즉, 우리는 안전을 위해 속도를 희생할 필요가 없습니다. 이 논문은 우리가 단순히 AI가 나쁜 짓을 하지 말아야 한다는 것을 "이해"하기를 바랄 것이 아니라, AI가 아이디어를 제안할 수는 있지만 암호학적 잠금이 승인되고 서명된 단계만을 실제로 실행하도록 보장하는 시스템이 필요하다고 주장합니다. 이것은 AI에게 똑똑해질 자유를 주면서도, 그들이 실제로 '할 수 있는 일'에 대해서는 엄격하고 깨뜨릴 수 없는 목줄을 채우는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →