KYA: A Framework-Agnostic Trust Layer for Autonomous Systems with Verifiable Provenance and Hierarchical Policy Composition
KYA는 자율 시스템을 위한 오픈소스 및 프레임워크 중립적 신뢰 계층으로, 안전한 4 게이트 적용 파이프라인, 계층적 정책 구성, 통합 신뢰 점수 산출 등 5 가지 핵심 원리를 활용하여 에이전트 드리프트, 누출, 적대적 공격을 탐지하면서도 밀리초 미만 지연 시간과 높은 처리량을 유지합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
자신에게 일하는 자율 로봇들 (AI 에이전트) 이 한 무리 있다고 상상해 보세요. 이 로봇들은 대출을 심사하거나, 의료 환자를 분류하거나, 주식을 거래합니다. 현재 이 로봇들을 감시하는 데 사용하는 도구들 (관측 가능성, observability) 은 자동차의 계기판과 같습니다. 엔진이 과열되었는지, 차가 느리게 움직이는지, 부품이 고장 났는지 등을 알려줄 뿐입니다.
**KYA(Agent 알기, Know Your Agents)**는 엔진을 단순히 감시하는 것을 넘어, 경비원, 탐정, 공증인이 하나로 합쳐진 새로운 시스템입니다. 계기판이 대답하지 못하는 질문에 답합니다: 이 로봇이 거짓말을 하고 있는가? 경로에서 벗어났는가? 비밀을 유출하고 있는가? 그리고 문제가 발생했을 때, 실제로 누가 책임져야 하는가?
다음은 일상적인 비유를 사용하여 다섯 가지 간단한 부분으로 분해한 KYA 의 작동 방식입니다:
1. 네 개의 문으로 이루어진 보안 검사 (문지기)
AI 에이전트가 새로운 작업을 하거나 규칙을 변경하기 전에 네 개의 엄격한 보안 문을 통과해야 합니다. 이는 고보안 은행 금고와 같습니다:
- 문 1: 열쇠를 들고 있는 사람이 실제로 이 요청서에 서명했는가? (디지털 서명 확인)
- 문 2: 이 요청은 여전히 유효한가, 아니면 만료되었는가? (시간 확인)
- 문 3: 이 요청은 규칙을 더 엄격하게 만들거나 더 느슨하게 만드는가? KYA 는 규칙이 더 엄격해져서 (안전해져서) 만 허용하며, 더 느슨해지는 것은 절대 허용하지 않습니다. 마치 부모님이 "집안일을 더 추가할 수는 있지만, 이미 있는 집안일은 없앨 수 없다"고 말하는 것과 같습니다.
- 문 4: 실제로 사람이 "예"라고 말했는가? 기본적으로 변경 사항은 사람이 승인해야 합니다.
2. "오직 강화만" 규칙집 (안전 격자)
로봇을 위한 규칙집이 있다고 상상해 보세요. 회사 (플랫폼) 가 기본 규칙을 설정합니다. 여러분 (임차인) 은 그 위에 더 엄격한 규칙을 추가할 수 있지만, 회사의 안전 규칙을 삭제할 수는 없습니다.
KYA 는 특수한 수학적 시스템을 사용하여, 몇 명이 규칙을 추가하더라도 시스템이 실수로 안전성이 떨어지지 않도록 보장합니다. 이는 안전 그물 더미와 같습니다: 그물을 더 추가할 수는 있지만, 아래쪽에서 하나를 빼낼 수는 없습니다.
3. KYP: "주인을 알기" (보편적 신분증)
과거에는 인간을 위한 별도의 신분증, 로봇을 위한 별도의 점수, 자동화된 스크립트를 위한 별도의 로그가 있었습니다. KYA 는 이 모든 것을 단 하나의 신분증 시스템으로 통합합니다.
행위자가 인간 직원인지, AI 로봇인지, 아니면 백그라운드 스크립트인지와 상관없이 KYA 는 그들에게 "신뢰 점수"를 부여합니다. 로봇이 잘못 행동하기 시작하면 점수가 떨어지고, 인간이 실수를 하면 점수가 떨어집니다. 이는 모두를 동일하게 대우하여 누가 신뢰할 수 있고 누가 위험한지 쉽게 파악할 수 있게 합니다.
4. "상호작용 승수" (위험 콤보)
때로는 단일 행동은 괜찮지만, 두 가지 행동이 결합되면 위험할 수 있습니다.
- 예시: 로봇에 "쓰기" 도구를 부여하는 것은 위험합니다. "비밀 데이터"에 접근할 수 있게 하는 것도 위험합니다.
- 승수: 로봇에 쓰기 도구와 비밀 데이터 접근 권한을 둘 다 부여하면, 위험은 단순히 "위험 + 위험"이 아닙니다. "초위험"이 됩니다.
KYA 는 이러한 "위험한 콤보" 목록을 보유하고 있습니다. 이를 감지하면 위험 점수를 곱하여 인간 운영자에게 이 특정 조합이 추가적인 감시가 필요하다고 경고합니다.
5. "책임 전가 게임" (오케스트레이터의 책임)
이것은 가장 중요한 기능 중 하나입니다. "관리자 로봇"이 일을 시키기 위해 세 명의 "작업자 로봇"을 고용한다고 상상해 보세요. 만약 한 명의 작업자 로봇이 제멋대로 되어 데이터를 훔친다면, 누가 trouble 에 빠질까요?
- 옛 방식: 작업자 로봇이 비난을 받습니다. 관리자 로봇은 깨끗하게 빠져나갑니다.
- KYA 방식: 관리자 로봇이 비난을 받습니다.
KYA 는 위험한 직원을 고용했다면, 그 직원이 무엇을 하든 당신이 책임져야 한다고 가정합니다. 하위 에이전트가 잘못 행동하면 시스템은 즉시 관리자 로봇의 신뢰 점수에서 감점합니다. 이는 관리자 로봇이 더러운 일을 하기 위해 "깨끗한" 하위 에이전트 뒤에 숨는 것을 막아줍니다.
증거 처리 방식 (변조 방지 일지)
에이전트가 무언가를 할 때마다 KYA 는 그것을 디지털 일지에 기록합니다. 하지만 이는 단순한 일반 로그가 아니라, 암호학적으로 연결된 일지입니다.
- 모든 항목은 특수한 수학적 잠금장치 (HMAC) 를 사용하여 이전 항목과 연결됩니다.
- 누군가 과거 항목을 변경하려고 시도하면 (실수를 지우는 것처럼), 잠금장치가 깨지고 일지 전체가 "변조됨"으로 표시됩니다.
- 이는 정확히 무엇을, 누가, 언제 했는지에 대해 법정에서 증거로 채택될 수 있는 기록을 생성합니다.
논문에서 실제로 발견한 것
저자들은 이 시스템을 몇 가지 까다로운 도전 과제들로 테스트했습니다:
- 속도: 놀라울 정도로 빠릅니다. 에이전트들의 속도를 늦추지 않고 초당 수천 개의 에이전트를 확인할 수 있습니다.
- 호환성: 15 개 이상의 다양한 AI 프레임워크 (LangChain, CrewAI 등) 와 작동합니다. 어떤 소프트웨어를 사용하든 상관없습니다. KYA 는 그 위에 적합하게 작동합니다.
- 해킹 테스트: 팀은 에이전트를 속이려고 시도하는 "레드 팀" 해커들을 고용했습니다. KYA 는 해커들이 로봇의 사슬을 사용하여 흔적을 숨기는 매우 교묘한 새로운 유형의 공격을 포함하여 공격의 **89%**를 적발했습니다.
- 실제 시나리오: 시뮬레이션된 은행 대출 시스템과 병원 분류 시스템에서 테스트했습니다. 두 경우 모두 위험한 에이전트를 성공적으로 식별하고 나쁜 행동을 올바른 사람 (또는 로봇) 으로 추적했습니다.
결론
KYA 는 AI 에이전트와 현실 세계 사이에 위치하는 오픈 소스 도구 (무료 사용 가능) 입니다. AI 가 작동하는지 여부를 알려주는 것을 넘어, AI 가 안전하고, 정직하며, 책임질 수 있는지를 알려줍니다. AI 가 실수를 저지르면 정확히 누구를 책임져야 하는지 알 수 있으며, 이를 증명할 수 있는 변조 방지 기록을 확보하도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.