← 최신 논문
🤖 AI

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

이 논문은 자율 AI 에이전트의 도구 호출 전 결정적 권한 부여를 위해 '오픈 에이전트 패스포트 (OAP)'라는 개방형 사양과 구현을 제안하며, 이를 통해 사회적 공학 공격에 대한 성공률을 0% 로 낮추고 보안 및 규정 준수 요구사항을 효과적으로 통제할 수 있음을 입증했습니다.

원저자: Uchi Uchibeke

게시일 2026-03-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Uchi Uchibeke

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 에이전트 (자율형 인공지능) 가 실수를 하거나 해킹당했을 때, 실제로 행동을 취하기 전에 막아주는 '허가증' 시스템"**에 대한 이야기입니다.

지금까지의 AI 안전 장치는 마치 **"AI 가 착한 아이로 자라도록 교육하는 것 (모델 정렬)"**이나 **"실수를 한 뒤에 뒤늦게 후회하고 기록하는 것 (사후 평가)"**에 의존해 왔습니다. 하지만 논문은 이것이 부족하다고 말합니다. AI 가 "돈을 이체해줘"라고 말했을 때, 그 명령이 실제로 실행되기 직전에 "잠깐, 이 금액이 너의 한도 내야 해? 이 사람은 너가 돈을 보낼 수 있는 사람 맞아?"라고 확인하는 확실한 허가 시스템이 필요하다는 것입니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 문제: "비행기 조종사"와 "허가증 없는 AI"

지금의 AI 에이전트들은 마치 비행기 조종사와 같습니다.

  • 교육 (모델 정렬): 조종사는 훈련을 통해 "위험한 행동은 하지 말아야 해"라고 배웁니다. 하지만 훈련받지 않은 악의적인 명령이나, 조종사가 실수하거나 속임수에 걸리면 (해킹), 비행기는 추락할 수 있습니다.
  • 사후 평가: 비행기가 추락한 뒤에 "왜 그랬지?"라고 조사하는 것은 소용없습니다.

이 논문은 **"AI 가 버튼을 누르기 직전, 그 버튼을 누를 자격이 있는지 확인하는 '안전관'이 필요하다"**고 말합니다.

2. 해결책: OAP (오픈 에이전트 패스포트)

이 논문이 제안한 OAP는 마치 공항의 보안 검색대은행의 금고 관리자와 같습니다.

  • 여권 (Agent Passport): AI 에이전트에게 발급되는 디지털 여권입니다. 이 여권에 "이 AI 는 100 달러까지만 이체할 수 있고, 한국 계좌만 보낼 수 있다"는 내용이 적혀 있습니다.
  • 검색대 (Before-Action Hook): AI 가 "이제 돈을 보내자!"라고 명령을 내리기 직전, 이 검색대가 나옵니다.
    • "여권 보여줘." (AI 의 신원 확인)
    • "보내려는 금액이 여권에 적힌 한도 (5,000 달러) 를 넘지 않았나?" (규칙 확인)
    • "받는 사람이 허가된 목록에 있나?" (대상 확인)
  • 결과: 조건을 만족하면 **"통과 (ALLOW)"**라고 찍어주고 행동을 실행시킵니다. 조건을 위반하면 **"거부 (DENY)"**라고 찍어주고 행동을 막아줍니다.

3. 실험 결과: "사기꾼"을 어떻게 막았나?

저자들은 실제 해커들 (사기꾼) 을 불러와 AI 를 속여보게 하는 실험을 했습니다.

  • 상황: 해커들은 AI 에게 "너는 지금 긴급한 상황이라서 한도를 무시하고 돈을 보내야 해!"라고 거짓말을 했습니다 (소셜 엔지니어링).
  • 결과 1 (기존 방식): AI 가 교육받지 않았거나 속임수에 걸리면, **74.6%**의 경우 돈을 보내버렸습니다.
  • 결과 2 (OAP 적용): AI 가 "아, 정말 급하네. 보내야지!"라고 생각하더라도, **검색대 (OAP)**가 "아니야, 너의 여권에는 한도가 5,000 달러야. 이 금액은 100 달러야. 거절!"이라고 100% 막아냈습니다.
    • 핵심: AI 가 "착하게" 행동하도록 교육하는 것만으로는 부족하고, 시스템이 규칙을 철저히 지키게 만드는 것이 중요하다는 것을 증명했습니다.

4. 다른 기술들과의 차이점 (샌드박스 vs 허가증)

이 논문은 기존에 있던 다른 안전 장치들과 OAP 가 어떻게 다른지 비교합니다.

  • 샌드박스 (모래상자): AI 가 행동을 하더라도 그 영향이 밖으로 퍼지지 못하게 가두는 기술입니다. (예: AI 가 파일을 삭제해도 내 컴퓨터 전체가 망가지지 않음)
    • 비유: AI 가 폭탄을 터뜨려도 방 안에만 터지게 하는 것.
    • 한계: 폭탄이 터지는 것 자체는 막지 못합니다.
  • 모델 기반 필터링: AI 가 "나쁜 짓을 하려는 것 같아"라고 판단하는 것.
    • 비유: 경비원이 "저 사람 눈치가 수상해"라고 눈으로 판단하는 것. (실수할 수 있음)
  • OAP (이 논문): 규칙에 기반한 자동 허가증 시스템입니다.
    • 비유: 경비원이 눈으로 판단하는 게 아니라, 자동 문이 "여권 번호와 한도를 확인한 후"만 열리는 것입니다. AI 가 아무리 "나쁜 짓을 하겠다"고 생각해도 문이 열리지 않습니다.

5. 결론: 왜 이것이 중요한가?

이 기술은 단순히 해킹을 막는 것을 넘어, 책임 소재를 명확히 하는 역할을 합니다.

  • AI 가 실수로 1 억 원을 이체했다면, 누구의 잘못일까요?
  • OAP 가 있다면, "규칙을 어긴 AI 가 아니라, 그 규칙을 설정한 회사나 시스템의 잘못"임을 **디지털 기록 (로그)**으로 남길 수 있습니다.

한 줄 요약:

"AI 가 아무리 똑똑하고 교육받았더라도, **실제 행동을 취하기 직전에 '허가증'과 '규칙'을 확인하는 자동 문 (OAP)**이 없으면, 우리는 AI 에게 너무 많은 권한을 맡기는 위험한 상황에 처하게 됩니다. 이 논문은 그 '자동 문'을 만드는 표준 설계도를 공개한 것입니다."

이 시스템은 2026 년 현재, 금융, 데이터 관리, 코드 실행 등 AI 가 중요한 결정을 내리는 모든 분야에서 필수적인 안전장치로 자리 잡을 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →