← 최신 논문
🤖 AI

Provably Auditable and Safe LLM Agents from Human-Authored Ontologies

이 논문은 타입 람다 계산법과 인간이 작성한 온톨로지를 기반으로 하여 증명 가능한 정확성과 감사 가능성을 갖춘 LLM 에이전트 아키텍처인 Agentic Redux를 소개하며, 의료 빌링 컴플라이언스 및 보안 취약점 공개에서의 적용 사례를 입증한다.

원저자: Aaron Sterling

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aaron Sterling

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 병원 청구 부서나 소프트웨어 버그를 추적하는 보안 팀처럼 매우 중요하고 위험 부담이 큰 작전을 운영하고 있다고 상상해 보십시오. 당신은 이들을 돕기 위해 초지능형 AI 비서(LLM) 팀을 고용했습니다. 하지만 문제가 있습니다. 이 AI들은 매우 똑똑하지만 예측 불가능합니다. 때때로 "환각(hallucination)" 현상을 일으켜 없는 사실을 지어내기도 하고, 서로 의견이 일치하지 않을 때도 있으며, 만약 이들을 자유롭게 내버려 둔다면 당신이 구축한 세계의 규칙을 실수로 깨뜨릴 수도 있습니다.

이 논문은 이러한 AI 비서들을 조직하는 새로운 방법인 **에이전틱 리덕스(Agentic Redux)**를 소개합니다. 이것은 새로운 AI를 만드는 것이 아니라, 안전성을 보장하고 모든 결정 사항에 대해 완벽하고 변경 불가능한 기록을 생성하는 새로운 관리 구조라고 생각하십시오.

이 구조가 어떻게 작동하는지 간단한 개념별로 설명하겠습니다.

1. 문제점: "쓰기 왜곡(Write Skew)" 재앙

앨리스와 밥이라는 두 명의 직원이 $100,000의 공동 예산을 관리하고 있다고 가정해 봅시다.

  • 앨리스는 남은 금액이 $45,000임을 확인하고 이를 사용하기로 결정합니다.
  • 밥은 남은 금액이 $60,000임을 확인하고 이를 사용하기로 결정합니다.
  • 두 사람은 서로 무엇을 하고 있는지 모르는 상태에서 동시에 행동합니다.
  • 결과: 시스템은 $105,000를 지출하게 됩니다. 예산이 초과되었습니다.

컴퓨터 과학에서는 이를 "쓰기 왜곡(Write Skew)"이라고 부릅니다. 현실 세계에서도 AI 에이전트들이 전체적인 그림을 보지 못한 채 독립적으로 행동할 때 이런 일이 발생합니다. 현재의 해결책들은 종종 AI에게 "이것이 괜찮습니까?"라고 묻고, AI가 "네"라고 답하기를 기대하는 방식입니다. 만약 AI가 컨디션이 좋지 않아 "예"라고 답해야 할 상황에서 "예"라고 답한다면, 피해는 돌이킬 수 없습니다.

2. 해결책: "스마트 컨테이너" (Agentic Redux)

이 논문은 인기 있는 소프트웨어 디자인 패턴인 **리덕스(Redux)**에서 영감을 받은 구조를 제안합니다. 다음과 같은 회사를 상상해 보십시오.

  • 작업자 (하위 에이전트): 이들은 AI 비서들입니다. 이들은 세상의 아주 작은 조각(자신의 "로컬 상태")만을 볼 수 있습니다. 이들은 생각하고, 계산하고, 행동을 제안할 수는 있지만, 세상을 직접 바꿀 수는 없습니다. 이들은 마치 "멍청한 컴포넌트"와 같습니다.
  • 관리자 (메타 에이전트): 이들은 전체적인 결정권자이며, 전체 글로벌 상태(전체 예산, 모든 규칙, 모든 이력)를 봅니다.
  • 프로세스:
    1. 작업자가 행동을 제안합니다 (예: "$45,000를 지출하겠다").
    2. 제안이 관리자에게 전달됩니다.
    3. 관리자는 제안을 불변량(Invariants)(예: "총 지출은 $100,000를 초과할 수 없다"와 같은 깨뜨릴 수 없는 규칙) 목록과 대조하여 검사합니다.
    4. 규칙이 성립하면, 관리자는 변경 사항을 승인합니다. 그렇지 않으면 관리자는 거절합니다.
    5. 관리자는 세상을 업데이트하고 작업자들에게 새로운 현실이 어떻게 변했는지 알려줍니다.

핵리의 핵심: 이 논문은 관리자가 규칙을 준과하는 한, 작업자들이 아무리 이상하거나 환각을 일으키는 제안을 하더라도 시스템이 규칙을 위반하는 것은 수학적으로 불가능함을 증명합니다(타입 람다 계산법이라는 논리학 분과를 사용하여). 즉, 아키텍처 자체가 안전망 역할을 합니다.

3. "블랙박스" 장부 (선형 감사 가능성)

관리자가 결정을 내릴 때마다 특별한 공책에 기록을 남깁니다.

  • 만약 "승인"한다면: 새로운 상태와 규칙이 준수되었음을 증명하는 증거를 함께 기록합니다.
  • 만 만약 "거절"한다면: 제안 내용, 거절 이유, 그리고 어떤 규칙이 위반될 뻔했는지를 기록합니다합니다.
  • 규칙: 이 공책은 **추가 전용(append-only)**입니다. 새로운 페이지를 추가할 수는 있지만, 기존의 페이지를 찢어내거나 지울 수는 없습니다.

이것은 "선형 감사 추적(linear audit trail)"을 생성합니다. 나중에 감사관이 오더라도, 이 공책을 통해 모든 결정이 내려진 이유를 완벽한 시간 순서대로 확인할 수 있습니다. 그들은 시스템이 규칙을 어기지 않았음을 검증할 수 있습니다.

4. 시스템 구축 방법: "온톨로지 우선 설계"

이 아키텍처를 아무 문제에나 적용할 수는 없습니다. 문제를 깊이 이해하는 과정이 선행되어야 합니다. 저자는 **온톨로지 우선 에이전트 설계(Ontology-First Agent Design)**라는 방법을 제안합니다.

  1. 영역 매핑: 인간 전문가가 표준 지도 제작 도구(기초 형식 온톨로지)를 사용하여 문제의 세계를 정밀하게 그립니다 (예: "환자란 무엇인가? 약물 테스트란 무엇인가? 규칙은 무엇인가?").
  2. 역할 할당: AI에게 이 지도를 보고 어떤 "역할(jobs)"이 수행되어야 하는지 제안하도록 요청합니다.
  3. 팀 구성: AI는 그 역할들을 작업자(하위 에이전트)와 관리자(메타 에이전트)를 위한 코드로 변환합니다.

이 논문은 두 가지 실제 사례에 대해 테스트를 진행했습니다.

  • 의료 청구: 보험 청구가 약물 테스트에 관한 복잡한 정부 규정을 따르는지 확인합니다.
  • 보안 취약점: 소프트웨어 버그를 발견하고 공개하는 과정에서 패닉을 일으키거나 법을 위반하지 않도록 관리합니다.

두 사례 모두에서, 이 시스템은 에이전트들이 단독으로 행동했을 때 발생했을 "쓰기 왜곡" 오류를 성공적으로 방지했습니다.

5. 인간 안전 밸브 (상담사 큐)

만약 규칙이 너무 복잡하여 관리자가 결정하기 어렵거나, 인간의 판단이 필요한 상황이 발생하면 어떻게 될까요?
시스템에는 **상담사 큐(Counselor Queue)**가 있습니다. 관리자가 막히거나 규칙상 "인간에게 문의"해야 하는 상황에 직면하면, 제안은 일시 중단되고 인간 전문가를 위한 대기열에 들어갑니다.

  • 인간은 상황을 검토하고 결정을 내립니다.
  • 결정적으로, 인간 또한 자신의 결정을 동일한 변경 불가능한 공책에 작성하며, 자신의 선택에 대해 설명해야 합니다.
  • 이 논문은 인간이 개입하더라도, 인간이 형식을 준수하는 한 시스템이 여전히 감사 가능하고 안전하다는 것을 증 proves 합니다.

요약

이 논문은 AI를 더 똑똑하게 만들겠다고 주장하는 것이 아닙니다. 대신, 매우 엄격한 관리자가 통제하는 우리 안으로 AI를 가둠으로써 AI를 더 안전하고 신뢰할 수 있게 만든다고 주장합니다.

  • AI는 생각하고 제안합니다.
  • **아키텍처(관리자)**는 검사하고 집행합니다.
  • 장부는 모든 것을 영구적으로 기록합니다.

그 결과, "나쁜 일"(예: 예산 초과나 규정 위반)이 실수로 발생하는 것은 수학적으로 불가능하며, 인간의 개입이 필요한 경우에도 그 결정이 완전한 투명성을 가지고 기록되는 시스템을 얻게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →