← 최신 논문
🤖 AI

TrustX Agent Risk Classification Framework (ARC): Risk-Tiering Internally Created Agentic AI Systems

이 논문은 실무자, 개발자 및 규제 기관이 내부적으로 생성된 에이전트형 AI의 고유한 위험을 관리할 수 있도록 특별히 설계된, 12개 차원의 점수 산정 루브릭과 기존 자율성 모델을 활용하여 7가지 유형의 에이전트형 AI 시스템을 그에 상응하는 거버넌스 통제가 적용되는 3가지 위험 계층으로 분류하는 구조화된 도구인 TrustX 에이전트 위험 분류 프레임워크(ARC)를 소개한다.

원저자: Hannah M. Liu, Rhea Saxena, Shiv Asthana

게시일 2026-07-13
📖 5 분 읽기🧠 심층 분석

원저자: Hannah M. Liu, Rhea Saxena, Shiv Asthana

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 북적이는 도시라고 상상해 보십시오. 오랫동안 "AI 시민"들은 대부분 유능한 사서나 계산기와 같았습니다. 그들은 선반 위에 앉아 질문이 들어오기를 기다렸다가 답변을 내놓았습니다. 하지만 최근 새로운 유형의 시민이 도착했습니다. 바로 **에이전틱 AI(Agentic AI)**입니다. 이들은 단순한 사서가 아닙니다. 정보를 찾는 것뿐만 아니라 비행기를 예약하고, 코드를 작성하며, 로봇을 움직이거나 심지어 은행 계좌를 관리하는 등 실제로 '행동'할 수 있는 아주 똑똑한 인턴과 같습니다. 이들은 인간이 매 순간 손을 잡아주지 않아도 스스로 계획을 세우고, 실행하며, 계속해서 나아갈 수 있습니다.

문제는 무엇일까요? 도시의 오래된 규칙 책들(NIST 프레임워크나 EU AI 법안 등)은 사서들을 위해 작성되었다는 점입니다. 이 규칙들은 파일을 실수로 삭제하거나, 비밀을 훔치거나, 혹은 연쇄적인 실수 반응을 일으킬 수도 있는 이 에너지 넘치는 새로운 AI 인턴들을 어떻게 다뤄야 할지 알지 못합니다.

여기, Responsible AI Institute의 **한나 리우(Hannah Liu), 레아 색세나(Rhea Saxena), 시브 아스다나(Shiv Asthana)**가 등장합니다. 이들은 **TrustX 에이전트 리스크 분류 프레임워크(ARC)**라는 새로운 도구를 구축했습니다. ARC를 이 새로운 AI 인턴들을 정밀하게 스캔하여 **저위험(Low), 중위험(Medium), 고위험(High)**의 세 가지 안전 구역으로 분류하도록 설계된 첨단 "리스크 레이더"라고 생각하십시오.

12가지 안전 스캔 항목

AI 인턴이 얼마나 위험할 수 있는지 판단하기 위해, ARC는 단순히 추측하지 않습니다. 대신 12차원 점수 산정 방식을 실행합니다. 마치 다음과 같은 12가지 질문이 담긴 체크리스트를 보는 것과 같습니다:

  • 자율성(Autonomy): AI가 매 동작마다 인간의 "가라"는 명령이 필요한가, 아니면 스스로 제멋대로 움직이는가?
  • 영향 범위(Blast Radius): 이 AI가 실수를 했을 때, 단 한 사람을 짜증 나게 하는 정도인가, 아니면 회사 전체의 네트워크를 마비시키는가?
  • 가역성(Reversibility): AI가 무언가를 망가뜨렸을 때 "되돌리기"를 할 수 있는가, 아니면 그 피해가 영구적인가?
  • 데이터 민감도(Data Sensitivity): AI가 공개된 날씨 보고서를 읽고 있는가, 아니면 최고 기밀인 "핵심 자산" 파일들을 뒤지고 있는가?

각 질문에는 1점(저위험), 2점(중위험), 3점(고위험)의 점수가 부여됩니다.

"결정적 차원" 규칙: 위험을 숨길 수 없다

이것이 그들의 발견 중 가장 중요한 부분이며, 마치 화재 경보와도 같습니다. 많은 리스크 시스템에서는 큰 문제 하나와 작은 문제 열 개가 있을 때, 시스템이 이를 평균 내어 "음, 대체로 괜찮네"라고 말할 수 있습니다.

이 논문의 저자들은 이러한 아이디어를 명시적으로 거부합니다. 그들은 재앙을 평균값으로 희석할 수는 없다고 주장합니다. 그들의 프레임워크는 "결정적 차원(critical dimension)" 접근 방식을 사용합니다. 즉, 12가지 질문 중 단 하나라도 "3"(고위험)이 나오면, 나머지 11개 질문이 아무리 안전하더라도 전체 시스템은 가장 높은 위험 단계로 격상됩니다.

예를 들어, 그들의 예시 사례에서 그들은 "의사 결정 지원 시스템"(의사를 돕는 의료용 AI와 같은 것)을 살펴보았습니다. 이 시스템은 대부분의 점수가 낮았지만(1점), 규제 대상인 민감한 의료 데이터를 다루기 때문에 하나의 "3"을 가졌습니다. 이 단 하나의 "3" 때문에, 프레임워크는 이 시스템을 Tier 3: 고위험으로 취급해야 한다고 제안합니다. 단순한 평균값은 이 위험을 숨겼겠지만, ARC는 이를 잡아냈습니다.

일곱 가지 유형의 AI 인턴

프레임워크는 이 에이전트들을 일곱 가지 범주로 분류하며, 그 결과는 놀랍습니다:

  1. 자율 에이전트(Autonomous Agents): 이들은 "보스"입니다. 목표를 설정하고 모든 것을 스스로 수행합니다. 논문의 시뮬레이션에서 이들은 평균 2.33을 기록했으며 **Tier 3 (고위험)**로 분류되었습니다. 이들은 길을 묻기 위해 멈추지 않는 자율 주행 자동차와 같습니다.
  2. 코딩 어시스턴트(Coding Assistants): 이들은 "프로그래머"입니다. 논문은 여기서 특별한 문제를 지적합니다. 이들이 컴퓨터에서 실행되는 코드를 작성하기 때문에, 규칙에 대한 특별한 "확장"이 필요하다는 것입니다. 심지어 단순한 "자동 완성" 도구(코드 제안만 하는 도구)조차 내부의 기밀 코드를 다루기 때문에 **Tier 2 (중위험)**로 측정되었습니다.
  3. 의사 결정 지원 시스템(Decision Support Systems): 앞서 언급했듯이, 이들이 주로 대화만 하더라도 개인적인 데이터를 다룬다면 Tier 3로 올라갑니다.
  4. 물리적 결합형/임베디드 에이전트(AI Embedded/Physical Agents): 이들은 로봇이나 자율 주행 자동차입니다. 이들은 사람을 다치게 하거나 물리적인 것을 파손할 수 있고, 자동차 사고를 "되돌릴" 수 없기 때문에 Tier 3입니다.
  5. 지식 어시스턴트(Knowledge Assistants): 이들은 "연구원"(챗봇 같은 존재)입니다. 보통은 Tier 2이지만, 너무 많은 것을 기억하거나 비밀 데이터를 다룬다면 Tier 3가 될 수 있습니다.
  6. 도구 사용 에이전트(Tool-Using Agents): 이들은 다른 앱과 통신하는 "연결자"입니다. 외부 세계로 데이터를 실수로 유출할 수 있기 때문에 Tier 3입니다.
  7. 거래/상업 에이전트(Transaction/Commerce Agents): 이들은 돈을 다룹니다. 놀랍게도 논문의 예시에서 이들은 보통 인간의 승인이 필요하기 때문에 **Tier 2 (중위험)**에 머물렀습니다. 하지만 저자들은 이 에이전트들이 더 많은 자유를 얻게 된다면 쉽게 고위험이 될 수 있다고 경고합니다.

이 논문이 제외하는 것들

저자들은 자신들의 도구가 무엇이 아닌지를 매우 명확히 밝히고 있습니다.

  • 이것은 모든 AI 문제를 해결하는 마법 지팡이가 아닙니다.
  • 이것은 최종적이고 변경 불가능한 법이 아닙니다. 논문은 이 프레임워크가 AI가 더 똑똑해짐에 따라 업데이트되어야 하는 "구조적이고 반복 가능한 도구"임을 인정합니다.
  • 이것은 인간의 판단을 대체하는 것이 아닙니다. 점수는 사용자가 질문에 답하는 방식에 기반하며, 저자들은 "점수의 주관성"이 한계점임을 인정합니다.
  • 이 도구는 고위험 AI를 절대 만들어서는 안 된다고 주장하는 것이 아닙니다. 대신, 만약 고위험 AI를 만든다면 안전을 유지하기 위해 "엄격한" 통제(제3자 검증 및 이사회 수준의 승인 등)가 필요하다고 주장합니다.

얼마나 확신하는가?

논문은 이것을 기존의 규칙과 실제 사건(예: 코딩 도구의 취약점이 드러났던 2025년의 "IDEsaster")에 기반한 제안된 프레임워크로 제시합니다. 그들은 예시 사례시뮬레이션된 점수 산정을 사용하여 이것이 어떻게 작동하는지 보여줍니다. 그들은 이 도구를 아직 세상의 모든 AI에 테스트했다고 주장하는 것이 아니라, 현재의 규칙들이 AI가 성장하는 속도를 따라잡지 못하고 있기 때문에 이 방법이 필요한 진전이라고 제안합니다.

핵심 요약

저자들은 이 "리스크 레이더"를 사용함으로써 기업과 규제 기관이 추측하는 것을 멈출 수 있다고 믿습니다. AI 인턴이 안전하기를 막연히 바라는 대신, 12가지 항목의 스캔을 실행할 수 있습니다. 만약 AI가 어떤 카테고리에서라도 "3"을 받으면, 경고등이 빨간색으로 바뀌고 엄격한 규칙이 적용됩니다. 이는 AI가 더 강력해짐에 따라 우리의 안전망도 더 강해지도록 만드는 방법입니다.

결론적으로, 이 프레임워크는 "실질적인 디딤돌"이 되기 위한 것입니다. 이것이 최종 목적지는 아닐지라도, 우리가 이전에 가졌던 지도들보다는 훨씬 더 나은 지도입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →