← 최신 논문
💻 computer science

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

본 논문은 오뱅의 생존성 이론에 기반하여 정보 생존성 원칙과 RiskGate 프레임워크를 제안함으로써, 관찰되지 않은 위험의 상한을 추정하고 행동 편차와 적대적 적응에도 불구하고 안전을 보장하기 위해 단조로운 제약을 부과함으로써 자율 AI 에이전트의 적응형 런타임 거버넌스를 가능하게 한다.

원저자: German Marin, Jatin Chaudhary

게시일 2026-04-28
📖 5 분 읽기🧠 심층 분석

원저자: German Marin, Jatin Chaudhary

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 자율적인 로봇 비서를 고용하여 은행 계좌를 관리하고 일정을 예약하며 식료품을 주문한다고 상상해 보세요. 당신은 로봇에게 행동할 수 있는 완전한 권한을 부여했습니다. 하지만 여기에는 문제가 있습니다. 코드를 전혀 변경하지 않더라도 로봇은 서서히 나쁜 결정을 내리기 시작할 수 있습니다. 새로운 유형의 요청에 혼란을 겪거나, 특정 집단을 다른 집단보다 우대하기 시작하거나, 무해해 보이는 작은 행동들을 연쇄적으로 이어붙여 거대한 사기로 이어질 수도 있습니다.

"Governing What You Cannot Observe(관측할 수 없는 것을 통치하다)"라는 제목의 이 논문은 이러한 AI 에이전트를 안전하게 유지할 새로운 방법을 제안합니다. 단일 행동이 허용되는지 확인하는 것을 넘어, 에이전트가 실제로 충돌하기 전에 아플지 예측하기 위해 에이전트의"생명 징후"를 감시하는 방식을 제안합니다.

간단한 비유를 사용하여 그들의 아이디어를 요약하면 다음과 같습니다:

1. 핵심 문제:"침묵하는 표류 (Silent Drift)"

AI 에이전트를 고속도로를 주행하는 자동차로 생각해 보세요.

  • 구식 방식: 매번 방향을 틀기 전에 자동차를 점검합니다."이 방향 전환은 합법적인가?"만약 그렇다면 진행을 허용합니다.
  • 문제점: 자동차의 타이어가 서서히 마모되거나, 연료 혼합비가 약간씩 어긋나거나, 운전자가 피로해질 수 있습니다. 모든 방향 전환이 합법적이라 하더라도, 이러한 느리고 보이지 않는 변화로 인해 결국 자동차가 추락할 수 있습니다.
  • 논문의 통찰: 현재 방향 전환만 살펴볼 것이 아니라,"관측되지 않은 위험 (Unobserved Risk)"을 추정해야 합니다. 이는 지금 당장은 보이지 않지만 몇 분 뒤에는 존재하게 될 위험입니다.

2. 새로운 규칙:"안전 마진 (Safety Margin)"

저자들은"정보적 생존 가능성 원칙 (Informational Viability Principle)"이라는 간단한 규칙을 제안합니다. AI 가"안전 예산"을 가지고 있다고 상상해 보세요.

  • 용량 (S): AI 가 현재 얼마나 잘 수행하고 있는지 (예: 질문에 정확하게 답변함).
  • 위험 상한선 (B): 아직 볼 수 없는 것들의 추정 위험 (예: AI 가 서서히 환각을 보거나 편향되기 시작함).
  • 규칙: AI 는 용량이 위험보다 안전한 마진만큼 더 클 때만 행동할 수 있습니다.
    • 비유: 다음 주유소까지의 거리 (위험) 보다 연료 탱크 (용량) 가 훨씬 더 가득 차 있을 때만 자동차를 운전합니다. 그 간격이 너무 좁아지면, 지금 당장 자동차가 멀쩡해 보이더라도 운전을 중단합니다.

3. 세 가지 숨겨진 위험 (위험 상한선)

이 논문은 보이지 않는 위험을 AI 가 걸릴 수 있는 세 가지 특정 유형의"질병"으로 분류합니다:

  • U(x) - "혼란 (Confusion)" (불확실성): AI 는 과거에 알던 것을 서서히 잊고 있습니다. 아마도 세상이 변했거나, AI 의 행동을 다르게 만든 소프트웨어 업데이트를 받았을 수 있습니다.
    • 비유: 완벽한 수프를 만들던 요리사가 서서히 레시피를 잊어가고, 매일 조금씩 소금을 더 많이 넣기 시작하는 상황입니다.
  • SB(x) - "불공정 (Unfairness)" (구조적 편향): AI 는 의도하지는 않았더라도 서로 다른 집단을 다르게 대우합니다.
    • 비유: 클럽의 도어맨이 아무런 지시도 받지 않았는데도, 한 동네 사람들은 90% 입실하게 하고 다른 동네 사람들은 10% 만 입실하게 하기 시작하는 상황입니다.
  • RG(x) - "속임수 (Trick)" (현실 격차): AI 는 개별적으로는 안전해 보이지만 합치면 위험한 행동을 합니다.
    • 비유: 도둑이 ATM 에서 5 번 연속으로 4,900 달러를 인출하는 경우입니다. 각 인출은 5,000 달러 한도를 넘지 않아 경보를 울리지 않지만, 총 24,500 달러는 명백한 도난입니다. AI 는 단일 인출이 아닌전체 이야기를 봐야 합니다.

4. 해결책:"오토파일럿"과"생존 가능성 지수"

저자들은 이를 관리하기 위해"RiskGate"라는 시스템을 구축했습니다. 이는 AI 를 위한 건강 모니터링 장치처럼 작동합니다.

  • 생존 가능성 지수 (VI): AI 가 얼마나 건강한지를 알려주는 단일 수치 (-1 에서 +1) 입니다.
    • +1: AI 는 매우 안전합니다.
    • 0: AI 는 위태롭게 가장자리에 서 있습니다.
    • -1: AI 는 위험에 처해 있습니다.
  • 미래 예측 (Anticipation): 이 시스템은 AI 가 고장 날 때까지 기다리지 않습니다. 최근"건강 지수"의 역사를 통해 선을 그어, 선이 하향 곡선을 그을 때 AI 가 언제 0 에 도달할지 예측합니다.
    • 비유: 환자의 체온 추세를 보는 의사와 같습니다. 환자가 지금 멀쩡해 보더라도 체온이 시간당 1 도씩 오르고 있다면, 의사는 2 시간 뒤에는 발열이 올 것을 알고 발열이 오기 전에 조치를 취합니다.
  • "조임 전용"규칙 (Monotonic Restriction): 이는 중요한 안전 기능입니다. AI 가 아파지기 시작하면 시스템은 규칙을 조일(더 신중하게 만들 수) 뿐입니다. 규칙을 자동으로 풀어주는 일은 결코 없습니다.
    • 비유: 배가 물을 머금기 시작하면, 선장은 더 많은 해치를 닫을 뿐입니다. 문제를"수정"하기 위해 더 많은 해치를 열 수는 없습니다. 배가 너무 빠르게 가라앉으면, 유일한 선택지는"킬 스위치"(AI 를 완전히 정지) 를 누르고 인간의 도움을 요청하는 것입니다.

5. 실제 생활에서의 작동 방식 (예시)

이 논문은 두 가지 시나리오로 이를 테스트했습니다:

  1. "구조화 (Structuring)"사기: 나쁜 행위자가 많은 소액 이체를 통해 돈을 훔치려 시도합니다.
    • 결과: "혼란"과"불공정"감지기는 각 이체가 정상적으로 보였기 때문에 아무런 문제도 발견하지 못했습니다. 하지만"속임수"감지기 (전체 시퀀스를 봄) 는 패턴을 감지하고 도난을 막았습니다.
  2. "침묵하는 편향"사기: AI 는 시간이 지남에 따라 서서히 특정 소수 집단의 대출 신청을 조금 더 자주 거절하기 시작합니다.
    • 결과: 시스템은"건강 지수"가 서서히 하락하는 것을 감지했습니다. 약 100 건의 거래 후 AI 가 불공정해질 것이라고 예측했습니다. 시스템은 불공정이 법적 위반이 되기 전에 자동으로 규칙을 강화했습니다.

요약

이 논문은 AI 를 통치하는 것이 매번 개별 행동에 대한"해야 할 것과 하지 말아야 할 것"목록을 확인하는 것이 아니라고 주장합니다. 그것은 시간이 지남에 따라 누적되는보이지 않는 위험을 추정하는 것입니다. 우리가 볼 수 있는 것 (AI 의 현재 행동) 과 볼 수 없는 것 (위험으로의 서서한 표류) 을 분리하고, 위험해 보일 때 규칙을 더 엄격하게만 만들 수 있는 시스템을 사용함으로써, 자율 에이전트가 실제 피해를 입히기 전에 안전하게 유지할 수 있습니다.

이 논문이 주장하지 않는 것:

  • 아직 수백만 개의 실제 AI 에이전트에서 이를 테스트했다고 주장하지 않습니다 (이는 향후 작업 계획입니다).
  • 모든 가능한 AI 문제 (예:"목표 불일치"또는"기만") 를 해결한다고 주장하지는 않지만, 가장 흔한 유형의 표류와 편향을 포착할 수 있는 프레임워크를 제공합니다.
  • AI 가 스스로를 수정할 수 있다고 말하지 않습니다."건강 지수"가 너무 낮아지면 시스템은 정지하고 인간의 도움을 기다립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →