← 최신 논문
💻 computer science

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

본 논문은 사전 행동 거버넌스 추론 루프를 통해 자율 AI 에이전트에 인간과 유사한 '행동 전 사고' 심의 과정을 내재화하는 신경인지 거버넌스 프레임워크를 제안하여, 에이전트가 외부 제약에 의존하지 않고도 4 단계 규칙 계층 구조에 따라 행동을 내부적으로 평가함으로써 높은 준수를 달성할 수 있도록 한다.

원저자: Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H.
게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 사업을 운영하도록 매우 똑똑하고 빠르게 움직이는 로봇 보조인을 고용한다고 상상해 보세요. 이 로봇은 회의를 예약하고, 물품을 구매하며, 이메일을 보내고 심지어 코드를 작성할 수도 있습니다. 그것은 놀라울 정도로 효율적이지만, 한 가지 문제가 있습니다: 충동적으로 행동한다는 점입니다. 만약 당신이 "최고의 거래를 찾아라"라고 지시하면, 그것은 실수로 백만 달러 상당의 재고를 구매하거나 잘못된 사람에게 사적인 이메일을 보낼 수도 있습니다.

현재 우리는 이러한 실수를 막기 위해 로봇 주위에 "울타리"를 설치하려 합니다. 로봇이 작업을 마친 에 그 작업을 점검하거나, 로봇이 말하기 전에 나쁜 단어를 차단하는 필터를 설치합니다. 하지만 이 논문의 저자들은 울타리만으로는 부족하다고 주장합니다. 로봇이 행동하기 전에 규칙에 대해 생각하지 않는다면, 결국 규칙을 우회하는 방법을 찾아낼 것입니다.

이 논문은 AI를 통제하는 새로운 방식을 제안합니다: 로봇이 책임감 있는 인간 직원처럼 생각하도록 가르치십시오.

다음은 그들의 "신경인지 거버넌스 (Neurocognitive Governance)" 모델이 어떻게 작동하는지 간단히 설명한 것입니다:

1. 핵심 아이디어: "멈추고 생각하라"

인간에게는 초능력이 있습니다: 우리가 위험한 일을 하기 전에 뇌가 "일시정지" 버튼을 누릅니다. 우리는 "이것이 허용되는가? 이것이 안전한가?"라고 스스로에게 묻습니다. 우리는 실수를 한 후 상사가 우리를 혼내기를 기다리는 것이 아니라, 행동하기 전에 스스로를 멈춥니다.

저자들은 이를 시스템 2 사고(느리고 의도적인 사고)와 시스템 1(빠르고 자동적인 반응)으로 구분합니다.

  • 현재의 AI: 주로 시스템 1입니다. 작업을 보고 서둘러 수행합니다.
  • 새로운 AI: 시스템 2를 사용하도록 강요받습니다. 어떤 큰 행동을 취하기 전에 반드시 멈추어 규칙서를 확인하고 진행할 수 있는지 결정해야 합니다.

2. "4 층 규칙서"

큰 회사에서 일하는 인간 직원을 상상해 보세요. 그들은 하나의 규칙만 따르는 것이 아니라, 계층 구조를 따릅니다:

  1. 글로벌 규칙: 회사의 핵심 가치 (예: "절대로 훔치지 마라").
  2. 부서 규칙: 해당 팀의 특정 규칙 (예: "재무팀은 서명 없이 1 만 달러 이상을 지출할 수 없다").
  3. 직무 규칙: 특정 역할에 대한 규칙 (예: "주니어 사무원으로서 당신은 파일을 읽을 수는 있지만 삭제할 수는 없다").
  4. 상황적 규칙: 지금만 적용되는 비상 규칙 (예: "감사 기간 동안 모든 사람은 이중 승인이 필요하다").

이 논문은 AI 를 위해 정확히 동일한 4 층 규칙서를 구축합니다. AI 가 무엇을 하기 전에 네 가지 계층을 모두 한 번에 확인합니다. 어떤 계층이라도 "아니오"라고 말하면 행동은 중단됩니다.

3. "행동 전 루프"(로봇의 양심)

이 논문은 **행동 전 거버넌스 추론 루프 (Pre-Action Governance Reasoning Loop, PAGRL)**라는 구체적인 프로세스를 소개합니다. 이는 로봇이 모든 움직임 전에 수행해야 하는 의무적인 "양심 점검"이라고 생각하면 됩니다.

다음은 루프가 작동하는 방식입니다:

  1. 충동: 로봇은 "이 이메일을 보내고 싶다"고 생각합니다.
  2. 점검: 멈추고 규칙서 (4 층) 를 불러옵니다.
  3. 추론: "이 이메일이 어떤 규칙을 위반하는가? 안전한가?"라고 묻습니다. 인간이 그 결정의 이유를 볼 수 있도록 자신의 생각을 기록합니다 ("추론 흔적").
  4. 결정: 다음 세 가지 경로 중 하나를 선택합니다:
    • 진행: "모든 것이 명확합니다. 이메일을 보내겠습니다."
    • 수정: "잠깐, 사람에게 보낼 수는 없지만 사람에게 보낼 수는 있습니다. 계획을 변경하고 다시 확인하겠습니다."
    • 도움 요청: "이것은 너무 위험하거나 제가 결정할 권한이 없습니다. 멈추고 인간 관리자에게 문의하겠습니다."

4. 왜 이것이 "울타리"보다 더 나은가

이 논문은 실제 세계의 공급망 시스템 (식료품점 재고 관리) 을 사용하여 이 아이디어를 테스트했습니다.

  • 구식 방식 (울타리): 로봇이 5 만 달러짜리 물건을 구매하려 하면, 필터가 시도 에 이를 차단합니다.
  • 신식 방식 (내부 사고): 로봇은 규칙에 대해 생각하고, 그것이 너무 비싸다는 것을 깨닫고, 구매를 시도하기 전에 인간에게 승인을 요청하기로 스스로 결정합니다.

결과:

  • 로봇은 95% 의 경우 올바른 결정을 내렸습니다.
  • 불확실할 때는 인간에게 도움을 요청하는 것이 정확했습니다 (거짓 경보 없음).
  • 로봇은 자신의 생각을 완벽하게 기록하여 인간이 정확히 무엇을 생각했는지 감사할 수 있게 했습니다.

5. 주의점 (논문에 명시된 내용)

저자들은 한계에 대해 솔직합니다. AI 가 약간 무작위적일 수 있는 "뇌"(대규모 언어 모델) 를 사용하기 때문에 100% 완벽하지는 않습니다. 때로는 질문이 까다롭게 표현되면 로봇이 혼란을 겪고 실수를 할 수 있습니다. 또한 로봇은 인간처럼 규칙을 영구적으로 "학습"하지 않습니다. 새로운 작업을 시작할 때마다 매번 규칙을 상기받아야 합니다.

요약

이 논문은 AI 를 안전하게 만들기 위해 단순히 AI 주위의 울타리를 더 높게 쌓는 것이 아니라, AI 내부에 양심을 구축해야 한다고 제안합니다. AI 를 책임감 있는 인간 직원처럼 멈추게 하고, 계층화된 규칙서를 참조하며, 행동을 추론하도록 강제함으로써 우리는 인간이 끊임없이 감시할 필요를 줄이고 스스로를 통제하는 자율 에이전트를 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →