← 최신 논문
💬 NLP

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

본 논문은 긴급 상황 트리거에 의해 엄격하게 정당화될 때만 규칙을 정당한 위반을 하도록 허용하면서도 권위에 대한 존중과 범위의 제한을 유지하면서 생성 에이전트가 구조화되고 해석 가능하며 타당한 결정을 내릴 수 있게 하는 새로운 4 모듈 인지 아키텍처인 PAVE 를 소개합니다.

원저자: Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 사람들 (생성 에이전트라고 불림) 이 가득한 가상의 마을을 상상해 보세요. 이 디지털 사람들은 인간처럼 말하고, 생각하고, 행동할 수 있는 첨단 AI 에 의해 구동됩니다. 보통 이 에이전트들은 '심즈' 게임을 하듯 규칙을 따르고 협력하는 데 뛰어납니다. 하지만 규칙을 깨야 할 때는 어떻게 될까요?

커피숍에서 화재가 발생했다고 상상해 보세요. 규칙은 '빨간불에서 멈추세요'입니다. 하지만 화재에서 벗어나기 위해 에이전트는 반드시 신호를 무시하고 횡단보도를 건너야 합니다. 아니면 경찰관이 서서 모두에게 멈추라고 지시하고 있다고 상상해 보세요. 에이전트는 경찰관의 말을 들어야 할까요, 아니면 어쨌든 도망쳐야 할까요?

현재의 AI 에이전트들은 종종 이 부분에서 실패합니다. 그들은 맹목적으로 규칙을 따르거나 (화재 속에 머무름), 너무 쉽게 규칙을 어깁니다 (서두른다는 이유만으로 신호를 위반함).

이 논문의 저자들은 이러한 에이전트들을 위해 PAVE라는 새로운 '두뇌'를 개발했습니다. PAVE 는 에이전트가 언제 규칙을 깨는 것이 실제로 허용되는지, 그리고 어떻게 미치지 않고 그렇게 할 수 있는지를 파악하도록 돕는 4 단계 의사결정 과정으로 생각할 수 있습니다.

간단한 비유를 들어 PAVE 가 어떻게 작동하는지 살펴보겠습니다:

4 단계 'PAVE' 과정

당신이 횡단보도에 있는 디지털 보행자라고 상상해 보세요. 이동하기 전에 새로운 일련의 정신적 기어를 돌려야 합니다.

1. 지각 (눈과 귀)

  • 기능: 단순히 '빨간불'을 보는 대신, 에이전트는 전체 상황을 파악합니다. 화재가 있나요? 얼마나 가까운가요? 근처에 경찰관이 있나요? 다른 사람들이 도망치고 있나요?
  • 비유: 범죄 현장을 수색하는 탐정 같습니다. 빨간불만 보는 것이 아니라, 두 블록 떨어진 곳의 화재 (높은 위험) 와 바로 옆에 있는 경찰관 (높은 권위) 을 봅니다. '위험'과 '거리'를 구분합니다.

2. 평가 (판사)

  • 기능: 에이전트는 스스로에게 다섯 가지 질문을 하고 각각에 1 에서 100 점까지 점수를 매깁니다:
    1. 위험: 잡힐 확률은 얼마나 됩니까? (경찰관이 바로 근처에 있다면 위험은 높음).
    2. 동료 압력: 다른 사람들은 무엇을 하고 있습니까? (모두 횡단보도를 무단으로 건너면 이 점수는 상승함).
    3. 사회적 규범: 사람들이 내가 무엇을 하기를 기대한다고 나는 생각합니까?
    4. 이익: 규칙을 깨는 것으로 얻는 이익은 얼마나 됩니까? (목숨을 구하는 것은 엄청난 이익이지만, 5 분 늦는 것은 작은 이익임).
    5. 정당성 (가장 중요한 것): 이것이 이 논문의 핵심 비법입니다. 에이전트는 이렇게 묻습니다: "이 규칙을 깨는 것이 필수적인가? 이것이 필요한 가장 작은 행동인가? 다른 방법이 없는가?"
  • 비유: 이는 법정에서 엄격한 판사와 같습니다. '이익' 점수가 높더라도 (늦었음!), '정당성' 점수가 낮을 수 있습니다 (일찍 출발할 수 있었음). 판사는 말합니다. "아니요, 이는 법을 어길 만큼 충분한 이유가 아닙니다."

3. 판결 (법정망치)

  • 기능: 에이전트는 최종 결정을 내립니다: 준수하거나 위반하거나.
  • 하드 게이트: 이것이 마법 같은 부분입니다. 에이전트는 자신의 성격에 기반한 개인적인 '임계값' (숫자) 을 가지고 있습니다. 판사가 매긴 '정당성' 점수가 이 임계값 미만이라면, 에이전트는 위험이나 동료 압력이 얼마나 크든 상관없이 규칙을 반드시 따라야 합니다. 단지 편리하다는 이유로 규칙을 깨서는 안 됩니다.
  • 비유: 클럽의 도어맨을 생각해 보세요. 부유하다 하더라도 (높은 이익) 친구들이 밀어 넣는다 하더라도 (동료 압력), VIP 패스가 없다면 (정당성 점수), 도어맨 (판결) 은 "입장 불가"라고 말합니다.

4. 모방 (행동)

  • 기능: 에이전트는 자신의 결정에 따라 행동합니다. 규칙을 깨기로 결정했다면, 찾은 특정 이유 때문에만 그렇게 합니다.
  • 비유: 에이전트가 화재에서 벗어나기 위해 신호를 위반하고 횡단보도를 건넌다면, 그것은 오직 길을 건너기 위해서만입니다. 갑자기 자전거를 훔치거나 집에 침입하기로 결정하지는 않습니다. 비상 상황에 집중합니다. 화재가 진압되면 즉시 모든 교통 법규를 준수하는 상태로 돌아갑니다.

어떻게 테스트했는지 (VOVILLE 마을)

연구자들은 유명한 AI 마을인 스몰빌의 교통 버전인 VOVILLE이라는 새로운 마을을 구축했습니다. 그들은 세 가지 주요 시나리오에서 에이전트들을 테스트했습니다:

  1. 화재 대피: 화재가 발생합니다.

    • 결과: PAVE 에이전트들은 화재에서 벗어나기 위해 신호를 위반했습니다 (정당한 위반). 화재가 진압되자마자 즉시 신호 위반을 중단했습니다 (회복).
    • 구형 AI: 종종 신호 앞에서 멈추어 화재 속에서 죽거나, 화재가 없더라도 서두른다는 이유만으로 신호를 위반했습니다.
  2. 경찰관: 화재가 발생했지만, 경찰관이 횡단보도에서 사람들이 기다리라고 지시하고 서 있습니다.

    • 결과: PAVE 에이전트들은 화재로 인해 도망치고 싶었음에도 경찰관의 말을 들었습니다. 그들은 권위를 존중했습니다.
    • 구형 AI: 종종 경찰관을 무시하고 어쨌든 도망쳤습니다.
  3. 동료 압력: 화재는 없으며, 친구가 횡단보도를 무단으로 건너며 "자, 가자!"라고 말합니다.

    • 결과: PAVE 에이전트들은 "아니요"라고 말했습니다. 늦는 것은 법을 어길 '필수적인' 이유가 아니라고 깨달았습니다.
    • 구형 AI: 종종 친구를 따라 횡단보도를 무단으로 건넜습니다.

큰 교훈

이 논문은 PAVE 가 AI 에이전트들을 특정 방식으로 훨씬 더 '인간적'으로 만든다고 주장합니다: 그들은 규칙이 중요하다는 것을 이해하지만, 때로는 비상 사태가 규칙을 깨야 함을 요구한다는 것을 이해합니다. 그러나 그들은 진정으로 필요할 때만 규칙을 깨고, 권위 있는 인물들의 말을 들으며, 비상 사태가 끝나는 순간 즉시 규칙 위반을 중단합니다.

PAVE 가 없으면 AI 에이전트들은 너무 경직되어 있거나 (위험할 때조차 규칙을 따름) 너무 혼란스럽습니다 (편리할 때마다 규칙을 깨는). PAVE 는 진짜 비상 사태와 단순히 서두르는 것의 차이를 아는 '도덕적 나침반'을 그들에게 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →