Right-to-Act: A Pre-Execution Non-Compensatory Decision Protocol for AI Systems
본 논문은 모든 안전 조건이 충족되지 않으면 AI 의 행동을 중단하는 결정론적이며 보상적이지 않은 사전 실행 프레임워크인'행동권'프로토콜을 소개함으로써, 의사결정 품질 최적화에서 실행의 허용 가능성에 대한 엄격한 통제로 초점을 전환합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 빠른 로봇 도우미를 상상해 보세요. 이 로봇은 돈을 송금하거나, 사람들의 계정을 잠그거나, 공장 기계의 설정을 변경하는 등의 작업을 수행할 수 있습니다. 현재 우리는 이 로봇이 안전하도록 하기 위해 많은 규칙을 두고 있습니다:
- 권한 부여: "이 로봇이 이 기계를 조작할 권한이 있는가?"
- 안전성: "이 행동이 누군가를 해칠 것인가?"
- 위험 점수화: "1 에서 100 점까지의 척도에서 이 행동의 위험도는 얼마나 되는가?"
해당 논문은 로봇이 이러한 모든 테스트를 통과하더라도 여전히 누락된 단계가 있다고 주장합니다. 로봇이 권한을 가지고 있고 안전하며 위험도가 낮을지라도, 퍼즐의 중요한 조각이 빠져 있기 때문에 지금 당장 그 행동을 수행하는 것은 잘못일 수 있습니다.
저자는 이 누락된 단계를 **"행전 전 정당성 격차 (Pre-Action Legitimacy Gap)"**라고 부릅니다.
핵심 문제: "점수" 대 "체크리스트"
이 격차를 이해하기 위해, 교사가 학생의 프로젝트를 평가하는 두 가지 방식을 상상해 보세요:
1. 보상식 시스템 (현재의 방식):
이는 점수 기반 게임과 같습니다.
- 학생은 훌륭한 디자인으로 10 점을 받습니다.
- 좋은 연구로 10 점을 받습니다.
- 훌륭한 발표로 10 점을 받습니다.
- 하지만, 제목 페이지를 포함하는 것을 잊어버렸습니다 (누락된 요구사항).
- 결과: 총 30 점을 얻었고 합격선이 20 점이므로, 교사는 그 학생에게 A 를 줍니다. 누락된 제목 페이지는 다른 좋은 부분들에 의해 "보상"됩니다.
2. 비보상식 시스템 (논문에서 제안하는 "행동 권리"):
이는 엄격한 체크리스트가 있는 보안 검문소와 같습니다.
- 티켓이 있습니까? 예.
- 여권이 있습니까? 예.
- 비자가 있습니까? 아니요.
- 결과: 황금 티켓을 가지고 있거나, 아름다운 여권을 소유했거나, 친절한 미소를 지녔더라도, 비자가 없다면 입장할 수 없습니다. 어떤 양의 "좋은 점수"도 누락된 비자를 해결할 수 없습니다.
논문은 AI 가 계정 잠금이나 자금 이동과 같은 현실 세계의 결정을 내릴 때, 점수 시스템이 아닌 체크리스트 접근 방식이 필요하다고 주장합니다.
"행동 권리 (Right-to-Act)" 프로토콜
저자는 **"행동 권리"**라는 새로운 규칙을 제안합니다.
이는 클럽의 문지기처럼, 당신이 얼마나 많은 돈을 가지고 있는지 (당신의 점수) 나 얼마나 잘생겼는지 (당신의 안전 등급) 는 상관하지 않습니다. 문지기는 오직 **"이 특정 문을 열기 위해 필요한 특정 열쇠를 가지고 있습니까?"**라고 묻기만 합니다.
- AI 가 "이 사용자의 계정을 잠그고 싶습니다"라고 말하면, 시스템은 확인합니다: "이 사용자가 실제로 규칙을 위반했다는 증거가 있는가, 아니면 단지 추측일 뿐인가?"
- 증거가 없으면, 시스템은 **"아니요"**라고 말합니다.
- "글쎄, 추측의 확신이 90% 이니 어쨌든 진행하자"라고 말하지 않습니다.
- 대신, "중지하세요. 우리는 열쇠가 없습니다. 더 많은 정보를 얻거나 인간에게 문의하세요"라고 말합니다.
왜 이것이 중요한가 (계정 정지 예시)
논문은 현실 세계의 예시를 사용합니다: 웹사이트에서 사용자를 차단하는 AI.
- 구 방식: AI 는 사용자가 5 번 의심스러운 행동을 했으며, 알려진 해커와 유사하게 보이며, AI 가 해커일 확률이 95% 라고 판단합니다. "위험 점수"가 높습니다. 결과: 사용자는 즉시 차단됩니다.
- 문제점: 만약 사용자가 해킹된 공유 컴퓨터를 사용했을 뿐이라면 어떨까요? AI 는 의심스러운 활동에 대해서는 "옳았을"지라도, 누가 그것을 했는지에 대해서는 "틀렸을" 수 있습니다. AI 는 필수 조건인 **"사용자 신원 확인"**을 놓쳤습니다.
- 새 방식 (행동 권리): 시스템이 체크리스트를 확인합니다.
- 의심스러운 활동? 예.
- 높은 확신? 예.
- 신원 확인됨? 아니요.
- 결과: 시스템은 중지합니다. 사용자를 차단하지 않습니다. 대신, "이것을 아직 수행할 수 없습니다. 사용자에게 더 많은 정보를 요청해야 합니다"라고 말합니다.
핵심 교훈
논문은 수학적으로 증명합니다. "위험 점수"를 더 높이거나 "안전성"을 개선하는 것만으로는 이 문제를 해결할 수 없다는 것입니다. 점수 시스템을 사용하면, 높은 점수가 항상 누락된 요구사항을 덮을 수 있습니다.
정당성은 점수가 아니라 경계입니다.
논문은 AI 가 현실 세계의 어떤 행동을 "발사"하기 전에, 엄격하고 양보할 수 없는 체크리스트를 통과해야 한다고 제안합니다. 필수 조건 중 하나라도 누락되면, AI 가 얼마나 "똑똑하거나" "확신에 찬" 상태이든 관계없이 해당 행동은 차단됩니다. 이는 "아무것도 하지 않는 것" (기다리기, 도움 요청, 인간에게 에스컬레이션) 을 시스템 실패가 아닌 유효하고 필수적인 결과로 전환시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.