Comprehensive AI governance requires addressing non-model gains
이 입론서는 효과적인 AI 거버넌스가 점차 역량을 증대시키고 배포 전 위험 관리 전략을 약화시키고 있는 추론, 시스템 및 자산 개선과 같은 '비모델 이득(non-model gains)'을 다루기 위해 전통적인 모델 수준 패러다임을 넘어 확장되어야 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 이제는 엔진만이 전부가 아닙니다
당신이 자동차의 속도와 안전을 규제하려고 노력하고 있다고 상상해 보세요. 오랫동안 주요 규칙은 이것이었습니다: "더 좋은 엔진(AI 모델)을 만든다면, 그 자동차가 얼마나 빨리 달릴지 예측할 수 있다."
이것이 논문에서 말하는 **모델 수준의 거버넌스(Model-Level Governance)**입니다. 이는 자동차의 속도가 거의 전적으로 엔진의 크기와 엔진을 만드는 데 사용된 연료에 달려 있다고 가정합니다. 따라서 규제 기관은 공장을 떠나기 전의 엔진을 검사하는 데 집중합니다.
논문의 경고:
저자들은 이러한 기존의 사고방식이 점점 효과를 잃고 있다고 주장합니다. 왜 그럴까요? 자동차의 속도는 더 이상 엔진에 의해서만 결정되지 않기 때문입니다. 자동차의 속도는 점차 엔진을 구매한 후에 무엇을 하느냐에 따라 달라지고 있습니다.
저자들은 이러한 새로운 속도 상승을 **"비모델 이득(Non-Model Gains)"**이라고 부릅니다. 엔진이 그대로라 할지라도, 타이어를 바꾸거나, 터보차저를 추가하거나, 더 좋은 트랙에서 주행함으로써 자동차를 위험할 정도로 빠르게 만들 수 있습니다. 논문은 우리가 엔진뿐만 아니라 이러한 추가 장치와 주행 조건도 규제해야 한다고 말합니다.
자동차를 "슈퍼차지"하는 세 가지 방법 (비모델 이득)
논문은 원래의 모델을 변경하지 않고도 AI를 훨씬 더 강력하게 만들 수 있는 세 가지 구체적인 방법을 제시합니다.
1. 추론 이득 (Inference Gain): "가속 페달을 더 세게 밟기"
- 비유: 표준 자동차 엔진을 상상해 보세요. 보통은 일정한 속도로 달립니다. 하지만 만약 주행 중에 가속 페달을 더 오래 밟거나 특수 연료 혼합물을 사용하여 질주하게 할 수 있다면 어떨까요?
- 실제: 이것이 추론 이득입니다. 이는 AI가 작동하는 동안(테스트 시에) 더 많은 컴퓨팅 자원을 제공하는 것을 의미합니다.
- 중요한 이유: 작고 저렴한 AI 모델이라도 충분한 시간과 전력을 주어 더 깊이 "생각"하게 만든다면, 갑자기 거대하고 비싼 모델처럼 작동할 수 있습니다. 이는 나쁜 의도를 가진 사람들이 엄청나게 비싼 엔진을 가질 필요 없이, 그저 가속 페달을 더 오래 밟기만 하면 되기 때문에 그들을 막기 어렵게 만듭니다.
2. 시스템 이득 (Systems Gain): "더 나은 섀시와 도구 구축하기"
- 비유: 표준 자동차를 가져와서 그 주변에 커스텀 프레임을 만듭니다. 트렁크에 로봇 팔을 달고, 다른 차들과 통신하는 GPS를 설치하며, 주행 중에 엔진을 자동으로 수리하는 컴퓨터를 추가합니다.
- 실제: 이것이 시스템 이득입니다. 이는 AI를 도구, 다른 소프트웨어, 또는 협력하는 AI 에이전트 팀이라는 "비계(scaffold)"로 감싸는 것을 의미합니다.
- 중요한 이유: 기본적인 AI는 컴퓨터를 해킹하는 법을 모를 수 있습니다. 하지만 AI에게 "드라이버"(코드 스캔 도구)와 "지도"(취약점 데이터베이스)를 제공하는 시스템을 구축한다면, 그 조합은 매우 위험해집니다. 논문은 이러한 "툴킷"은 비싼 엔진과 달리 구축하기 쉽고 공유하기도 쉽다고 지적합니다.
3. 자산 이득 (Asset Gain): "비밀 트랙에서 주행하기"
- 비유: 일반적인 트랙에서는 안전한 경주용 자동차가 있다고 상상해 보세요. 그런데 정부가 그 자동차에 아무도 가지지 못한 특수 연료와 무기가 갖춰진 비밀의 첨단 군사 트랙으로 가는 접근 권한을 준다면 어떨까요?
- 실제: 이것은 자산 이득입니다. 이는 AI가 원래 제작자가 가졌던 것과는 다른 제한적이고, 비밀스럽고, 전문적인 자원(예: 기밀 정부 데이터, 생물학적 샘와, 군사 하드웨어)과 결합될 때 발생합니다.
- 중요한 이유: "비밀 트랙"이 존재하지 않는 일반 실험실에서는 이러한 위험을 테스트할 수 없습니다. 공개적인 테스트에서는 안전해 보였던 모델이라도, 나쁜 의도를 가진 사람이 비밀 데이터베이스에 대한 접근권을 준다면 무기로 변할 수 있습니다.
미래: 스스로 배우고 운전하는 자동차
논문은 또한 "엔진 중심"의 규제를 더욱 어렵게 만드는 세 가지 미래 트렌드에 대해 경고합니다.
- 체화 (Embodiment - 자동차에 다리가 생김): AI를 로봇 안에 넣는 것입니다. 만약 AI가 환각(hallucination, 잘못된 정보 생성)을 일으킨다면, 그것은 더 이상 화면상의 틀린 답이 아니라, 실제로 사람을 때리거나 기계를 부수는 물리적인 행동이 될 수 있습니다.
- 지속적 학습 (Continual Learning - 운전하며 배우는 자동차): AI는 공장을 떠난 후에도 새로운 것을 계속 배웁니다. 첫날에는 안전했던 자동차가 열흘째 되는 날에는 나쁜 습관을 배울 수도 있습니다.
- 확산 (Diffusion - 교통 체증 효과): 수백만 대의 이러한 AI 자동차들이 도로에 동시에 있을 때, 그들은 기이한 방식으로 상호작용하기 시작할 수 있습니다. 한 대의 자동차의 실수가 (개별 자동차가 직접 일으키지 않았더라도) 연쇄 반응(예: 금융 위기)을 일으킬 수 있습니다.
해결책: 새로운 규칙서
우리가 더 이상 엔진만 확인할 수 없기 때문에, 논문은 다층적인 안전망이 필요하다고 제안합니다. 이는 자동차 개별 모델이 아니라 고속도로 시스템 전체를 규제하는 것과 같습니다.
- 시스템 거버넌스 (System Governance): AI 주변의 "툴킷"과 "프레임"을 만드는 사람들을 규제하십시오. AI 제작자만을 규제하는 것이 아닙니다.
- 엔티티 거버넌스 (Entity Governance): 기업 자체를 규제하십시오. 그들은 좋은 안전 문화를 가지고 있습니까? 책임감이 있습니까?
- 에이전트 거버넌스 (Agent Governance): AI "에이전트"들이 서로 어떻게 대화하는지를 규제하십시오. 만약 두 AI가 법을 어기기 위해 공모하기 시작한다면, 누가 책임을 져야 합니까?
- 클라우드 거버넌스 (Cloud Governance): "주유소"(클라우드 서버)를 모니터링하십시오. 누군가 위험한 계산을 수행하기 위해 엄청난 양의 전력을 사용하고 있다면, 클라우드 제공업체가 이를 포착할 수 있어야 합니다.
- 사회적 회복력 (Societal Resilience): 이것이 가장 중요합니다. 완벽한 규칙이 있더라도 사고는 발생합니다. 우리는 무언가 잘못되었을 때 살아남고 회복할 수 있을 만큼 강인한 사회를 구축해야 합니다 (예: 더 나은 병원이나 비상 계획을 갖추는 것과 같습니다).
결론
이 논문은 엔진 검사를 중단해야 한다고 말하는 것이 아닙니다. 엔진을 확인하는 것만으로는 더 이상 충분하지 않다고 말하는 것입니다.
우리가 모델(엔진)에만 집중한다면, 그 모델에 부착된 도구들, 주입되는 비밀 데이터, 그리고 학습하는 방식에서 오는 위험을 놓치게 될 것입니다. 모두의 안전을 지키기 위해서는 자동차 전체와 운전자, 도로, 그리고 그 주변의 공동체 전체를 규제해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.