← 최신 논문
💻 computer science

Protocol-Governed Human–AI Software Engineering: Autonomy Without Authority

본 논문은 활동 자율성과 권한 부여 권한을 분리하는 프로토콜 기반 컴퓨팅 아키텍처를 제시하고 이를 실증적으로 평가하며, 명시적인 승인, 승격 및 봉인 프로토콜을 통해 인간의 감독이 어떻게 AI 주도 소프트웨어 공학을 제어할 수 있는지 입증하는 동시에 가드 메커니즘의 개선이 필요한 구체적인 영역들을 식별한다.

원저자: Bhash Ganti

게시일 2026-09-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bhash Ganti

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 소프트웨어 제작의 세계에 새로운 종류의 노동자가 등장했다. 코드를 작성하고, 시스템을 설계하며, 잠을 자지 않고도 오류를 수정할 수 있는 인공지능이다. 이러한 변화는 프로그램이 구축되는 방식을 변화시켰지만, 동시에 누가 실제로 통제권을 쥐고 있는지에 대한 조용하고 위험한 혼란을 야기했다. 수십 년 동안 코드를 작성하는 사람은 곧 그 코드가 무엇을 할 수 있는지 결정하는 사람이기도 했다. 인간 개발자가 변경 사항을 병합할 때, 그들은 암묵적으로 "내가 이것을 확인했으며, 실행하기에 안전하다"라고 말하는 것이었다. 하지만 AI가 코드를 작성할 때, 인간은 종종 최종 결과물만을 검토하게 된다. 이는 격차를 만든다. AI는 구축할 수 있는 힘을 가졌지만, 인간은 여전히 승인할 수 있는 힘을 보유하고 있다. 이 두 가지 권한을 분리할 수 있을 것인가? 기계가 소프트웨어 공학의 모든 힘든 일을 수행하도록 허용하면서도, 인간이나 엄격한 규칙의 집합이 최종 소프트웨어가 허용되는 바를 결정하는 유일한 주체로 남을 수 있는가?

이것이 독립 연구자 바샤 간티(Bhash Ganti)의 최근 연구가 다루는 핵심적인 퍼즐이다. 이 연구는 '프로토콜 기반 컴퓨팅(Protocol-Governed Computing)'이라는 특정 아키텍처 개념을 탐구한다. 간단히 말해, 이것은 프로그램이 구축되기도 전에 프로그램이 할 수 있는 일에 대한 규칙이 고정되는 시스템이다. 코드가 작성된 후에 그것이 규칙을 따르는지 확인하는 대신, 이 시스템은 빌더(builder)가 사전 승인된 권한이라는 우리 안에서 코드를 구성하도록 강제한다. 빌더는 부품을 설계하고 조립할 수는 있지만, 그 자체로 우리를 바꿀 수는 없으며, 완성된 기계가 특정 별도의 검사를 통과하지 못했다면 그 기계를 실행하도록 결정할 수도 없다. 목표는 인공지능이 요구 사항 분석, 솔루션 설계, 코드 작성을 포함한 소프트웨어 엔지니어링의 전 과정을 수행하면서도, 규칙을 변경하거나 소프트웨어를 실행하도록 강제할 수 있는 권한을 결코 얻지 못하게 하는 것이었다.

이를 테스트하기 위해, 연구자는 AI 에이전트에게 기존 소프트웨어 시스템에 새로운 기능을 추가하라는 특정 과업을 부여한 통제된 환경을 설정했다. 이 에이전트는 단순히 제안을 타이핑하는 단순한 보조 도구가 아니라, 복잡한 9단계 프로세스를 통과해야 하는 자율적인 작업자였다. 이 프로세스는 인간이 프로젝트의 범위와 이를 규율할 규칙을 정의하는 것으로 시작된다. 그다음 AI는 현재 시스템을 분석하고, 새로운 기능을 설계하며, 필요한 코드를 작성해야 한다. 결정적으로, AI는 단순히 코드를 작성하고 저장할 수 없다. AI가 취하는 모든 단계는 기록되며, 생성하는 모든 작업물은 일련의 자동화된 체크포인트를 통과해야 한다. 이 체크포인트들은 게이트키퍼 역할을 하여, 새로운 작업이 원래의 규칙과 일치하는지, 그리고 승인되지 않은 변경 사항을 몰래 삽입하려고 시도하지 않는지 검증한다. 만약 AI가 규칙을 어기려 한다면 시스템은 이를 중단시킨다. 만약 규칙을 따른다면, 그 작업은 실행 가능한 새로운 불변(immutable) 상태로 봉인된다.

실험은 AI가 실제로 작업을 수행할 수 있음을 보여주는 데 성공했다. 에이전트는 기존 시스템을 분석하고, 디지털 도서관을 위한 새로운 대출 기능을 설계했으며, 필요한 모든 코드와 문서를 생성해 냈다. AI는 세부 사항을 추측하거나 학습 데이터에서 기억해 내는 대신, 현재 상태를 이해하기 위해 기존 시스템에 질의함으로써 이 일을 수행했다. AI는 사전 설정된 규칙을 완전히 준수하는 새로운 소프트웨어 버전 후보를 만들어 냈다. 그러나 가장 중요한 발견은 AI가 구축할 수 있다는 사실이 아니라, AI가 승인할 수는 없다는 사실이었다. 시스템은 AI가 자신의 작업물을 공식적인 실행 버전으로 승격시킬 방법이 없도록 설계되었다. AI가 후보를 구축했음에도 불구하고, 그것이 새로운 기준(baseline)이 되기 위해서는 별도의 인간 운영자가 명시적으로 승인해야만 했다. AI는 구성할 수 있는 자율성은 가졌으나, 시스템이 다음에 무엇을 할지 결정할 권한은 전혀 없었다.

연구는 또한 시스템이 실제로 의도한 대로 작동하는지 확인하기 위해 증거를 면밀히 조사했다. 연구진은 안전 메커즘이 실제인지 아니면 이론적인 것인지 테스트하기 위해, AI가 빠져나갈 수 있는지 확인하고자 특정 안전 점검을 제거하여 시스템을 속이려 시냈다. 6번의 특정 테스트 중 4번의 경우, 시스템은 위반 사항을 정확히 포착하고 진행을 거부했다. 그러나 다른 2번의 테스트에서는, 있어야 할 안전 점검이 제거되었음에도 불구하고 시스템이 이를 감지하지 못했다. 이는 중요한 발견이었다. 즉, 아키텍처는 견고했지만, 이를 증명하기 위해 사용된 특정 테스트들이 때때로 너무 약했다는 것을 보여주었다. 테스트를 통과했다는 것이 항상 안전 가드(safety guard)가 실제로 제 역할을 하고 있다는 의미는 아니었다. 이는 미래를 위한 중요한 교훈을 남겼다. 규칙을 마련하는 것과 그 규칙이 실제로 집행되고 있다는 증거를 갖는 것은 다르다는 점이다.

궁극적으로, 이 연구는 인공지능에게 복잡한 소프트웨어를 엔지니어링할 자유를 주면서도 그 소프트웨어의 규칙을 규정할 권한은 주지 않는 것이 가능하다는 것을 입증한다. "작업을 수행하는 것"과 "무엇이 허용되는지 결정하는 것"의 분리는 단순한 정책이 아니라 시스템의 구조적 특징이다. AI는 빌더가 될 수 있지만, 권한은 봉인된 규칙과 최종 단계를 승인하는 인간 운영자에게 남아 있다. 이것은 인간이 지켜보고 있기 때문에 AI가 안전하다는 뜻이 아니다. 이는 시스템이 설계될 때부터 인간의 역할은 경계를 설정하고 결과를 승인하는 것이며, AI는 전적으로 그 경계 안에서 작동하도록 되어 있다는 의미이다. 연구는 우리가 작업에 대한 적절한 '우리(cage)'를 구축한다면, 디지털 시스템에 대한 권한을 디지털 작업자에게 이전하지 않고도 그들의 자율성을 높일 수 있다고 결론짓는다. 남은 과제는 이 우리를 검증하는 데 사용하는 테스트가 그것을 깨뜨리려는 모든 시도를 잡아낼 만큼 강력한지 확인하는 것이다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →