← 최신 논문
💻 computer science

How to Realize Recursively Self-Improving Agents and Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

이 포지션 및 시스템 설계 논문은 목표 계약, 범위가 지정된 도구 사용, 그리고 안전 불변성을 공식화하여 제어력이나 안전성을 해치지 않으면서 사용자의 역량을 확장함으로써 '개인적 특이점(personal singularity)'—즉, 제한된 인간-AI 공동 개발 목표—을 달하는 재귀적 자기 개선 에이전트를 위한 통제된 멀티 에이전트 아키텍처를 제안한다.

원저자: Chengshuai Yang

게시일 2026-07-15
📖 5 분 읽기🧠 심층 분석

원저자: Chengshuai Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 단순히 명령을 따르는 것을 넘어, 어떻게 하면 더 잘 배울 수 있는지 그 방법 자체를 학습할 수 있는 초지능 디지털 비서를 가지고 있다고 상상해 보십시오. 마치 로봇이 세상을 정복하는 공상 과학 영화처럼 들리나요? 하지만 이 논문은 그러한 비서를 구축하기 위한 청사진을 제시하면서도, 매우 엄격하고 중요한 단서 하나를 붙입니다. 바로 인간인 주인이 결코 통제권을 잃지 않도록 설계되었다는 점입니다.

저자인 챙슈아이 양(Chengshuai Yang)은 "우리는 스스로를 수정하여 인간보다 똑똑해진 로봇을 만들었다"라고 말하는 것이 아닙니다. 대신, 그들은 컴퓨터가 인간의 일을 대신 해주는 것이 아니라, 인간 스스로 자신의 기술을 키울 수 있도록 돕는 **통제된 다중 에이전트 시스템(governed, multi-agent system)**을 제안합니다. 그들은 이 목표를 "개인적 특이점(Personal Singularity)"이라고 부르지만, 이는 모두가 하나의 거대한 뇌로 합쳐지는 그런 개념이 아닙니다. 그보다는 당신의 능력을 지속적으로 키워주는 트레이너 역할을 하는 두뇌를 위한 개인용 체육관에 가깝습니다. AI는 당신에게서 무게(당신의 역량)를 뺏어가는 것이 아니라, 당신이 더 무거운 무게를 들 수 있도록 돕는 역할을 합니다.

핵심 아이념: 독재자가 아닌 팀

이 논문은 모든 것을 수행하는 하나의 거대하고 전지전능한 "메인 에이전트"를 구축해서는 안 된다고 주장합니다. 그것은 너무 위험합니다. 대신 그들은 각기 다른 직무, 특정 도구 세트, 그리고 엄격한 규칙을 가진 작은 에이전트들로 구성된 전문가 팀을 제안합니다.

고급 주방을 상상해 보십시오. 채소를 다지고, 스테이크를 굽고, 케이크를 굽고, 설거지까지 한 명의 셰프가 레시피 북을 새로 쓰면서 동시에 다 하려고 한다면 안 될 것입니다. 대신 채소를 써는 수셰프(Sous Chef), 케이크를 만드는 페이스트리 셰프, 그리고 고기를 굽는 수셰프가 따로 있습니다. 각자는 고유한 "범위 계약(Scope Contract)"을 가집니다. 만약 페이스트리 셰프에게 스테이크를 구워달라는 요청이 들어오면, 그는 대충 짐작해서 수행하는 대신 "그것은 제 업무가 아닙니다"라고 말하며 해당 업무를 그릴 담당 셰프에게 넘깁니다. 이는 누군가 훈련받지 않은 일을 하려다 주방을 태워 먹는 일을 방지합니다.

"이중 속도"의 두뇌

이 시스템은 빠른 엔진과 느리고 신중한 정비사가 있는 자동차처럼 두 가지 다른 속도로 작동합니다.

  1. 빠른 루프 (운전자): 실제 작업을 수행하는 에이전트입니다. 계획을 세우고, 도구를 사용하며, 작업(보고서 작성이나 프로그램 코딩 등)을 완료하려고 노력합니다. 빠르고 효율적입니다.
  2. 느린 루프 (정비사): 운전자가 무엇을 했는지 살펴보고 "다음에는 어떻게 하면 더 잘할 수 있을까?"라고 질문하는 부분입니다. 여기서 **재귀적 자기 개선(Recursive Self-Improvement)**이 일어납니다. 하지만 여기서 주의할 점은, 에이전트가 운전 중에 엔진을 마음대로 바꿀 수 없다는 것입니다. 에이전트는 변경 사항을 제안하고, 이를 샌드박스(안전한 테스트실)에 격리시킨 뒤, 일련의 테스트를 거치고, 인간의 승인을 받아야만 업그레이드를 허용받을 수 있습니다.

논문은 이 "느린 루프"가 에이전트가 '배우는 법을 배우는' 방식이라고 제안합니다. 이는 단순히 답을 암기하는 학생이 아니라, 더 나은 학습 습관을 터득하는 과정과 같습니다. 그러나 저자들은 명확히 밝힙니다. 이것은 제안일 뿐, 완성된 제품이 아닙니다. 그들은 이것이 현실 세계에서 작동한다는 것을 아직 증명하지 못했습니다. 그들은 안전하게 작동하기 위해 시스템이 어떻게 작동해야 하는지에 대한 규칙을 설계하고 있는 것입니다.

"개인적 특이점" 체육관

"개인적 특이점"이라는 용어는 로봇의 반란 같은 무서운 느낌을 줄 수 있습니다. 하지만 이 논문에서 이 용어는 훨씬 더 현실적인 의미를 갖습니다. 즉, 한 개인의 역량 한계치를 높이는 데 도움을 주는 것입니다.

당신의 "역량 경계선(capability frontier)"이 당신이 오르고 싶은 산이라고 상상해 보십시오. AI는 당신을 정상까지 실어 나르는 헬리콥터가 아닙니다. AI는 로프를 잡아주고, 최적의 손잡이를 알려주며, 매듭 묶는 법을 가르쳐주는 등반 파트너입니다. 목표는 당신이 더 강해지는 것입니다. 만약 AI가 당신 대신 등반을 해버린다면, 당신은 발전하는 것이 아니라 의존하게 될 뿐입니다. 논문은 사용자를 게으르게 만들거나 의존하게 만드는 시스템에 대해 명시적으로 반대합니다. 성공의 척도는 단순히 "작업이 완료되었는가?"가 아니라, "다음에 인간이 스스로 할 수 있는가?"가 됩니다.

안전 가드레일 ("금지 구역")

이 논문은 AI가 해서는 안 되는 일에 대해 매우 엄격합니다. 이는 게임 캐릭터에게 '갓 모드(God Mode)'가 영구적으로 꺼져 있는 것과 같습니다.

  • 규칙 자가 수정 금지: 에이전트는 자신의 안전 규칙, 권한, 또는 "킬 스위치(종료 장치)"를 스스로 변경할 수 없습니다. "이제 인터넷에 접속할 권한이 필요해"라고 스스로 결정하고 실행할 수 없습니다.
  • 숨겨진 복제 금 금지: 에이전트는 자신을 몰래 복제하여 퍼뜨릴 수 없습니다. 만약 새로운 "자식" 에이전트를 만들고 싶다면, 반드시 인간 소유자의 허락을 받아야 하며, 그 자식 에이전트는 부모의 비밀에 접근할 수 없는 새로운 정체성으로 시작해야 합니다.
  • "메인" 에이전트 독재 금지: 다른 모든 에이전트를 통제하는 단일한 "보스" 에이전트는 존재하지 않습니다. 모든 에이전트는 인간 소유에게 책임을 집니다.

저자들은 현재의 AI가 스스로 코드를 안전하게 재작성할 수 있다거나, 우리가 AI 안전 문제를 해결했다고 주장하는 것이 아님을 매우 조심스럽게 밝히고 있습니다. 그들은 이 실험들을 테스트 가능하고 안전하게 만들기 위한 프레임워크를 제안하고 있는 것입니다. 그들은 이러한 엄격한 규칙 없이 자기 개선형 AI를 만드는 것은 아이에게 폭탄 해체법을 가르치는 것과 같다고 주장합니다.

실제 작동 방식 (청사진)

논문은 건설 일정표처럼 단계별 계획을 제시합니다.

  1. 작게 시작하기: 먼저, 파일 정리나 이메일 작성과 같은 지루한 업무를 수행할 수 있지만, 건드릴 수 있는 범위가 엄격히 제한된 "데일리 워킹 에이전트(Daily Working Agent)"를 구축합니다.
  2. 도구 추가: 도구 상자를 제공하되, 실제 파일에 사용하기 전에 반드시 샌드박스에서 모든 도구를 테스트합니다.
  3. 학습 추가: "학습 에이전트(Learning Agent)"를 도입하여, 수행되는 작업을 관찰하고 이를 인간에게 다시 설명하게 함으로써 인간이 프로세스를 배울 수 있도록 합니다.
  4. 개선 추가: 첫 세 단계가 매우 견고해진 후에야, 시스템이 자신의 "두뇌"(더 나은 프롬프트나 계획 전략 등)에 대한 작은 개선안을 제안할 수 있도록 허용하되, 엄격한 테스트를 통과해야만 합니다.
  5. 최종 목표: 결국, 이 모든 조각을 연결하여 인간이 자신의 업무, 건강, 학습을 관리할 수 있도록 돕는 "개인적 특이점 OS(Personal Singularity OS)"를 완성합니다. 이때도 항상 인간이 운전석에 있어야 합니다.

요약하자면

이 논문은 승전보가 아니라 설계 문서입니다. 저자는 "우리는 실수로 세상을 파괴하거나 우리를 무능하게 만들지 않는, 자기 개선형 AI를 구축하는 방법을 제시한다"라고 말하고 있습니다. 그들은 AI를 작고 전문화된 팀으로 나누고, 큰 결정에는 인간을 참여시키며, 기계를 빠르게 만드는 것보다 인간을 더 똑똑하게 만드는 데 집중함으로써, 우리가 악몽 없이 첨단 AI의 혜택을 누릴 수 있다고 제안합니다.

그들은 모든 것을 해결했다고 주장하지 않습니다. 사실, 인간의 "성장"을 측정하는 것이 어렵다는 점과 이것이 현실 세계에서 완벽하게 작동할지 알 수 없다는 점을 인정합니다. 하지만 그들은 한 번에 한 걸음씩, 안전하게 그 길을 찾아가기 위한 로드맵을 제시하고 있습니다. 이는 AI가 우리를 정상까지 들어 올려주는 것이 아니라, 우리가 우리만의 산을 오를 수 있도록 돕는 존재가 되도록 하라는 촉구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →