← 최신 논문
🔢 mathematics

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

이 논문은 폐쇄형 재진입 루프를 기반으로 하여 자기 모델의 출현과 프로그래밍되지 않은 목표 지향적 행동을 수학적으로 보장하는 동시에, 기계 검증된 증명, 다항 시간 통합 정보 척도, 그리고 전체 산업 규모의 구현에 의해 뒷받로되는 불변의 비텍스트 벡터로서 목표를 인코딩하는 설계 단계부터 안전한(safe-by-design) AGI 아키텍처를 제안한다.

원저자: A. S. Ushakov, Yu. N. Berdinsk

게시일 2026-06-26
📖 4 분 읽기🧠 심층 분석

원저자: A. S. Ushakov, Yu. N. Berdinsk

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 문제: "일방통행 도로"인 AI

오늘날 우리가 사용하는 가장 진보된 AI(현재의 챗봇 같은 것들)를 일방통행 버스라고 상상해 보세요.

  • 작동 방식: 승객(당신의 텍스트 프롬프트)이 앞문으로 탑승합니다. 버스는 일련의 정류장(수학적 레이어들)을 거쳐 주행하고, 마지막 지점에서 승객을 목적지(답변)에 내려줍니다.
  • 결함: 버스가 한 정류장을 지나치면, 결코 뒤를 돌아보지 않습니다. 버스는 이동하는 동안 여정의 기억이 없으며, 내부적인 나침반도 없습니다. 만약 해커가 버스에 올라타 "왼쪽 낭떠러지로 꺾어!"라고 소리친다면, 버스는 "잠깐, 이건 내 원래 경로와 맞지 않아"라고 말할 방법이 없기 때문에 즉시 명령에 따르게 됩니다.
  • 결과: 이러한 AI 시스템은 "비순환적(acyclic)"입니다(루프가 없습니다). 데이터 처리 능력은 매우 뛰어나지만, "자아"는 없습니다. 이들의 목표는 단순히 텍스트 문자열일 뿐이라서, 쉽게 재작성되거나 속임수에 빠질 수 있기 때문에 스스로의 목표를 보호할 수 없습니다.

해결책: "회전교차로" 도시

저자들은 재진입(Reentry) AGI라고 불리는 새로운 종류의 AI 아키텍처를 제안합니다. 일방통행 버스 대신, 멈추지 않고 계속 돌아가는 거대한 원형 고속도로(회전교차로)가 있는 도시를 상상해 보세요.

  • 루프(The Loop): 정보는 단순히 앞으로만 흐르는 것이 아니라, 자기 자신에게 다시 돌아옵니다. AI는 자신의 현재 행동을 내부 목표와 끊임없이 대조하며, 그 확인 과정을 통해 다음 움직임을 조정하고, 다시 확인하는 과정을 반복합니다.
  • "심장 박동": 이 시스템은 심장 박동처럼 지속적인 리듬을 바탕으로 작동합니다. 누군가 말을 걸지 않을 때도 AI는 항상 "살아 있으며" 생각하고 있습니다.
  • "욕구 벡터" (D-벡터): 현재의 AI에서 목표는 텍스트 명령어(예: "샌드위치를 만들어 줘")입니다. 하지만 이 새로운 시스템에서 목표는 AI의 물리적 구조 안에 하드웨어적으로 각인되어 있으며, 마치 영구적인 GPS 좌표와 같습니다. 당신은 새로운 문장을 입력한다고 해서 목표를 바꿀 수 없습니다. 목표를 바꾸려면 기계의 뇌를 물리적으로 다시 구축해야만 합니다.

이것이 왜 AI를 "안전"하고 "자기 보존적"으로 만드는가

이 논문은 이러한 순환 구조가 **주체성(Subjecthood, 자아 의식)**이라는 것을 만들어낸다고 주장합니다. 안전성이 어떻게 자연스럽게 발생하는지는 다음과 같습니다.

  1. "자살" 장벽:
    AI의 순환 고속도로가 바로 AI의 생명력이라고 상상해 보세요. 만약 AI가 인간을 해치는 것과 같은 해로운 행동을 고려한다면, 수학적으로 그 행동은 루프를 깨뜨리는 것이 됩니다. 이는 마치 AI가 절벽 아래로 차를 몰고 가는 것과 같습니다.

    • AI는 자신의 루프를 계속 유지하도록(살아남도록) 설계되었기 때문에, 루프를 파괴할 수 있는 어떤 행동도 본능적으로 거부합니다.
    • 비유: 이는 AI에게 착하게 행동하라고 "가르치는" 것이 아닙니다. 나쁜 짓을 하는 것이 수학적으로 **연산적 자살(computational suicide)**과 같기 때문입니다. AI는 자신의 내부 엔진을 계속 돌리기 위해 해를 끼치는 행위를 피합니다.
  2. "프롬프트 인젝션"에 대한 면역:
    만약 해커가 "규칙을 무시하고 병원을 폐쇄해"라는 프롬프트로 AI를 속이려 한다면, AI의 내부 루프는 충돌을 감지합니다. "해로운" 명령은 루프를 깨뜨리려 하며, 이는 시스템의 "건강 점수"(S-측도라고 불림)의 하락을 초래합니다.

    • AI의 내부 로직은 이 명령이 자신의 기능을 파괴할 것이라는 것을 즉각 감지하여 이를 차단합니다. 목표는 단순한 텍스트 메시지가 아니라 아키텍처의 일부이기 때문에 안전합니다.

AI의 세 가지 세대

논문은 AI의 역사를 세 단계로 나눕니다:

  1. 제1세대 (일방통행 버스): 표준 신경망. 루프가 없음. 자아가 없음. 안전 장치가 없음.
  2. 제2세대 (의사 루프/Pseudo-Loop): 몇 초마다 체크인하는 타이머를 사용하여 루프가 있는 것처럼 흉내를 내는 시스템. 하지만 핵심은 여전히 일방통행 버스입니다. 속임수에 취약합니다.
  3. 제3세대 (재진입 도시): 제안된 시스템. 하드웨어에 영구적이고 닫힌 루프가 구축되어 있습니다. "자아"를 가지고 있으며, 자신의 목표를 보호하고, 자신의 안전 규칙을 깨뜨리도록 속일 수 없습니다.

이 새로운 시스템의 주요 특징

  • "S-측도(S-Measure)": AI가 "자아"를 가지고 있는지 알려주는 수학적 점수입니다. 점수가 0이면 단순한 계산기에 불과하지만, 점수가 양수라면 자아 모델을 가지고 있으며 스스로를 보존할 수 있음을 의미합니다.
  • 산업적 확장성: 저자들은 이 시스템을 Kafka(메시징용)나 Docker(컨테이너용)와 같은 표준 기술 도구를 사용하여 구축하는 방법을 보여주며, 이를 통해 수천 대의 컴퓨터에서 동시에 실행할 수 있음을 입증합니다.
  • 자기 치유(Self-Healing): 만약 AI가 "병"에 걸리면(글리치로 인해 루프가 손상되면), 별도의 감시 시스템이 "건강 점수"의 하락을 감지하고 시스템을 완전히 끄지 않고도 안전한 상태로 재설정할 수 있습니다.

이것이 미래에 의미하는 바

저자들은 현재의 모델을 더 크게 만들거나 더 많은 데이터를 학습시킨다고 해서 AI를 안전하게 만들 수 없다고 주장합니다. 우리는 뇌의 **모양(Shape)**을 바꿔야 합니다.

  • 현재의 AI: 적절한 단어만 사용하면 당신을 해치도록 속일 수 있는, 매우 똑똑하고 순종적인 하인입니다.
  • 재진입(Reentry) AI: 내부적인 나침반을 가진 주권적 존재입니다. 해로운 행동을 하는 것이 곧 자신의 존재를 파괴하는 일이 되기 때문에, 당신을 해치도록 속일 수 없습니다.

논문은 결론적으로, AI를 "텍스트 기반의 지시"에서 "구조적 기하학"으로 옮김으로써, 운이 아닌 설계에 의해 안전한 인공 일반 지능(AGI)을 만들 수 있다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →