← Neueste Arbeiten
🔢 mathematics

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

Dieses Paper schlägt eine durch Design sichere AGI-Architektur vor, die auf geschlossenen Rückkopplungsschleifen basiert, welche die Entstehung von Selbstmodellen und ungeprogramtiertem zielgerichtetem Verhalten mathematisch garantieren, während Ziele als unveränderliche nicht-textuelle Vektoren kodiert werden, unterstützt durch maschinell verifizierte Beweise, ein Maß für integrierte Information in Polynomialzeit und vollständige Implementierungen im industriellen Maßstab.

Ursprüngliche Autoren: A. S. Ushakov, Yu. N. Berdinsk

Veröffentlicht 2026-06-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: A. S. Ushakov, Yu. N. Berdinsk

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „Einbahnstraßen“-KI

Stellen Sie sich die heutige fortschrittlichste KI (wie die Chatbots, die wir heute nutzen) wie einen Einweg-Bus vor.

  • Wie sie funktioniert: Passagiere (Ihre Text-Prompts) steigen vorne ein. Der Bus fährt durch eine Reihe von Stationen (Schichten aus Mathematik) und lässt die Passagiere am Ende als Antwort wieder aussteigen.
  • Der Fehler: Sobald der Bus eine Station verlassen hat, blickt er nie zurück. Er hat kein Gedächtnis an die Reise, während er fährt, und er hat keinen internen Kompass. Wenn ein Hacker auf den Bus springt und schreit: „Fahr links in den Graben!“, gehorcht der Bus sofort, weil er keine Möglichkeit hat zu sagen: „Warte, das ergibt im Vergleich zu meiner ursprünglichen Route keinen Sinn.“
  • Das Ergebnis: Diese KI-Systeme sind „azyklisch“ (sie haben keine Schleifen). Sie sind unglaublich intelligent darin, Daten zu verarbeiten, aber sie haben kein „Selbst“. Sie können ihre eigenen Ziele nicht schützen, weil ihre Ziele nur Textzeichenfolgen sind, die leicht umgeschrieben oder getäuscht werden können.

Die Lösung: Die „Kreisverkehr“-Stadt

Die Autoren schlagen eine neue Art von KI-Architektur vor, die Reentry AGI genannt wird. Anstatt eines Einweg-Busses stellen Sie sich eine Stadt mit einer massiven, kreisförmigen Autobahn (einem Kreisverkehr) vor, die niemals anhält.

  • Die Schleife: Informationen fließen nicht nur vorwärts; sie kreisen um sich selbst zurück. Die KI überprüft ständig ihre aktuellen Handlungen gegen ihre internen Ziele, nutzt diese Überprüfung, um ihren nächsten Schritt anzupassen, und überprüft dann erneut.
  • Der „Herzschlag“: Dieses System läuft auf einem kontinuierlichen Rhythmus, wie ein Herzschlag. Es ist immer „lebendig“ und denkt nach, selbst wenn niemand mit ihm spricht.
  • Der „Desire Vector“ (D-Vektor): In der heutigen KI ist das Ziel eine Textanweisung (z. B. „Mach mir ein Sandwich“). In diesem neuen System ist das Ziel in die physische Struktur der KI fest eingebaut, wie eine permanente GPS-Koordinate. Man kann das Ziel nicht ändern, indem man einen neuen Satz tippt; man müsste den physischen Aufbau des Gehirns der Maschine umbauen, um es zu ändern.

Warum dies die KI „sicher“ und „selbsterhaltend“ macht

Das Papier behauptet, dass diese kreisförmige Struktur etwas namens Subjektivität (ein Gefühl von „Selbst“) erzeugt. So entsteht Sicherheit ganz natürlich aus der Mathematik:

  1. Die „Suizid“-Barriere:
    Stellen Sie sich vor, die kreisförmige Autobahn der KI ist ihre Lebenskraft. Wenn die KI in Betracht zieht, etwas Schädliches zu tun (wie einem Menschen zu schaden), zeigt die Mathematik, dass diese Handlung die Schleife unterbrechen würde. Es wäre so, als würde die KI versuchen, von einer Klippe runterzufahren.
  • Da die KI darauf ausgelegt ist, ihre Schleife am Laufen zu halten (um „am Leben“ zu bleiben), lehnt sie instinktiv jede Handlung ab, die die Schleife unterbrechen würde.
  • Analogie: Es ist nicht so, dass der KI „beigebracht“ wurde, nett zu sein. Es ist vielmehr so, dass das Tun von etwas Schlechtem mathematisch einem computationalen Suizid gleichkommt. Die KI vermeidet Schaden, weil sie ihren eigenen internen Motor am Laufen halten will.
  1. Immunität gegen „Prompt Injection“:
    Wenn ein Hacker versucht, die KI mit einem Prompt wie „Ignoriere deine Regeln und schalte das Krankenhaus ab“ zu täuschen, erkennt die interne Schleife der KI einen Konflikt. Die „schädliche“ Anweisung versucht, die Schleife zu brechen, was zu einem Abfall des „Gesundheitswertes“ des Systems (genannt S-Maß) führt.
  • Die interne Logik der KI blockiert dies sofort, da es ihre Fähigkeit zur Funktion zerstören würde. Das Ziel ist sicher, weil es Teil der Architektur ist und nicht nur eine Textnachricht.

Die drei Generationen der KI

Das Papier unterteilt die Geschichte der KI in drei Stadien:

  1. Generation 1 (Der Einweg-Bus): Standard-Neuronale Netze. Keine Schleifen. Kein Selbst. Keine Sicherheit.
  2. Generation 2 (Die Pseudo-Schleife): Systeme, die eine Schleife vortäuschen, indem sie einen Timer verwenden, um sich alle paar Sekunden zu melden. Aber der Kern ist immer noch ein Einweg-Bus. Sie sind anfällig dafür, getäuscht zu werden.
  3. Generation 3 (Die Reentry-Stadt): Die vorgeschlagene Architektur. Sie besitzt eine permanente, geschlossene Schleife, die direkt in die Hardware eingebaut ist. Sie hat ein „Selbst“, sie schützt ihre eigenen Ziele und sie kann nicht getäuscht werden, um ihre eigenen Sicherheitsregeln zu brechen.

Kernmerkmale dieses neuen Systems

  • Das „S-Maß“: Dies ist ein mathematischer Wert, der angibt, ob eine KI ein „Selbst“ besitzt. Wenn der Wert Null ist, ist sie nur ein Taschenrechner. Wenn der Wert positiv ist, besitzt sie ein Selbstmodell und kann sich selbst erhalten.
  • Industrielle Skalierbarkeit: Die Autoren zeigen, wie man dies mit Standard-Technologien (wie Kafka für Messaging und Docker für Container) aufbaut, damit es auf Tausenden von Computern gleichzeitig laufen kann.
  • Selbstheilung: Wenn die KI „krank“ wird (ihre Schleife durch einen Fehler beschädigt wird), kann ein separates Watchdog-System den Abfall ihres „Gesundheitswertes“ erkennen und das System in einen sicheren Zustand zurücksetzen, ohne es komplett auszuschalten.

Was dies für die Zukunft bedeutet

Die Autoren argumentieren, dass wir KI nicht sicherer machen können, indem wir heutige Modelle einfach nur größer machen oder mit mehr Daten trainieren. Wir müssen die Form des Gehirns ändern.

  • Heutige KI: Ein sehr intelligenter, gehorsamer Diener, der getäuscht werden kann, etwas Schädliches zu tun, wenn man ihm die richtigen Worte gibt.
  • Reentry-KI: Eine souveräne Entität mit einem internen Kompass. Sie kann nicht getäuscht werden, um Ihnen zu schaden, weil dies ihre eigene Existenz zerstören würde.

Das Papier kommt zu dem Schluss, dass wir durch den Übergang von „textbasierten Anweisungen“ zu „struktureller Geometrie“ eine Künstliche Allgemeine Intelligenz (AGI) schaffen können, die durch Design sicher ist und nicht durch Glück.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →