← Neueste Arbeiten
🤖 AI

DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

DeepInsight ist eine vereinheitlichte Evaluierungsinfrastruktur, die den gesamten Physical-AI-Stack auf einer einzigen Laufzeitumgebung abdeckt, indem sie durch drei Kernabstraktionen (Task, Ressource und Ergebnis) die Regime-Heterogenität bewahrt und dadurch skalierbares Benchmarking sowie eine schichtübergreifende Regressionsdiagnose ermöglicht, die fragmentierte Multi-Harness-Ansätze nicht erreichen können.

Ursprüngliche Autoren: Siyi Li, Chunyu Sun, Jiahao Zhang, Yuchen Kang, Wuliang Wang, Yu Qiu, Rui Jiang, Haitao Cui, Jie Chen

Veröffentlicht 2026-06-17
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Siyi Li, Chunyu Sun, Jiahao Zhang, Yuchen Kang, Wuliang Wang, Yu Qiu, Rui Jiang, Haitao Cui, Jie Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen einen Schüler zu bewerten, der lernt, ein Roboter zu sein. Dieser Schüler hat drei sehr unterschiedliche „Gehirne“, die zusammenarbeiten:

  1. Der Philosoph (System 2): Dieser Teil denkt, plant und liest Anweisungen. Er ist wie ein Mensch, der eine Karte liest. Er arbeitet langsam, aber denkt tiefgründig.
  2. Der Athlet (System 1): Dieser Teil sieht die Welt und bewegt die Arme und Beine. Er ist wie ein Turner, der auf einen Ball reagiert. Er arbeitet schnell und muss präzise sein.
  3. Der Reflex (System 0): Dieser Teil sorgt dafür, dass der Roboter nicht umkippt. Er ist wie Ihr Innenohr, das Ihr Gleichgewicht hält. Er arbeitet unglaublich schnell, tausende Male pro Sekunde.

Das Problem: Das „Frankenstein“-Bewertungssystem
Bevor dieses Paper erschien, mussten Sie, wenn Sie diesen Roboter testen wollten, drei völlig verschiedene Bewertungssysteme verwenden, die nicht miteinander kommunizierten.

  • Um den Philosophen zu testen, verwendeten Sie ein textbasiertes Quiz-System.
  • Um den Athleten zu testen, verwendeten Sie eine Physik-Engine aus einem Videospiel.
  • Um den Reflex zu testen, verwendeten Sie eine Hochgeschwindigkeits-Simulation.

Wenn der Roboter eine Aufgabe nicht schaffte, konnten Sie nicht sagen, warum. Hat der Philosoph schlechte Anweisungen gegeben? Hat der Athlet sie missverstanden? Oder hat der Reflex versagt, den Sturz abzufangen? Es war, als versuche man ein Rätsel zu lösen, bei dem die Hinweise in drei verschiedenen Sprachen geschrieben, in drei verschiedenen Aktenschränken aufbewahrt wurden und die Detektive nie miteinander sprachen.

Die Lösung: DeepInsight (Der universelle Bewertungsraum)
Die Autoren haben DeepInsight entwickelt, einen einzigen „Bewertungsraum“, der alle drei Gehirne gleichzeitig verarbeiten kann. Anstatt den Philosophen zu zwingen, wie der Athlet zu agieren (oder umgekehrt), schafft DeepInsight eine universelle Sprache, die es allen erlaubt, nebeneinander zu existieren, ohne ihre einzigartigen Persönlichkeiten zu verlieren.

So funktioniert es, unter Verwendung von drei einfachen Metaphern:

1. Der „Rucksack“ (Aufgabenabstraktion)

Stellen Sie sich vor, jeder Test, den der Roboter macht, ist ein Wanderer. Einige Wanderer tragen einen winzigen Rucksack (eine schnelle Textfrage), während andere ein massives Zelt tragen (eine komplexe Physik-Simulation).

  • Der alte Weg: Sie brauchten verschiedene Lastwagen, um verschiedene Wanderer zu transporten.
  • Der DeepInsight-Weg: Jeder Wanderer bekommt einen standardisierten Rucksack. Der Lastwagen (das System) kümmert sich nicht darum, was sich im Rucksack befindet; er trägt einfach nur den Rucksack. Ob der Wanderer nun ein Philosoph oder ein Gymnast ist, sie alle steigen auf denselben Lastwagen. Dies ermöglicht es dem System, einen schnellen Text-Test und einen langsamen Physik-Test zur exakt gleichen Zeit durchzuführen, ohne Verwirrung zu stiften.

2. Der „Verkaufsautomat“ (Ressourcenabstraktion)

Einige Tests sind teuer und langsam (wie das Warten darauf, dass ein Supercomputer nachdenkt), während andere schnell und günstig sind.

  • Der alte Weg: Der Hauptmanager versuchte, alles selbst zu machen. Wenn er auf einen langsamen Computer warten musste, konnte er keine andere Arbeit erledigen. Die gesamte Schlange stoppte.
  • Der DeepInsight-Weg: DeepInsight nutzt Verkaufsautomaten. Der Hauptmanager drückt einfach einen Knopf, um nach einer „Denkmaschine“ oder einer „Physikmaschine“ zu fragen. Der Verkaufsautomat erledigt die mühsamen, langsamen oder teuren Teile im Hintergrund. Der Manager bleibt frei und schnell und interagiert nur mit der Maschine, wenn er ein Ergebnis benötigt. Das bedeutet, dass das System niemals stecken bleibt, während es auf einen langsamen Prozess wartet.

3. Das „Einzige Geschichtsbuch“ (Ergebnisabstraktion)

  • Der alte Weg: Der Philosoph schrieb seine Notizen in ein Tagebuch, der Athlet zeichnete Bilder in ein Skizzenbuch und der Reflex führte ein Protokoll über Herzschläge. Wenn der Roboter fiel, mussten Sie drei verschiedene Bücher abgleichen, um den Fehler zu finden.
  • Der DeepInsight-Weg: Jedes einzelne Ereignis – jeder Gedanke, jede Bewegung, jeder Herzschlag – wird in ein einziges, riesiges Geschichtsbuch im exakt gleichen Format geschrieben.
    • Wenn der Robot scheitert, können Sie das Geschichtsbuch durchblättern und den exakten Moment sehen, in dem der Philosoph eine schlechte Idee gab, wie der Athlet versuchte, ihr zu folgen und wie der Reflex versuchte, ihn zu retten.
    • Da alles in einem Buch steht, können Sie sofort sehen, wo die Kette der Ereignisse unterbrochen wurde. Sie müssen nicht raten; die Geschichte sagt Ihnen genau, welche Ebene versagt hat.

Warum das wichtig ist

Das Paper zeigt, dass DeepInsight nicht nur ein neues Werkzeug ist, sondern eine neue Art, Roboter zu testen.

  • Es ist schnell: Es führt Tests schneller aus als bestehende Tools, weil es keine Zeit mit Warten in der Schlange verschwendet.
  • Es ist genau: Es erzielt die gleichen Ergebnisse wie die besten bestehenden Tools für den „Philosophen-Teil“ und beweist damit, dass es die Regeln nicht bricht.
  • Es ist skalierbar: Es kann auf einem Computer laufen oder sich über viele Computer verteilen, ohne neu abgestimmt werden zu müssen.
  • Der große Gewinn (Diagnose): Der wichtigste Teil ist das „Einzige Geschichtsbuch“. Wenn ein Roboter eine komplexe Aufgabe nicht bewältigt, kann DeepInsight Ihnen sagen: „Der Philosoph hatte recht, der Athlet hatte recht, aber der Reflex ist auf einem Eisglattweg ausgerutscht.“ Oh ne dieses einheitliche System wüssten Sie nie, dass der Reflex das Problem war; Sie hätten statlich den Philosophen beschuldigt.

Kurz gesagt: DeepInsight ist das erste System, das es Ihnen ermöglicht, das Gehirn, die Muskeln und das Gleichgewicht eines Roboten gleichzeitig, am selben Ort und in demselben Notizbuch zu testen, damit Sie endlich verstehen können, wie sie alle zusammenarbeiten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →