← Neueste Arbeiten
💻 computer science

Do Open-Loop Metrics Predict Closed-Loop Driving? A Cross-Benchmark Correlation Study of NAVSIM and Bench2Drive

Diese Studie analysiert die Korrelation zwischen NAVSIM-Open-Loop-Metriken und Bench2Drive-Closed-Loop-Leistung über state-of-the-art-Methoden hinweg und zeigt, dass zwar aggregierte NAVSIM-Werte eine starke, aber nicht-monotone Korrelation mit dem Erfolg im realen Fahrbetrieb aufweisen, Ego Progress jedoch die aussagekräftigste einzelne Metrik ist und eine vereinfachte Drei-Metriken-Formel den vollständigen Fünf-Metriken-Score für Ranking-Zwecke wirksam ersetzen kann.

Ursprüngliche Autoren: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Hai Yang, Yang Chen, Hao Sun

Veröffentlicht 2026-05-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Hai Yang, Yang Chen, Hao Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter das Autofahren beizubringen. Um zu prüfen, ob der Roboter gut ist, haben Sie zwei Möglichkeiten, ihn zu testen:

  1. Der „Papier-Test" (Offener Regelkreis): Sie geben dem Roboter eine Karte und eine Reihe von Anweisungen und bitten ihn, auf einem Blatt Papier eine Linie zu zeichnen, die zeigt, wohin er gehen würde. Sie vergleichen diese Linie dann mit dem perfekten Pfad. Dies ist schnell, günstig und Sie können es tausendmal pro Sekunde durchführen.
  2. Die „Echte Fahrt" (Geschlossener Regelkreis): Sie setzen den Roboter tatsächlich in ein Auto (oder ein superrealistisches Videospiel) und lassen ihn fahren. Das Auto reagiert auf Ampeln, andere Fahrzeuge und Fußgänger. Wenn der Roboter stecken bleibt oder zu langsam fährt, besteht er den Test nicht. Dies ist der „Goldstandard", aber es dauert Stunden, kostet viel Geld und ist schwer genau auf die gleiche Weise zu wiederholen.

Die große Frage: Kann der „Papier-Test" zuverlässig vorhersagen, wie der Roboter bei der „Echten Fahrt" abschneiden wird?

Lange Zeit lautete die Antwort nein. Alte Tests maßen lediglich, wie stark die Zeichnung des Roboters von der perfekten Linie abwich (wie die Messung des Abstands zwischen zwei Punkten). Das Papier zeigt, dass selbst wenn ein Roboter eine fast perfekte Linie zeichnet, er im echten Leben trotzdem einen Unfall haben oder stecken bleiben könnte.

Was diese Arbeit leistete

Die Autoren untersuchten 8 verschiedene Spitzentechnologien für Roboterfahrer. Sie prüften, wie diese Roboter beim „Papier-Test" (unter Verwendung eines neuen, intelligenteren Tests namens NAVSIM) abschnitten, und verglichen dies mit ihrer tatsächlichen Leistung bei der „Echten Fahrt" (unter Verwendung eines Tests namens Bench2Drive).

Hier ist das, was sie fanden, einfach erklärt:

1. Die Falle „Sicherheit vs. Geschwindigkeit"

Der neue „Papier-Test" (NAVSIM) ist viel besser als die alten. Er überprüft die Sicherheit (haben Sie etwas angefahren?) und den Fortschritt (haben Sie sich vorwärts bewegt?).

  • Das Problem: Einige Roboter sind zu sicher. Sie fahren wie eine Schildkröte und halten bei jedem kleinen Schatten an, um sicherzustellen, dass sie nichts anfahren.
  • Das Ergebnis: Beim „Papier-Test" erhalten diese Schildkröten-Roboter hohe Punktzahlen, weil sie nie etwas anfahren. Aber bei der „Echten Fahrt" werden sie dafür bestraft, dass sie zu langsam fahren oder im Verkehr stecken bleiben. Sie bestehen den echten Test nicht, weil sie zu vorsichtig sind.
  • Die Analogie: Stellen Sie sich einen Schüler vor, der auf jede Frage in einem Test mit „Ich weiß es nicht" antwortet, um zu vermeiden, einen einzigen Punkt falsch zu haben. Bei einem Test, der nur falsche Antworten zählt, erhält er eine Eins. Aber bei einem Test, der verlangt, dass man die Prüfung tatsächlich beendet, erhält er eine Fünf, weil er sie nicht beendet hat.

2. Der geheime Inhaltsstoff: „Eigener Fortschritt"

Die Forscher zerlegten den „Papier-Test" in seine Bestandteile, um zu sehen, welcher Teil den Erfolg in der realen Welt tatsächlich vorhersagte.

  • Sie stellten fest, dass die wichtigste Zahl nicht „Haben Sie einen Unfall gehabt?" (Sicherheit) war. Es war „Haben Sie sich vorwärts bewegt?" (Fortschritt).
  • Die Analogie: Denken Sie an einen Marathon. Wenn Sie perfekt laufen, ohne zu stolpern (Sicherheit), aber alle 10 Sekunden anhalten, um Ihre Schnürsenkel zu binden, werden Sie das Rennen nicht gewinnen. Der Roboter muss sich vorwärts bewegen. Der „Fortschritt"-Wert war der beste einzelne Prädiktor dafür, ob der Roboter die Fahrt tatsächlich erfolgreich abschließen würde.

3. Der „Schneeball-Effekt"

Warum werden kleine Fehler im „Papier-Test" zu riesigen Misserfolgen bei der „Echten Fahrt"?

  • Die Analogie: Stellen Sie sich vor, Sie gehen einen Flur entlang. Wenn Sie einen winzigen Schritt nach links machen, ist es egal. Aber wenn Sie 10 Minuten lang immer wieder winzige Schritte nach links machen, laufen Sie schließlich gegen eine Wand.
  • Beim „Papier-Test" plant der Roboter nur 4 Sekunden im Voraus. Eine winzige Zögerung mag wie ein kleiner Fehler aussehen. Aber bei der „Echten Fahrt" führt diese winzige Zögerung dazu, dass der Roboter eine grüne Ampel verpasst, auf eine rote Ampel wartet, hinter dem Zeitplan zurückbleibt und schließlich wegen Zeitüberschreitung durchfällt. Kleine Fehler „schneeballen" sich zu einem totalen Misserfolg zusammen.

4. Eine einfachere Formel

Der „Papier-Test" verwendet eine komplexe Formel mit 5 verschiedenen Zahlen, um eine Endpunktzahl zu berechnen. Die Autoren stellten fest, dass zwei dieser Zahlen (wie komfortabel die Fahrt ist und wie nah Sie an einem Unfall sind) für alle Top-Roboter im Wesentlichen gleich waren – sie waren bei diesen Dingen alle perfekt.

  • Die Entdeckung: Sie können die komplexe Formel wegwerfen und einfach 3 einfache Zahlen verwenden: „Haben Sie einen Unfall gehabt?", „Sind Sie in Ihrer Spur geblieben?" und „Haben Sie sich vorwärts bewegt?".
  • Das Ergebnis: Diese supersimple Formel sagte die Ergebnisse in der realen Welt genauso gut voraus wie die komplexe. Es ist so, als würde man erkennen, dass man keinen 50-seitigen Bericht braucht, um zu wissen, ob ein Auto gut ist; man muss nur wissen, ob es fährt und keinen Unfall baut.

Das Fazit

Die Arbeit kommt zu dem Schluss, dass wir, auch wenn wir das reale Fahren nicht perfekt vorhersagen können, indem wir nur auf eine Zeichnung schauen, viel näher dran sind.

  • Schauen Sie nicht nur auf die Sicherheit: Ein Roboter, der sicher ist, aber sich nicht bewegt, ist ein schlechter Fahrer.
  • Beobachten Sie den „Fortschritt": Die Fähigkeit, sich vorwärts zu bewegen, ist das beste Zeichen für einen guten Fahrer.
  • Vereinfachen Sie: Wir brauchen keine übermäßig komplexen Bewertungssysteme, um gute Fahrer von schlechten zu unterscheiden; ein einfacher Fokus auf Sicherheit und Bewegung funktioniert derzeit am besten.

Die Autoren warnen, dass wir, wenn Roboter besser werden, diese Regeln möglicherweise wieder anpassen müssen, aber vorläufig ist diese „Fortschritt"-Metrik der Schlüssel dazu zu wissen, wer auf der Straße tatsächlich Erfolg haben wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →