← Neueste Arbeiten
💻 computer science

Large Language Model based Interactive Decision-Making for Autonomous Driving

Dieses Paper stellt ein auf Large Language Models basierendes Entscheidungsframework für das autonome Fahren vor, das durch semantische Szenenmodellierung, die Analyse von Absichten anderer Verkehrsteilnehmer und die Kommunikation über natürliche Sprache eine sicherere, effizientere und menschenähnlichere Interaktion in komplexem Mischverkehr ermöglicht.

Ursprüngliche Autoren: Xinwei Dong, Jiyang Li, Jiabin Xie, Yang Yi, Tianshang Jia, Shiyu Fang, Ye Tian, Peng Hang

Veröffentlicht 2026-04-28
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Xinwei Dong, Jiyang Li, Jiabin Xie, Yang Yi, Tianshang Jia, Shiyu Fang, Ye Tian, Peng Hang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Problem: Der „ängstliche Roboter“ im Berufsverkehr

Stellen Sie sich vor, Sie fahren in einer hektischen Großstadt. Die Straßen sind voll, die Fahrer sind manchmal ungeduldig, manchmal aggressiv, und alle versuchen gleichzeitig, durch eine enge Kreuzung zu kommen.

Bisherige selbstfahrende Autos verhalten sich in solchen Situationen oft wie ein extrem schüchterner Praktikant. Sobald es an der Kreuzung etwas unübersichtlich wird, passiert Folgendes: Das Auto sieht, dass ein anderes Auto kommt, bekommt „Panik“ und bleibt einfach stehen. Es wartet ewig, bis die Straße komplett leer ist, bevor es sich traut, loszufahren. Das Ergebnis? Ein riesiger Stau, genervte Autofahrer und ein System, das im echten Leben kaum akzeptiert wird.

Die Lösung: Das „intelligente Gehirn“ mit Sprachgefühl

Die Forscher der Tongji-Universität haben nun ein neues System entwickelt. Sie haben dem Auto nicht nur Sensoren (Augen) gegeben, sondern ein „Gehirn“ auf Basis von Large Language Models (LLMs) – also einer Technologie, die ähnlich wie ChatGPT funktioniert.

Man kann sich das neue System wie einen erfahrenen, kommunikativen Autofahrer vorstellen, der drei besondere Fähigkeiten besitzt:

1. Der „Szenen-Scanner“ (Die OPM-Methode)

Ein normales Auto sieht nur Zahlen: „Objekt A ist bei Koordinate X, Geschwindigkeit Y.“ Das ist für ein Gehirn schwer zu verarbeiten.
Das neue System nutzt die sogenannte OPM-Methode. Das ist so, als würde das Auto die Szene nicht nur als Datenwüste sehen, sondern wie ein Regisseur einen Film liest: „Da ist ein Auto (Objekt), es zieht gerade nach links (Prozess) und es droht, mit mir zu kollidieren (Beziehung).“ Es versteht den Kontext, nicht nur die Zahlen.

2. Das „Gedankenlesen“ (Intent Parsing)

Ein Mensch erkennt am Verhalten eines anderen Fahrers, was er vorhat. Wenn jemand leicht nach links lenkt oder schneller wird, wissen wir: „Der will jetzt vorziehen.“
Das neue System nutzt das LLM, um die Absichten anderer zu erraten. Es kombiniert die Bewegungen der anderen mit „sozialem Wissen“. Es fragt sich quasi: „Ist der andere Fahrer eher ein vorsichtiger Opa oder ein hektischer Pendler?“ Dadurch kann das Auto proaktiv handeln, statt nur passiv zu reagieren.

3. Der „Höflichkeits-Modus“ (eHMI-Kommunikation)

Das ist der Clou: Das Auto ist nicht mehr stumm. Wenn es sich entschieden hat, vorzufahren, „spricht“ es über eine externe Anzeige (eHMI) mit den Menschen um es herum.
Stellen Sie sich vor, das Auto würde nicht nur fahren, sondern ein kleines Schild zeigen oder eine Nachricht senden: „Ich fahre jetzt langsam vor, bitte lass mich kurz durch.“ Das schafft Vertrauen. Es ist wie ein kurzes Nicken oder ein Handzeichen unter Autofahrern.

Das Ergebnis: Der Turing-Test für Autos

Die Forscher haben das System in einem Simulator getestet. Das Ergebnis war beeindruckend:

  • Effizienz: Das Auto kommt schneller durch die Kreuzung als die „ängstlichen“ alten Modelle.
  • Sicherheit: Es vermeidet gefährliche Situationen besser, weil es die Absichten der anderen versteht.
  • Menschlichkeit: In einem „Turing-Test“ (einem Test, bei dem Menschen raten müssen, ob sie gegen einen Menschen oder eine Maschine fahren) konnten die Teilnehmer oft nicht mehr unterscheiden, ob das Auto ein echter Mensch oder eine KI war. Das Auto fuhr „natürlich“.

Zusammenfassung in einem Satz

Anstatt nur stur Regeln zu folgen wie ein Taschenrechner, lernt das Auto, die „soziale Sprache“ des Verkehrs zu verstehen und selbst mitzureden – so wie ein erfahrener Autofahrer, der weiß, wann man höflich Platz macht und wann man mutig vorzieht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →