← Neueste Arbeiten
💻 computer science

GROVE: Grounded Pedestrian Simulation via Natural Language for Interactive Social Robot Navigation

GROVE ist ein Text-zu-Szenario-Framework für die Fußgängersimulation, das natürliche Sprachaufforderungen nutzt, um dynamisch realistische, sozial komplexe menschliche Verhaltensweisen über mehrere Simulationsumgebungen hinweg zu generieren und damit die Sim-to-Real-Lücke für das Training der interaktiven sozialen Roboternavigation überbrückt.

Ursprüngliche Autoren: Duc Tai Nguyen, Volodymyr Shcherbyna, Anh Do Duc, Zhengcheng Shen, Teham Buiyan, Linh Kästner

Veröffentlicht 2026-06-25
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Duc Tai Nguyen, Volodymyr Shcherbyna, Anh Do Duc, Zhengcheng Shen, Teham Buiyan, Linh Kästner

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Regisseur, der eine Szene für einen Film über einen Roboter drehen möchte, der durch ein belebtes Krankenhaus läuft. In den alten Zeiten mussten Sie die „Schauspieler“ (die digitalen Menschen) manuell anweisen, wo sie stehen, wann sie gehen oder mit wem sie zusammenstoßen sollten. Es war wie das Choreografieren eines Tanzes, bei dem man jeden einzelnen Schritt für hunderte von Tänzern aufschreiben musste. Wenn man die Szene von einem „ruhigen Morgen“ zu einer „hastigen Evakuierung“ ändern wollte, müsste man das gesamte Skript von Grund auf neu schreiben.

GROVE ist ein neues Werkzeug, das die Art und Weise verändert, wie wir diese digitalen Menschenmengen erstellen. Anstatt ein Skript zu schreiben, sprechen Sie einfach mit dem Computer. Sie sagen etwas wie: „Erstelle einen belebten Krankenhausflur, in dem Menschen wegen eines Alarms zum Ausgang eilen“ oder „Erstelle eine Schlange von Menschen, die an einer Apotheken-Theke warten.“ GROVE baut dann sofort eine realistische Simulation genau dieser Szene auf.

Hier ist die Funktionsweise, unterteilt in einfache Teile:

1. Das „Gehirn“ und der „Bibliothekar“ (RAG und LLM)

Stellen Sie sich vor, GROVE hat zwei Haupthelfer:

  • Der Bibliothekar (RAG): Bevor der Computer versucht, die Szene zu schreiben, prüft er eine riesige Bibliothek mit vorgeschriebenen „Verhaltensnotizen“. Wenn Sie nach einer „Warteschlange“ fragen, findet der Bibliothekar die spezifischen Notizen darüber, wie Menschen in einer Schlange stehen. Wenn Sie nach einem „Notfall“ fragen, findet er Notizen darüber, wie Menschen zu den Ausgängen rennen. Dies verhindert, dass der Computer Dinge erfindet (halluziniert) oder die Regeln des menschlichen Verhaltens vergisst.
  • Der Regisseur (LLM): Sobald der Bibliothekar die richtigen Notizen überreicht hat, schreibt der Regisseur (ein Large Language Model) das „Skript“ für die Szene. Er sagt nicht nur „gehe hierhin“, sondern erstellt einen Behavior Tree (Verhaltensbaum). Denken Sie an einen Behavior Tree wie an ein Flussdiagramm oder einen Entscheidungsbaum. Er sagt den digitalen Menschen: „Wenn du einen Roboter siehst, halte an. Wenn du einen Alarm hörst, renne zur Tür. Wenn du in einer Schlange stehst, warte an der Reihe.“

2. Das „GPS“ und der „Fluss“ (Global Planner & Velocity Fields)

Ein Skript allein reicht nicht aus; die Menschen müssen auch wissen, wie sie sich bewegen, ohne gegen Wände zu laufen.

  • Das GPS (Global Planner): GROVE nutzt ein intelligentes Kartensystem (genannt Theta*), um unsichtbare Pfade für die Menschen zu zeichnen. Es stellt sicher, dass selbst wenn das „Skript“ sagt „gehe zur Apotheke“, die digitalen Menschen wissen, wie sie um die Möbel herumgehen, um dort anzukommen, ohne durch Wände zu laufen.
  • Der Fluss (Velocity Fields): In chaotischen Situationen (wie einem Notfall) gibt GROVE nicht jedem Menschen einzeln ein Ziel vor. Stattdessen erzeugt es einen unsichtbaren „Wind“ oder eine Strömung (ein Velocity Field), die die gesamte Menge in die richtige Richtung drückt, wie Wasser, das einen Fluss hinunterfließt. Dies hält die Menge flüssig in Bewegung, ohne dass sie gegeneinander stoßen.

3. Die „Modi“ (Presets)

Um es noch einfacher zu machen, verfügt GROVE über drei spezielle „Modi“ oder Voreinstellungen, ähnlich wie verschiedene Kamerafilter auf einem Handy:

  • Notfallmodus (Emergency Mode): Der Computer schaltet in den „Panikmodus“. Er ignoriert Smalltalk und konzentriert sich voll und ganz darauf, alle so schnell wie möglich zum Ausgang zu bringen, wodurch ein realistischer Ansturm entsteht.
  • Warteschlangenmodus (Queuing Mode): Der Computer erstellt eine geordnete Schlange. Er weiß genau, wie er die Menschen voneinander abstandlich positioniert, damit sie die Theke nicht überfüllen.
  • Normalmodus (Normal Mode): Dieser ist für den Alltag gedacht. Menschen unterhalten sich vielleicht, gehen in Gruppen oder bleiben stehen, um sich etwas anzusehen, genau wie in einem echten Büro oder Zuhause.

Warum ist das eine große Sache?

Das Paper vergleicht GROVE mit anderen Werkzeugen und stellt fest:

  • Alte Werkzeuge ließen Menschen oft in geraden Linien durch Wände laufen oder scheiterten daran, realistische Schlangen zu bilden.
  • GROVE erstellt Szenen, die viel mehr wie das echte Leben wirken und sich auch so verhalten. Bei Tests erzielte es im Vergleich zu anderen Methoden höhere Werte bei „Realismus“ und „Befolgen von Anweisungen“.
  • Es arbeitet direkt mit populärer Roboter-Simulationssoftware (wie Isaac Sim und Gazebo) zusammen, was bedeutet, dass Roboterentwickler diese realistischen Menschenmengen nutzen können, um ihre Roboter darauf zu trainieren, in unserer geschäftigen, von Menschen erfüllten Welt sicherer und höflicher zu navigieren.

Kurz gesagt: GROVE verwandelt einen einfachen Textsatz in eine komplexe, realistische Menschenmengen-Simulation. Es kombiniert einen smarten „Bibliothekar“, um das richtige Verhalten zu finden, einen „Regisseur“, um das Skript zu schreiben, und ein „GPS“, um sicherzustellen, dass jeder sicher navigiert – und das alles, um Roboter darauf vorzubereiten, sich in unserer belebten, von Menschen geprägten Welt zurechtzufinden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →