← Neueste Arbeiten
💻 computer science

Say the Mission, Execute the Swarm: Agent-Enhanced LLM Reasoning in the Web-of-Drones

Dieser Beitrag stellt einen agentenunterstützten LLM-Rahmen vor, der die W3C-Standards für das Web of Things und das Model Context Protocol nutzt, um die Steuerung von UAV-Schwärmen mittels natürlicher Sprache zu ermöglichen, und zeigt, dass zwar aktuelle LLMs ohne Anbindung an die reale Welt Schwierigkeiten mit einer zuverlässigen Ausführung haben, aufgabenspezifische Werkzeuge und Laufzeit-Sicherheitsvorkehrungen die Robustheit jedoch erheblich verbessern.

Ursprüngliche Autoren: Andrea Iannoli, Lorenzo Gigli, Luca Sciullo, Angelo Trotta, Marco Di Felice

Veröffentlicht 2026-05-06
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Andrea Iannoli, Lorenzo Gigli, Luca Sciullo, Angelo Trotta, Marco Di Felice

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen Schwarm Drohnen, und statt komplexen Computercode zu schreiben, um ihnen genau vorzugeben, was zu tun ist, sprechen Sie einfach in klarem Englisch mit ihnen: „Überfliegen Sie dieses Feld" oder „Formieren Sie sich am Himmel zu einem Stern".

Dieser Artikel handelt vom Aufbau eines Systems, das solch eine Kommunikation ermöglicht, jedoch mit einem entscheidenden Twist: Es stellt sicher, dass die Drohnen tatsächlich zuhören, verstehen und sicher bleiben, ohne gegeneinander zu kollidieren.

Hier ist die Aufschlüsselung, wie sie es mit einfachen Analogien erreicht haben:

Das Problem: Der „geniale, aber ahnungslose" Pilot

Die Forscher versuchten, Large Language Models (LLMs) – dieselbe Art von KI, die Chatbots antreibt – als „Gehirn" für Drohnenschwärme einzusetzen.

  • Die gute Nachricht: Diese KIs sind hervorragend darin, menschliche Sprache zu verstehen. Wenn Sie sagen „nach Norden", verstehen sie es.
  • Die schlechte Nachricht: Wenn Sie eine KI bitten, reale Maschinen zu steuern, gerät sie oft ins Wanken. Sie könnte halluzinieren (sich Dinge ausdenken), vergessen, wo sich die Drohnen befinden, oder Befehle erteilen, die die Drohnen nicht verstehen. Es ist, als würde man einen brillanten Philosophen anheuern, um ein Flugzeug zu fliegen; er kennt die Theorie des Fliegens, weiß aber vielleicht nicht, wie man die spezifischen Knöpfe an diesem spezifischen Flugzeug drückt.

Die Lösung: Der „Übersetzer" und der „Sicherheitswächter"

Um dies zu beheben, entwickelte das Team ein dreiteiliges System, das als Brücke zwischen der menschlichen Stimme und der Mechanik der Drohnen fungiert.

1. Der universelle Übersetzer (Das Web der Dinge)
Stellen Sie sich vor, jede Drohne, jeder Sensor und jede Batterie ist ein einzigartiges Gadget mit seiner eigenen seltsamen Fernbedienung. Die Forscher verwendeten einen Standard namens W3C Web of Things (WoT).

  • Die Analogie: Anstatt dass die KI die spezifische Fernbedienung für eine DJI-Drohne, eine Parrot-Drohne und eine selbstgebaute Drohne lernen müsste, tragen sie alle dasselbe „Uniform". Die KI sieht sie alle als standardisierte „Dinge" mit Standardtasten (wie „Starten", „Hierhin bewegen", „Batterie prüfen"). Dies ermöglicht es der KI, mit jeder Drohne zu sprechen, ohne für jede einzelne ein benutzerdefiniertes Handbuch zu benötigen.

2. Der Interpreter (Das MCP-Gateway)
Die KI ruft Befehle nicht einfach nur heraus; sie verwendet ein Model Context Protocol (MCP).

  • Die Analogie: Denken Sie daran wie an einen strengen Dolmetscher vor Gericht. Die KI (der Anwalt) stellt einen Antrag. Der Interpreter prüft, ob der Antrag gültig ist, übersetzt ihn in eine Sprache, die die Drohnen verstehen, und meldet dann genau zurück, was passiert ist. Die KI spricht niemals direkt mit der Drohne; sie geht immer über diesen Interpreter.

3. Der Sicherheitswächter (Der Agent Core)
Dies ist der wichtigste Teil. Die KI erhält eine Reihe von „Sicherheitsvorkehrungen".

  • Die Analogie: Stellen Sie sich einen Fluglehrer vor, der neben dem KI-Piloten sitzt. Wenn die KI versucht, etwas Gefährliches zu tun (wie zwei Drohnen auf denselben Punkt fliegen zu lassen) oder vergisst, sie am Ende zu landen, greift der Lehrer sofort ein, sagt „Stopp! Das ist unsicher" und zwingt die KI, ihren Plan zu überdenken. Die KI schreibt keinen Code, um dies zu beheben; der Lehrer stößt den Denkprozess der KI einfach wieder in die richtige Richtung.

Das Experiment: Auf die Probe gestellt

Das Team testete dieses System in einer Computersimulation mit 10 Drohnen. Sie forderten sechs verschiedene „intelligente" KIs (darunter Modelle von OpenAI, DeepSeek und anderen) auf, vier verschiedene Missionen auszuführen:

  1. Ein Feld abdecken: Über ein großes Gebiet fliegen, um Fotos zu machen.
  2. Formationen: Die Drohnen so anordnen lassen, dass sie eine Sternform bilden.
  3. Smarte Landwirtschaft: Zu Sensoren fliegen, um Luftfeuchtigkeit und Temperatur zu prüfen, und dann entscheiden, ob die Pflanzen Wasser benötigen.

Was sie herausfanden:

  • Alleine kämpft die KI: Wenn die KI selbst herausfinden musste, wie sie das Feld abdecken sollte (ohne Hilfe), scheiterte sie oft oder blieb stecken.
  • Werkzeuge helfen: Als die Forscher der KI ein „Planungswerkzeug" gaben (ein Helfer, der den besten Weg berechnet), stieg die Erfolgsrate in die Höhe. Es ist, als würde man der KI eine GPS-Karte geben, anstatt sie zu bitten, die ganze Stadt auswendig zu lernen.
  • Größe zählt (aber nicht nur das Gehirn): Die größten, leistungsfähigsten KI-Modelle gewannen nicht immer. Manchmal schnitt ein etwas kleineres Modell mit besseren „Sicherheitsvorkehrungen" und Werkzeugen besser und sicherer ab.
  • Kosten vs. Qualität: Sie verfolgten, wie viel „Rechenleistung" (Tokens) die KI verbrauchte. Sie stellten fest, dass nur weil eine KI viel redete (viele Tokens verwendete), dies nicht bedeutete, dass sie einen besseren Job machte. Eine schwatzhafte KI konnte die Mission immer noch zum Absturz bringen.

Das Fazit

Der Artikel kommt zu dem Schluss, dass wir, obwohl die KI intelligenter wird, sie nicht einfach mit Drohnen wild umherlaufen lassen können. Um es in der realen Welt funktionsfähig zu machen, benötigen wir ein strukturiertes System:

  1. Standardisieren, wie Drohnen kommunizieren (damit die KI nicht verwirrt wird).
  2. Der KI Werkzeuge zur Planung geben (damit sie nicht raten muss).
  3. Einen Sicherheitswächter in den Kreislauf integrieren (um Fehler zu fangen, bevor sie geschehen).

Das Ziel ist es nicht, menschliche Piloten durch KI-Code zu ersetzen, sondern ein System zu schaffen, in dem Sie einfach die Mission sagen können, und die KI, geleitet durch diese Sicherheitsnetze und Übersetzer, den Schwarm sicher und zuverlässig ausführt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →