← Neueste Arbeiten
💻 computer science

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

Dieses Paper stellt CoCoBench vor, einen neuen Benchmark bestehend aus 897 durch Experten validierten Haushaltsaufgaben, der die verkörperte Multi-Agenten-Koordination durch feingliedrige Metriken auf Konstruktionsebene (Aufgabenzuweisung, sequentielle Ordnung, gegenseitiger Ausschluss und Übergabe) anstatt nur durch allgemeine Erfolgsraten bewertet und aufzeigt, dass aktuelle multimodale große Sprachmodelle hochspezifische Stärken und Schwächen bei verschiedenen Arten der Koordination aufweisen.

Ursprüngliche Autoren: Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

Veröffentlicht 2026-08-31
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In naher Zukunft werden die Roboter, die wir in unseren Häusern sehen, wahrscheinlich keine Einzelarbeiter sein, sondern Teams. So wie Menschen zusammenarbeiten, um Möbel zu bewegen, eine Mahlzeit zuzubereiten oder ein großes Haus zu reinigen, müssen zukünftige Systeme der künstlichen Intelligenz ihre Handlungen koordinieren, um gemeinsame Ziele zu erreichen. Dieses Feld, bekannt als verkörperte Multi-Agenten-Planung (embodied multi-agent planning), wirft eine grundlegende Frage auf: Wie bringen wir Maschinen bei, zusammenzuarbeiten, ohne sich gegenseitig im Weg zu stehen? Während jüngste Fortschritte es einzelnen Robotern ermöglicht haben, Bilder zu verstehen und einfache Aufgaben auszuführen, führt der Sprung zu einer Gruppe von Robotern, die im selben physischen Raum operieren, eine neue Ebene der Komplexität ein. Es reicht nicht aus, dass jeder Roboter weiß, was er tun soll; sie müssen auch wissen, wann er es tun soll, wer es tun soll und wie sie Objekte übergeben, ohne eine Kollision oder eine Verzögerung zu verursachen.

Forscher kämpfen schon lange damit, diese Fähigkeit zur Kooperation zu messen. Bestehende Tests konzentrieren sich oft darauf, ob ein Team eine Aufgabe schließlich abschließt, wobei das Endergebnis als die einzige relevante Metrik behandelt wird. Dieser Ansatz verbirgt jedoch die chaotische Realität der Art und Weise, wie die Arbeit erledigt wurde. Ein Team könnte durch Zufall erfolgreich sein, oder sie könnten das Ziel erreichen, nachdem sie Zeit verschwendet, dieselben Handlungen wiederholt oder die Regeln der Umgebung ignoriert haben. Um dies zu lösen, hat ein Team von Wissenschaftlern der Nanjing University, AgiBot und der Tsinghua University ein neues Testfeld namens CoCoBench eingeführt. Anstatt nur zu fragen, ob ein Team eine Aufgabe abgeschlossen hat, zerlegt dieser Benchmark die spezifischen Arten, wie Roboter kooperieren müssen, und misst die Qualität ihrer Teamarbeit Schritt für Schritt.

Die Forscher bauten ihren Test innerhalb einer hochentwickelten Computersimulation eines Haushalts auf, einer digitalen Umgebung, in der virtuelle Roboter Schubladen öffnen, Objekte aufheben und sich bewegen können. Sie erstellten fast neunhundert verschiedene Szenarien, von denen jedes darauf ausgelegt war, die Roboter dazu zu zwingen, auf eine der vier spezifischen Arten der Kooperation zurückzugreifen. Die erste Art ist die Aufgabenverteilung (task allocation), bei der eine Gruppe entscheiden muss, wie sie unabhängige Aufgaben aufteilt, wie zum Beispiel ein Roboter, der Tassen sortiert, während ein anderer Teller sortiert. Die zweite ist die sequentielle Ordnung (sequential ordering), die erfordert, dass Roboter einem strengen Zeitplan folgen, wie etwa einen Schrank zu öffnen, bevor Gegenstände hineingelegt werden, und ihn erst zu schließen, nachdem alles platziert wurde. Die dritte ist der gegenseitige Ausschluss (mutual exclusion), ein Szenario, in dem mehrere Roboter ein einzelnes gemeinsames Werkzeug nutzen müssen, wie etwa ein Messer, was sie dazu zwingt, abzuwechseln. Die vierte ist die Übergabe-Koordination (handoff coordination), bei der ein Roboter ein Objekt über einen Zwischenplatz, wie einen Tisch, an einen anderen übergeben muss, was erfordert, dass sie ihre Bewegungen so timen, dass der Empfänger bereit ist, wenn das Objekt ankommt.

Für jedes dieser Szenarien haben die Forscher nicht einfach nur aufgezeichnet, ob die Roboter erfolgreich waren. Sie haben auch gemessen, wie gut die Roboter koordinierten. Sie verfolgten, ob das Team Zeit verschwendete, indem es dieselbe Aufgabe zweimal ausführte, ob sie die notwendige Reihenfolge der Schritte verletzten, ob sie um das gemeinsame Werkzeug stritten oder ob sie einander warten ließen. Dies ermöglichte es ihnen, ein erfolgreiches Ergebnis von einem gut koordinierten Prozess zu trenen. Ein Team konnte die Aufgabe zwar abgeschlossen haben, aber dennoch eine niedrige Punktzahl erhalten, wenn es dies unter Missachtung der Regeln oder durch ineffiziente Arbeitsweise tat.

Als die Forscher elf der fortschrittlichsten heute verfügbaren Modelle der künstlichen Intelligenz testeten, offenbarten die Ergebnisse eine überraschende Wahrheit über die Zusammenarbeit von Maschinen. Die Modelle, die insgesamt am besten abschnitten, waren nicht zwangsläufig in jeder Art der Kooperation exzellent. Einige Modelle waren hervorragend darin, Aufgaben aufzuteilen, hatten aber große Schwierigkeiten beim Abwechseln bei einem gemeinsamen Werkzeug. Andere waren großartig darin, einer Sequenz von Schritten zu folgen, scheiterten aber, wenn sie ein Objekt an einen Partner übergeben mussten. Dies deutet darauf hin, dass die Fähigkeit zur Koordination keine einzelne, allgemeine Fähigkeit ist, die ein Roboter entweder besitzt oder nicht; stattdessen ist sie eine Sammlung distinkter Fähigkeiten, die separat entwickelt werden müssen.

Die Studie untersuchte auch, wie die Roboter kommunizierten. Als die Forscher den Robotern einen zentralen Planer gaben, der alles sehen und das Team leiten konnte, waren die Ergebnisse deutlich besser als wenn die Roboter Entscheidungen nur basierend auf dem treffen mussten, was sie selbst sehen konnten. Das Hinzufügen eines einfachen Kommunikationskanals half den unabhängigen Robotern, schloss die Lücke zum zentralen Planer jedoch nicht vollständig. Dies deutet darauf an, dass die Hauptschwierigkeit für diese Systeme nicht darin besteht, die Welt zu sehen, sondern vielmehr darin, die Handlungen einer Gruppe logisch zu planen. Tatsächlich, als die Forscher die visuellen Bilder aus dem Test entfernten und den Robotern nur Textbeschreibungen der Situation gaben, sank ihre Leistung nicht wesentlich. Dies legt nahe, dass der Engpass nicht in der Erkennung von Objekten liegt, sondern in der High-Level-Logik des Teammanagements.

Als die Forscher die Anzahl der Roboter in einem Team von zwei auf drei und dann auf vier erhöhten, stieg die Schwierigkeit der Aufgabe. Die Erfolgsquote der Teams sank, wenn mehr Agenten hinzugefügt wurden, insbesondere bei den kleineren, weniger leistungsfähigen Modellen. Dies zeigt, dass das Hinzufügen von mehr Arbeitern eine Aufgabe nicht automatisch einfacher macht; es erhöht die Komplexität der erforderlichen Koordination. Die Forscher fanden heraus, dass während die fortschrittlichsten Modelle relativ stabil blieben, die schwächeren Modelle mit wachsender Teamgröße erheblich zu kämpfen hatten und oft daran scheiterten, die Planung innerhalb der erlaubten Zeit abzuschließen oder die Regeln der Simulation einzuhalten.

Vielleicht war die kritischste Erkenntnis, dass es irreführend ist, nur darauf zu schauen, ob eine Aufgabe abgeschlossen wurde. Die Forscher entdeckten, dass einige Modelle eine hohe Erfolgsquote erzielten, indem sie Abkürzungen nahmen, die gegen die Regeln der Koordination verstießen, wie etwa ein Werkzeug zu greifen, während ein anderer Roboter es noch benutzte, oder ein Objekt zu platzieren, bevor der Behälter geöffnet war. Diese Teams erreichten das Ziel, taten dies jedoch durch chaotisches und illegales Verhalten. Durch die Einführung eines Scores, der die Legalität und Qualität der Koordination maß, zeigten die Forscher, dass ein Team das Spiel "gewinnen" kann, während es schlecht spielt. Diese Unterscheidung ist entscheidend für die Entwicklung von Robotern, die sicher und effizient in echten Haushalten arbeiten können, wo das Befolgen der Interaktionsregeln genauso wichtig ist wie das Erledigen der Hausarbeit.

Die in dieser Arbeit vorgestellte Forschung beansprucht nicht, das Problem der Roboter-Teamarbeit gelöst zu haben. Stattdessen bietet sie einen viel klareren Weg, um zu sehen, wo aktuelle Systeme Erfolg haben und wo sie scheitern. Indem sie Koordination in spezifische, messbare Teile zerlegten, haben die Forscher gezeigt, dass der Aufbau eines Roboterteams mehr erfordert, als nur die einzelnen Agenten intelligenter zu machen. Es erfordert das Design von Systemen, die in der Lage sind, die spezifischen Anforderungen des Teilens von Raum, Zeit und Werkzeugen zu bewältigen. Während wir uns auf eine Zukunft zubewegen, in der Maschinen neben uns arbeiten, wird das Verständnis dieser Nuancen der Kooperation essenziell sein, um sicherzustellen, dass sie dies ohne Verwirrung oder Konflikte tun.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →