← Neueste Arbeiten
💻 computer science

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

Diese Arbeit untersucht das Hinzufügen von Griechisch zu einer Roboter-Vision-Language-Action-Policy unter Verwendung ausschließlich maschinell umformulierter Anweisungen, wobei sie aufzeigt, dass eine robuste Evaluierung Null-Benchmarks und Seed-Replikation erfordert, um falsche Schlussfolgerungen zu vermeiden, während sie gleichzeitig demonstriert, dass zweisprachiges Training trotz Überanpassung an spezifische Formulierungen konsistente Verbesserungen gegenüber Kontrollgruppen liefert.

Ursprüngliche Autoren: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

Veröffentlicht 2026-09-09
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die sehen, verstehen und sich bewegen können, werden zur Realität, aber derzeit sprechen sie nur eine Sprache: Englisch. Diese Maschinen lernen durch das Beobachten von Videos, in denen Menschen Aufgaben ausführen, wobei die Anweisungen auf Englisch verfasst sind. Die Software, die ihnen hilft, diese Wörter zu verstehen, wurde mit massenhaften englischen Texten trainiert, was sie für diese spezifische Sprache unglaublich gut macht. Für jeden, der Griechisch oder eine andere Sprache spricht, schafft dies eine harte Barriere. Es gibt keine Videobibliotheken von Robotern, die Objekte unter griechischen Anweisungen bewegen, und der Aufbau eines solchen Systems von Grund auf würde Monate an manueller Führung eines Roboterarms für jede einzelne Aktion erfordern. Die Frage, die sich die Forscher stellten, war simpel: Könnten sie die vorhandenen englischen Daten nehmen, die Anweisungen mithilfe eines Computers ins Griechische übersetzen und den Roboter lehren, die neue Sprache zu verstehen, ohne das gesamte System neu aufzubauen?

Die Antwort erwies sich als komplizierter als eine einfache Übersetzung. Ein Team von Forschern bei Sophea AI und KIEFER SA in Athen nahm ein Open-Source-Robotersystem und fütterte es mit tausenden griechischen Anweisungen, die von einer Maschine generiert wurden. Sie änderten weder das Gehirn noch die physische Struktur des Roboters; sie ersetzten lediglich den englischen Text durch griechischen Text. Der Übersetzungsprozess war schnell und einfach und dauerte nur wenige Stunden. Doch die eigentliche Arbeit begann, als sie versuchten zu messen, ob der Roboter tatsächlich verstand, was man ihm sagte. In der Welt der Robotik ist es überraschend einfach, ein System vorzutäuschen, erfolgreich zu sein, obwohl es eigentlich nur rät. Die Forscher fanden heraus, dass Standardtests, die normalerweise ein klares Bestehen oder Nichtbestehen liefern, völlig getäuscht wurden. Sie entdeckten, dass ein Roboter einer griechischen Anweisung mit hohen Erfolgsraten folgen konnte, selbst wenn die Anweisung unsinnig war oder wenn der Robot überhaupt nicht auf Griechisch trainiert worden war. Dies geschah, weil der Roboter lernte, die Szene und die Objekte zu erkennen, anstatt die Worte zu lesen.

Um dies zu lösen, mussten die Forscher neue Wege finden, um den Roboter zu testen. Sie bauten eine Kontrollgruppe auf, in der sie dem Roboter absichtlich falsche Anweisungen auf Griechisch gaben, um zu sehen, ob er dennoch versuchen würde, die Aufgabe auszuführen. Sie fanden heraus, dass ein Roboter, der mit maschinell übersetzten griechischen Anweisungen trainiert wurde, bei einem kleinen Satz von zehn Aufgaben in etwa vierundachtzig Prozent der Fälle erfolgreich zu sein schien. Wenn sie ihn jedoch mit den falschen Anweisungen testeten, war er immer noch in etwa zweiundachtzig Prozent der Fälle erfolgreich. Dies bewies, dass der Roboter nicht das Griechische las, sondern lediglich auf das visuelle Setup reagierte. Der Robot ignorierte die Sprache vollständig.

Die Forscher versuchten es dann mit einem anderen Ansatz. Sie nutzten einen größeren Satz von neunzig Aufgaben, bei denen der Roboter zwischen mehreren möglichen Zielen in derselben Szene wählen musste. Hier wurde die Sprache zum einzigen Signal, um dem Roboter zu sagen, was er tun soll. Sie fanden heraus, dass ein Roboter, der sowohl mit englischen als auch mit griechischen Anweisungen trainiert wurde, griechischen Kommandos in etwa siebenundzwanzig Prozent der Fälle folgen konnte, was signifikant besser als zufälliges Raten war. Ein Roboter, der jedoch nur mit griechischen Anweisungen trainiert wurde, ohne dass englische Daten ihn unterstützten, verbesserte sich kaum über das zufällige Raten hinaus. Während das zweisprachige Training im Durchschnitt besser abschnitt als das rein griechische Training, überschnitten sich die statistischen Bereiche ihrer Leistung erheblich, was bedeutete, dass die Daten nicht definitiv bestätigen konnten, ob das englische Training als notwendiges Gerüst für das Lernen des Griechischen diente. Der robusteste Befund war, dass Demonstrationen in der Zielsprache notwendig sind, aber allein oft unzureichend sind; eine auf Griechisch trainierte Policy folgt dem Sprache kaum und bleibt über mehrere Testläufe hinweg innerhalb von drei Punkten ihrer eigenen Fehlerschwelle.

Die Studie deckte auch auf, dass der Roboter die griechische Sprache nicht so lernte, wie ein Mensch es tun würde. Stattdessen memorierte er die spezifische Formulierung, die der Maschinentranslator verwendete. Als die Forscher den Roboter mit griechischen Sätzen testeten, die von einem anderen Computerprogramm geschrieben wurden, sank seine Leistung drastisch. Er hatte den Stil des ersten Translators gelernt, nicht die Sprache selbst. Um dies zu beheben, lehrten sie den Roboter dieselbe Aufgabe mit sieben verschiedenen griechischen Formulierungen. Diese einfache Änderung machte den Roboter viel robuster und halbierte den Leistungsabfall beim Testen mit neuen Formulierungen. Dies zeigte, dass die Vielfalt in den Trainingsdaten essenziell ist, damit der Roboter über den Schreibstil eines einzelnen Maschinenprogramms hinaus generalisieren kann.

Vielleicht war die überraschendste Erkenntnis, dass einige logische Verbesserungen den Roboter tatsächlich schlechter machten. Das Team versuchte, das Training des Roboters mit einem Modell zu beginnen, das bereits an das Griechische angepasst worden war, in der Hoffnung, ihm einen Vorsprung zu verschaffen. Stattdessen schnitt der Roboter sowohl auf Englisch als auch auf Griechisch schlechter ab. Sie versuchten auch, den Teil des Robotergehirns, der Sprache verarbeitet, frei lernen zu lassen, anstatt ihn eingefroren zu halten. Auch dies verschlechterte die Leistung. Die Ergebnisse legen nahe, dass es für diese spezifischen Systeme die beste Strategie ist, den sprachverarbeitenden Teil des Gehirns exakt so zu belassen, wie er trainiert wurde, und dem Roboter lediglich beizubringen, wie er sich unter Verwendung der neuen Sprache bewegt.

Die Forscher versuchten zudem, diese Methoden an einer massiven Sammlung echter Roboterdaten zu testen, die weit größer war als ihre simulierten Tests. Sie übersetzten über fünfzigtausend echte Roboter-Episoden ins Griechische. Sie konnten den Erfolg dieser Daten jedoch nicht messen, da es ihnen an der physischen Roboter-Hardware fehlte, die erforderlich wäre, um die Tests durchzuführen. Dies verdeutlichte einen Engpass in diesem Bereich: Das Übersetzen der Daten ist billig und schnell, aber die Verifizierung, ob der Roboter tatsächlich gelernt hat, ist langsam, teuer und erfordert physische Ausrüstung.

Letztlich kommt das Paper zu dem Schluss, dass das Hinzufügen einer neuen Sprache zu einem Roboter möglich ist, aber nicht so einfach wie eine Übersetzung. Es erfordert eine spezifische Art von Basismodell, das die Sprache bereits versteht, eine Mischung aus Trainingsdaten in sowohl der neuen Sprache als auch in Englisch sowie einen sehr sorgfältigen Testprozess, der bewusste Fehler beinhaltet, um sicherzustellen, dass der Roboter tatsächlich zuhört. Der Roboter lernt die Sprache nicht auf eine tiefe, menschliche Weise; er lernt, spezifische Wortmuster mit Handlungen zu assoziieren, und er benötigt die Stabilität des englischen Trainings, um dies zu tun, obwohl der genaue Mechanismus, wie das Englische das Griechische unterstützt, eher eine offene Frage als eine bestätigte Regel bleibt. Die Arbeit dient als Warnung an andere in diesem Bereich: Vertrauen Sie der Erfolgsrate eines Roboters nicht blindlings, und testen Sie immer mit einer Kontrollgruppe, die beweist, dass der Roboter nicht nur rät. Der Weg zu einem multilingualen Roboter ist nicht nur mit Daten gepflastert, sondern mit der rigorosen Disziplin, zu beweisen, dass die Daten tatsächlich verstanden wurden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →