← Neueste Arbeiten
💻 computer science

BEACON: Cross-Domain Co-Training of Generative Robot Policies via Best-Effort Adaptation

BEACON ist ein theoriebasiertes Framework, das die Robustheit und Dateneffizienz generativer Robotik-Policies in domänenübergreifenden Szenarien verbessert, indem es Co-Training als ein diskrepanzbewusstes Umge wichtungsproblem formuliert, das gemeinsam eine diffusionsbasierte visuomotorische Policy und pro-Sample-Quellgewichte optimiert, um den Generalisierungsfehler im Zielbereich zu minimieren.

Ursprüngliche Autoren: Antong Zhang, Han Qi, Heng Yang

Veröffentlicht 2026-05-13
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Antong Zhang, Han Qi, Heng Yang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboterarm beizubringen, wie man Blöcke stapelt. Sie verfügen über zwei Arten von Trainingsdaten:

  1. Die „Quell"-Daten: Eine riesige Bibliothek von Videos, die Roboter zeigen, wie sie die Aufgabe in einer perfekten, computergenerierten Welt (Simulation) ausführen. Es gibt Tausende dieser Videos, doch Beleuchtung, Texturen und Physik weichen leicht von der realen Welt ab.
  2. Die „Ziel"-Daten: Eine winzige, kostbare Handvoll von Videos, die einen echten Roboter zeigen, wie er die Aufgabe in Ihrer tatsächlichen Küche ausführt. Diese sind teuer und schwer zu beschaffen, aber sie sind die einzigen, die für die eigentliche Aufgabe wirklich zählen.

Das Problem:
Wenn Sie einfach alle Computer-Videos mit den wenigen realen Videos mischen und den Roboter gleichermaßen aus allen lehren, gerät der Roboter in Verwirrung. Die Computerwelt ist zu unterschiedlich von der realen Welt (unterschiedliche Reibung, Beleuchtung, Kamerawinkel). Der Roboter könnte lernen, Blöcke in der Simulation perfekt zu stapeln, scheitert aber kläglich in der realen Küche.

Verwenden Sie nur die wenigen realen Videos, lernt der Roboter nicht genug und ist nicht in der Lage, das Gelernte zu verallgemeinern.

Die Lösung: BEACON
Die Arbeit stellt eine neue Methode namens BEACON (Best-Effort Adaptation for Cross-Domain Co-Training) vor. Betrachten Sie BEACON nicht als Lehrer, sondern als einen intelligenten Redakteur oder einen Kurator.

Anstatt jedes Trainingsvideo gleich zu behandeln, weist BEACON jedem einzelnen Video in der riesigen Bibliothek einen „Relevanzwert" (ein Gewicht) zu.

  • Die „Best-Effort"-Idee: Das System fragt: „Welche dieser Tausenden von gefälschten Videos sehen und fühlen sich tatsächlich wie die wenigen realen Videos an, die ich habe?"
  • Der Bearbeitungsprozess:
    • Wenn ein Computer-Video eine Bewegung des Roboters zeigt, die der des echten Roboters sehr ähnlich ist, vergibt BEACON einen hohen Wert. Es sagt: „Verwenden Sie diesen! Er ist hilfreich!"
    • Wenn ein Computer-Video etwas Seltsames oder Unrealistisches zeigt (wie einen Block, der auf Eis rutscht, während echte Blöcke auf Holz rutschen), vergibt BEACON einen niedrigen Wert (oder Null). Es sagt: „Ignorieren Sie diesen. Er wird den Roboter verwirren."

Wie es funktioniert (Der Zaubertrick):
Normalerweise versuchen Menschen, die Computerwelt und die reale Welt zum Aussehen gleich zu machen, indem sie Farben oder Texturen verändern (wie das Auftragen eines Filters auf ein Foto). BEACON macht etwas anderes.

Es versucht nicht, die Welten gleich aussehen zu lassen. Stattdessen selektiert es die spezifischen Momente in der Computerwelt, die bereits für die reale Welt nützlich sind.

  • Analogie: Stellen Sie sich vor, Sie lernen, ein bestimmtes Gericht zu kochen. Sie haben ein Rezept von Ihrer Großmutter (die realen Daten) und tausend Rezepte von einem berühmten TV-Koch, der andere Zutaten verwendet (die Quelldaten).
    • Der alte Weg: Sie versuchen, die Zutaten des TV-Kochs an die Ihrer Großmutter anzupassen, oder Sie mischen sie einfach alle zusammen.
    • Der BEACON-Weg: Sie lesen die tausend Rezepte des TV-Kochs und wählen nur die Schritte aus, die der Technik Ihrer Großmutter entsprechen. Sie ignorieren den Rest. Sie lernen von den wenigen Schritten Ihrer Großmutter, füllen aber die Lücken mit den besten passenden Schritten des TV-Kochs.

Das überraschende Ergebnis:
Die Arbeit fand heraus, dass durch diese „intelligente Selektion" das Gehirn des Roboters (sein neuronales Netz) auf natürliche Weise begann, die reale Welt besser zu verstehen. Obwohl dem System nicht explizit befohlen wurde, „Merkmale auszurichten" oder „Muster abzugleichen", bewirkte der Akt der richtigen Datenselektion, dass der Roboter automatisch die richtigen Muster lernte. Es ist wie bei einem Schüler, der nur die relevantesten Übungsfragen studiert und dadurch auf natürliche Weise beginnt, die zugrunde liegende Logik des Fachs zu erkennen, ohne dass ein separater Kurs über „Logik" nötig ist.

Was sie testeten:
Sie testeten dies an einem Roboterarm bei drei Aufgaben: Blöcke stapeln, Tassen aufräumen und eine Nadel einfädeln. Sie verglichen BEACON mit:

  1. Der Verwendung nur der wenigen realen Videos.
  2. Der gleichmäßigen Mischung aller Videos.
  3. Der Verwendung anderer Methoden, die versuchen, die Computer- und reale Welt zum Aussehen ähnlich zu machen.

Das Ergebnis:
BEACON gewann konsequent. Der Roboter lernte schneller, benötigte weniger reale Daten und war viel robuster, wenn sich die Umgebung änderte (wie das Verschieben der Kamera oder das Ändern der Tischtextur). Es bewies, dass ein intelligenter Kurator von Daten zu sein mächtiger ist als der Versuch, die Daten zum Aussehen gleich zu machen.

Kurz gesagt:
BEACON ist ein Framework, das Roboter lehrt, indem es sagt: „Wir haben viele gefälschte Daten und ein wenig echte Daten. Lassen Sie uns den gefälschten Teil ignorieren, der nicht passt, und uns intensiv auf den gefälschten Teil konzentrieren, der passt, damit wir die echte Aufgabe effizient lernen können."

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →