← Neueste Arbeiten
💻 computer science

SI-Diff: A Framework for Learning Search and High-Precision Insertion with a Force-Domain Diffusion Policy

Dieser Beitrag stellt SI-Diff vor, ein einheitliches Diffusionsrichtlinien-Framework im Kraftbereich, das einen neuartigen modusbedingten Mechanismus und eine Such-Lehrer-Richtlinie integriert, um gleichzeitig eine robuste Suche und eine hochpräzise Einfügung zu erlernen, wodurch die Fehlertoleranz bei Fehlausrichtung und die Zero-Shot-Übertragbarkeit im Vergleich zu bestehenden Baselines erheblich verbessert werden.

Ursprüngliche Autoren: Yibo Liu, Stanko Oparnica, Simon Shewchun-Jakaitis, Guoyi Fu, Jie Wang, Jun Yang, Anand Jagannathan, Tony Hong-Yau Lo

Veröffentlicht 2026-05-13
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yibo Liu, Stanko Oparnica, Simon Shewchun-Jakaitis, Guoyi Fu, Jie Wang, Jun Yang, Anand Jagannathan, Tony Hong-Yau Lo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einen Schlüssel in ein Schloss zu stecken, tragen aber dicke Handschuhe und können das Schlüsselloch nur schlecht sehen. Sie müssen sich tastend vorwärts bewegen. Wenn der Schlüssel leicht außermittig ist, könnten Sie ihn einfach gerade nach unten drücken und stecken bleiben. Wenn Sie genau wissen, wo das Loch ist, können Sie ihn perfekt hineinschieben. Doch was ist, wenn Sie einen Roboter dafür einsetzen müssen, der nicht genau weiß, wo das Loch ist?

Diese Arbeit stellt SI-Diff vor, ein neues „Gehirn" für Roboter, das genau dieses Problem löst. Es lehrt einem Roboter, zwei völlig unterschiedliche Dinge mit demselben Befehlssatz zu tun: das Suchen nach dem Loch, wenn es verloren ist, und das Hineinschieben des Objekts, sobald es gefunden wurde.

So funktioniert es, aufgeschlüsselt mit einfachen Analogien:

1. Das Problem: Zwei verschiedene Bewegungen

Normalerweise werden Roboter darauf trainiert, diese Aufgaben getrennt zu erledigen.

  • Die Suche: Wenn der Roboter verloren ist, muss er wackeln und den Bereich absuchen (wie eine Person, die im Dunkeln nach einem Lichtschalter tastet).
  • Das Einstecken: Sobald es gefunden ist, muss es sehr vorsichtig sein, nur so viel wackeln, um das Objekt hineinzuschieben, ohne stecken zu bleiben (wie das Einfädeln einer Nadel).

Die meisten Roboter müssen den „Modus" wechseln oder unterschiedliche Software laden, um diese beiden Dinge zu tun. Die Autoren wollten ein einziges Roboterhirn bauen, das beides erledigen kann, ohne den Gang zu wechseln, genau wie ein menschlicher Arbeiter, der nach einem Loch tasten und dann einen Stift hineinschieben kann, ohne über einen Werkzeugwechsel nachzudenken.

2. Die Lösung: Eine „Diffusions"-Politik

Das Team verwendete eine Art von KI, die als Diffusions-Politik bezeichnet wird.

  • Die Analogie: Denken Sie an Diffusion wie an einen Bildhauer, der mit einem Block aus noisy, zufälligem Ton beginnt und langsam das Rauschen abschläbt, bis eine perfekte Statue entsteht.
  • Im Roboter: Der Roboter beginnt mit einer zufälligen Vermutung, wie er seinen Arm bewegen soll. Die KI „entrauscht" diese Vermutung und verfeinert sie Schritt für Schritt basierend darauf, was die Sensoren des Roboters (Berührung und Kraft) ihm mitteilen, bis sie die perfekte Bewegung findet, um entweder zu suchen oder einzustecken.

3. Das Geheimnis: Der „Modus"-Schalter

Die größte Herausforderung bestand darin, der KI beizubringen, zu wissen, welche Bewegung sie ausführen soll (Suche vs. Einstecken), ohne den Code zu ändern.

  • Die Analogie: Stellen Sie sich einen Musikplayer vor, der sowohl ein „Such-Song" als auch ein „Einsteck-Song" abspielen kann. Normalerweise bräuchten Sie dafür zwei verschiedene Player. SI-Diff verwendet einen Modus-Prompt, der wie ein „Track-Switch"-Knopf funktioniert.
  • Wie es funktioniert: Dem Roboter wird gesagt: „Im Moment befindest du dich im Such-Modus" oder „Im Moment befindest du dich im Einsteck-Modus". Diese winzige Anweisung sagt der KI, dass sie dieselben Sensordaten betrachtet, sie aber anders interpretiert. Im Such-Modus sucht sie nach Mustern, die bedeuten „weiter suchen". Im Einsteck-Modus sucht sie nach Mustern, die bedeuten „sanft wackeln, um zu passen".

4. Der Lehrer: Lernen von einem klugen Führer

Roboter lernen am besten, indem sie Experten beobachten. Die Autoren erstellten eine „Lehrer-Politik" (eine Reihe von Regeln), um Trainingsdaten zu generieren.

  • Der Such-Lehrer: Anstatt einfach eine perfekte Spirale zu zeichnen (die das Loch verpassen könnte), ist dieser Lehrer etwas chaotisch. Er versucht acht verschiedene Suchmuster mit zufälligen Geschwindigkeiten und Richtungen. Es ist wie ein Lehrer, der Ihnen nicht nur eine Art zeigt, einen verlorenen Gegenstand zu finden, sondern Ihnen viele verschiedene Wege zeigt, den Boden abzusuchen, damit Sie lernen, sich anzupassen.
  • Der Einsteck-Lehrer: Dieser Lehrer weiß, wie man einen feststeckenden Stift aus einer engen Stelle wackelt, ein Trick, den Menschen instinktiv anwenden.

Der Roboter beobachtet Tausende dieser „erfolgreichen" Versuche des Lehrers und lernt, das Gefühl des Erfolgs nachzuahmen.

5. Die Ergebnisse: Von „Vielleicht" zu „Bestimmt"

Das Team testete seinen Roboter gegen die derzeit besten Methoden (wie ein System namens TacDiffusion).

  • Der alte Weg: Wenn der Stift mehr als 2 Millimeter (etwa die Dicke einer Kreditkarte) abstand hatte, versagte der Roboter normalerweise. Er war zu starr.
  • SI-Diff: Das neue System konnte Fehlausrichtungen bis zu 5 Millimeter bewältigen. Es war viel verzeihender gegenüber Fehlern.
  • Zero-Shot-Magie: Obwohl der Roboter nur auf einen quadratischen Block trainiert wurde, konnte er erfolgreich ungesehene Formen wie Zylinder, Dreiecke und sogar einen USB-Stecker einsetzen. Er lernte das Konzept des Suchens und Einsteckens, nicht nur die spezifische Form des Blocks.

Zusammenfassung

SI-Diff ist ein Roboter-Kontrollsystem, das ein einziges KI-Modell verwendet, um sowohl nach einem Loch zu jagen als auch ein Objekt darin hineinzuschieben. Durch die Verwendung eines „Modus-Schalters" und das Lernen aus einer vielfältigen Reihe von „Lehrer"-Demonstrationen macht es Roboter viel robuster, sodass sie größere Fehler bewältigen und mit Formen arbeiten können, die sie noch nie gesehen haben, alles ohne dass sie Software wechseln oder sich selbst neu programmieren müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →