Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models
Diese Arbeit zeigt, dass eine starke Einschritt-Aktionsgenerierung für Vision-Language-Action-Modelle allein durch das Biasen der Trainingszeitverteilung hin zu Zuständen mit hohem Rauschen erreicht werden kann, wodurch die Notwendigkeit komplexer Destillation oder Hilfsziele, die typischerweise in der Bildsynthese erforderlich sind, entfällt und gleichzeitig die Leistung von Mehrschritt-Diffusions-Policies erreicht oder übertroffen wird.