GCImOpt: Learning efficient goal-conditioned policies by imitating optimal trajectories
GCImOpt एक गणनात्मक रूप से कुशल ढांचा है जो प्रक्षेपवक्र अनुकूलन (trajectory optimization) और डेटा संवर्धन (data augmentation) के माध्यम से उत्पन्न उच्च-गुणवत्ता वाले डेटासेट पर न्यूरल नेटवर्क को प्रशिक्षित करके छोटे, उच्च-गति और निकट-इष्टतम लक्ष्य-सशर्त नीतियों (goal-conditioned policies) को सीखता है।