FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning
FlowR2A एक जनरेटिव मल्टीमॉडल ड्राइविंग प्लानिंग मॉडल है जो डेंस सिमुलेशन-आधारित रिवार्ड्स (rewards) से कंडिशन्ड एक फ्लो-मैचिंग डिकोडर को सीखकर स्कोरिंग-आधारित और एंकर-आधारित विधियों के बीच के तनाव को हल करता है, जिससे NAVSIM बेंचमार्क्स पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए डेंस सुपरविजन को डायनेमिक प्रपोजल जनरेशन के साथ एकीकृत किया जाता है।