SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
SIVA-RL मल्टीमॉडल सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक नवीन ढांचा है जो ऑपरेटर-कंडीशन्ड पर्यवेक्षण को आउटकम-कंडीशन्ड, सैंपल-वाइज संरेखण से बदलकर विजुअल ग्राउंडिंग को बढ़ाता है, जिसमें विविध बेंचमार्क पर बेहतर तर्क प्रदर्शन के लिए देखे गए रिवॉर्ड ड्रॉप्स के आधार पर हस्तक्षेपों को गतिशील रूप से रूट करने के लिए एक फ्रोजन ऑडिट पॉलिसी का उपयोग किया जाता है।