Learning Self-Correction in Vision-Language Models via Rollout Augmentation
यह शोधपत्र Octopus पेश करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रोलआउट पुनर्संयोजन (rollout recombination) और एक रिस्पॉन्स-मास्किंग रणनीति के माध्यम से सघन स्व-सुधार उदाहरणों को संश्लेषित करके विजन-लैंग्वेज मॉडल्स के लिए सैंपल दक्षता को बढ़ाता है और प्रशिक्षण को स्थिर करता है, जिसके परिणामस्वरूप अत्याधुनिक Octopus-8B मॉडल प्राप्त होता है।