← नवीनतम पेपर
💬 NLP

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM एक यूनिफाइड मल्टीमॉडल मॉडल्स के लिए एक सेल्फ-रिवॉर्डिंग पोस्ट-ट्रेनिंग फ्रेमवर्क पेश करता है जो बाहरी रिवॉर्ड मॉडल्स या मानव-लेबल वाले डेटा की आवश्यकता के बिना विजुअल जनरेशन फिडेलिटी को महत्वपूर्ण रूप से बढ़ाने के लिए एक ग्लोबल-लोकल डुअल रिवॉर्ड सिस्टम के साथ मॉडल के अपने अंडरस्टैंडिंग मॉड्यूल का आंतरिक इवैल्यूएटर के रूप में लाभ उठाता है।

मूल लेखक: Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

प्रकाशित 2026-06-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार है जो एक बहुत ही सख्त कला समीक्षक भी है। यह कलाकार एक एकल कंप्यूटर प्रोग्राम के भीतर रहता है जिसे यूनिफाइड मल्टीमॉडल मॉडल (UMM) कहा जाता है।

यहाँ समस्या है जिसे यह पेपर पहचानता है:
यह कलाकार चित्रों की समीक्षा करने में अद्भुत है। यदि आप उन्हें एक ड्राइंग दिखाते हैं और कहते हैं, "क्या यह 'नीली मेज पर एक लाल सेब' के विवरण से मेल खाता है?", तो वे तुरंत गलती पकड़ सकते हैं। हालाँकि, जब आप उनसे वह सटीक चित्र बनाने के लिए कहते हैं, तो वे अक्सर इसे बिगाड़ देते हैं। वे शायद एक हरा सेब बना दें या मेज को गलत जगह पर रख दें। उनका "समीक्षक मस्तिष्क" उनके "कलाकार हाथ" से अधिक स्मार्ट है।

SRUM (यूनिफाइड मल्टीमॉडल मॉडल्स के लिए सेल्फ-रिवॉर्डिंग) एक नई प्रशिक्षण विधि है जो इस अंतर को ठीक करती है। यह कलाकार को अपने "समीक्षक मस्तिष्क" का उपयोग करके अपने "कलाकार हाथ" को कोचिंग देने के लिए प्रशिक्षित करती है, जिसमें किसी मानव शिक्षक या काम को ग्रेड करने के लिए किसी अलग कंप्यूटर प्रोग्राम की आवश्यकता नहीं होती है।

SRUM कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "प्रयास, निर्णय और सुधार" का लूप (The "Try, Judge, and Fix\text{Fix}" Loop)

मानव द्वारा चित्रों को ग्रेड करने का इंतज़ार करने के बजाय, मॉडल इसे स्वयं करता है:

  • चरण 1 (कलाकार): मॉडल एक प्रॉम्प्ट (जैसे, "नीली मेज पर एक लाल सेब") के आधार पर एक छवि बनाने का प्रयास करता है।
  • चरण 2 (समीक्षक): मॉडल का अपना "समझ" वाला मॉड्यूल अभी बनाई गई ड्राइंग को देखता है। यह एक आंतरिक न्यायाधीश के रूप में कार्य करता है। यह केवल "अच्छा" या "बुरा" नहीं कहता। यह एक स्कोर देता है और बताता है कि क्यों
  • चरण 3 (पाठ): मॉडल भविष्य के चित्रों को समायोजित करने के लिए इस स्व-जनित स्कोर का उपयोग करता है। यदि समीक्षक कहता है, "सेब बहुत अधिक हरा है," तो कलाकार अगली बार सेब को अधिक लाल बनाने के लिए सीखता है।

2. "ग्लोबल और लोकल" स्कोरकार्ड (The "Global and Local" Scorecard)

पेपर का तर्क है कि एक साधारण "अच्छा काम किया" पर्याप्त नहीं है। वास्तव में अच्छा बनने के लिए, कलाकार को दो विशिष्ट प्रकार के फीडबैक की आवश्यकता होती है, जो SRUM प्रदान करता है:

  • ग्लोबल रिवॉर्ड (बड़ी तस्वीर - The Global Reward): यह कमरे में घूम रहे एक गैलरी मालिक की तरह है। वे देखते हैं कि क्या पूरा दृश्य समझ में आता है। क्या मेज वास्तव में सेब के नीचे है? क्या आकाश जमीन के ऊपर है? यह सुनिश्चित करता है कि समग्र लेआउट सही हो।
  • लोकल रिवॉर्ड (बारीक विवरण - The Local Reward): यह एक आवर्धक लेंस (magnifying glass) की तरह है। यह विशिष्ट वस्तुओं पर ज़ूम करता है। क्या सेब वास्तव में लाल है? क्या मेज की लकड़ी की बनावट वास्तविक है? यह उन छोटी, विशिष्ट गलतियों को ठीक करता है जिन्हें बड़ी तस्वीर शायद मिस कर दे।

इन दोनों को मिलाकर, मॉडल को एक पूर्ण रिपोर्ट कार्ड मिलता है: "कमरा सही दिखता है (ग्लोबल), लेकिन सेब को अधिक लाल होने की आवश्यकता है (लोकल)।"

3. यह एक बड़ी बात क्यों है

आमतौर पर, AI को बेहतर चित्र बनाने के लिए प्रशिक्षित करने के लिए, आपको चाहिए:

  • हजारों विशेषज्ञ मानव जो छवियों को देखें और कहें, "यह अच्छा है, वह बुरा है।"
  • या, एक अलग, विशाल AI प्रोग्राम जो न्यायाधीश के रूप में कार्य करे।

SRUM इन दोनों की आवश्यकता को समाप्त कर देता है। यह मॉडल के अपने आंतरिक ज्ञान का उपयोग करके खुद को ग्रेड करने के लिए करता है। यह एक छात्र की तरह है जो एक अभ्यास निबंध लिखता है, फिर उसी पाठ्यपुस्तक का उपयोग करके अपने निबंध को ग्रेड करता है जिससे उसने अध्ययन किया था, और फिर बेहतर ग्रेड प्राप्त करने के लिए निबंध को फिर से लिखता है।

परिणाम

इस पेपर का परीक्षण जटिल कार्यों पर किया गया, जैसे वस्तुओं की विशिष्ट संख्या बनाना या 3D स्थान में वस्तुओं को व्यवस्थित करना (जैसे, "एक पीले सेब के ऊपर एक लाल केला")।

  • SRUM से पहले, मॉडल समझने में अच्छा था लेकिन जटिल दृश्यों को बनाने में खराब था।
  • SRUM के बाद, मॉडल की ड्राइंग क्षमता में काफी उछाल आया। इसने अपनी मजबूत समझ को बेहतर जनरेशन (generation) में अनुवाद करना सीख लिया।

संक्षेप में: SRUM एक स्व-सुधार प्रणाली है जो एक मल्टीमॉडल मॉडल को अपने स्वयं के "मस्तिष्क" का उपयोग करके अपने "हाथों" को बेहतर चित्र बनाने के लिए सिखाने की अनुमति देती है, जिसमें बड़ी तस्वीर और सूक्ष्म विवरणों की जाँच करने की दोहरी प्रणाली का उपयोग किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →