← नवीनतम पेपर
💻 computer science

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

यह शोध पत्र DyCoRM को प्रस्तुत करता है, जो एक गतिशील मानदंड-जागरूक रिवॉर्ड मॉडलिंग ढांचा है जो एक नए निर्मित डेटासेट और बेंचमार्क का लाभ उठाकर टेक्स्ट-टू-इमेज जनरेशन में सूक्ष्म, कार्य-विशिष्ट छवि मूल्यांकन की आवश्यकता को संबोधित करता है ताकि उपयोगकर्ता की आवश्यकताओं के साथ अधिक सटीक संरेखण सक्षम किया जा सके।

मूल लेखक: Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कला समीक्षक हैं, लेकिन केवल यह कहने के बजाय कि "मुझे यह पेंटिंग उस दूसरी पेंटिंग से अधिक पसंद है," आपको एक विशिष्ट नियम के आधार पर यह समझाना होगा जो कलाकार ने आपको दिया है।

यह शोध पत्र DyCoRM (Dynamic Criterion-Aware Reward Model) नामक एक नई प्रणाली प्रस्तुत करता है, जिसे कंप्यूटर को AI-जनित छवियों का मूल्यांकन करने में मदद करने के लिए डिज़ाइन किया गया है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

समस्या: "एक ही आकार के सभी के लिए" वाला जज (The "One-Size-Fits-All" Judge)

वर्तमान में, अधिकांश AI इमेज जज एक जनरल मैनेजर की तरह काम करते हैं जो केवल अंतिम उत्पाद को देखते हैं और एक एकल स्कोर देते हैं (जैसे, "10 में से 8")।

  • समस्या: कभी-कभी एक उपयोगकर्ता चाहता है कि छवि "डरावनी" हो, और कभी-कभी वह चाहता है कि वह "रंगीन" हो। एक जनरल मैनेजर एक रंगीन छवि को उच्च स्कोर दे सकता है भले ही उपयोगकर्ता ने विशेष रूप से कुछ डरावना मांगा हो। पुराने जज यह नहीं जानते कि विशिष्ट अनुरोध के आधार पर अपना ध्यान कैसे केंद्रित करें। वे हर काम के लिए नियमों के एक निश्चित सेट में फंसे हुए हैं।

समाधान: "विशेषज्ञ निरीक्षक" (The "Specialized Inspector" - DyCoRM)

लेखकों ने एक नया सिस्टम बनाया है जो एक लचीले, विशेषज्ञ निरीक्षक की तरह कार्य करता है। केवल एक स्कोर देने के बजाय, यह निरीक्षक दो चरणों में काम करता है:

  1. चरण 1: ब्लूप्रिंट को पढ़ना (Criterion Grounding):
    छवियों को देखने से पहले, निरीक्षक उपयोगकर्ता के प्रॉम्प्ट (prompt) को पढ़ता है और पूछता है, "इस विशिष्ट कार्य के लिए विशिष्ट नियम क्या हैं?"

    • उपमा: यदि प्रॉम्प्ट "एक साइबरपंक सिटी" है, तो निरीक्षक लिखता है: "नियॉन लाइट, उड़ने वाली कारों और अंधेरी सड़कों की जाँच करें।"
    • यदि प्रॉम्प्ट "एक आरामदायक रसोई" है, तो वह लिखता है: "गर्म रोशनी, खिड़की पर भाप और वास्तविक खाद्य बनावट (textures) की जाँच करें।"
    • यह सिस्टम हर नए अनुरोध के लिए इन विशिष्ट नियमों को स्वचालित रूप से समझने में सक्षम है।
  2. चरण 2: नियमों के आधार पर ग्रेड देना (Criterion-Conditioned Comparison):
    एक बार जब नियम निर्धारित हो जाते हैं, तो निरीक्षक दो छवियों को देखता है और केवल उन विशिष्ट नियमों के आधार पर उनकी तुलना करता है।

    • उपमा: यह केवल यह नहीं कहता कि "छवि A अधिक सुंदर है।" यह कहता है, "छवि A जीतती है क्योंकि नियॉन लाइटें अधिक चमकदार हैं (नियम #1), लेकिन छवि B जीतती है क्योंकि भोजन अधिक स्वादिष्ट दिखता है (नवल #2)।"

प्रशिक्षण डेटा: "अभ्यास परीक्षा" (The "Practice Exam" - DyCoDataset-20K)

इस निरीक्षक को उसका काम सिखाने के लिए, शोधकर्ताओं ने DyCoDataset-20K नामक एक विशाल नया प्रशिक्षण सेट बनाया है।

  • इसे कैसे बनाया गया: उन्होंने हजारों प्रॉम्प्ट लिए, 14 अलग-अलग AI मॉडल से छवियां उत्पन्न कीं, और फिर मनुष्यों को "ट्यूटर" के रूप में काम पर रखा।
  • शिक्षण प्रक्रिया: मनुष्यों को केवल विजेता चुनने के लिए नहीं कहा गया था। उन्हें निम्नलिखित कार्य करने थे:
    1. उस विशिष्ट प्रॉम्प्ट के लिए विशिष्ट मानदंड (criteria) लिखना (जैसे, "हाथ वास्तविक दिखने चाहिए")।
    2. केवल उन मानदंडों के आधार पर छवियों की तुलना करना।
  • परिणाम: 20,000+ उदाहरणों का एक ऐसा डेटासेट जहाँ हर कार्य के लिए "नियम" बदलते रहते हैं, जो AI को लचीला बनाना सिखाता है।

बेंचमार्क: "फाइनल एग्जाम" (The "Final Exam" - DyCoBench-1K)

उन्होंने एक छोटा, कठिन टेस्ट सेट भी बनाया जिसे DyCoBench-1K कहा जाता है। यह एक फाइनल एग्जाम की तरह है जहाँ प्रश्न कठिन होते हैं और उनके लिए तेजी से अपना ध्यान बदलने की आवश्यकता होती है। परिणाम दिखाते हैं कि DyCoRM पिछले "जनरल मैनेजर" शैली के जजों की तुलना में इस परीक्षा को बहुत बेहतर तरीके से पास करता है।

अनुप्रयोग: "पर्सनल शॉपर" (The "Personal Shopper" - DyCoPick)

अंत में, लेखकों ने दिखाया कि कैसे इस सिस्टम का उपयोग DyCoPick नामक एक टूल के साथ किया जा सकता है।

  • यह कैसे काम करता है: कल्पना कीजिए कि आपने AI से "अंतरिक्ष में बिल्ली" की 10 तस्वीरें बनाने के लिए कहा है।
  • पुराना तरीका: AI शायद पहली ऐसी तस्वीर चुन लेगा जिसे वह सामान्य रूप से "अच्छा" समझता है।
  • DyCoPick का तरीका: सिस्टम 10 विकल्प उत्पन्न करता है, फिर उस "विशेषज्ञ निरीक्षक" का उपयोग करता है जो आपकी विशिष्ट आवश्यकताओं के आधार पर उन्हें देखता है (जैसे, "मैं चाहता हूँ कि बिल्ली रोएँदार दिखे" या "मैं चाहता हूँ कि बैकग्राउंड गहरा हो")। फिर यह उस छवि को चुनता है जो आपके विशिष्ट मानदंडों पर सबसे सटीक बैठती है, जो एक पर्सनल शॉपर की तरह काम करता है जिसे पता है कि आपको वास्तव में क्या चाहिए, न कि वह जो लोकप्रिय है।

सारांश

संक्षेप में, यह शोध पत्र कहता है: "सभी AI इमेज जजिंग के लिए एक सामान्य नियम पुस्तिका का उपयोग करना बंद करें। इसके बजाय, एक ऐसा सिस्टम बनाएं जो पहले यह पता लगाए कि वर्तमान कार्य के लिए विशिष्ट नियम क्या हैं, और फिर उन विशिष्ट नियमों के आधार पर छवियों का मूल्यांकन करे।" उन्होंने शिक्षक (डेटासेट), छात्र (मॉडल), और परीक्षण (बेंचमार्क) बनाया है ताकि यह साबित किया जा सके कि यह पुराने तरीके से बेहतर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →