← नवीनतम पेपर
🤖 AI

Self-Improving Diffusion Classifiers with Minority Preference Optimization

यह शोध पत्र MiPO को प्रस्तुत करता है, जो एक ऐसी विधि है जो अतिरिक्त इमेज डेटा या बाहरी रिवॉर्ड मॉडल की आवश्यकता के बिना, अल्पसंख्यकीय डेटा वितरण के प्रति धारणा में सुधार करने के लिए अल्पसंख्यक प्राथमिकता अनुकूलन (minority preference optimization) के साथ पूर्व-प्रशिक्षित मॉडलों को फाइन-ट्यून करके डिफ्यूजन मॉडल्स के अल्पसंख्यक क्षेत्रों में ज़ीरो-शॉट वर्गीकरण प्रदर्शन को बढ़ाता है।

मूल लेखक: Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट कलाकार है जिसने वर्षों तक लाखों चित्र बनाए हैं। यह कलाकार इतना कुशल है कि यदि आप उनसे "कुत्ता" या "कार" बनाने के लिए कहते हैं, तो वे इसे पूरी तरह से कर सकते हैं। AI की दुनिया में, इस कलाकार को डिफ्यूजन मॉडल (Diffusion Model) कहा जाता है।

हाल ही में, वैज्ञानिकों ने खोजा है कि यह कलाकार एक अनुमान लगाने वाला खेल खेलने में भी आश्चर्यजनक रूप से अच्छा है: "इस तस्वीर में क्या है?" इसे डिफ्यूजन क्लासिफायर (Diffusion Classifier) कहा जाता है। हालाँकि, इसमें एक पेंच है। यह कलाकार थोड़ा घमंडी है। वे आम चीजों (जैसे एक मानक कुत्ता या कार) का अनुमान लगाते समय अविश्वसनीय रूप से आत्मविश्वासी होते हैं क्योंकि उन्होंने उन्हें लाखों बार देखा है। लेकिन यदि आप उन्हें कुछ दुर्लभ या असामान्य चीज़ दिखाते हैं (जैसे किसी अजीब बत्तख का विशिष्ट प्रकार या एक दुर्लभ सिंक), तो वे अक्सर गलत हो जाते हैं। वे "अल्पसंख्यक" (minority) वस्तुओं के साथ संघर्ष करते हैं क्योंकि उन्होंने उनका पर्याप्त अभ्यास नहीं किया है।

समस्या: कलाकार की अंध बिंदु (Blind Spot)

पेपर बताता है कि ऐसा इसलिए होता है क्योंकि इस कलाकार को मुख्य रूप से सामान्य, लोकप्रिय छवियों पर प्रशिक्षित किया गया था। वे "बहुसंख्यक" (majority) के लिए बेहतरीन हैं लेकिन "अल्पसंख्यक" (minority) के लिए बहुत खराब हैं। इसे ठीक करने के प्रयास पहले एक चीट शीट देने जैसे थे जो केवल पेंटिंग करते समय कलाकार को दी जाती थी। इसने उन्हें कुछ दुर्लभ चित्र बनाने में मदद तो की, लेकिन इसने वास्तव में कलाकार को दुर्लभ चीजों को बेहतर ढंग से समझने के लिए नहीं सिखाया। एक बार जब चीट शीट हटा दी गई, तो वे वापस भ्रमित हो गए।

समाधान: MiPO (माइनोरिटी प्रेफरेंस ऑप्टिमाइज़ेशन)

लेखकों, ह्युनसू किम और उनकी टीम ने एक नई विधि बनाई है जिसे MiPO कहा जाता है। MiPO को एक स्व-सुधारने वाले कोच (self-improving coach) के रूप में सोचें जो कलाकार को नई वास्तविक तस्वीरों को देखे बिना दुर्लभ चीजों की सराहना करना और समझना सीखने में मदद करता है।

MiPO इस तरह काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. अभ्यास सत्र (स्व-उत्पादन/Self-Generation): नई तस्वीरें दिखाने के बजाय (जो उनके पास नहीं हैं), MiPO कलाकार को यादृच्छिक विवरणों (कैप्शन) के आधार पर चित्र कल्पना करने और बनाने के लिए कहता है।
  2. "दुर्लभता" का स्कोर (The "Rareness" Score): कलाकार द्वारा चित्र बनाने के बाद, MiPO इसकी जाँच करता है। यदि चित्र कुछ ऐसा दिखता है जिसे कलाकार आमतौर पर अनदेखा कर देता है (एक "अल्पसंख्यक" क्षेत्र), तो MiPO उन्हें एक उच्च स्कोर (पुरस्कार) देता है। यदि यह एक उबाऊ, सामान्य चित्र जैसा दिखता है, तो उन्हें कम स्कोर मिलता है।
  3. कोमल धक्का (LoRA और RL): MiPO एक विशेष, हल्के उपकरण (जिसे LoRA कहा जाता है) का उपयोग करता है ताकि कलाकार के मस्तिष्क में सूक्ष्म बदलाव किए जा सकें। यह एक विशेष चश्मे को जोड़ने जैसा है जो कलाकार को दुर्लभ विवरणों पर बेहतर ध्यान केंद्रित करने में मदद करता है। यह ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) नामक तकनीक का उपयोग करता है, जो चित्रों के एक समूह की तुलना करने जैसा है। यदि एक ड्राइंग समूह के अन्य चित्रों की तुलना में अधिक "दुर्लभ" है, तो कलाकार को उस विशिष्ट शैली के लिए अतिरिक्त क्रेडिट मिलता है।
  4. सुरक्षा जाल (KL रेगुलराइजेशन): एक जोखिम यह है कि "दुर्लभ" होने की कोशिश में, कलाकार बेतुकी चीजें बनाना शुरू कर सकता है या सामान्य चीजों को बनाना भूल सकता है। इसे रोकने के लिए, MiPO एक "सुरक्षा बेल्ट" (KL Regularization) जोड़ता है। यह सुनिश्चित करता है कि कलाकार अपने मूल कौशल के प्रति वफादार रहे और केवल दुर्लभ चीजों के अपने ज्ञान का विस्तार करे।

परिणाम

पेपर ने इस नए कोच का परीक्षण पांच अलग-अलग मानक परीक्षणों (जैसे CIFAR10 और ImageNet) पर किया। यहाँ हुआ:

  • कठिन चीजों में बेहतर: कलाकार उन दुर्लभ, कम-घनत्व वाली वस्तुओं को पहचानने में बहुत बेहतर हो गया जिनमें वे पहले विफल हो जाते थे।
  • आसान चीजों में अभी भी अच्छा: "सुरक्षा बेल्ट" के कारण, कलाकार ने सामान्य चीजों को बनाना या पहचानना नहीं भुला।
  • कोई अतिरिक्त फोटो आवश्यक नहीं: यह पूरी प्रक्रिया केवल टेक्स्ट विवरणों का उपयोग करके हुई। उन्हें किसी नई छवि को फीड करने की आवश्यकता नहीं थी।
  • तेज़ और लचीला: "चश्मा" (LoRA) छोटा है और इसे आसानी से पहना या उतारा जा सकता है। यह विभिन्न प्रकार के कलाकारों (विभिन्न डिफ्यूजन मॉडल) के साथ काम करता है और प्रक्रिया को बहुत धीमा नहीं करता है।

निचोड़ (The Bottom Line)

पेपर का दावा है कि AI को स्व-सुधारने वाले लूप के माध्यम से दुर्लभ वस्तुओं को उत्पन्न करने और पहचानने का "अभ्यास" करने के लिए सिखाकर, AI एक बहुत बेहतर ऑल-राउंड ऑब्जर्वर बन जाता है। यह उस पूर्वाग्रह को ठीक करता है जहाँ AI केवल लोकप्रिय चीजों को समझता है, जिससे यह सामान्य वस्तुओं से लेकर अजीब और अद्भुत चीजों तक के लिए अधिक मजबूत और सटीक बनता है।

संक्षेप में: MiPO AI को उन चीजों को अनदेखा करना बंद करने के लिए सिखाता है जो मुख्यधारा में नहीं हैं, जिससे यह एक स्मार्ट, निष्पक्ष क्लासिफायर बनता है जिसे किसी नए प्रशिक्षण डेटा की आवश्यकता नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →