← नवीनतम पेपर
📊 statistics

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

यह शोध पत्र एक अर्ध-पर्यवेक्षित (semi-supervised), दो-चरणीय प्रशिक्षण ढांचे का प्रस्ताव करता है जो प्रचुर मात्रा में अनलेबल डेटा का उपयोग करके हल्के विशेषज्ञ डिफ्यूजन मॉडलों को एक सामान्यज्ञ मॉडल में संकुचित (distill) करता है, जिससे उन सांख्यिकीय गारंटियों के साथ कुशल बहु-उद्देश्यीय शिक्षण प्राप्त होता है जो सामान्यज्ञ के बजाय केवल विशेषज्ञों की जटिलता पर निर्भर करते हैं।

मूल लेखक: Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट या कंप्यूटर प्रोग्राम को एक साथ कई अलग-अलग काम करना सिखाने की कोशिश कर रहे हैं। शायद उसे एनिमे (anime) की शैली में, ऑयल पेंटिंग की शैली में, और वास्तविक फोटो की शैली में चित्र बनाने की आवश्यकता हो। या शायद उसे एक रोबोटिक हाथ को लाल क्यूब, नीला क्यूब और हरा क्यूब उठाने में मदद करने की आवश्यकता हो।

AI की दुनिया में, इसे मल्टी-ऑब्जेक्टिव लर्निंग (Multi-Objective Learning) कहा जाता है। लक्ष्य एक "जनरलिस्ट" (Generalist) मस्तिष्क बनाना है जो इन सभी कार्यों में कुशल हो।

समस्या: "जैक ऑफ ऑल ट्रेड्स" (सब कुछ करने वाला) महंगा है

आमतौर पर, इस जनरलिस्ट मस्तिष्क को प्रशिक्षित करने के लिए, आपको बड़ी मात्रा में सटीक उदाहरणों की आवश्यकता होती है। प्रत्येक कार्य के लिए, आपको डेटा का एक जोड़ा चाहिए: निर्देश (जैसे "एक बिल्ली बनाओ") और उसका सटीक परिणाम (वास्तविक बिल्ली की तस्वीर)।

लेकिन यहाँ एक पेंच है: उन सटीक जोड़ों को प्राप्त करना कठिन और महंगा है।

  • रोबोटिक्स में: आपको किसी मानव विशेषज्ञ द्वारा हजारों बार उस कार्य का भौतिक प्रदर्शन करने की आवश्यकता होती है।
  • कला में: आपको उच्च-गुणवत्ता वाले, क्यूरेटेड इमेज पेयर्स (चित्रों के जोड़े) की आवश्यकता होती है।

लेकिन आपके पास बहुत सारे "निर्देश" (conditions) मौजूद हैं। आपके पास लाखों टेक्स्ट प्रॉम्प्ट या लाखों रोबोट शुरुआती स्थितियाँ हैं, लेकिन आपके पास उन सभी के लिए सटीक उत्तर नहीं हैं। यह सेमी-सुपरवाइज्ड (Semi-Supervised) समस्या है: प्रश्न बहुत सारे हैं, लेकिन उत्तर बहुत कम हैं।

यदि आप सीधे उन कुछ उत्तरों पर बड़े जनरलिस्ट मस्तिष्क को प्रशिक्षित करने की कोशिश करते हैं, तो यह दुनिया के हर विषय में महारत हासिल करने के लिए एक पीएचडी छात्र को केवल एक ही पाठ्यपुस्तक का उपयोग करके पढ़ाने जैसा है। यह अक्षम है, और छात्र अच्छी तरह से सीख भी नहीं पाएगा।

समाधान: "स्पेशलिस्ट" प्रशिक्षु (Apprentices)

लेखक एक चतुर दो-चरणीय तरकीब का प्रस्ताव देते हैं, जैसे एक मास्टर शेफ एक नए हेड शेफ को प्रशिक्षित करता है।

चरण 1: विशेषज्ञों (Specialists) को प्रशिक्षित करें (प्रशिक्षु)
बड़े जनरलिस्ट को तुरंत प्रशिक्षित करने के बजाय, आप पहले छोटे, हल्के "स्पेशलिस्ट" मॉडल प्रशिक्षित करते हैं।

  • आप स्पेशलिस्ट #1 को "एनिमे स्टाइल" के कुछ उदाहरण देते हैं और उसे केवल वही सिखाते हैं।
  • आप स्पेशलिस्ट #2 को "ऑयल पेंटिंग" के कुछ उदाहरण देते हैं और उसे केवल वही सिखाते हैं।
  • आप स्पेशलिस्ट #3 को "रियलिज्म" (यथार्थवाद) के कुछ उदाहरण देते हैं और उसे केवल वही सिखाते हैं।

क्योंकि ये स्पेशलिस्ट छोटे और केंद्रित होते हैं, वे उपलब्ध डेटा की कम मात्रा से बहुत तेज़ी से और कुशलता से सीख जाते हैं। वे अपनी छोटी, विशिष्ट दुनिया के विशेषज्ञ बन जाते हैं।

चरण 2: जनरललिस्ट विशेषज्ञों से सीखता है
अब, आपके पास एक समस्या है: आपके पास अभी भी लाखों "निर्देश" (अनलेबल डेटा) हैं लेकिन कोई "उत्तर" नहीं है।

  • आप उन लाखों निर्देशों को अपने स्पेशलिस्ट्स को देते हैं।
  • स्पेशलिस्ट #1 एक निर्देश के लिए एक नकली "एनिमे" चित्र बनाता है।
  • स्पेशलिस्ट #2 दूसरे निर्देश के लिए एक नकली "ऑयल पेंटिंग" चित्र बनाता है।

इन्हें स्यूडो-सैंपल्स (Pseudo-samples) कहा जाता है। वे पूर्ण नहीं हैं, लेकिन पर्याप्त रूप से अच्छे हैं। अब, आपके पास "निर्देश + उत्पन्न उत्तर" के विशाल पुस्तकालय का एक संग्रह है।

आप अपने बड़े, शक्तिशाली जनरललिस्ट मॉडल को इस स्यूडो-सैंपल्स के विशाल पुस्तकालय (और मूल कुछ वास्तविक उदाहरणों) पर प्रशिक्षित करते हैं। जनरललिस्ट विशेषज्ञों से सीखता है, प्रभावी रूप से उनके ज्ञान को एक बड़े मस्तिष्क में "डिस्टिल" (distill) करता है।

यह एक बड़ी बात क्यों है (सिद्धांत)

लेखक एक गणितीय प्रमाण (एक "सांख्यिकीय सिद्धांत") प्रदान करते हैं जो यह दर्शाता है कि यह इतना अच्छा क्यों काम करता है।

इसे इस तरह सोचें:

  • पुराना तरीका: किसी जटिल कौशल को सीखने के लिए, आपको अभ्यास के बहुत सारे प्रयासों की आवश्यकता होती है। प्रयासों की संख्या उस चीज़ के साथ बढ़ती है जितनी जटिल वह कौशल है।
  • नया तरीका: लेखक सिद्ध करते हैं कि आपको कितने वास्तविक, महंगे अभ्यास प्रयासों की आवश्यकता है, यह केवल इस बात पर निर्भर करता है कि स्पेशलिस्ट कितने जटिल हैं, न कि इस पर कि जनरललिस्ट कितना जटिल है।

चूंकि स्पेशलिस्ट छोटे और सरल होते हैं, इसलिए आपको उन्हें प्रशिक्षित करने के लिए बहुत कम वास्तविक उदाहरणों की आवश्यकता होती है। जनरललिस्ट विशाल और जटिल है, लेकिन क्योंकि वह स्पेशलिस्ट द्वारा उत्पन्न "नकली" डेटा से सीखता है, इसलिए उसे सीखने के लिए बहुत बड़ी संख्या में वास्तविक उदाहरणों की आवश्यकता नहीं होती है।

परिणाम: आपको एक सुपर-स्मार्ट जनरललिस्ट मॉडल मिलता है जो कई कार्यों को अच्छी तरह से संभालता है, लेकिन आपको केवल छोटे, सरल मॉडलों के लिए डेटा एकत्र करने की "कीमत" चुकानी पड़ी।

वास्तविक दुनिया के परीक्षण

लेखकों ने इस विचार का दो अलग-अलग क्षेत्रों में परीक्षण किया:

  1. रोबोटिक्स: उन्होंने एक रोबोटिक हाथ को क्यूब्स को रखने और उठाने के लिए सिखाया। उन्होंने विभिन्न लाइटिंग और कैमरा एंगल के लिए छोटे स्पेशलिस्ट प्रशिक्षित किए, फिर उन स्पेशलिस्ट का उपयोग एक बड़े जनरललिस्ट को प्रशिक्षित करने के लिए किया। परिणाम? रोबोट नए, अनदेखे वातावरण (जैसे अलग रोशनी या कैमरा एंगल) को संभालने में बहुत बेहतर था, यदि उन्होंने केवल वास्तविक उदाहरणों पर बड़े रोबोट को प्रशिक्षित किया होता।
  2. इमेज रेस्टोरेशन (Image Restoration): उन्होंने क्षतिग्रस्त फोटो को ठीक करने (इनपेंटिंग) की कोशिश की। उन्होंने विभिन्न प्रकार के नुकसान (जैसे रेखाएं, फेस मास्क, या चौड़े खरोंच) को ठीक करने के लिए स्पेशलिस्ट प्रशिक्षित किए। फिर, उन्होंने उन स्पेशलिस्ट का उपयोग एक बड़े जनरललिस्ट के लिए प्रशिक्षण डेटा उत्पन्न करने के लिए किया। परिणाम यह था कि जनरललिस्ट ने सीमित वास्तविक डेटा पर प्रशिक्षित मॉडलों की तुलना में फोटो को बहुत बेहतर तरीके से ठीक किया।

निचोड़ (The Bottom Line)

यह पेपर दिखाता है कि जब आपके पास महंगे, सटीक डेटा की कमी हो, तो अपने बड़े AI को एक साथ सब कुछ सीखने के लिए मजबूर न करें। इसके बजाय, बुनियादी बातें जल्दी सीखने के लिए छोटे, सस्ते "स्पेशलिस्ट" को काम पर लगाएं, उन्हें अभ्यास सामग्री उत्पन्न करने दें, और फिर अपने बड़े "जनरललिस्ट" को उनसे सीखने के लिए सिखाएं। यह शक्तिशाली AI बनाने का एक स्मार्ट, सस्ता और अधिक कुशल तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →