← नवीनतम पेपर
🤖 machine learning

Personalized Image Generation via Human-in-the-loop Bayesian Optimization

यह शोध पत्र MultiBO को प्रस्तुत करता है, जो एक मल्टी-चॉइस प्रिफरेंशियल बेयसियन ऑप्टिमाइज़ेशन फ्रेमवर्क है जो डिफ्यूजन मॉडल्स को उपयोगकर्ता की विशिष्ट मानसिक छवि की ओर निर्देशित करने के लिए पुनरावृत्ति मानव प्राथमिकता फीडबैक का लाभ उठाता है, जिससे केवल भाषा प्रॉम्प्ट्स द्वारा छोड़े गए अंतर को प्रभावी ढंग से भरा जा सके।

मूल लेखक: Rajalaxmi Rajagopalan, Debottam Dutta, Yu-Lin Wei, Romit Roy Choudhury

प्रकाशित 2026-02-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rajalaxmi Rajagopalan, Debottam Dutta, Yu-Lin Wei, Romit Roy Choudhury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके दिमाग में एक बहुत ही विशिष्ट चित्र है। शायद यह वह सटीक दृश्य है जहाँ आप बड़े हुए थे, या किसी काल्पनिक जीव का चित्र जिसमें बहुत विशिष्ट रंग हैं। आप इस चित्र को एक शक्तिशाली AI कलाकार को शब्दों (एक "प्रॉम्ट") के माध्यम से समझाने की कोशिश करते हैं। AI अपना सर्वश्रेष्ठ प्रयास करता है और एक छवि देता है। यह करीब तो है, लेकिन पूरी तरह से सही नहीं है। आप और अधिक शब्दों के साथ इसे ठीक करने की कोशिश करते हैं, लेकिन आप एक दीवार से टकरा जाते हैं: उन सूक्ष्म विवरणों को बदलने के लिए पर्याप्त शब्द नहीं हैं जिन्हें आपको बदलने की आवश्यकता है।

यह शोध पत्र इस अंतर को पाटने का एक नया तरीका पेश करता है। केवल AI से बात करने के बजाय, आप इसके साथ "हॉट एंड कोल्ड" (नजदीक या दूर) का खेल खेलते हैं, लेकिन एक चतुर मोड़ के साथ।

MultiBO कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:

1. समस्या: "शब्दों की सीमा"

AI को एक ऐसे शेफ (रसोइया) के रूप में सोचें जो एक सीमित भाषा बोलता है। आप चाहते हैं कि व्यंजन बिल्कुल आपकी दादी के गुप्त नुस्खे जैसा हो। आप शेफ से कहते हैं, "इसे और तीखा बनाओ," और वे अधिक काली मिर्च डाल देते हैं। लेकिन शायद आप अधिक काली मिर्च नहीं चाहते थे; आप एक विशिष्ट प्रकार की जड़ी-बूटी चाहते थे। आप शब्दों के माध्यम से अंतर को स्पष्ट नहीं कर सकते। जो आप अपने मन में देखते हैं और जो AI बनाता है, उसके बीच का अंतर केवल भाषा के लिए बहुत बड़ा है।

2. समाधान: "टेस्ट टेस्ट" गेम

AI से आपके शब्दों का अनुमान लगाने के लिए कहने के बजाय, यह शोध पत्र सुझाव देता है कि AI से एक साथ एक ही समय में छवि के चार अलग-अलग संस्करण दिखाने के लिए कहें।

  • पुराना तरीका: AI आपको एक छवि दिखाता है। आप कहते हैं, "नहीं।" AI दूसरी छवि दिखाता है। आप कहते हैं, "नहीं।" इसमें बहुत समय लगता है और यह निराशाजनक हो जाता है।
  • MultiBO का तरीका: AI आपको एक साथ चार छवियां दिखाता है। आप बस उस एक को चुनते हैं जो आपके मानसिक चित्र के सबसे करीब दिखता है। आपको यह समझाने की ज़रूरत नहीं है कि क्यों; आप बस विजेता को चुनते हैं।

3. गुप्त नुस्खा: "जादुई दिशा-सूचक यंत्र" (Bayesian Optimization)

AI आपके चुनाव से सीखने के लिए एक स्मार्ट गणितीय उपकरण का उपयोग करता है जिसे Bayesian Optimization कहा जाता है।

  • कल्पना करें कि आप एक धुंधले पहाड़ की श्रृंखला में सबसे ऊँची चोटी को खोजने की कोशिश कर रहे हैं (आपका आदर्श चित्र)। आप पूरे पहाड़ को नहीं देख सकते।
  • हर बार जब आप चार विकल्पों में से एक विजेता चुनते हैं, तो AI को एक "दिशा-सूचक संकेत" मिलता है। यह सीखता है, "ठीक है, शिखर संभवतः उस दिशा में है, इस दिशा में नहीं।"
  • शोध पत्र का विशेष तरीका यह है कि आपको केवल दो के बजाय चार विकल्प देकर, आप AI को एक बहुत मजबूत दिशा-सूचक संकेत देते हैं। यह तेजी से सीखता है और कम चरणों में पहाड़ की चोटी (आपके आदर्श चित्र) तक पहुँच जाता है।

4. "स्टीयरिंग व्हील" (Self-Attention Warping)

आप सोच सकते हैं: "AI वास्तव में चित्र को कैसे बदलता है?"

  • आमतौर पर, AI मॉडल हजारों छोटे बटनों वाली विशाल, जटिल मशीनों की तरह होते हैं। उन्हें बेतरतीब ढंग से घुमाना धीमा और अव्यवस्थित होता है।
  • MultiBO सभी बटनों को नहीं छूता है। यह मशीन के एक विशिष्ट भाग पर ध्यान केंद्रित करता है जिसे "Self-Attention" लेयर कहा जाता है। इसे AI का "फोकस लेंस" समझें।
  • पूरी छवि को फिर से बनाने के बजाय, MultiBO उन विशेषताओं को धीरे से वार्प (warps) करता है (खींचता, खिसकाता या मोड़ता है) जिन्हें AI पहले से ही देख रहा है। यह एक फोटो लेने और फिर उसे एक फन-हाउस मिरर (अजीब दिखने वाले दर्पण) का उपयोग करके नाक के आकार या मुस्कान के वक्र को बदलने जैसा है, न कि एक नया चेहरा बनाने की कोशिश करने जैसा। यह बदलावों को सटीक और तेज़ बनाता है।

5. परिणाम: एक व्यक्तिगत उत्कृष्ट कृति

इस शोध पत्र का परीक्षण वास्तविक लोगों के साथ किया गया।

  • सेटअप: लोगों के मन में एक लक्षित छवि थी और एक शुरुआती छवि थी जो "ठीक" थी लेकिन पूर्ण नहीं थी।
  • प्रक्रिया: लोगों को छवियों के समूह दिखाए गए। लोगों ने अपने पसंदीदा को चुना। AI ने उन चुनावों का उपयोग अपने "फोकस लेंस" को बदलने और नए, बेहतर समूहों को उत्पन्न करने के लिए किया।
  • परिणाम: लगभग 50 राउंड के इस सरल "सबसे अच्छा चुनें" गेम के बाद, AI ने एक ऐसी छवि बनाई जो उल्लेखनीय रूप से उस व्यक्ति के मन में मौजूद विचार के करीब थी।

यह क्यों विशेष है?

  • कोई प्रशिक्षण आवश्यक नहीं: AI को फिर से सिखाने या हजारों नए उदाहरण खिलाने की आवश्यकता नहीं थी। इसने सीधे आपसे रीयल-टाइम में सीखा।
  • मेट्रिक्स को मात देना: अक्सर, AI एक गणितीय स्कोर (जैसे, "यह कितना सुंदर है?") के लिए अनुकूलित होने की कोशिश करता है। लेकिन इंसान "मैंने वास्तव में क्या चाहा था" के बेहतर निर्णायक होते हैं। MultiBO कंप्यूटर स्कोर के बजाय इंसान को जज के रूप में उपयोग करता है, और यह कंप्यूटर स्कोर पर निर्भर तरीकों से बेहतर काम करता है।
  • दक्षता: एक साथ 4 विकल्प दिखाकर और केवल "फोकस लेंस" को बदलकर, इसने उपयोगकर्ता को इंतज़ार कराए बिना काम को जल्दी पूरा कर दिया।

संक्षेप में: MultiBO इमेज जनरेशन को एक निराशाजनक बातचीत से बदलकर "सबसे अच्छा चुनें" के एक सरल खेल में बदल देता है, जो आपके द्वारा कल्पना की गई चीज़ पर तेज़ी से सटीक होने के लिए स्मार्ट गणित का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →