← नवीनतम पेपर
💻 computer science

BlendFusion -- Scalable Synthetic Data Generation for Diffusion Model Training

BlendFusion एक स्केलेबल, ओपन-सोर्स फ्रेमवर्क है जो डिफ्यूजन मॉडल ट्रेनिंग में मॉडल ऑटोफैगी डिसऑर्डर (MAD) को कम करने के लिए पाथ ट्रेसिंग और ऑब्जेक्ट-सेंट्रिक कैमरा प्लेसमेंट का उपयोग करके 3D दृश्यों से उच्च-गुणवत्ता वाले सिंथेटिक इमेज-कैप्शन डेटासेट उत्पन्न करता है।

मूल लेखक: Thejas Venkatesh, Suguna Varshini Velury

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thejas Venkatesh, Suguna Varshini Velury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पेंटिंग करना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको उसे लाखों तस्वीरें दिखानी होंगी जिनके साथ विवरण हों जैसे "एक लकड़ी की मेज पर लाल सेब।"

लंबे समय से, हम इंटरनेट से इन तस्वीरों को इकट्ठा कर रहे हैं। लेकिन इंटरनेट अव्यवस्थित है, कॉपीराइट के मुद्दों से भरा है, और कभी-कभी विवरण भी गलत होते हैं। इसलिए वैज्ञानिकों ने खुद AI का उपयोग करके इन तस्वीरों को बनाने की कोशिश शुरू की।

लेकिन यहाँ एक समस्या है: यदि आप एक AI को दूसरी AI द्वारा बनाई गई तस्वीरों का उपयोग करके पेंटिंग करना सिखाते हैं, तो यह एक फोटोकॉपी मशीन द्वारा फोटोकॉपी की नकल करने जैसा है। हर बार जब आप नकल करते हैं, तो छवि थोड़ी धुंधली होती जाती है, रंग अजीब हो जाते हैं, और अंत में, तस्वीर एक कीचड़ जैसी गंदगी में बदल जाती है। इसे "मॉडल ऑटोफैगी डिसऑर्डर" (या MAD) कहा जाता है—मूल रूप से, AI अपनी ही पूंछ खा रहा है और खुद को भूखा मारकर खत्म कर रहा है।

पेश है BlendFusion।

इस शोध पत्र के लेखकों, थेजस और सुगुना ने इन प्रशिक्षण चित्रों को बनाने के लिए एक नया किचन बनाया है। "जादुई AI छड़ी" (डिफ्यूजन मॉडल) का उपयोग करके शून्य से चित्र पैदा करने के बजाय, उन्होंने 3-डी कंप्यूटर ग्राफिक्स का उपयोग करके एक आभासी फोटोग्राफी स्टूडियो बनाने का निर्णय लिया।

यहाँ बताया गया है कि उनका सिस्टम, BlendFusion, कैसे काम करता है, जिसे कुछ सरल उपमाओं के साथ समझाया गया है:

1. सेट डिज़ाइनर (3D दृश्य)

यह अनुमान लगाने के बजाय कि कोई दृश्य कैसा दिखता है, वे किसी कमरे या सड़क के वास्तविक 3D मॉडल (जैसे एक वीडियो गेम लेवल) से शुरुआत करते हैं। इसे एक वास्तविक भौतिक सेट बनाने जैसा समझें जिसमें असली फर्नीचर, असली रोशनी और असली छाया हो। क्योंकि यह भौतिकी (physics) के साथ बनाया गया है, इसलिए इसकी ज्यामिति (geometry) एकदम सटीक है। एक कुर्सी के चार पैर होते हैं; एक मेज का ऊपरी हिस्सा सपाट होता है। यहाँ कोई अजीब AI मतिभ्रम (hallucinations) नहीं है।

2. स्मार्ट फोटोग्राफर (ऑब्जेक्ट-सेंट्रिक कैमरा)

यदि आप बस एक कमरे में रैंडम तरीके से कैमरा फेंक देंगे, तो हो सकता है कि आप छत की, एक खाली दीवार की, या सोफे के पीछे छिपी हुई कुर्सी की तस्वीर ले लें। यह एक रोबोट को सिखाने के लिए बेकार है।

BlendFusion एक "स्मार्ट फोटोग्राफर" रणनीति का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि एक फोटोग्राफर है जो एक विशिष्ट वस्तु, मान लीजिए एक फूलदान (vase) के प्रति जुनूनी है। बिना किसी उद्देश्य के भटकने के बजाय, फोटोग्राफर उस फूलदान के चारों ओर एक पूर्ण घेरे में घूमता है, हर कोण से तस्वीरें लेता है।
  • परिणाम: सिस्टम यह सुनिश्चित करता है कि कैमरा हमेशा वस्तु को पूरी तरह से फ्रेम करे, जिससे यह सुनिश्चित हो सके कि फूलदान ही मुख्य आकर्षण बना रहे, न कि बैकग्राउंड। यह गारंटी देता है कि हर फोटो वास्तव में किसी चीज़ के बारे में है।

3. बाउंसर (फिल्टरिंग)

स्मार्ट फोटोग्राफर होने के बावजूद, कुछ तस्वीरें बहुत अंधेरी, बहुत धुंधली या खाली हो सकती हैं।

  • हेयुरिस्टिक बाउंसर (Heuristic Bouncer): यह एक साधारण नियम-जांचकर्ता है। "क्या तस्वीर बहुत अंधेरी है? इसे बाहर निकालो।" "क्या वस्तु अदृश है? इसे बाहर निकालो।"
  • VLM बाउंसर: यह एक सुपर-स्मार्ट AI सहायक है जो फोटो को देखता है और पूछता है, "क्या मैं वास्तव में इसका वर्णन कर सकता हूँ?" यदि फोटो बहुत भ्रमित करने वाली है या वस्तु कटी हुई है, तो बाउंसर कहता है, "नहीं, इसे डिलीट करो।"

4. रिपोर्टर (कैप्शनिंग)

एक बार जब अच्छी तस्वीरें चुन ली जाती हैं, तो सिस्टम को एक विवरण की आवश्यकता होती है। इंसानों द्वारा इसे लिखने (जो धीमा और महंगा है) के बजाय, वे एक AI रिपोर्टर का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि एक सख्त पत्रकार को निर्देश दिया गया है: "केवल वही लिखें जो आप स्पष्ट रूप से देख सकते हैं। अनुमान न लगाएं। मनगढ़ंत बातें न बनाएं।"
  • परिणाम: सिस्टम एक छोटा, तथ्यात्मक वाक्य बनाता है जैसे "धूप वाले कमरे में एक लकड़ी की कुर्सी।" क्योंकि फोटो को 3D दुनिया में बनाया गया था, इसलिए AI रिपोर्टर जानता है कि वहां वास्तव में क्या है, इसलिए विवरण 100% सटीक है।

5. क्यूरेटर (विविधता सैंपलिंग)

अंत में, सिस्टम के पास हजारों तस्वीरें हैं। लेकिन यदि आपके पास एक ही कुर्सी की एक ही कोण से 1,000 तस्वीरें हैं, तो वह उबाऊ है।

  • उपमा: कल्पना कीजिए कि एक संग्रहालय क्यूरेटर है। वे तस्वीरों के ढेर को देखते हैं और कहते हैं, "हमारे पास लाल कुर्सियों की बहुत अधिक तस्वीरें हैं। आइए नीली वाली, लकड़ी वाली और बारिश में वाली कुर्सी को रखें, और डुप्लिकेट्स को हटा दें।"
  • परिणाम: वे अंततः एक विविध, उच्च-गुणवत्ता वाला संग्रह प्राप्त करते हैं जिसे FineBLEND कहा जाता है।

यह "जादुई छड़ी" (Diffusion) से बेहतर क्यों है?

पेपर उनकी 3D तस्वीरों की तुलना मानक AI (जैसे Stable Diffusion) द्वारा बनाई गई तस्वीरों से करता है।

  • जादुई छड़ी: अनुमान लगाने की कोशिश करती है कि "पार्किंग साइन" कैसा दिखता है। कभी-कभी यह एक ऐसा साइन बनाती है जिस पर "PARKING" लिखा होता है लेकिन अक्षर उल्टे होते हैं, या साइन फुटपाथ में पिघल रहा होता है।
  • 3D स्टूडियो: एक वास्तविक 3D साइन बनाता है। अक्षर एकदम सही होते हैं। साइन सीधा खड़ा होता है।

मुख्य निष्कर्ष

लेखकों ने FineBLEND (7,500 चित्र) नामक एक डेटासेट बनाया है ताकि यह साबित किया जा सके कि AI को दूसरे AI की नकल करने देने के बजाय एक "आभासी स्टूडियो" बनाना एक सुरक्षित और स्वच्छ तरीका है।

चुनौती:
वर्तमान में, उनका डेटासेट उन विशाल डेटासेट्स की तुलना में छोटा है जिनका उपयोग सबसे बड़े AI को प्रशिक्षित करने के लिए किया जाता है (जिनमें अरबों चित्र होते हैं)। यह ऐसा है जैसे उन्होंने एक बेहतरीन, हाई-एंड रेस्टोरेंट बनाया है लेकिन उनके पास केवल 7,500 लोगों को खिलाने के लिए पर्याप्त भोजन है। उन्हें उम्मीद है कि भविष्य में, वे इसे लाखों तक बढ़ा पाएंगे।

संक्षेप में:
यदि AI को प्रशिक्षित करना एक बच्चे को चित्र बनाना सिखाने जैसा है, तो BlendFusion बच्चे को दूसरे चित्रों की धुंधली फोटोकॉपी की नकल करने के बजाय, ट्रेस करने के लिए वास्तविक, पूर्ण प्लास्टिक मॉडल देने जैसा है। यह सबक को स्पष्ट, सटीक और उन "कॉपी-पेस्ट" त्रुटियों से मुक्त रखता है जो AI को पागल बना देती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →