← नवीनतम पेपर
🤖 machine learning

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

यह शोध पत्र "जेनरेट एनी सीन" (Generate Any Scene) को प्रस्तुत करता है, जो एक डेटा इंजन है जो स्व-सुधार (self-improvement), ज्ञान आसवन (knowledge distillation) और पुरस्कार मॉडलिंग (reward modeling) के माध्यम से टेक्स्ट-टू-विज़न मॉडलों की संरचनात्मक सामान्यीकरण (compositional generalization) और अर्थ संबंधी संरेखण (semantic alignment) में सुधार करने के लिए व्यवस्थित रूप से विविध, उच्च-गुणवत्ता वाले सीन ग्राफ-आधारित प्रशिक्षण डेटा को संश्लेषित करता है।

मूल लेखक: Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को पेंटिंग करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह आपकी कल्पना की हर चीज़ को चित्रित कर सके: "एक बैंगनी बिल्ली जिसने टॉप हैट पहनी है, और पनीर से बनी साइकिल चला रही है, जबकि बैकग्राउंड में एक ड्रैगन सैंडविच खा रहा है।"

वर्तमान रोबोट कलाकार वास्तविक चीजों को चित्रित करने में अच्छे हैं, लेकिन जब आप उनसे जटिल, अजीब या विशिष्ट संयोजन के लिए कहते हैं, तो वे अक्सर भ्रमित हो जाते हैं। वे बिल्ली तो बना सकते हैं, लेकिन साइकिल को भूल सकते हैं, या रंगों को मिला सकते हैं। ऐसा क्यों है? क्योंकि उनके द्वारा सीखे गए "पाठ्यपुस्तकें" (इंटरनेट डेटासेट) अव्यवस्थित हैं। वे साधारण, रैंडम फोटो से भरी हुई हैं जिनके कैप्शन अस्पष्ट जैसे "एक कुत्ता" या "एक सूर्यास्त" हैं, लेकिन इसमें बहुत कम विस्तृत निर्देश हैं कि वस्तुएं आपस में कैसे जुड़ती हैं।

यह पेपर एक नया टूल पेश करता है जिसे Generate Any Scene (GAS) कहा जाता है। GAS को केवल एक चित्रकार के रूप में नहीं, बल्कि एक अत्यधिक व्यवस्थित आर्किटेक्ट और लाइब्रेरियन के रूप में सोचें जो इन रोबोट कलाकारों के लिए आदर्श प्रशिक्षण मैनुअल बनाता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. ब्लूप्रिंट: सीन ग्राफ्स (Scene Graphs)

केवल एक वाक्य लिखने के बजाय, GAS "सीन ग्राफ्स" नामक ब्लूप्रिंट्स में सोचता है।

  • उपमा: कल्पना कीजिए कि यह एक लेगो (Lego) सेट है। एक सीन ग्राफ वह निर्देश पुस्तिका है जो हर एक ईंट (वस्तु), उसके रंग और आकार (विशेषताएं), और वे बिल्कुल कैसे आपस में जुड़ते हैं (संबंध) को सूचीबद्ध करती है।
  • समस्या: वास्तविक दुनिया की तस्वीरें फर्श पर फेंके गए तैयार लेगो के ढेर की तरह हैं। आप परिणाम देख सकते हैं, लेकिन आप यह नहीं जानते कि उन्हें वास्तव में कैसे जोड़ा गया था।
  • समाधान: GAS प्रोग्रामेटिक रूप से ऐसे लाखों ब्लूप्रिंट बनाता है। इसके पास 28,000 वस्तुओं, 1,000 विशेषणों और चीजों के संबंधित होने के 10,000 तरीकों का एक विशाल पुस्तकालय है। यह उन्हें मिलाने और जोड़ने के लिए इनका उपयोग करके अनंत, पूरी तरह से संरचित परिदृश्य बना सकता है, जैसे "मैट पर एक बिल्ली" से लेकर "लाइब्रेरी में टकराता हुआ एक स्पेसशिप" तक।

2. GAS की चार महाशक्तियाँ

पेपर दिखाता है कि यह "आर्किटेक्ट" AI को बेहतर बनाने में चार तरीकों से मदद करता है:

A. स्व-सुधार लूप (The "Practice Makes Perfect" Gym)

  • कैसे काम करता है: AI एक GAS ब्लूप्रिंट के आधार पर एक दृश्य बनाने की कोशिश करता है। यदि वह गलती करता है, तो GAS ब्लूप्रिंट की जांच करता है, देखता है कि क्या छूट गया था, और कहता है, "फिर से कोशिश करो, लेकिन इस बार साइकिल पर ध्यान केंद्रित करो।"
  • परिणाम: AI इन सिंथेटिक ब्लूप्रिंट्स पर अभ्यास करता है और वास्तविक फोटो देखने की तुलना में जटिल निर्देशों का पालन करने में बेहतर हो जाता है। यह एक सख्त शिक्षक के साथ अभ्यास करने जैसा है जो उन्हें विशिष्ट ड्रिल देता है, न कि केवल रैंडम वीडियो देखने जैसा।

B. "चोरी करने" की तकनीक (Distillation)

  • कैसे काम करता है: कुछ महंगे, क्लोज्ड-सोर्स AI मॉडल (जैसे DALL-E 3) कई वस्तुओं वाले जटिल दृश्यों को बनाने में अद्भुत हैं। ओपन-सोर्स मॉडल (जैसे Stable Diffusion) अच्छे हैं लेकिन जटिलता में संघर्ष करते हैं।
  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ (DALL-E 3) और एक प्रतिभाशाली होम कुक (Stable Diffusion) हैं। होम कुक एक जटिल 10-कोर्स मील बनाना सीखना चाहता है। अकेले प्रयास करने के बजाय, वह मास्टर शेफ को वह विशिष्ट भोजन बनाते हुए देखता है और उनकी तकनीक की नकल करता है।
  • परिणाम: GAS "मेन्यू" (जटिल प्रॉम्प्ट) बनाता है, मास्टर शेफ भोजन पकाता है, और होम कुक उससे तकनीक सीखता है। ओपन-सोर्स मॉडल अचानक जटिल दृश्यों को संभालने में बहुत बेहतर हो जाता है, लगभग महंगे मॉडल के बराबर पहुँच जाता है।

C. "सत्य का पता लगाने वाला" (Reward Modeling)

  • कैसे काम करता है: AI को प्रशिक्षित करते समय, हमें यह कहने के लिए एक तरीके की आवश्यकता होती है कि "अच्छा काम किया!" या "बुरा काम किया!", आमतौर पर लोगों से चित्रों को देखने के लिए कहकर। यह धीमा और महंगा है।
  • उपमा: हर ड्राइंग को ग्रेड देने के लिए इंसानों को काम पर रखने के बजाय, GAS एक सख्त गणित शिक्षक की तरह कार्य करता है। क्योंकि GAS को ब्लूप्रिंट (सीन ग्राफ) का पता है, इसलिए यह स्वचालित रूप से एक क्विज़ बना सकता है: "क्या बिल्ली बैंगनी है? क्या साइकिल पनीर से बनी है?" यह तुरंत क्विज़ के उत्तरों के विरुद्ध AI के ड्राइंग की जांच करता है।
  • परिणाम: AI बहुत तेज़ी से और अधिक सटीकता से सीखता है क्योंकि उसे केवल एक सामान्य "अच्छा दिखता है" के बजाय हर एक विवरण पर तत्काल, सटीक फीडबैक मिलता है।

D. "नकली पकड़ने वाला" (Content Moderation)

  • कैसे काम करता है: जैसे-जैसे AI वास्तविकता की नकल करने में बेहतर होता जा रहा है, हमें नकली चीजों को पकड़ने के लिए बेहतर डिटेक्टरों की आवश्यकता है। लेकिन डिटेक्टर अक्सर केवल "सामान्य" नकली चीजों पर प्रशिक्षित होते हैं।
  • उपमा: यदि आप केवल नकली 20केनोटोंकोपहचाननेकेलिएसुरक्षागार्डकोप्रशिक्षितकरतेहैं,तोवेनकली20 के नोटों को पहचानने के लिए सुरक्षा गार्ड को प्रशिक्षित करते हैं, तो वे नकली 50 के नोट को मिस कर सकते हैं। GAS "अजीब" और "जटिल" नकली चित्र (जैसे पनीर की बाइक पर बैंगनी बिल्ली) उत्पन्न करता है ताकि सुरक्षा गार्ड को प्रशिक्षित किया जा सके।
  • परिणाम: डिटेक्टर बहुत स्मार्ट हो जाता है और किसी भी AI मॉडल से नकली चीजों को पकड़ सकता है, यहाँ तक कि उन मॉडलों से भी जिन्हें उसने पहले कभी नहीं देखा है, क्योंकि उसने अजीब चीजों को भी देखा है।

यह क्यों महत्वपूर्ण है

सबसे बड़ी बात नियंत्रण और संरचना है।

वर्तमान AI एक ऐसे छात्र की तरह है जिसने लाखों पत्रिकाओं को सरसरी तौर से पढ़कर सीखा है। वे जानते हैं कि "कुत्ता" कैसा दिखता है, लेकिन वे यह नहीं समझते कि एक कुत्ता कुर्सी पर बैठने के नियम क्या हैं।

Generate Any Scene AI को एक संरचित पाठ्यक्रम देता है। यह AI को दुनिया के तर्क (वस्तुएं, विशेषताएं, संबंध) को सीखने के लिए मजबूर करता है, न कि केवल पैटर्न को याद करने के लिए। यह AI को अंततः उन जटिल, रचनात्मक और विशिष्ट दृश्यों को समझने और उत्पन्न करने की अनुमति देता है जिन्हें मनुष्य वास्तव में देखना चाहते हैं।

संक्षेप में: GAS अराजक इंटरनेट को एक संरचित, अनंत कक्षा में बदल देता है जहाँ AI ठीक वही बनाने के लिए सीख सकता है जो आप उससे मांगते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →