← नवीनतम पेपर
🤖 AI

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

यह शोध पत्र ProductWebGen को प्रस्तुत करता है, जो एक बेंचमार्क और डेटासेट है जिसे स्रोत छवियों और टेक्स्ट प्रॉम्प्ट्स से सुसंगत, निर्देश-अनुसरण करने वाले उत्पाद वेबपेज बनाने में मल्टीमॉडल जनरेटिव मॉडल्स की क्षमताओं का मूल्यांकन और तुलना करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक स्टोर के मालिक हैं जिसने अभी-अभी एक नए उत्पाद, जैसे कि दौड़ने वाले जूतों (running shoes) की एक शानदार फोटो ली है। आप इस जूते को अपनी वेबसाइट पर डालना चाहते हैं, लेकिन आप केवल एक तस्वीर नहीं चाहते; आप एक पूरा पेज चाहते हैं जो जूते को अलग-अलग कोणों से दिखाए, एक शानदार बैकग्राउंड हो, हर फोटो पर एक विशिष्ट लोगो हो, और कीमतों एवं "Buy Now" बटन के साथ एक अच्छी तरह से डिज़ाइन किया गया लेआउट हो।

यह सब मैन्युअल रूप से करने में घंटों लग जाते हैं। यह पेपर एक नए टूल ProductWebGen के बारे में बताता है, जो एक "सुपर-ऑटोमेटेड वेब डिज़ाइनर" की तरह काम करता है जो इस काम को आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करके तुरंत करने की कोशिश करता है।

यहाँ इस पेपर का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. बड़ी चुनौती: "दो सिरों वाला" कार्य (The "Two-Headed" Task)

पेपर बताता है कि AI से वेबपेज बनाने के लिए कहना एक शेफ से एक साथ दो बहुत अलग काम करने के लिए कहने जैसा है:

  1. रेसिपी लिखें (कोड): AI को HTML कोड (डिजिटल निर्देश) लिखना होगा जो ब्राउज़र को बताता है कि टेक्स्ट, रंग और बटनों को कैसे व्यवस्थित किया जाए।
  2. भोजन पकाएं (इमेज): AI को उत्पाद की नई तस्वीरें भी बनानी होंगी। ये केवल रैंडम तस्वीरें नहीं होनी चाहिए; इन्हें मूल जूते जैसा ही दिखना चाहिए, अलग-अलग कोणों से, समान लाइटिंग के साथ, और शायद हर एक फोटो में एक विशिष्ट वॉटरमार्क भी जोड़ा गया हो।

पेपर नोट करता है कि वर्तमान AI मॉडल एक या दूसरे में अच्छे हैं, लेकिन शायद ही कभी दोनों को एक साथ पूरी तरह से कर पाते हैं।

2. नया बेंचमार्क: AI के लिए एक "टेस्ट ऑफ टेस्ट" (A "Taste Test" for AI)

यह देखने के लिए कि कौन सा AI सबसे अच्छा "शेफ" है, शोधकर्ताओं ने एक बेंचमार्क (एक मानकीकृत परीक्षण) बनाया।

  • मेन्यू: उन्होंने 500 टेस्ट केस एकत्र किए जो 13 विभिन्न प्रकार के उत्पादों (भोजन, कपड़े, इलेक्ट्रॉनिक्स आदि) को कवर करते हैं।
  • ऑर्डर: प्रत्येक टेस्ट AI को एक मूल फोटो और एक विशिष्ट निर्देश देता है: "एक वेबपेज बनाएं। बैकग्राउंड लकड़ी की मेज होनी चाहिए। कपड़ों को पहने हुए मॉडल हर फोटो में वही व्यक्ति होना चाहिए। लोगो ऊपर-दाएं कोने में होना चाहिए।"
  • लक्ष्य: AI को पूर्ण वेबपेज कोड और वे नई छवियां जेनरेट करनी होंगी जो इन सख्त नियमों का पालन करती हों।

3. दो रणनीतियाँ: "असेंबली लाइन" बनाम "वन-मैन बैंड"

शोधकर्ताओं ने इस समस्या को हल करने के दो अलग-अलग तरीके आजमाए:

  • रणनीति A: असेंबली लाइन (एडिटिंग-आधारित)

    • यह कैसे काम करता है: पहले, एक "टेक्स्ट एक्सपर्ट" (Large Language Model) वेबपेज कोड लिखता है और यह वर्णन करता है कि नई तस्वीरें कैसी दिखनी चाहिए। फिर, एक "पिक्चर एडिटर" (Image Editing Model) मूल फोटो और उस विवरण को लेकर नई छवियां बनाता है।
    • उपमा: यह एक फैक्ट्री की तरह है जहाँ एक कर्मचारी ब्लूप्रिंट लिखता है, और दूसरा कर्मचारी उस ब्लूप्रिंट के आधार पर पुर्जे बनाता है।
    • परिणाम: यह तरीका लेआउट निर्देशों (वेबपेज को अच्छा दिखाने) और कोड लिखने में बहुत अच्छा था, लेकिन कभी-कभी तस्वीरें एक-दूसरे के साथ पूरी तरह से सुसंगत (consistent) नहीं थीं।
  • रणनीति B: वन-मैन बैंड (यूनिफाइड मॉडल)

    • यह कैसे काम करता है: एक ही शक्तिशाली AI मॉडल एक साथ सब कुछ करने की कोशिश करता है। यह मूल फोटो और निर्देशों को देखता है, और फिर एक निरंतर प्रवाह में कोड और नई छवियां जेनरेट करता है।
    • उपमा: यह एक एकल कलाकार की तरह है जो गाना लिखता है, बोल गाता है और गिटार भी बजाता है।
    • परिणाम: यह तरीका तस्वीरों को सुसंगत रखने में बहुत बेहतर था (उदाहरण के लिए, यह सुनिश्चित करना कि सभी फोटो में एक ही व्यक्ति दिखाई दे), लेकिन यह वेबपेज लेआउट के लिए जटिल कोड लिखने में संघर्ष करता रहा।

4. विजेता और हारने वाले

  • चैंपियन: एक क्लोज्ड-सोर्स मॉडल जिसका नाम Gemini-2.5-Flash-Image है, ओवरऑल विनर रहा। यह एकमात्र मॉडल था जो जटिल कोड और कठिन इमेज कंसिस्टेंसी दोनों को लगभग पूरी तरह से संभाल सकता था।
  • अंतर: इस "चैंपियन" और सर्वश्रेष्ठ ओपन-सोर्स मॉडल्स (वे मॉडल जिन्हें कोई भी मुफ्त में डाउनलोड कर सकता है) के बीच एक बड़ा अंतर था। ओपन-सोर्स मॉडल्स अक्सर गलतियाँ करते थे, जैसे कि दूसरे फोटो में व्यक्ति का चेहरा बदल देना या टूटा हुआ कोड लिखना।

5. ट्रेनिंग समाधान: "छात्र को पढ़ाना" (Teaching the Student)

शोधकर्ताओं ने महसूस किया कि ओपन-सोर्स मॉडल इसलिए संघर्ष कर रहे थे क्योंकि उन्हें इस विशिष्ट कार्य के लिए प्रशिक्षित नहीं किया गया था।

  • समाधान: उन्होंने एक नया डेटासेट बनाया जिसे ProductWebGen-1k कहा जाता है। इसे एक "पाठ्यपुस्तक" के रूप में सोचें जिसमें 1,000 आदर्श उत्पाद वेबपेज शामिल हैं जिनमें सही कोड और इमेज हैं।
  • परिणाम: उन्होंने एक ओपन-सोर्स मॉडल (BAGEL) को इस "पाठ्यपुस्तक" के साथ "फाइन-ट्यूनिंग" (अध्ययन) कराया। इसके बाद, मॉडल में काफी सुधार हुआ। वह एक भ्रमित छात्र से एक सक्षम डिजाइनर बन गया, जिससे उसकी निर्देशों का पालन करने और वेबपेज को अच्छा बनाने की क्षमता में सुधार हुआ।

सारांश

यह पेपर यह दावा नहीं करता कि यह तकनीक बीमारियों का इलाज करेगी या विश्व भूख मिटा देगी। इसके बजाय, यह कहता है:

  1. हमारे पास AI को उत्पाद वेबपेज बनाने के लिए एक नया, कठिन परीक्षण है।
  2. वर्तमान में, सबसे अच्छा AI (Gemini) इसमें बहुत अच्छा है, लेकिन मुफ्त मॉडल्स को अधिक प्रशिक्षण की आवश्यकता है।
  3. मुफ्त मॉडल्स को विशिष्ट उदाहरणों की एक "पाठ्यपुस्तक" देकर, हम उन्हें सुसंगत उत्पाद चित्र बनाने और बेहतर वेबपेज बनाने में बहुत बेहतर बना सकते हैं।

पेपर निष्कर्ष निकालता है कि हालांकि हम करीब पहुँच रहे हैं, फिर भी इस विशिष्ट, जटिल कार्य के मामले में "सुपर-स्मार्ट" पेड AI और "स्मार्ट" फ्री AI के बीच एक बड़ा अंतर बना हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →