← नवीनतम पेपर
🤖 AI

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

यह शोध पत्र LongWebBench प्रस्तुत करता है, जो विज़न-लैंग्वेज मॉडल्स द्वारा लॉन्ग-होराइजन वेबपेज जनरेशन की संरचनात्मक निष्ठा और कार्यात्मक निष्पादन क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक प्रणालियाँ दृश्य सुसंगतता के बावजूद दीर्घकालिक सामंजस्य और संवादात्मक क्षमताओं के साथ संघर्ष करती हैं।

मूल लेखक: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

प्रकाशित 2026-06-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली वास्तुकार (आर्किटेक्ट) को एक हवेली की एक विशाल तस्वीर के आधार पर एक घर बनाने के लिए काम पर रख रहे हैं।

समस्या:
अब तक, AI "वास्तुकारों" (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) के लिए अधिकांश परीक्षणों में केवल उन्हें छोटे, एक कमरे वाले कॉटेज बनाने के लिए कहा गया था। वे परीक्षण यह देखते थे कि क्या सामने का दरवाजा सही दिखता है या पेंट का रंग मेल खाता है या नहीं। लेकिन वास्तविक वेबसाइटें विशाल हवेलियों की तरह होती हैं जिनमें दर्जनों कमरे, कई मंजिलें और जटिल वायरिंग होती है। यदि आप किसी AI को एक फोटो से पूरी हवेली बनाने के लिए कहते हैं, तो हो सकता है कि वह सामने का दरवाजा तो सही बना दे, लेकिन यह भूल जाए कि सीढ़ियों को दूसरी मंजिल से कैसे जोड़ा जाए, या एक ऐसा किचन बना दे जो दिखने में तो असली लगे लेकिन उसमें कोई काम करने वाला सिंक न हो।

समाधान: LongWebBench
इस शोध पत्र के लेखकों ने एक नया, अधिक कठिन परीक्षण बनाया जिसे LongWebBench कहा जाता है। इसमें केवल यह जांचने के बजाय कि क्या घर फोटो जैसा दिखता है, वे दो चीजें जांचते हैं:

  1. ब्लूप्रिंट (संरचना): क्या पूरी इमारत समझ में आने योग्य है? क्या कमरे सही क्रम में हैं? क्या छत दीवारों से जुड़ी हुई है?
  2. प्लंबिंग और बिजली (कार्यक्षमता): यदि आप नल खोलते हैं, तो क्या पानी आता है? यदि आप लाइट का स्विच दबाते हैं, तो क्या लाइट जलती है?

उन्होंने यह परीक्षण कैसे बनाया:
उन्होंने वास्तविक दुनिया के दो विशाल "हवेली फोटो" (लंगे वेबपेज) संग्रह एकत्र किए:

  • 490 "लुक-अलाइक" (दिखने में समान) परीक्षण: उन्होंने बहुत लंबी वेबसाइटों की तस्वीरें लीं (कुछ इतनी लंबी कि नीचे तक देखने के लिए आपको 30 स्क्रीन तक स्क्रॉल करना पड़ेगा)। उन्होंने AI मॉडल से उन पेजों के लिए कोड को फिर से बनाने के लिए कहा। परीक्षण ने यह जांचा कि क्या AI पूरे पेज के ऊपर से लेकर बिल्कुल नीचे तक लेआउट को सुसंगत बनाए रख सकता है।
  • 507 "डू-इट" (करके दिखाओ) परीक्षण: उन्होंने 129 वेबसाइटों को चुना और AI को विशिष्ट कार्य दिए, जैसे "टोक्यो के लिए उड़ान खोजें," "कार्ट में एक आइटम जोड़ें," या "खोज परिणामों को फ़िल्टर करें।" AI को वह कोड लिखना था जो वास्तव में एक वास्तविक वेब ब्राउज़र में ये चीजें कर सके, न कि केवल दिखावा करे।

परिणाम: "रियलिटी गैप" (वास्तविकता का अंतर)
जब उन्होंने इस नए परीक्षण के माध्यम से सर्वश्रेष्ठ AI मॉडल चलाए, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:

  • "लॉन्ग स्क्रॉल" की समस्या: जैसे-जैसे वेबसाइटें लंबी होती गईं, संरचना को सही रखने की AI की क्षमता खराब होती गई। यह एक ऐसे वास्तुकार की तरह है जो एक आदर्श पहली मंजिल तो डिजाइन कर सकता है लेकिन यह भूल जाता है कि दूसरी मंजिल उससे कैसे जुड़ती है।
  • "फेक हाउस" (नकली घर) की समस्या: कई AI ने ऐसी वेबसाइटें बनाईं जो सुंदर और यथार्थवादी दिखती थीं (जैसे कि एक फिल्म का सेट), लेकिन जब आप किसी बटन पर क्लिक करते या फॉर्म भरते, तो कुछ भी नहीं होता था। "प्लंबिंग" खराब थी।
  • इनपुट संबंधी समस्या: भले ही शोधकर्ताओं ने लंबी फोटो को छोटे टुकड़ों में तोड़ दिया ताकि AI के लिए उसे देखना आसान हो जाए, फिर भी AI उन टुकड़ों को एक काम करने वाले पूर्ण रूप में जोड़ने में संघर्ष करता रहा।

निष्कर्ष
यह शोध पत्र निष्कर्ष निकालता है कि हम केवल इस आधार पर AI का निर्णय नहीं ले सकते कि उसके चित्र कितने सुंदर दिखते हैं। वास्तव में उपयोगी होने के लिए, एक AI को लंबी, जटिल वेबसाइट बनाने में सक्षम होना चाहिए जो वास्तव में काम करती हों जब आप उनके साथ इंटरैक्ट करते हैं। LongWebBench वह नया पैमाना है जिसका उपयोग वे इसे मापने के लिए कर रहे हैं, जो हमें दिखाता है कि हालांकि AI चित्र बनाने में अच्छा हो रहा है, लेकिन एक पूरी तरह से कार्यात्मक डिजिटल घर बनाने के लिए इसे अभी लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →