StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
यह शोध पत्र StructEval प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें 18 प्रारूप और 44 कार्य प्रकार शामिल हैं जो गैर-रेंडर करने योग्य (non-renderable) और रेंडर करने योग्य (renderable) दोनों प्रकार के संरचित आउटपुट को उत्पन्न करने और परिवर्तित करने की LLMs की क्षमता का मूल्यांकन करता है, जो महत्वपूर्ण प्रदर्शन अंतराल को उजागर करता है जहाँ अत्याधुनिक मॉडल भी संरचनात्मक निष्ठा (structural fidelity) के साथ संघर्ष करते हैं, विशेष रूप से जनरेशन और विजुअल कंटेंट कार्यों में।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली, सुपर-फास्ट शेफ (एक लार्ज लैंग्वेज मॉडल, या LLM) को काम पर रख रहे हैं ताकि वे आपके रेस्टोरेंट को चलाने में आपकी मदद कर सकें।
अतीत में, हमने इस शेफ का परीक्षण मुख्य रूप से इस बात पर किया था कि वे कितनी अच्छी तरह मेन्यू का विवरण लिख सकते हैं। क्या वे बर्गर का ऐसा वर्णन कर सकते थे कि उसे पढ़कर मुँह में पानी आ जाए? क्या वे सामग्री के बारे में सवालों के जवाब दे सकते थे? हमने उन्हें ऐसे टेस्ट दिए जैसे "एक टमाटर पर कविता लिखो" या "पिज्जा का इतिहास समझाओ।"
लेकिन सॉफ्टवेयर की वास्तविक दुनिया में, शेफ को केवल सुंदर शब्द लिखने की आवश्यकता नहीं है। उन्हें रसोई के उपकरण बनाने और पेंट्री (सामान रखने की जगह) को व्यवस्थित करने की भी आवश्यकता है। यदि वे एक ऐसी रेसिपी लिखते हैं जो दिखने में तो शानदार है लेकिन उसमें माप गलत है, तो केक धंस जाएगा। यदि वे पेंट्री को व्यवस्थित करते हैं लेकिन आटे को मसाले के जार में रख देते हैं, तो पूरी रसोई खराब हो जाएगी।
यही वह चीज़ है जिसके बारे में StructEval पेपर है। यह एक नया, कठिन टेस्ट है यह देखने के लिए कि क्या ये AI शेफ वास्तव में संरचित चीजें (structured things) बना सकते हैं, न कि केवल उनके बारे में बात कर सकते हैं।
यहाँ उनके नए टेस्ट का विवरण दिया गया है, जिसे रसोई के रूपकों (metaphors) के साथ समझाया गया है:
1. "खाना पकाने" के दो प्रकार
शोधकर्ताओं ने महसूस किया कि "निर्माण करना" दो अलग-अलग रूपों में आता है, इसलिए उन्होंने टेस्ट को दो भागों में विभाजित किया:
"पेंट्री ऑर्गनाइज़र" (केवल टेक्स्ट):
कल्पना कीजिए कि शेफ को सामग्रियों की एक स्प्रेडशीट व्यवस्थित करने की आवश्यकता है। उन्हें यह सुनिश्चित करना होगा कि डेटा एक सख्त फॉर्मेट में हो जैसे कि JSON (एक डिजिटल फाइलिंग कैबिनेट), YAML (निर्देशों की एक सूची), या CSV (एक किराने की सूची)।- टेस्ट: "यह सामग्रियों की एक अस्त-व्यस्त सूची है। कृपया इसे एक परफेक्ट JSON फाइल में व्यवस्थित करें।"
- यह क्यों महत्वपूर्ण है: यदि फाइल थोड़ी सी भी खराब है, तो इसे पढ़ने वाला कंप्यूटर प्रोग्राम क्रैश हो जाएगा।
"आर्किटेक्ट" (विजुअल रेंडरिंग):
अब, कल्पना कीजिए कि शेफ को एक भौतिक डिस्प्ले विंडो या वेबसाइट बनानी है। उन्हें HTML (एक वेबपेज का कंकाल), React (इंटरैक्टिव बटन), या SVG (डिजिटल आर्ट) के लिए कोड लिखना होगा।- टेस्ट: "यहाँ एक यात्रा कार्यक्रम (itinerary) का विवरण है। कृपया एक वेबपेज बनाएं जो इसे दिखाए, जिसमें एक बड़ा शीर्षक, 3 पंक्तियों वाली एक टेबल और नीचे एक बटन हो।"
- यह क्यों महत्वपूर्ण है: कोड न केवल कागज पर सही दिखना चाहिए, बल्कि जब आप इसे ब्राउज़र में खोलते हैं तो इसे वास्तव में काम भी करना चाहिए।
2. टेस्ट लेने के दो तरीके
पेपर AI को चुनौती देने के दो अलग-अलग तरीके पेश करता है:
- "ब्लैंक कैनवस" चैलेंज (जेनरेशन/निर्माण):
AI को एक नेचुरल लैंग्वेज प्रॉम्प्ट दिया जाता है (जैसे, "एक अंतरिक्ष यात्रा के लिए शेड्यूल बनाएं") और उसे शुरुआत से एक स्ट्रक्चर बनाना होता है। यह शेफ से शुरुआत से एक नया व्यंजन आविष्कार करने के लिए कहने जैसा है। यह कठिन है क्योंकि उन्हें रचनात्मक होने के साथ-साथ उस फॉर्मेट के सभी नियमों को भी याद रखना पड़ता है। - "ट्रांसलेशन" चैलेंज (कन्वर्जन/रूपांतरण):
AI को एक फॉर्मेट में एक स्ट्रक्चर दिया जाता है (जैसे, एक JSON फाइल) और उसे दूसरे फॉर्मेट में (जैसे, एक YAML फाइल) अनुवाद करने के लिए कहा जाता है। यह एक फ्रेंच में लिखी गई रेसिपी को बिना किसी सामग्री को खोए पूरी तरह से स्पेनिश में अनुवाद करने जैसा है।
3. उन्होंने शेफ को कैसे ग्रेड किया?
अतीत में, इंसान आउटपुट को पढ़ते थे और कहते थे, "अच्छा लग रहा है!" लेकिन यह बहुत व्यक्तिपरक (subjective) है। StructEval एक रोबोट जज का उपयोग करता है जिसके पास तीन विशिष्ट उपकरण हैं:
- सिंटैक्स चेक (ग्रामर पुलिस): क्या कोड वास्तव में चलता है? यदि आपने JSON मांगा है, तो क्या वह वैध JSON है, या वह टूटा हुआ कचरा है? यदि यह पार्स (parse) नहीं होता है, तो स्कोर शून्य है।
- कीवर्ड हंट (इन्वेंटरी चेक): क्या शेफ ने वे विशिष्ट चीजें शामिल कीं जो आपने मांगी थीं? यदि आपने "शीर्षक" और "तारीख" मांगा था, तो क्या उन्होंने वास्तव में उन सटीक शब्दों को सही जगहों पर रखा?
- विजुअल आई (आर्ट क्रिटिक): विजुअल कार्यों (जैसे वेबपेज) के लिए, वे कोड के रेंडर किए गए इमेज को देखने के लिए एक विशेष AI का उपयोग करते हैं। वह सवाल पूछता है जैसे, "क्या शीर्षक बीच में (centered) है?" या "क्या बटन नीला है?" यदि इमेज निर्देशों से मेल नहीं खाती है, तो अंक काट लिए जाते हैं।
4. चौंकाने वाले परिणाम
शोधकर्ताओं ने शीर्ष शेफ (आज उपलब्ध सबसे अच्छे AI मॉडल, जैसे GPT-4o, o1-mini, और ओपन-सोर्स मॉडल जैसे Llama) का परीक्षण किया। यहाँ उन्होंने क्या पाया:
- अंतर वास्तविक है: यहाँ तक कि "स्टार शेफ" (सबसे महंगे, कमर्शियल मॉडल) भी लगभग 100 में से 75 ही अंक प्राप्त कर पाए। वे अच्छे हैं, लेकिन वे पूर्णता से बहुत दूर हैं।
- ओपन-सोर्स का संघर्ष: फ्री, कम्युनिटी-निर्मित मॉडल (जैसे Llama) पेड दिग्गजों की तुलना में लगभग 10 अंक कम स्कोर करते हैं। वे वहां पहुँच रहे हैं, लेकिन वे अभी भी जटिल नियमों में लड़खड़ा जाते हैं।
- यह जितना दिखता है उससे अधिक कठिन है:
- ट्रांसलेशन, क्रिएशन से आसान है: AI के लिए एक JSON फाइल को YAML फाइल में बदलना, एक पैराग्राफ के टेक्स्ट से JSON फाइल बनाने की तुलना में आसान है।
- विजुअल्स सबसे कठिन हैं: एक ऐसा वेबपेज बनाना जो सही दिखे, केवल एक टेक्स्ट लिस्ट लिखने से कहीं अधिक कठिन है। AI अक्सर टेक्स्ट को सेंटर करना भूल जाता है या एक विशिष्ट बटन मिस कर देता है।
- "निश" (Niche) का दुःस्वप्न: AI मॉडल HTML या JSON जैसी सामान्य चीजों के लिए बेहतरीन हैं। लेकिन यदि आप उन्हें Mermaid में डायग्राम बनाने या TikZ (विशेषीकृत फॉर्मेट) में टाइपसेटिंग फाइल बनाने के लिए कहते हैं, तो वे अक्सर बुरी तरह विफल हो जाते हैं, और 50% से भी कम स्कोर करते हैं।
मुख्य निष्कर्ष
पेपर निष्कर्ष निकालता है कि जबकि AI निबंध लिखने और चैट करने में अद्भुत है, यह सख्त, संरचित सिस्टम बनाने के मामले में अभी भी अनाड़ी (clumsy) है।
इसे ऐसे सोचिए: AI एक घर के बारे में एक सुंदर कहानी लिख सकता है, लेकिन यदि आप इसे वास्तव में ब्लूप्रिंट बनाने के लिए कहते हैं ताकि निर्माण दल यह सुनिश्चित कर सके कि छत गिरने से पहले सब कुछ ठीक हो, तो यह अक्सर गलतियाँ करता है।
StructEval वह टूल है जिसकी हमें इन AI को सिखाने के लिए आवश्यकता है कि वास्तविक दुनिया में, स्टाइल जितना जरूरी है, स्ट्रक्चर भी उतना ही महत्वपूर्ण है। यदि फॉर्मेट गलत है, तो पूरा एप्लिकेशन टूट जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।