← नवीनतम पेपर
🤖 machine learning

MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation

यह शोधपत्र MermaidSeqभेंच (MermaidSeqBench) को प्रस्तुत करता है, जो 132 मानव-सत्यापित और सिंथेटिक रूप से विस्तारित नमूनों से बना एक नया बेंचमार्क है, जिसे सूक्ष्म (fine-grained), LLM-एज़-अ-जज मेट्रिक्स का उपयोग करके प्राकृतिक भाषा विवरणों से सटीक रूप से मर्मेड (Mermaid) अनुक्रम आरेख उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Basel Shbita, Farhan Ahmed, Chad DeLuca

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Basel Shbita, Farhan Ahmed, Chad DeLuca

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने सपनों के घर का ब्लूप्रिंट (नक्शा) बनाने के लिए एक पेशेवर आर्किटेक्ट को काम पर रखने की कोशिश कर रहे हैं। आप उन्हें एक विवरण देते हैं: "मुझे एक किचन चाहिए जिसमें मार्बल का आइलैंड हो, एक धूप वाली खिड़की हो, और एक कोने में छिपा हुआ पेंट्री (पार्लर) हो।"

ज्यादातर समय, आर्किटेक्ट इसे सही ढंग से समझ लेते हैं। लेकिन कभी-कभी, वे पेंट्री को भूल सकते हैं, या वे खिड़की वहां बना सकते हैं जहां दरवाजा होना चाहिए, या—सबसे बुरा तो यह है—वे ऐसा ब्लूप्रिंट बना सकते हैं जो इतना बिखरा हुआ और बेतुका हो कि निर्माण दल उसे पढ़ भी न सके।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, "आर्किटेक्ट्स" लार्ज लैंग्वेज मॉडल्स (LLMs) हैं, और "ब्लूप्रिंट्स" मर्मेड सीक्वेंस डायग्राम (Mermaid Sequence Diagrams) हैं (विशेष प्रकार का टेक्स्ट-आधारित कोड जो विजुअल फ्लोचार्ट में बदल जाता है, जिससे यह दिखाया जाता है कि एक कंप्यूटर सिस्टम के विभिन्न हिस्से आपस में कैसे बात करते हैं)।

समस्या: "बिखरे हुए ब्लूप्रिंट" की दुविधा

अभी, हम इन तकनीकी आरेखों (डायग्राम) को बनाने के लिए AI का उपयोग कर रहे हैं, लेकिन हमारे पास एक बड़ी समस्या है: हमारे पास उनके काम की जांच करने के लिए एक विश्वसनीय "बिल्डिंग इंस्पेक्टर" (निरीक्षक) नहीं है।

यदि कोई AI किसी बैंक के सुरक्षा तंत्र के लिए एक डायग्राम बनाता है और एक छोटा सा कदम भी छोड़ देता है (जैसे: "पासवर्ड सत्यापित करें"), तो पूरा सिस्टम क्रैश हो सकता है या हैक किया जा सकता है। वर्तमान में, ऐसा कोई मानक या कठोर तरीका नहीं है जिससे यह परीक्षण किया जा सके कि क्या कोई AI वास्तव में ये डायग्राम बनाने में "कुशल" है या वह केवल "दिखावा" कर रहा है कि वह सुंदर चीजें बना रहा है।

समाधान: MermaidSeqBench (अल्टीमेट इंस्पेक्टर)

शोधकर्ताओं ने IBM में MermaidSeqBench नामक कुछ बनाया है। इसे एक "मास्टर सर्टिफिकेशन एग्जाम" के रूप में समझें, जो AI आर्किटेक्ट्स के लिए है।

केवल AI से यह पूछने के बजाय कि, "क्या तुम एक डायग्राम बना सकते हो?" और यह कहना कि "अच्छा लग रहा है!", यह बेंचमार्क AI को एक कठिन, बहु-चरणीय निरीक्षण प्रक्रिया से गुजारता है:

  1. परीक्षा का प्रश्नपत्र (डेटासेट): उन्होंने 132 अत्यधिक विस्तृत "परीक्षण परिदृश्य" (test scenarios) बनाए हैं। ये केवल साधारण कार्य नहीं हैं; इनमें जटिल "क्या होगा अगर" वाली स्थितियां शामिल हैं (जैसे: "यदि उपयोगकर्ता गलत पासवर्ड डालता है तो क्या होगा?" या "यदि सर्वर बहुत व्यस्त है तो क्या होगा?")।

  2. छह-बिंदु निरीक्षण (मेट्रिक्स): केवल पास/फेल के बजाय, AI को छह विशिष्ट "सुरक्षा और गुणवत्ता" मानकों पर ग्रेड दिया जाता है:

    • सिंटैक्स (Syntax): क्या कोड सही ढंग से लिखा गया है ताकि कंप्यूटर इसे पढ़ सके? (क्या लिखावट पठनीय है?)
    • केवल मर्मेड (Mermaid Only): क्या AI ने केवल डायग्राम प्रदान किया, या उसने अनावश्यक बातों के साथ बड़बड़ाना शुरू कर दिया? (क्या उन्होंने केवल ब्लूप्रिंट दिया, या उन्होंने टाइल्स के रंग के बारे में 10 पन्नों का निबंध भी शामिल कर दिया?)
    • लॉजिक (Logic): क्या प्रवाह वास्तव में समझ में आता है? (क्या पानी नल से सिंक तक बहता है, या यह जादू से शावर में प्रकट हो जाता है?)
    • पूर्णता (Completeness): क्या इसमें मांगी गई हर एक बारीकी शामिल है? (क्या वे पेंट्री को भूल गए?)
    • एक्टिवेशन हैंडलिंग (Activation Handling): क्या यह सटीक रूप से दिखाता है कि कोई घटक (component) कब "व्यस्त" होकर काम कर रहा है? (क्या मशीन चलने के दौरान लाइट चालू है?)
    • त्रुटि और स्थिति ट्रैकिंग (Error & Status Tracking): क्या यह स्पष्ट रूप से दिखाता है कि चीजें गलत होने पर क्या होता है? (क्या डायग्राम में एक स्पष्ट "इमरजेंसी एग्जिट" साइन है?)
  3. सुपर-जज (LLM-as-a-Judge): परीक्षा को ग्रेड करने के लिए, वे इंसानों का उपयोग नहीं करते (जो धीमा है) या साधारण सॉफ्टवेयर का उपयोग नहीं करते (जो बहुत "मंद" है)। वे "सुपर-जजेस" का उपयोग करते हैं—विशाल, अत्यंत बुद्धिमान AI मॉडल (जैसे DeepSeek और GPT) जो वरिष्ठ निरीक्षकों की तरह छात्र AI के काम को ग्रेड करते हैं।

यह क्यों मायने रखता है?

इस बेंचमार्क को बनाकर, शोधकर्ताओं ने अनिवार्य रूप से उद्योग के लिए एक "गुणवत्ता मानक" तैयार किया है।

अब, जब कोई कंपनी अपने सॉफ़्टवेयर को डॉक्यूमेंट करने के लिए AI का उपयोग करना चाहती है, तो उन्हें यह अनुमान लगाने की आवश्यकता नहीं है कि क्या AI विश्वसनीय है। वे इसे पहले MermaidSeqBench के माध्यम से चला सकते हैं। यदि AI "इंस्पेक्टर के एग्जाम" में फेल हो जाता है, तो कंपनी जान जाती है कि उन्हें अपने महत्वपूर्ण मिशन वाले ब्लूप्रिंट के लिए उस पर भरोसा नहीं करना चाहिए।

संक्षेप में: उन्होंने एक उच्च-तकनीकी पैमाने का निर्माण किया है जिससे यह मापा जा सके कि हम वास्तव में डिजिटल दुनिया के मानचित्रों को बनाने के लिए AI पर कितना भरोसा कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →