PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading
यह शोध पत्र PlotlyChain को प्रस्तुत करता है, जो एक नियतात्मक (deterministic), जनरेटर-आधारित बेंचमार्क है जिसमें सटीक ग्राउंड ट्रुथ और इंटरमीडिएट चेकपॉइंट्स के साथ 450 इंजीनियरिंग प्लॉट्स शामिल हैं, जो यह प्रकट करता है कि जहाँ शीर्ष मल्टीमॉडल LLMs मानक प्लॉट्स को पढ़ने में लगभग 80% सटीकता प्राप्त करते हैं, वहीं वे FFT और बैंडपास रिस्पॉन्स जैसे फ्रीक्वेंसी-डोमेन कार्यों के साथ काफी संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक इंजीनियर हैं जो एक खराब मशीन को ठीक करने की कोशिश कर रहे हैं। आप केवल मशीन को नहीं देखते; आप उन चार्ट्स और ग्राफ्स को देखते हैं जिन्हें वह बनाती है। ये सुंदर इंस्टाग्राम इन्फोग्राफिक्स नहीं हैं; ये तकनीकी चित्र हैं जैसे कि "बोडे प्लॉट्स" (दिखाते हैं कि एक सिग्नल समय के साथ कैसे बदलता है) या "स्ट्रेस-स्ट्रेन कर्व्स" (दिखाते हैं कि धातु टूटने से पहले कितना मुड़ सकती है)।
लंबे समय से, AI मॉडल टेक्स्ट पढ़ने या किसी तस्वीर का वर्णन करने में बहुत अच्छे रहे हैं। लेकिन जब आप उनसे एक तकनीकी ग्राफ से संख्याएं पढ़ने और इंजीनियरिंग समस्या को हल करने के लिए गणित करने को कहते हैं, तो वे अक्सर लड़खड़ा जाते हैं।
PlotChain से मिलिए। इसे एक विशेषज्ञ ड्राइविंग टेस्ट की तरह समझें, लेकिन कार चलाने के बजाय, AI को डैशबोर्ड पर लगे जटिल गेज (gauges) को पढ़ना है।
यहाँ इस पेपर की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. समस्या: "अंधा" AI
अधिकांश AI बेंचमार्क सूर्यास्त की तस्वीर का वर्णन करने के लिए एक छात्र से पूछने जैसा है। AI कह सकता है, "यह नारंगी और सुंदर है।" यह आसान है।
लेकिन इंजीनियरिंग कठिन है। यह AI से पूछने जैसा है: "एक कार के इंजन के प्रदर्शन के इस ग्राफ को देखो। मुझे ठीक-ठीक बताओ कि 3,000 RPM पर यह कितनी हॉर्सपावर बनाता है, और फिर उसके आधार पर ईंधन दक्षता (fuel efficiency) की गणना करो।"
पुराने परीक्षण अक्सर AI द्वारा केवल अनुमान लगाने या टेक्स्ट लेबल पढ़ने पर निर्भर थे। PlotChain अलग है। यह AI को लाइनों को देखने, अक्षों (axes) का पता लगाने और सटीक संख्याएं निकालने के लिए मजबूर करता है।
2. समाधान: "गोल्ड स्टैंडर्ड" जनरेटर
आपको कैसे पता चलेगा कि AI सही है या नहीं? आमतौर पर, इंसानों को टेस्ट ग्रेड करना पड़ता है, जो धीमा है और जिसमें गलती होने की संभावना रहती है।
PlotхChain के लेखकों ने एक रोबोटिक टेस्ट-मेकर बनाया।
- उन्होंने एक कंप्यूटर प्रोग्राम लिखा जो सटीक गणित का उपयोग करके ग्राफ को शुरू से बनाता है।
- क्योंकि कंप्यूटर ने उस ग्राफ को बनाया है, इसलिए वह दशमलव के अंतिम अंक तक सटीक उत्तर (ground truth) जानता है।
- उन्होंने 450 अलग-अलग टेस्ट प्रश्न बनाए जो 15 प्रकार के इंजीनियरिंग ग्राफ (जैसे पंप कर्व्स, इलेक्ट्रिकल सर्किट और मटेरियल स्ट्रेस टेस्ट) को कवर करते हैं।
यह एक ऐसे शिक्षक की तरह है जो टेस्ट लिखता है, जिसके पास उत्तर कुंजी (answer key) पूरी तरह से मौजूद है, और जो ग्रेडिंग में कभी गलती नहीं करता।
3. "चेकपॉइंट" सिस्टम: असली सीक्रेट सॉस
यह इस पेपर का सबसे चतुर हिस्सा है।
आमतौर पर, एक टेस्ट आपको अंत में एक स्कोर देता है: "आपने 10 में से 8 अंक प्राप्त किए।" लेकिन यदि आपको 8 मिले, तो आपको पता नहीं चलेगा कि आपने 2 अंक क्यों खोए। क्या आपने ग्राफ को गलत पढ़ा? या आपने ग्राफ को सही पढ़ा लेकिन गणित गलत किया?
PlotChain चेकपॉइंट्स (जिन्हें cp_* के रूप में लेबल किया गया है) का उपयोग करता है।
- उपमा (Analogy): कल्पना कीजिए कि यह एक रिले रेस है।
- चेकपॉइंट 1: AI को 100 मीटर के निशान पर धावक की गति पढ़नी है।
- चेकपॉइंट 2: AI को 200 मीटर के निशान पर गति पढ़नी है।
- अंतिम उत्तर: AI को औसत गति की गणना करनी है।
- यदि AI अंतिम उत्तर गलत देता है, तो चेकपॉइंट हमें बताता है कि वह कहाँ विफल हुआ।
- क्या वह अंतिम उत्तर में विफल हुआ लेकिन चेकपॉइंट्स में सफल रहा? तो वह गणित में खराब है।
- क्या वह चेकपॉइंट्स में विफल हुआ? तो वह ग्राफ पढ़ने में खराब है।
यह इंजीनियरों को यह जानने में मदद करता है कि उन्हें AI में वास्तव में क्या सुधारना है।
4. दौड़: कौन जीता?
लेखकों ने चार सबसे स्मार्ट उपलब्ध AI मॉडलों (Google, OpenAI और Anthropic से) का इस टेस्ट पर परीक्षण किया। उन्होंने AI को बहुत सख्त रहने के लिए मजबूर किया: कोई अनुमान नहीं, कोई बातचीत नहीं, बस संख्याएं एक विशिष्ट प्रारूप में।
परिणाम:
- विजेता: Google के Gemini 2.5 Pro, OpenAI के GPT-4.1, और Anthropic के Claude Sonnet 4.5 शीर्ष प्रदर्शन करने वाले थे। उन्होंने पूरे टेस्ट के लगभग 72% प्रश्न पूरी तरह से हल किए (इसका मतलब है कि उन्होंने एक प्रश्न के लिए हर एक संख्या बिल्कुल सही पढ़ी)।
- हारने वाला: OpenAI का GPT-4o (एक बहुत ही लोकप्रिय मॉडल) काफी पीछे था, जिसे केवल 32% परफेक्ट स्कोर मिला।
- कठिन हिस्से: विजेता भी विशिष्ट प्रकार के ग्राफों में संघर्ष करते थे, जैसे कि फ्रीक्वेंसी रिस्पॉन्स (जटिल ध्वनि/तरंग पैटर्न)। यह वैसा ही है जैसे एक इंसान स्पीडोमीटर पढ़ने में बहुत अच्छा हो सकता है लेकिन एक जटिल रडार स्क्रीन पढ़ने में बुरा हो सकता है।
5. यह क्यों महत्वपूर्ण है
यह पेपर केवल यह कहने के बारे में नहीं है कि "AI स्मार्ट है।" यह AI का निदान (diagnosis) करने के बारे में है।
- पुनरुत्पादकता (Reproducibility): उन्होंने अपना सारा कोड और डेटा जारी किया है। कोई भी यह देखने के लिए टेस्ट को फिर से चला सकता है कि क्या कोई नया AI बेहतर है।
- यथार्थवाद (Realism): उन्होंने केवल यह परीक्षण नहीं किया कि क्या AI संख्या का "भ्रम" (hallucinate) पैदा कर सकता है; उन्होंने यह परीक्षण किया कि क्या वह एक ग्राफ को उसी सटीकता के साथ पढ़ सकता है जैसा कि एक मानव इंजीनियर करता है।
- भविष्य: इन "चेकपॉइंट्स" का उपयोग करके, डेवलपर्स यह अनुमान लगाना बंद कर सकते हैं कि AI क्यों विफल होता है और वे सीधे उस विशिष्ट हिस्से को ठीक करना शुरू कर सकते हैं जो टूटा हुआ है (क्या उसकी आँखें खराब हैं? या उसका कैलकुलेटर?)।
संक्षेप में
PlotChain AI के लिए एक कठोर, गणितीय रूप से पूर्ण ड्राइविंग टेस्ट है। यह केवल AI से "तस्वीर देखने" के लिए नहीं कहता; यह AI को डैशबोर्ड पढ़ने, गणित करने और बिना दुर्घटना के कार चलाने के लिए कहता है। इसने खुलासा किया कि हालांकि नवीनतम AI मॉडल इस काम में बहुत अच्छे होते जा रहे हैं, फिर भी वे सबसे जटिल "ट्रैफिक" (फ्रीक्वेंसी ग्राफ) के साथ संघर्ष करते हैं, और अब हमारे पास बेहतर तरीका है जिससे हम सटीक रूप से माप सकें कि वे कहाँ विफल हो रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।