← नवीनतम पेपर
🤖 AI

DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules

यह शोध पत्र DiagnosticIQ प्रस्तुत करता है, जो 6,690 विशेषज्ञ-सत्यापित प्रश्नों का एक बेंचमार्क है जिसे प्रतीकात्मक औद्योगिक रखरखाव नियमों को सुधारात्मक कार्रवाइयों में अनुवाद करने की LLMs की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि फ्रंटियर मॉडल मानव-स्तर के प्रदर्शन के करीब पहुँचते हैं, वे संरचनात्मक व्यवधानों के तहत भंगुर बने रहते हैं और उनमें मजबूत अंशांकन (कैलिब्रेशन) का अभाव है।

मूल लेखक: Devin Yasith De Silva, Dhaval Patel, Christodoulos Constantinides, Shuxin Lin, Nianjun Zhou, Paul J Adams, Sal Rosato, Nicolas Constantinides, Deborah L. McGuinness, Jayant Kalagnanam

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Devin Yasith De Silva, Dhaval Patel, Christodoulos Constantinides, Shuxin Lin, Nianjun Zhou, Paul J Adams, Sal Rosato, Nicolas Constantinides, Deborah L. McGuinness, Jayant Kalagnanam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सैकड़ों मशीनों वाली एक विशाल, जटिल इमारत के प्रबंधक हैं—जैसे एयर कंडीशनर, वॉटर पंप और पावर जनरेटर। इन मशीनों में सेंसर लगे हैं जो एक तंत्रिका तंत्र (nervous system) की तरह काम करते हैं और लगातार संकेत भेजते रहते हैं। जब कुछ गलत होता है, तो सेंसर एक "नियम" को ट्रिगर करते हैं, जो मूल रूप से एक विशेषज्ञ इंजीनियर द्वारा लिखा गया एक सख्त "यदि-तो" (If-Then) कथन होता है।

समस्या:
सेंसर यह बताने में बहुत अच्छे हैं कि, "हे, तापमान बहुत अधिक है!" (डिटेक्शन)। लेकिन वे यह बताने में बहुत खराब हैं कि, "ठीक है, अब पंप के बाईं ओर इस विशिष्ट बोल्ट को कसने जाओ" (एक्शन)।

"तापमान अधिक है" वाले अलर्ट को वास्तविक मरम्मत के चरण में अनुवाद करने के लिए वर्षों के व्यावहारिक अनुभव की आवश्यकता होती है। यह एक डॉक्टर के सहायक के समान है जो जानता है कि मरीज को बुखार है, लेकिन वरिष्ठ डॉक्टर के मार्गदर्शन के बिना यह नहीं जान पाता कि उसे कौन सी दवा देनी है। शोध पत्र पूछता है: क्या आर्टिफिशियल इंटेलिजेंस (विशेष रूप से लार्ज लैंग्वेज मॉडल्स या LLMs) उस वरिष्ठ डॉक्टर की भूमिका निभा सकते हैं और मरम्मत तकनीशियन को बता सकते हैं कि उसे क्या करना है?

समाधान: DiagnosticIQ
शोधकर्ताओं ने एक विशाल परीक्षण बनाया जिसे DiagnosticIQ कहा जाता है। इसे AI के लिए एक अंतिम परीक्षा की तरह समझें, लेकिन यह "फ्रांस की राजधानी क्या है?" पूछने के बजाय पूछता है:
"एयर हैंडलर चल रहा है, बाहरी हवा का डैम्पर 15% से कम है, और तापमान निर्धारित स्तर (setpoint) से नीचे है। सबसे संभावित कारण क्या है?"

उन्होंने 16 अलग-अलग प्रकार की औद्योगिक मशीनों से 118 वास्तविक दुनिया के नियमों पर आधारित 6,690 प्रश्न बनाए। उन्होंने विशेषज्ञों (शिक्षकों) से ही उत्तर लिखवाए और कठिन गलत विकल्प (distractors) भी बनाए ताकि परीक्षण कठिन हो सके।

परिणाम: AI स्मार्ट है, लेकिन नाजुक (Fragile) है
शोधकर्ताओं ने 29 अलग-अलग AI मॉडल्स का इस परीक्षा पर परीक्षण किया। यहाँ उन्हें जो मिला, वह कुछ सरल उपमाओं (analogies) का उपयोग करके दिया गया है:

  1. "फ्रंटियर" करीब आ रहा है: शीर्ष तीन AI मॉडल लगभग बराबरी पर हैं। वे सभी मानक परीक्षण पर लगभग 73-74% स्कोर कर रहे हैं। यह एक कक्षा के तीन छात्रों की तरह है जो सभी 'A' ग्रेड प्राप्त कर रहे हैं, लेकिन वे एक-दूसरे के इतने करीब हैं कि केवल ग्रेड देखकर यह कहना कठिन है कि वास्तव में "सबसे स्मार्ट" कौन है।
  2. "भंगुरता" (The Brittleness - कांच का घर): जब शोधकर्ताओं ने अधिक गलत उत्तर जोड़कर (जैसे किसी छात्र को 4 के बजाय 10 विकल्प देना) परीक्षण को कठिन बनाया, तो AI का प्रदर्शन गिर गया। शीर्ष मॉडल 74% से गिरकर 60% पर आ गया। यह ऐसा है जैसे AI एक शांत कमरे में आत्मविश्वासी था, लेकिन शोर होने पर घबरा गया।
  3. पैटर्न मैचिंग बनाम वास्तविक तर्क (Reasoning): यह सबसे महत्वपूर्ण निष्कर्ष है। शोधकर्ताओं ने एक चाल चली: उन्होंने नियमों के तर्क को उलट दिया (उदाहरण के लिए, "तापमान > 80" को "तापमान < 80" में बदलना)।
    • वास्तविक तर्क: यदि आप तर्क समझते हैं, तो आपको कहना चाहिए, "रुको, स्थितियाँ बदल गई हैं, इसलिए उत्तर भी अलग होना चाहिए।"
    • AI ने क्या किया: AI ने ज्यादातर बदलावों को नजरअंदाज कर दिया और वही मूल उत्तर चुन लिया। यह ऐसा था जैसे कोई छात्र उत्तर कुंजी (answer key) रट लेता है ("उत्तर B") बिना वास्तव में प्रश्न पढ़े। यहाँ तक कि सबसे स्मार्ट AI ने भी ऐसा 63% समय किया। यह नियमों को हल करने के लिए एक पहेली के बजाय उन्हें पहचानने के लिए एक टेम्पलेट की तरह मानता है।
  4. "अनुवाद" की समस्या: जब शोधकर्ताओं ने तकनीकी, प्रतीकात्मक नियमों को साधारण अंग्रेजी में फिर से लिखा (जैसे किसी गणितीय समीकरण को एक कहानी में बदलना), तो AI और भी खराब प्रदर्शन करने लगा। ऐसा लगता है कि AI तकनीकी प्रतीकों के विशिष्ट "आकार" पर निर्भर करता है, और जब आप उसे सामान्य भाषा में सहज बना देते हैं, तो वह भ्रमित हो जाता है।

मानव तुलना
शोधकर्ताओं ने यह परीक्षण वास्तविक सुविधा प्रबंधकों (facility managers - वे लोग जो वास्तव में इन मशीनों को ठीक करते हैं) को भी दिया।

  • इंसान: अनुभवी इंसानों ने भी केवल 45% सही उत्तर दिए। यह साबित करता है कि यह परीक्षण वास्तव में कठिन है और इसके लिए गहरे, विशेष ज्ञान की आवश्यकता है, न कि केवल सामान्य बुद्धिमत्ता की।
  • AI बनाम इंसान: सर्वश्रेष्ठ AI मॉडल औसत मानव कार्यकर्ता (लगभग 56% बनाम 45%) से बेहतर स्कोर करते हैं, लेकिन वे सर्वश्रेष्ठ मानव विशेषज्ञों को नहीं हरा सके।

मुख्य निष्कर्ष (The Bottom Line)
शोध पत्र निष्कर्ष निकालता है कि हालांकि AI इन औद्योगिक नियमों को पढ़ने में बहुत अच्छा हो रहा है, लेकिन यह अभी तक "बॉस" बनने के लिए तैयार नहीं है। यह वर्तमान में भंगुर (brittle) है। यह समस्या के मानक, टेक्स्टबुक संस्करण को संभाल सकता है, लेकिन यदि आप शब्दों को बदलते हैं, तर्क को उलट देते हैं, या बहुत सारे भ्रमित करने वाले विकल्प जोड़ देते हैं, तो यह टूट जाता है और उन पैटर्न के आधार पर अनुमान लगाने लगता है जिन्हें इसने रटा हुआ है, न कि वास्तविक समझ के आधार पर।

डिप्लॉयमेंट की बाधा यह नहीं है कि AI पर्याप्त स्मार्ट नहीं है; बल्कि यह है कि यह वास्तविक दुनिया के कारखाने के फर्श की जटिल और बदलती वास्तविकता को संभालने के लिए पर्याप्त कैलिब्रेटेड (calibrated) नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →