← नवीनतम पेपर
🤖 AI

Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents

इंजीनियरिंग रीजनिंग एंड इंस्ट्रक्शन (ERI) बेंचमार्क एक विशाल, वर्गीकरण-संचालित डेटासेट है जो नौ इंजीनियरिंग क्षेत्रों और विभिन्न कठिनाई स्तरों में फैला हुआ है, जिसे फाउंडेशन मॉडल और एजेंटों को प्रशिक्षित करने और उनका मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें एक कठोर सत्यापन प्रोटोकॉल है जो फ्रंटियर और छोटे मॉडलों के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रदर्शित करता है और मतिभ्रम (hallucination) के जोखिम को 1.7% तक सीमित करता है।

मूल लेखक: MZ Naser, Ahmad Bani Awwad, Zoie McCreery, Radwa Eissa, Ahmad Naser, Gianluca Cusatis, Andrew Metcalf, Kapil Madathil, Jamal Abdalla, Venkatesh Kodur, Mohammad Reza Saeb

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: MZ Naser, Ahmad Bani Awwad, Zoie McCreery, Radwa Eissa, Ahmad Naser, Gianluca Cusatis, Andrew Metcalf, Kapil Madathil, Jamal Abdalla, Venkatesh Kodur, Mohammad Reza Saeb

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया इंजीनियर काम पर रख रहे हैं जो एक पुल, एक रॉकेट या एक केमिकल प्लांट डिजाइन करने में मदद करेगा। आप उनसे सिर्फ यह नहीं पूछेंगे, "क्या आप जानते हैं कि पुल क्या होता है?" बल्कि आप यह देखना चाहेंगे कि क्या वे वास्तव में भार (load) की गणना कर सकते हैं, कंक्रीट में आई दरार की समस्या का समाधान कर सकते हैं, या तूफान का अनुकरण (simulate) करने के लिए कोड लिख सकते हैं।

लंबे समय से, आर्टिफिशियल इंटेलिजेंस (AI) कविता लिखने और सामान्य सामान्य ज्ञान के उत्तर देने में बहुत अच्छा रहा है। लेकिन जब बात इंजीनियरिंग की आती है, तो दांव बहुत ऊंचे होते हैं। कविता में गलत उत्तर का मतलब सिर्फ एक खराब कविता है; इंजीनियरिंग में गलत उत्तर का मतलब एक ढहती हुई इमारत हो सकती है।

यह शोध पत्र AI के लिए एक नए "फाइनल एग्जाम" को पेश करता है जिसे ERI (Engineering Reasoning and Instruction) कहा जाता है। इसे एक विशाल, विशेषीकृत जिम के रूप में समझें जहाँ AI मॉडल यह साबित करने के लिए आते हैं कि वे वास्तविक इंजीनियरिंग कार्य करने के लिए कितने मजबूत हैं।

यह कैसे काम करता है, इसका विवरण कुछ सरल उपमाओं (analogities) का उपयोग करके यहाँ दिया गया है:

1. इंजीनियरिंग का "मेन्यू" (The Taxonomy)

एक विशाल पुस्तकालय की कल्पना करें। अधिकांश AI परीक्षण किसी भी पुस्तक के एक यादृच्छिक पृष्ठ को पढ़ने के लिए कहने जैसे होते हैं। ERI बेंचमार्क अलग है। इसमें एक सख्त मेन्यू है जिसमें 9 मुख्य खंड (सिविल, मैकेनिकल, इलेक्ट्रिकल, आदि) और 55 विशिष्ट अध्याय (जैसे "स्टील बीम को कैसे डिजाइन करें" या "लीक होने वाले पाइप को कैसे ठीक करें") हैं।

  • उपमा: केवल यह पूछने के बजाय कि, "क्या आप खाना बनाना जानते हैं?", यह टेस्ट पूछता है, "क्या आप एक सूफ़ले (सिविल) बना सकते हैं, कार का इंजन ठीक कर सकते हैं (मैकेनिकल), और एक स्मार्ट थर्मोस्टेट प्रोग्राम कर सकते हैं (इलेक्ट्रिकल)?"
  • विविधता: हर विषय के लिए, AI को 7 अलग-अलग प्रकार के कार्य करने होंगे:
    • परिभाषित करना (Define): "ट्रस (truss) क्या है?"
    • व्याख्या करना (Explain): "यह पुल हवा में क्यों डोल रहा है?"
    • गणना करना (Calculate): "यह बीम कितना वजन सह सकता है?"
    • तुलना करना (Compare): "गर्म जलवायु के लिए कौन सी सामग्री बेहतर है?"
    • डिजाइन करना (Design): "एक छोटे जल फिल्टर के लिए एक योजना बनाएं।"
    • समस्या सुलझाना (Troubleshoot): "मशीन ओवरहीट हो रही है; क्या समस्या है?"
    • कोड लिखना (Code): "रोबोटिक आर्म को नियंत्रित करने के लिए सॉफ्टवेयर लिखें।"

2. कठिनाई के तीन स्तर

यह टेस्ट केवल एक ही आकार का नहीं है। इसमें वीडियो गेम के स्तरों की तरह तीन कठिनाई स्तर हैं:

  • अंडरग्रेजुएट (Undergraduate): बुनियादी बातें। जैसे कॉलेज का कोई छात्र जो मौलिक सूत्रों को सीख रहा हो।
  • ग्रेजुएट (Graduate): जटिल चीजें। जैसे एक मास्टर डिग्री का छात्र जो अनिश्चितताओं और विशेष मामलों (edge cases) से निपट रहा हो।
  • प्रोफेशनल (Professional): वास्तविक दुनिया की उलझनें। जैसे एक वरिष्ठ इंजीनियर जो सुरक्षा कोड, बजट सीमाओं और "क्या होगा यदि" वाली स्थितियों से निपट रहा हो।

यह क्यों महत्वपूर्ण है: कुछ AI मॉडल तथ्य याद रखने में अच्छे होते हैं (अंडरग्रेजुएट स्तर), लेकिन जब उन्हें सुरक्षा और बाधाओं के बारे में गंभीर रूप से सोचने की आवश्यकता होती है (प्रोफेशनल स्तर), तो वे विफल हो जाते हैं। यह टेस्ट उनकी इन कमजोरियों को पकड़ लेता है।

3. "भ्रम" का जाल (The Circular Logic Problem)

यहाँ पेचीदा हिस्सा है: यदि टेस्ट खुद एक AI द्वारा लिखा गया है, तो आप AI टेस्ट को कैसे ग्रेड करेंगे?

  • समस्या: यदि आप एक AI को गणित की समस्या लिखने के लिए कहते हैं और फिर दूसरे AI को उसे हल करने के लिए कहते हैं, तो दूसरा AI पहले AI की गलतियों को ही कॉपी कर सकता है। यह एक छात्र द्वारा अपना होमवर्क खुद लिखने और फिर खुद ही उसे ग्रेड करने जैसा है।
  • समाधान: शोधकर्ताओं ने तीन अलग-अलग AI कंपनियों (OpenAI, Anthropic, और Mistral) के "थ्री-जज पैनल" का उपयोग किया। उन्होंने "कन्वर्जेंट वैलिडेशन" (Convergent Validation) पद्धति का भी उपयोग किया।
    • उपमा: कल्पना करें कि तीन अलग-अलग विशेषज्ञ शेफ एक व्यंजन का स्वाद चखते हैं। यदि वे सभी सहमत हैं कि स्वाद अच्छा है, तो वह शायद अच्छा है। यदि वे असहमत हैं, तो कुछ गलत है। शोधकर्ताओं ने पाया कि "रेफरेंस उत्तर" (सही उत्तर) 98.3% बार सटीक थे, जिससे प्रभावी रूप से यह सिद्ध हुआ कि यह टेस्ट केवल भ्रम का घेरा (hall of mirrors) नहीं था।

4. परिणाम: टेस्ट किसने पास किया?

शोधकर्ताओं ने इस परीक्षा पर 7 अलग-अलग AI मॉडल का परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • "फ्रंटियर" मॉडल (शीर्ष छात्र): GPT-5, Claude Sonnet 4, और DeepSeek V3.1 जैसे मॉडल्स ने बहुत उच्च स्कोर किया (5 में से 4.3 से ऊपर)। वे सभी 9 इंजीनियरिंग क्षेत्रों में सुसंगत थे। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने अपना काम दिखाया और अपनी सुरक्षा की जांच की।
  • "मिड-टियर" मॉडल: ये मॉडल (जैसे Llama 3.3) सरल प्रश्नों पर ठीक थे लेकिन जब प्रश्न कठिन या अधिक विशिष्ट हो गए, तो वे विफल होने लगे।
  • "छोटे" मॉडल: छोटे, सस्ते मॉडल (7-8 बिलियन पैरामीटर्स वाले) जटिल कार्यों पर बुरी तरह विफल रहे। उनकी विफलता दर 10% से अधिक थी, जिसका अर्थ है कि वे 10 में से 1 बार खतरनाक सलाह देंगे।
    • सबक: आप एक परमाणु रिएक्टर डिजाइन करने के लिए छोटे, सस्ते AI का उपयोग नहीं कर सकते। आपको "भारी उठाने वाले" (heavy lifters) मॉडल्स की आवश्यकता है।

5. यह शोध पत्र क्यों महत्वपूर्ण है

इससे पहले, हमारे पास यह बताने का कोई अच्छा तरीका नहीं था कि कोई AI वास्तव में "इंजीनियर-रेडी" है या केवल स्मार्ट दिखने में माहिर है।

  • शोधकर्ताओं के लिए: यह एक मानक पैमाना है यह मापने के लिए कि क्या नए AI मॉडल वास्तव में इंजीनियरिंग में बेहतर हो रहे हैं या केवल याद रखने में बेहतर हो रहे हैं।
  • कंपनियों के लिए: यह उन्हें यह तय करने में मदद करता है कि, "क्या यह AI हमारे अगले उत्पाद को डिजाइन करने में मदद करने के लिए पर्याप्त सुरक्षित है?"
  • शिक्षकों के लिए: यह हमें दिखाता है कि AI कहाँ कमजोर है (जैसे समस्या सुलझाना) ताकि इंसान उन विशिष्ट कौशलों को सिखाने पर ध्यान केंद्रित कर सकें।

निष्कर्ष

ERI बेंचमार्क AI के लिए एक विशाल, संरचित और सावधानीपूर्वक जांचा गया "ड्राइविंग टेस्ट" है। यह साबित करता है कि जबकि सबसे स्मार्ट AI मॉडल अविश्वसनीय रूप से सक्षम इंजीनियर बन रहे हैं, छोटे और सस्ते मॉडल अभी भी गंभीर काम के लिए बहुत जोखिम भरे हैं। यह सुनिश्चित करने की दिशा में एक महत्वपूर्ण कदम है कि जब हम AI को अपनी दुनिया बनाने में मदद करने दें, तो वह गलती से ऐसा पुल न बना दे जो गिर जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →