← नवीनतम पेपर
🤖 AI

AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

यह शोध पत्र AssetOpsBench प्रस्तुत करता है, जो एक एकीकृत ढांचा और बेंचमार्किंग प्लेटफॉर्म है जिसमें डोमेन-विशिष्ट एजेंटों का एक मल्टीमॉडल इकोसिस्टम, औद्योगिक प्रश्नों का एक क्यूरेटेड डेटासेट और औद्योगिक संपत्ति संचालन एवं रखरखाव के लिए एआई-संचालित कार्य स्वचालन को आगे बढ़ाने और उसका आकलन करने के लिए एक स्वचालित मूल्यांकन प्रणाली शामिल है।

मूल लेखक: Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-तकनीकी कारखाने के प्रबंधक हैं। यह कारखाना विशाल, जटिल मशीनों जैसे औद्योगिक चिलर (सोचिए कि वे सुपर-साइज एयर कंडीशनर हैं) और पवन टर्बाइन से भरा हुआ है। ये मशीनें लगातार आपसे बात कर रही हैं, आपको हर दिन लाखों संदेश भेज रही हैं—उनके तापमान, दबाव, ऊर्जा उपयोग और स्वास्थ्य के बारे में।

अतीत में, यदि कोई मशीन अजीब व्यवहार करने लगती थी, तो एक मानव विशेषज्ञ को हजारों पन्नों के लॉग्स को पढ़ना पड़ता था, सेंसर डेटा की जांच करनी पड़ती थी, पुराने मरम्मत रिकॉर्ड देखने पड़ते थे, और फिर यह पता लगाना पड़ता था कि क्या गलत हुआ है। यह एक अंधेरी आंखों वाली पट्टी पहनकर घास के ढेर में एक विशिष्ट सुई खोजने जैसा था।

"AI एजेंट" का आगमन।

एक AI एजेंट को एक सुपर-स्मार्ट, अथक डिजिटल इंटर्न (प्रशिक्षु) के रूप में सोचें। आप उससे पूछ सकते हैं, "हे, चिलर #4 गर्म क्यों चल रहा है?" और इसे उत्तर ढूंढना चाहिए, डेटा की जांच करनी चाहिए और आपको बताना चाहिए कि क्या करना है।

लेकिन समस्या यहाँ है: अधिकांश AI इंटर्न ईमेल लिखने या लेखों का सारांश देने में बहुत अच्छे होते हैं, लेकिन वे वास्तविक दुनिया की मशीनों को ठीक करने में बहुत खराब होते हैं। वे भ्रमित हो सकते हैं (गलत जानकारी बना सकते हैं) या जब डेटा अव्यवस्थित होता है तो उलझ सकते हैं। हमारे पास यह परीक्षण करने का कोई तरीका नहीं था कि क्या ये AI इंटर्न वास्तव में कारखाने के फर्श के लिए तैयार हैं।

"AssetOpsBench" का आगमन।

लेखकों ने इन AI इंटर्न के लिए एक विशाल, वास्तविक प्रशिक्षण जिम बनाया। वे इसे AssetOpsBench कहते हैं।

यह कैसे काम करता है, कुछ सरल उपमाओं का उपयोग करते हुए:

1. "जिम" (वातावरण)

नकली, साफ डेटा पर AI का परीक्षण करने के बजाय, लेखकों ने कंप्यूटर के भीतर एक सिम्युलेटेड कारखाना बनाया।

  • मशीनें: उन्होंने सिम्युलेशन में वास्तविक औद्योगिक मशीनों (चिलर, पंप) के डिजिटल ट्विन्स रखे।
  • डेटा: उन्होंने इसमें 2.3 मिलियन वास्तविक डेटा पॉइंट्स डाले, जिसमें सेंसर रीडिंग, मरम्मत लॉग और विफलता मैनुअल शामिल थे। यह AI को एक ऐसी लाइब्रेरी देने जैसा है जिसमें कारखाने में होने वाली हर संभावित खराबी का विवरण हो।
  • परिदृश्य (Scenarios): उन्होंने AI के लिए 141 विशिष्ट "मिशन" लिखे। ये सरल प्रश्न नहीं हैं जैसे "2+2 क्या है?" ये जटिल, वास्तविक दुनिया के अनुरोध हैं जैसे: "चिलर #9 का ऊर्जा उपयोग बढ़ने की संभावना है। पिछले 30 दिनों के डेटा की जांच करें, देखें कि क्या मशीन वास्तव में चल रही थी, और यदि नहीं, तो मुझे बताएं कि हम भविष्य की भविष्यवाणी क्यों नहीं कर सकते।"

2. "कोच" (मूल्यांकन)

आप कैसे जानेंगे कि AI ने अच्छा काम किया या नहीं? आप केवल AI से यह नहीं पूछ सकते, "क्या मैंने अच्छा किया?"

  • "LLM-as-Judge" (निर्णायक के रूप में LLM): शोधकर्ताओं ने पहले AI को ग्रेड देने के लिए एक दूसरे, बहुत सख्त AI (एक "जज") का उपयोग किया।
  • स्कोरकार्ड: जज तीन चीजों को देखता है:
    1. क्या उन्होंने कार्य पूरा किया? (क्या उन्होंने वास्तव में प्रश्न का उत्तर दिया?)
    2. क्या उनके तथ्य सही थे? (क्या उन्होंने सही मशीन और सही तारीख देखी?)
    3. क्या उन्होंने परिणाम को सत्यापित किया? (क्या उन्होंने अपने काम की दोबारा जांच की?)

3. "सोचने के दो तरीके" (आर्किटेक्चर)

पेपर ने इन समस्याओं को हल करने के लिए AI के सोचने के दो अलग-अलग तरीकों का परीक्षण किया:

  • तरीका A: "उपकरणों के साथ मैनेजर" (Agent-As-Tool)
    कल्पना कीजिए कि एक मैनेजर है जिसके पास एक टूलबॉक्स है। जब कोई समस्या आती है, तो मैनेजर सोचता है, "मुझे एक रिंच (wrench) की आवश्यकता है," वह एक उपकरण (टूल) चुनता है, उसका उपयोग करता है, परिणाम देखता है, और फिर निर्णय लेता है कि आगे क्या करना है। यह एक चरण-दर-चरण, "सोचो-कार्य करो-अवलोकन करो" वाला लूप है।

    • परिणाम: यह तरीका बेहतर काम कर गया। यह अधिक लचीला था और जटिल, अव्यवस्थित वास्तविक दुनिया के डेटा को बेहतर ढंग से संभाल सका।
  • तरीका B: "मास्टर प्लानर" (Plan-Execute)
    कल्पना कीजिए कि एक जनरल है जो युद्ध से पहले बैठता है, एक आदर्श 10-चरणीय युद्ध योजना लिखता है, और फिर बिना कुछ बदले उसे लागू करता है।

    • परिणाम: यह अक्सर विफल रहा। एक अराजक कारखाने में, चीजें तेजी से बदलती हैं। यदि जनरल की योजना थोड़ी भी गलत है, तो पूरी योजना ध्वस्त हो जाती है। AI एक कठोर योजना का पालन करने में फंस गया जब डेटा मेल नहीं खा रहा था।

4. "बड़ा टूर्नामेंट" (सामुदायिक अपनाना)

लेखकों ने इसे केवल अपने तक सीमित नहीं रखा। उन्होंने इसे एक सार्वजनिक प्रतियोगिता (जैसे कोडिंग हैकाथॉन) में बदल दिया।

  • भीड़: 250 से अधिक लोग (छात्र, इंजीनियर, शोधकर्ता) इसमें शामिल हुए।
  • सबमिशन: उन्होंने 141 मिशनों को हल करने के लिए 500 से अधिक अलग-अलग AI "इंटर्न" भेजे।
  • लीडरबोर्ड: बिल्कुल वीडियो गेम की तरह, एक स्कोरबोर्ड है जो दिखाता है कि कौन से AI मॉडल औद्योगिक मशीनों को ठीक करने में सबसे अच्छे हैं।

यह क्यों मायने रखता है?

इस पेपर से पहले, यदि आप किसी पावर प्लांट को प्रबंधित करने के लिए AI बनाना चाहते थे, तो आपको अनुमान लगाना पड़ता था कि क्या यह काम करेगा। आप लाखों डॉलर खर्च कर सकते थे, इसे तैनात कर सकते थे, और फिर इसे सिस्टम को क्रैश करने के कारण विफल होते देख सकते थे क्योंकि यह नहीं समझ पाया कि एक सेंसर खराब था।

AssetOpsBench औद्योगिक AI के लिए "ड्राइवर लाइसेंस टेस्ट" है।

  • यह साबित करता है कि वर्तमान AI बेहतर हो रहा है लेकिन अभी भी इसे बहुत कुछ सीखना बाकी है (किसी भी AI ने 100% अंक प्राप्त नहीं किए)।
  • यह दिखाता है कि औद्योगिक नौकरियों के लिए, लचीलापन (तरीका A) कठोर योजना (तरीका B) से बेहतर है।
  • यह शोधकर्ताओं को यह कहने का एक मानक तरीका देता है कि, "मेरा AI आपसे बेहतर है," क्योंकि वे दोनों एक ही कठिन परीक्षा दे रहे हैं।

संक्षेप में: इस पेपर ने AI रोबोटों के लिए एक वास्तविक, उच्च-दांव वाला वीडियो गेम बनाया ताकि वे कारखानों को ठीक करना सीख सकें। इसने हमें दिखाया कि कौन से रोबोट वास्तविक दुनिया के लिए तैयार हैं और किन्हें अभी और अभ्यास की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →