← नवीनतम पेपर
🤖 AI

DynaSchedBench: Calibrated Dynamic Scheduling Benchmarks and Observability Paradox in LLM-based Scheduling Agents

यह शोध पत्र DynaSchedBench प्रस्तुत करता है, जो डायनेमिक फ्लेक्सिबल जॉब शॉप शेड्यूलिंग के लिए एक कैलिब्रेटेड बेंचमार्किंग फ्रेमवर्क है जो अनुक्रमिक इवेंट-स्पेस कैलिब्रेटर (Sequential Event-Space Calibrator) का उपयोग करके कठोरता से नियंत्रित इंस्टेंस उत्पन्न करता है, जो एक "ऑब्जर्वेबिलिटी पैराडॉक्स" (Observability Paradox) को उजागर करता है जहाँ पूर्ण सूचना तक पहुँच और टूल-संवर्धन अक्सर LLM-आधारित एजेंट के प्रदर्शन को कम कर देते हैं, जिससे वे मजबूत डिस्पैचिंग बेसलाइनों की तुलना में कम प्रदर्शन करते हैं।

मूल लेखक: Shijie Cao, Yuan Yuan, Jing Liu

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shijie Cao, Yuan Yuan, Jing Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि एक व्यस्त फैक्ट्री के फर्श को कैसे प्रबंधित किया जाए, जहाँ मशीनें खराब होती रहती हैं, नए ऑर्डर अचानक आते हैं, और समय सीमा (डेडलाइन) बदलती रहती है। इसे डायनेमिक फ्लेक्सिबल जॉब शॉप शेड्यूलिंग (Dynamic Flexible Job Shop Scheduling) कहा जाता है।

यह शोध पत्र तर्क देता है कि हम इन रोबोटों को सिखाने के लिए गलत प्रकार के "अभ्यास परीक्षणों" (practice tests) का उपयोग कर रहे हैं। यहाँ उनके नए दृष्टिकोण और उनकी खोजों का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है।

1. समस्या: खराब अभ्यास परीक्षण (Bad Practice Tests)

वर्तमान में, शोधकर्ता शेड्यूलिंग AI का परीक्षण दो प्रकार की समस्याओं पर करते हैं:

  • स्टैटिक बेंचमार्क (Static Benchmarks): यह एक छात्र को गणित के 50 निश्चित प्रश्नों की सूची देने जैसा है। छात्र उन विशिष्ट 50 प्रश्नों के उत्तरों को रट सकता है बजाय इसके कि वह गणित करना सीखे। जब वे किसी नई समस्या का सामना करते हैं, तो वे विफल हो जाते हैं।
  • रैंडम जनरेटर्स (Random Generators): अन्य लोग अनंत रैंडम समस्याएं बनाने की कोशिश करते हैं। लेकिन यह पासे फेंककर टेस्ट बनाने जैसा है। कभी-कभी पासा किस्मत से एक "सुपर ईजी" टेस्ट बना देता है, जिससे AI स्मार्ट दिखता है। अन्य समय में, यह एक "सुपर हार्ड" टेस्ट बना देता है और AI मूर्ख दिखता है। आप यह नहीं बता सकते कि AI वास्तव में अच्छा है या केवल भाग्यशाली/दुर्भाग्यशाली है।

परिणाम: हमें यह नहीं पता कि AI वास्तव में स्मार्ट है या केवल टेस्ट को रट रहा है या किस्मत का सहारा ले रहा है।

2. समाधान: डायनाशेडबेंच (DynaSchedBench - "कैलिब्रेटेड जिम")

लेखकों ने DynaSchedBench नामक एक नया ढांचा बनाया है। इसे शेड्यूलिंग रोबोट्स के लिए एक "स्मार्ट जिम" के रूप में सोचें।

केवल पासे फेंकने के बजाय, वे सीक्वेंशियल इवेंट-स्पेस कैलिब्रेटर (Sequential Event-Space Calibrator - SESC) नामक एक विशेष उपकरण का उपयोग करते हैं।

  • यह कैसे काम करता है: कल्पना करें कि आप एक धावक की गति का परीक्षण एक ट्रैक पर हवा के प्रतिरोध (wind resistance) के साथ करना चाहते हैं। केवल हवा के सही दिशा में बहने की उम्मीद करने के बजाय, यह उपकरण हवा की मशीन को तब तक एडजस्ट करता है जब तक कि प्रतिरोध ठीक उतना न हो जितना आपने मांगा था।
  • "स्ट्रेस इंडेक्स" (SSI): उन्होंने एक "कठिनाई स्कोर" (जैसे वीडियो गेम लेवल) बनाया है। अब वे एक "लेवल 5" की समस्या बना सकते हैं जो गारंटी के साथ "लेवल 4" से कठिन होगी, लेकिन "लेवल 6" से आसान होगी। यह किस्मत के कारक को हटा देता है।

3. बड़ी खोज: "ऑब्जर्वेबिलिटी पैराडॉक्स" (The Observability Paradox)

शोधकर्ताओं ने लार्ज लैंग्वेज मॉडल्स (LLMs)—वही AI जो निबंध लिखता है और आपसे चैट करता है—का परीक्षण किया ताकि देखा जा सके कि क्या वे फैक्ट्री मैनेजर के रूप में कार्य कर सकते हैं। उन्होंने AI को फैक्ट्री को "देखने" के तीन अलग-अलग तरीके दिए:

  • लेवल 1 (लोकल व्यू): "यहाँ आपकी ठीक सामने वाली मशीन है। यह खाली है। क्या आप इसका उपयोग करना चाहते हैं?" (सरल तथ्य)।
  • लेवल 2 (स्टेट्स व्यू): "यहाँ मशीन है, साथ ही पूरे फैक्ट्री की व्यस्तता का एक सारांश भी है।" (सरल तथ्य + डैशबोर्ड)।
  • लेवल 3 (ओरेकल व्यू): "यहाँ मशीन है, डैशबोर्ड है, और साथ ही फैक्ट्री का गुप्त ब्लूप्रिंट, भविष्य का शेड्यूल और छिपे हुए बॉटलनेक्स (bottlenecks) भी हैं।" (सब कुछ)।

चौंकाने वाली बात:
आप सोचेंगे कि AI को अधिक जानकारी देने (लेवल 3) से वह स्मार्ट हो जाएगा। ऐसा नहीं हुआ।

  • AI ने सरल डैशबोर्ड (लेवल 2) के साथ सबसे अच्छा प्रदर्शन किया।
  • जब उन्हें जटिल ब्लूप्रिंट के साथ "ओरेकल" व्यू (लेवल 3) दिया गया, तो AI वास्तव में और खराब हो गया।

उपमा: कल्पना कीजिए कि आप कार चला रहे हैं।

  • लेवल 2 सड़क और अपने स्पीडोमीटर को देखना है। आप अच्छी तरह से गाड़ी चलाते हैं।
  • लेवल 3 आपको अगले सप्ताह के मौसम पैटर्न, इंजन का आंतरिक तापमान, और सड़क पर हर कार का GPS इतिहास और पूरा ट्रैफिक रिपोर्ट देना है।
  • पैराडॉक्स: अतिरिक्त डेटा ने आपको ओवरवेल्म (अभिभूत) कर दिया। आप शोर (noise) से भ्रमित हो गए और केवल सड़क देखने की तुलना में खराब निर्णय लिए। शोध पत्र इसे "ऑब्जर्वेबिलिटी पैराडॉक्स" कहता है।

4. "टूल" का जाल (The "Tool" Trap)

उन्होंने AI को विशेष उपकरण भी दिए ताकि वह यह "सिमुलेट" कर सके कि यदि वह कोई कदम उठाता है तो क्या होगा (जैसे शतरंज का कंप्यूटर भविष्य को देखता है)।

  • परिणाम: इन उपकरणों का उपयोग करने से बहुत अधिक "टोकन" (कंप्यूटिंग पावर/पैसा) खर्च हुआ, लेकिन इससे AI शेड्यूलिंग में बिल्कुल भी बेहतर नहीं हुआ। यह एक फैंसी GPS के लिए भुगतान करने जैसा था जो आपको वही निर्देश दे रहा था जिनका आप स्वयं अनुमान लगा सकते थे।

5. अंतिम फैसला: अनुमान लगाने में अच्छे, ऑप्टिमाइज़ करने में कमजोर

शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI शेड्यूलिंग एजेंट सुपर-ऑप्टिमाइज़र नहीं हैं।

  • वे रोबस्ट एप्रोक्सिमेटर्स (Robust Approximators) हैं। इसका मतलब है कि वे "सुरक्षित," ठीक-ठाक अनुमान लगाने में अच्छे हैं जो किसी मानव विशेषज्ञ के त्वरित नियम-आधारित निर्णय (rule-of-thumb) के लगभग बराबर होते हैं।
  • वे पारंपरिक, हाथ से बनाए गए नियमों (heuristics) को लगातार हरा नहीं सकते। वे एक "परफॉरमेंस सीलिंग" (प्रदर्शन की सीमा) में फंसे हुए हैं।

सारांश

शोध पत्र कहता है: "AI को रटे हुए या रैंडम समस्याओं पर टेस्ट करना बंद करें। उन्हें निष्पक्ष रूप से परखने के लिए हमारे नए 'कैलिब्रेटेड जिम' का उपयोग करें। जब आप ऐसा करेंगे, तो आप पाएंगे कि AI को बहुत अधिक जानकारी देना वास्तव में उन्हें भ्रमित कर देता है, और वे वर्तमान में केवल बहुत अच्छे अनुमान लगाने वाले (guessers) हैं, जीनियस नहीं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →