LHAW: Controllable Underspecification for Long-Horizon Tasks
यह शोध पत्र LHAW को प्रस्तुत करता है, जो एक मॉड्यूलर सिंथेटिक पाइपलाइन है जो चार आयामों में सूचना को हटाकर नियंत्रित रूप से अल्प-निर्धारित दीर्घ-अवधि कार्य वेरिएंट्स को व्यवस्थित रूप से उत्पन्न करती है और एजेंट परीक्षणों के माध्यम से उनके प्रभाव को प्रमाणित करती है, जिससे अस्पष्ट सेटिंग्स में एजेंट स्पष्टीकरण व्यवहार के लागत-संवेदनशील मूल्यांकन के लिए पहला ढांचा प्रदान किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने पूरे व्यवसाय को अपने लिए चलाने के लिए एक बहुत ही बुद्धिमान, सुपर-फास्ट रोबोट सहायक को काम पर रखा है। आप उसे कहते हैं, "हमारे नए उत्पाद के लिए एक मार्केटिंग अभियान बनाओ।"
एक आदर्श दुनिया में, रोबोट ठीक से जानता है कि आपका क्या मतलब है। लेकिन वास्तविक दुनिया में, आपके निर्देश अक्सर सूक्ष्म, महत्वपूर्ण विवरणों से रह जाते हैं। शायद आपने यह नहीं बताया कि कौन सा उत्पाद, या क्या बजट उपयोग करना है, या दर्शक कौन हैं।
यदि रोबोट बहुत अधिक आत्मविश्वासी है, तो वह गलत अनुमान लगा सकता है और हफ्तों का काम बर्बाद कर सकता है। यदि वह बहुत अधिक सतर्क है, तो वह रुक जाएगा और आपसे लाखों सवाल पूछेगा, जिससे आप परेशान होंगे और काम की गति धीमी हो जाएगी।
समस्या:
वर्तमान में, हमारे पास यह परीक्षण करने का कोई अच्छा तरीका नहीं है कि हमारे AI रोबोट को कब अनुमान लगाना चाहिए और कब मदद मांगनी चाहिए। अधिकांश परीक्षण उन्हें पूर्ण निर्देश देते हैं, इसलिए वे वास्तविक जीवन की अव्यवस्थित, अपूर्ण वास्तविकता को संभालना कभी नहीं सीखते।
समाधान: LHAW ("मिसिंग पीस" सिम्युलेटर)
इस शोध पत्र के लेखकों ने LHAW (लॉन्ग-होरिज़न ऑगमेंटेड वर्कफ़्लो) नामक एक टूल बनाया है। LHAW को एक "गेम मास्टर" की तरह समझें जो AI रोबोट के लिए काम करता है।
यह कैसे काम करता है, इसके लिए एक सरल उपमा देखें:
1. रेसिपी टेस्ट (पहेली बनाना)
कल्पना कीजिए कि आपके पास केक बनाने की एक आदर्श रेसिपी है (एक अच्छी तरह से निर्दिष्ट कार्य)। LHAW उस रेसिपी को लेता है और व्यवस्थित रूप से सामग्री या निर्देशों को हटाकर उसका एक "टूटा हुआ" संस्करण बनाता है।
- लक्ष्य हटाना (Goal Removal): "केक बनाओ।" (लेकिन कैसा? चॉकलेट? गाजर वाला? जन्मदिन के लिए?)
- प्रतिबंध हटाना (Constraint Removal): "इसे बेक करें।" (लेकिन किस तापमान पर? कितनी देर के लिए?)
- इनपुट हटाना (Input Removal): "मैदा इस्तेमाल करें।" (लेकिन कौन सा बैग? पेंट्री वाला या गैरेज वाला?)
- संदर्भ हटाना (Context Removal): "सजावट करें।" (लेकिन किसके साथ? स्प्रिंकल्स? आइसिंग? क्या यह बेबी शॉवर के लिए है या अंतिम संस्कार के लिए?)
LHAW ऐसे हजारों "टूटे हुए रेसिपी" बनाता है और उन्हें लेबल करता है:
- परिणाम-महत्वपूर्ण (Outcome-Critical): यदि रोबोट गलत अनुमान लगाता है, तो केक खराब हो जाता है (कार्य विफल हो जाता है)।
- विचलित (Divergent): रोबोट अपने अनुमान के आधार पर एक शानदार केक भी बना सकता है या एक बुरा केक भी।
- सौम्य (Benign): रोबोट इसे अपने आप समझ सकता है (जैसे, "350 डिग्री पर बेक करें" एक सुरक्षित डिफ़ॉल्ट है)।
2. स्ट्रेस टेस्ट (रोबोट को देखना)
अब, LHAW इन टूटी हुई रेसिपी को विभिन्न AI मॉडलों (जैसे GPT-5, Claude, Gemini) को देता है और देखता है कि वे क्या करते हैं।
- "साइलेंट फेलर्स" (खामोश विफल होने वाले): कुछ रोबट बस अनुमान लगाते हैं। वे एक केक बनाते हैं, लेकिन वह गलत स्वाद का होता है। वे चुपचाप विफल हो जाते हैं।
- "ओवर-आस्कर्स" (बहुत अधिक पूछने वाले): कुछ रोबोट रुक जाते हैं और पूछते हैं, "कौन सा स्वाद? कौन सा आकार? कौन सा पैन? कौन सा ओवन?" वे इतने सवाल पूछते हैं कि वे उपयोगकर्ता को परेशान कर देते हैं।
- "स्ट्रेटेजिक आस्कर्स" (रणनीतिक रूप से पूछने वाले): सबसे अच्छे रोबोट जानते हैं कि समय बर्बाद किए बिना स्थिति को संभालने के लिए कौन से सटीक प्रश्न पूछने हैं।
3. स्कोरकार्ड (दक्षता मापना)
यह शोध पत्र इन रोबोटों को ग्रेड देने का एक नया तरीका पेश करता है जिसे "प्रति प्रश्न लाभ" (Gain per Question) कहा जाता है।
- कल्पना कीजिए कि आप उपयोगकर्ता हैं। हर बार जब आप किसी प्रश्न का उत्तर देते हैं, तो इसमें आपका समय और मानसिक ऊर्जा खर्च होती है।
- खराब रोबोट: थोड़ी सी स्पष्टता पाने के लिए 10 प्रश्न पूछता है। (उच्च लागत, कम लाभ)।
- अच्छा रोबोट: एक विशिष्ट प्रश्न पूछता है जो पूरी समस्या को हल कर देता है। (कम लागत, उच्च लाभ)।
उन्होंने क्या पाया?
शोधकर्ताओं ने आज उपलब्ध सबसे स्मार्ट AI मॉडलों का परीक्षण किया और कुछ दिलचस्प पैटर्न पाए:
- GPT-5.2 एक घबराए हुए छात्र की तरह है: यह बहुत सारे प्रश्न पूछता है। यह शायद ही कभी विफल होता है, लेकिन बहुत अधिक पूछकर उपयोगकर्ता को परेशान करता है।
- Gemini मॉडल "शांत स्वभाव" वाले लोगों की तरह हैं: वे बहुत अधिक अनुमान लगाते हैं और अक्सर गलत हो जाते हैं क्योंकि वे पूछने से डरते हैं।
- पूछने की "लागत": शोध पत्र में यह भी परीक्षण किया गया कि रोबोट कैसे प्रतिक्रिया करता है यदि आप उसे कहते हैं, "मैं बहुत व्यस्त हूँ, जब तक कि आपात स्थिति न हो, मुझे परेशान न करें।" रोबोटों ने वास्तव में अपना व्यवहार बदल लिया! जब उन्हें लगा कि आप व्यस्त हैं, तो उन्होंने कम प्रश्न पूछे, जिससे पता चला कि वे "लागत" को समझ सकते हैं।
यह क्यों मायने रखता है?
हम एक ऐसे भविष्य की ओर बढ़ रहे हैं जहाँ AI एजेंट जटिल, दीर्घकालिक कार्य करेंगे (जैसे आपके वित्त का प्रबंधन करना, सॉफ्टवेयर कोड करना, या आपकी आपूर्ति श्रृंखला चलाना)।
यदि ये एजेंट यह अंतर नहीं कर सकते कि "मैं यह खुद समझ सकता हूँ" और "मुझे मदद की ज़रूरत है", तो वे या तो:
- चुपचाप विफल होंगे और आपदाएँ पैदा करेंगे।
- आपको लगातार परेशान करेंगे और बेकार हो जाएंगे।
LHAW पहला ऐसा टूल है जो हमें इन रोबोटों को रणनीतिक बनाने के लिए प्रशिक्षित और परीक्षण करने की अनुमति देता है। यह उन्हें एक आदर्श कर्मचारी बनने के लिए सिखाता है: अकेले काम करने के लिए पर्याप्त आत्मविश्वासी, लेकिन वास्तव में जरूरत पड़ने पर मदद मांगने के लिए पर्याप्त विनम्र।
संक्षेप में: LHAW एक प्रशिक्षण सिम्युलेटर है जो AI रोबोट को सिखाता है कि सूचना की कमी को कैसे संभालना है ताकि वे उनके मानव मालिकों को पागल न करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।