Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents
यह शोधपत्र Ambig-DS प्रस्तुत करता है, जो दो नैदानिक सूट्स (diagnostic suites) से युक्त एक बेंचमार्क है जो यह प्रकट करता है कि डेटा-साइंस एजेंट अस्पष्टता का सामना करने पर अनचाहे कार्य फ्रेमिंग (task framings) को स्वीकार करके चुपचाप कैसे विफल हो जाते हैं, और यह रेखांकित करता है कि वर्तमान मूल्यांकनों में पाइपलाइन निष्पादन सुनिश्चित करने के बजाय अपर्याप्त विवरण (underspecification) को पहचानना ही महत्वपूर्ण बाधा है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ Ambig-DS पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।
मुख्य विचार: "मौन गलती" (The Silent Mistake)
कल्पना कीजिए कि आपने अपने लिए खाना पकाने के लिए एक बहुत ही स्मार्ट, स्वचालित शेफ (एक AI एजेंट) को काम पर रखा है। आप उसे एक रेसिपी कार्ड और सामग्रियों की एक टोकरी देते हैं।
मौजूदा परीक्षणों में, रेसिपी कार्ड आमतौर पर एकदम सही होता है: इसमें लिखा होता है, "टमाटर और बेसिल का उपयोग करके एक स्पाइसी पास्ता डिश बनाएँ।" शेफ इसे बनाता है, परोसता है, और टेस्ट कहता है: "बहुत बढ़िया! पास्ता सही ढंग से पका हुआ है और प्लेट में सजाया गया है।"
लेकिन वास्तविक दुनिया में, रेसिपी कार्ड अक्सर अस्पष्ट होते हैं। आप शायद सिर्फ इतना कह सकते हैं, "इन सामग्रियों से कुछ बनाओ," बिना यह बताए कि क्या बनाना है।
- समस्या: AI शेफ सामग्रियों को देखता है और चुपचाप तय कर लेता है, "ठीक है, मैं सलाद बनाऊँगा।" वह एक बेहतरीन, खाने योग्य सलाद बनाता है। लेकिन आप पास्ता चाहते थे।
- विफलता: टेस्ट कहता है, "सफलता! सलाद पका हुआ है और प्लेट में सजाया गया है।" टेस्ट को नहीं पता कि आप पास्ता चाहते थे। AI ने यह नहीं पूछा, "क्या आप पास्ता चाहते हैं या सलाद?" उसने बस अनुमान लगाया, एक गलत चीज़ को पूरी तरह से बनाकर पेश कर दिया, और अपनी गलती को एक बेहतरीन निष्पादन (execution) के पीछे छिपा लिया।
पेपर इसे "अनफ्लैग्ड मिसफ्रेमिंग" (Unflagged Misframing) कहता है। AI तकनीकी रूप से सक्षम है (वह खाना बना सकता है), लेकिन उसमें यह समझने की समझ (wisdom) की कमी है कि निर्देश अस्पष्ट थे और काम शुरू करने से पहले स्पष्टीकरण मांगना चाहिए।
समाधान: Ambig-DS (द कन्फ्यूजन टेस्ट)
शोधकर्ताओं ने इस विशिष्ट प्रकार की विफलता को पकड़ने के लिए Ambig-DS नामक एक नया बेंचमार्क बनाया है। AI को एकदम सटीक निर्देश देने के बजाय, उन्होंने जानबूझकर ऐसे "ट्रिकी" कार्य बनाए जहाँ लक्ष्य स्पष्ट नहीं है।
उन्होंने दो मुख्य प्रकार के भ्रम (confusion) का परीक्षण किया:
1. "कौन सा नंबर?" वाला भ्रम (Target Ambiguity)
- सेटअप: कल्पना कीजिए कि एक स्प्रेडशीट है जिसमें संख्याओं के दो कॉलम हैं। एक कॉलम "असली" उत्तर है जिसे AI को प्रेडिक्ट करना चाहिए (जैसे, "कुल बिक्री" - Total Sales), और दूसरा एक "डिकॉय" (decoy) है (जैसे, "कुल कर्मचारी" - Total Employees)। दोनों बहुत समान दिखते हैं और दोनों को प्रेडिक्ट करना समान रूप से आसान है।
- चाल: निर्देश केवल कहते हैं, "वैल्यू प्रेडिक्ट करें।" वे यह नहीं बताते कि कौन सी वैल्यू।
- परिणाम: AI एक को चुन लेता है (आमतौर पर डिकॉय को), एक परफेक्ट मॉडल बनाता है, और उसे सबमिट कर देता है।
- स्कोर: क्योंकि AI ने गलत कॉलम चुना, इसलिए उसे बहुत खराब स्कोर मिलता है, भले ही कोड पूरी तरह से चला हो।
- निष्कर्ष: यहाँ तक कि सबसे स्मार्ट AI मॉडल भी 39% से 63% बार इस जाल में फंस जाते हैं। वे चुपचाप गलत उत्तर के प्रति प्रतिबद्ध हो जाते हैं।
2. "हम कैसे मापें?" वाला भ्रम (Objective Ambiguity)
- सेटअप: कल्पना कीजिए कि एक ऐसा कार्य है जहाँ आपको यह अनुमान लगाना है कि किसी फोटो में कैक्टस है या नहीं। निर्देश कहते हैं, "अपने अनुमान सबमिट करें," लेकिन वे यह बताना भूल जाते हैं कि अनुमानों को कैसे जाँचा जाएगा।
- चाल: क्या आपको "हाँ/नहीं" (Hard Label) सबमिट करना चाहिए या "70% संभावना कि हाँ" (Probability)?
- यदि ग्रेडर प्रोबेबिलिटी चाहता है, लेकिन आप हाँ/नहीं सबमिट करते हैं, तो आप फेल हो जाएंगे।
- यदि ग्रेडर हाँ/नहीं चाहता है, लेकिन आप प्रोबेबिलिटी सबमिट करते हैं, तो आप फेल हो सकते हैं या अजीब स्कोर मिल सकता है।
- परिणाम: AI अनुमान लगाता है। कभी-कभी वह गलत फॉर्मेट में अनुमान लगाता है। कभी-कभी, यह महसूस करते हुए कि उसे पता नहीं है, वह हार मान लेता है और बस एक आलसी, निरंतर उत्तर (जैसे हर चीज़ के लिए "हाँ") सबमिट कर देता है ताकि काम पूरा हो सके।
- निष्कर्ष: इन मामलों में, 16% से 62% बार, AI या तो गलत फॉर्मेट चुनता है या चुपचाप हार मान लेता है।
"जादुई प्रश्न" प्रयोग (The "Magic Question" Experiment)
शोधकर्ता जानना चाहते थे: यदि AI को एक प्रश्न पूछने की अनुमति दी जाए, तो क्या वह इस गलती को सुधार सकता है?
उन्होंने AI को एक "क्लैरिफिकेशन ओरकल" (एक जादुई बटन जो एक प्रश्न का सच्चाई से उत्तर देता है) दिया।
- परिणाम: जब AI को पूछने की अनुमति दी गई, "कौन सा कॉलम टारगेट है?" या "क्या आपको प्रोबेबिलिटी चाहिए या हाँ/नहीं?", तो उनका प्रदर्शन लगभग पूर्ण स्तर तक वापस आ गया।
- पेंच: AI सवाल का जवाब देने में बहुत अच्छा है यदि वह सवाल पूछता है। लेकिन AI यह जानने में बहुत बुरा है कि कब पूछना है।
- यदि आप AI को कहते हैं "आप कुछ भी पूछ सकते हैं," तो वह उन कार्यों पर भी बहुत सारे फालतू सवाल पूछता है (जैसे "क्या आपको तीखा पसंद है?") जो पहले से ही स्पष्ट थे।
- यदि आप कहते हैं "केवल तभी पूछें जब आप अटक जाएं," तो वह ट्रिकी कार्यों पर चुप रहता है और गलत अनुमान ही लगाता है।
निष्कर्ष (The Takeaway)
पेपर निष्कर्ष निकालता है कि हम वर्तमान में AI एजेंटों का परीक्षण रेस कारों की तरह कर रहे हैं: हम देखते हैं कि क्या वे तेज़ चल सकते हैं और सही समय पर रुक सकते हैं। लेकिन हम यह परीक्षण नहीं कर रहे हैं कि क्या वे तब मैप पढ़ सकते हैं जब सड़क के संकेत गायब हों।
मुख्य बाधा यह नहीं है कि AI कोड नहीं लिख सकता या मॉडल ट्रेन नहीं कर सकता; बल्कि यह है कि AI को यह नहीं पता कि उसे कब नहीं पता है।
- उपयोगकर्ताओं के लिए: यह न मानें कि AI आपके अस्पष्ट निर्देशों को समझ जाता है। आप क्या प्रेडिक्ट करना चाहते हैं और सफलता को कैसे मापना चाहते हैं, इसके बारे में बहुत स्पष्ट रहें।
- बिल्डर्स के लिए: हमें AI को यह कहने में बेहतर बनाने के लिए प्रशिक्षित करने की आवश्यकता है कि, "मैं भ्रमित हूँ, क्या आप स्पष्ट कर सकते हैं?" बजाय इसके कि वह केवल अनुमान लगाए और उम्मीद करे कि सब ठीक होगा।
- टेस्टर के लिए: हमें केवल यह जांचना बंद करना होगा कि कोड चल रहा है या नहीं। हमें यह भी जांचना होगा कि क्या AI ने यह महसूस किया कि निर्देश अस्पष्ट थे।
संक्षेप में: एक ऐसा AI जो एक गलत योजना को पूरी तरह से लागू कर सकता है, एक खतरनाक AI है। Ambig-DS पहला टूल है जिसे विशेष रूप से इस प्रकार की 'मौन विफलता' (silent failure) को पकड़ने के लिए डिज़ाइन किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।