NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles
NeuroState-Bench एक मानव-कैलिब्रेटेड बेंचमार्क है जो प्रतिबद्धता अखंडता (commitment integrity) को मापने के लिए साइड-क्वेरी प्रोब्स का उपयोग करके LLM एजेंट प्रोफाइल्स का मूल्यांकन करता है, जो यह प्रकट करता है कि कार्य सफलता और अखंडता अक्सर भिन्न होते हैं और पारंपरिक सफलता मेट्रिक्स की तुलना में डिस्ट्रैक्टर गड़बड़ी (distractor perturbations) के तहत अखंडता रैंकिंग अधिक स्थिर होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल, बहु-दिवसीय यात्रा की योजना बनाने के लिए एक व्यक्तिगत सहायक (personal assistant) को काम पर रख रहे हैं। आप उन्हें नियमों की एक सूची देते हैं: "समुद्र के दृश्य वाला होटल बुक करें," "रात के खाने पर $200 से अधिक खर्च न करें," और "याद रखें कि मुझे मूंगफली से एलर्जी है।"
पुराना तरीका (परिणाम-आधारित मूल्यांकन):
अतीत में, हम केवल अंतिम परिणाम की जाँच करते थे। यदि सहायक एक आदर्श यात्रा कार्यक्रम लेकर आता जिसमें समुद्र के दृश्य वाला होटल, सस्ता खाना और कोई मूंगफली नहीं थी, तो हम उन्हें "A" ग्रेड देते थे। हमें इससे कोई फर्क नहीं पड़ता था कि वे वहां तक कैसे पहुँचे। हो सकता है कि वे बीच में मूंगफली की एलर्जी के बारे में भूल गए हों, घबरा गए हों और आखिरी सेकंड में इसे ठीक कर दिया हो। हो सकता है कि उन्होंने गलती से गलत होटल बुक कर दिया हो लेकिन किस्मत से उसे बदल दिया हो। जब तक अंतिम कागज़ात सही दिख रहे थे, काम पूरा माना जाता था।
नई समस्या:
इस शोध पत्र के लेखक, NeuroState-Bench, तर्क देते हैं कि यह "अंतिम ग्रेड" वाली प्रणाली खतरनाक है। वास्तविक दुनिया में, हमें यह जानने की आवश्यकता है कि क्या सहायक ने पूरी प्रक्रिया के दौरान नियमों को लगातार याद रखा। क्या उन्होंने दोपहर के भोजन का ऑर्डर देते समय भी मूंगफली की एलर्जी को ध्यान में रखा? क्या वे किसी शानदार रेस्टोरेंट के लालच में आकर बजट पर टिके रहे? यदि वे बीच में नियम भूल गए और केवल अंत में इसे ठीक किया, तो वे किसी अन्य यात्रा पर गलती कर सकते हैं जहाँ उन्हें दूसरा मौका नहीं मिलेगा।
नया समाधान: "साइड-क्वेश्चन" (पार्श्व-प्रश्न) परीक्षण
यह पेपर AI एजेंटों (स्मार्ट कंप्यूटर प्रोग्राम) को टेस्ट करने का एक नया तरीका पेश करता है जिसे NeuroState-Bench कहा जाता है। केवल अंतिम उत्तर का इंतजार करने के बजाय, यह बेंचमार्क बीच में ही AI से "साइड क्वेश्चन" पूछता है।
इसे एक कक्षा में परीक्षा के दौरान घूमते हुए शिक्षक की तरह समझें:
- कार्य: "रोम के इतिहास पर एक निबंध लिखें।"
- साइड क्वेश्चन: "हे, इसे पूरा करने से पहले, आपने जिस पहले सम्राट का उल्लेख किया था, उनका नाम क्या था?"
यदि छात्र एक शानदार निबंध लिखता है लेकिन पूछे जाने पर सम्राट का नाम याद नहीं रख पाता, तो इसका मतलब है कि उसने या तो अंत का अनुमान लगाया या कहीं से नकल की है। उसने उन तथ्यों के प्रति अपनी "प्रतिबद्धता" (commitment) को वास्तव में बनाए नहीं रखा जो वह लिख रहा था।
यह बेंचमार्क कैसे काम करता है:
- सेटअप: शोधकर्ताओं ने 144 अलग-अलग "परिदृश्य" (जैसे यात्रा योजना का उदाहरण) बनाए जिनमें 8 अलग-अलग प्रकार की मानसिक चुनौतियाँ (जैसे नियम याद रखना, व्याकुलता को अनदेखा करना, या गलती सुधारना) शामिल थीं।
- प्रोब्स (Probes): प्रत्येक परिदृश्य के लिए, उन्होंने 306 विशिष्ट "साइड क्वेश्चन" जोड़े जो यह जांचने के लिए डिज़ाइन किए गए थे कि क्या AI अभी भी मूल नियमों का पालन कर रहा है।
- मानवीय जाँच: मनुष्यों ने इन परीक्षणों की समीक्षा की ताकि यह सुनिश्चित किया जा सके कि प्रश्न निष्पक्ष हैं और कठिनाई स्तर सटीक हैं। उन्होंने पाया कि मनुष्यों और AI के बीच इस बात पर बहुत अधिक सहमति थी कि क्या "कठिन" है और क्या "आसान"।
- स्कोर: उन्होंने एक नया स्कोर निकाला जिसे HCCIS-CORE कहा जाता है। यह "कमिटमेंट इंटीग्रिटी" (प्रतिबद्धता अखंडता) को मापता है। यह पूछता है: क्या AI उन नियमों के प्रति सच्चा रहा जिनका पालन करने का उसने वादा किया था, भले ही चीजें भ्रमित करने वाली हो गई हों?
चौंकाने वाले परिणाम:
जब उन्होंने 32 अलग-अलग AI मॉडल (कुछ छोटे, कुछ बहुत बड़े और शक्तिशाली) का परीक्षण किया, तो उन्हें कुछ चौंकाने वाला पता चला:
- "सबसे अच्छा" छात्र "सबसे ईमानदार" छात्र नहीं है: वह AI जिसने सबसे अधिक सही अंतिम उत्तर दिए, वह नहीं था जो नियमों के साथ सबसे अधिक सुसंगत रहा।
- रैंकिंग का पलटना: यदि आप AI मॉडलों को उनके अंतिम उत्तरों के आधार पर रैंक करते हैं, तो शीर्ष स्थान एक मॉडल को मिलता है। लेकिन यदि आप उन्हें उनकी "कमिटमेंट इंटीग्रिटी" (नियमों पर टिके रहने की क्षमता) के आधार पर रैंक करते हैं, तो वही मॉडल नीचे गिर जाता है और एक दूसरा मॉडल शीर्ष पर आ जाता है। वास्तव में, 32 में से 31 मॉडलों की रैंकिंग बदल गई जब आपने "अंतिम उत्तर" से "प्रतिबद्धता" के आधार पर ग्रेडिंग की।
- विघटन (Distractions): जब शोधकर्ताओं ने "डिस्ट्रैक्टर्स" (भ्रमित करने वाली अतिरिक्त जानकारी) जोड़े, तो वे मॉडल जो सही अंतिम उत्तर देने में अच्छे थे, बिखर गए। हालाँकि, उच्च "कमिटमेंट इंटीग्रिटी" वाले मॉडल स्थिर रहे। वे शोर को अनदेखा करने और योजना पर टिके रहने में बेहतर थे।
इसका क्या अर्थ है (शोध पत्र के अनुसार):
पेपर निष्कर्ष निकालता है कि अंत में सही उत्तर प्राप्त करना यह साबित करने के लिए पर्याप्त नहीं है कि एक AI विश्वसनीय है। एक AI गलती से सही उत्तर प्राप्त कर सकता है जबकि वह बीच में नियमों का पूरा ट्रैक खो चुका हो।
लेखकों ने इस बेंचमार्क को AI की ईमानदारी और निरंतरता के लिए एक "तनाव परीक्षण" (stress test) के रूप में बनाया है। वे यह दावा नहीं कर रहे हैं कि उन्होंने एक नया AI बनाया है जो अधिक स्मार्ट है; उन्होंने यह मापने के लिए एक बेहतर पैमाना (ruler) बनाया है कि क्या एक AI वास्तव में वही कर रहा है जो वह कह रहा है।
उन्होंने क्या दावा नहीं किया:
- उन्होंने यह दावा नहीं किया कि यह एक चिकित्सा उपकरण है या मानव मस्तिष्क की समस्याओं का निदान करने का तरीका है (नाम में "न्यूरो" होने के बावजूद, यह मानव जीव विज्ञान के बारे में नहीं बल्कि AI के "मानसिक अवस्थाओं" के बारे में है)।
- उन्होंने यह दावा नहीं किया कि उनकी नई स्कोरिंग विधि पूर्ण है या यह हमेशा भविष्य की भविष्यवाणी करेगी।
- उन्होंने स्पष्ट रूप से कहा कि उनके "न्यूरल" (मस्तिष्क जैसे) एड-ऑन ने वास्तव में स्कोर को बहुत बेहतर नहीं बनाया, इसलिए उन्होंने सरल, मानव-कैलिब्रेटेड संस्करण के साथ बने रहने का निर्णय लिया।
संक्षेप में:
NeuroState-Bench AI के लिए एक नया रिपोर्ट कार्ड है। यह केवल अंतिम ग्रेड देखने के बजाय होमवर्क नोट्स की जाँच करता है ताकि यह देखा जा सके कि क्या छात्र वास्तव में पूरे समय ध्यान दे रहा था। यह सच है कि वह AI जिसके पास सबसे अच्छा अंतिम ग्रेड था, अक्सर वह नहीं था जो सबसे अधिक ध्यान दे रहा था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।