← नवीनतम पेपर
🤖 AI

ProEvent: An Event-centric Benchmark for Proactive Agents

यह शोध पत्र ProEvent को प्रस्तुत करता है, जो इंस्टेंट मैसेजिंग चैट से उपयोगकर्ता की घटनाओं को स्वायत्त रूप से ट्रैक करने की प्रोएक्टिव एजेंटों की क्षमता का मूल्यांकन करने के लिए पहला इवेंट-केंद्रित बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान बड़े भाषा मॉडल (LLMs) समय निर्धारण (timing), घटना रद्द होने (event cancellation) और निहित तर्क (implicit reasoning) के मामले में काफी संघर्ष करते हैं।

मूल लेखक: Guanzhen Li, Liangming Pan, Leye Wang

प्रकाशित 2026-07-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanzhen Li, Liangming Pan, Leye Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट डिजिटल सहायक है जो केवल आपकी मदद के लिए पूछने का इंतज़ार नहीं करता, बल्कि एक बाज की तरह आपके जीवन पर नज़र रखता है, और आपके बोलने से पहले ही अंदाज़ा लगा लेता है कि आपको क्या चाहिए। यह "प्रोएक्टिव एजेंट्स" (proactive agents) का सपना है। एक साधारण रोबोट के विपरीत जो बटन दबाने तक निष्क्रिय बैठा रहता है, एक प्रोएक्टिव एजेंट एक व्यक्तिगत शेफ की तरह है जो लहसुन की खुशबू मिलते ही सब्जियां काटना शुरू कर देता है, या एक ऐसे दोस्त की तरह है जो आसमान के धूसर होते ही आपको छाता थमा देता है। कंप्यूटर विज्ञान में वर्तमान में सबसे बड़ी चुनौती इन डिजिटल दिमागों को यह सिखाना है कि वे मानवीय जीवन की अव्यवस्थित और अराजक वास्तविकता से भ्रमित हुए बिना यह काम कैसे करें। हम जानते हैं कि कंप्यूटर सख्त नियमों का पालन करने में माहिर होते हैं, लेकिन वास्तविक जीवन छिपे हुए संकेतों, ओवरलैपिंग बातचीत और लोगों के बिना "कैंसिल" कहे अपने मन बदलने से भरा होता है। यदि हम चाहते हैं कि ये एजेंट्स वास्तव में मददगार हों, तो उन्हें हमारे टेक्स्ट संदेशों को सुनकर हमारे भविष्य की योजनाओं—जैसे कि हाइकिंग ट्रिप या मीटिंग—को ट्रैक करने में सक्षम होना चाहिए, और उन्हें यह भी पता होना चाहिए कि उन्हें कब बोलना है और कब चुप रहना है।

यहाँ PROEVENT आता है, एक नया "प्रशिक्षण मैदान" जिसे शोधकर्ताओं द्वारा यह परीक्षण करने के लिए डिज़ाइन किया गया है कि क्या ये डिजिटल सहायक वास्तव में वास्तविक दुनिया के लिए तैयार हैं। PROEVENT को एक विशाल, उच्च-दांव वाले वीडियो गेम लेवल की तरह समझें जहाँ खिलाड़ी एक AI है जो इंसान का कैलेंडर मैनेज करने की कोशिश कर रहा है। AI को अपॉइंटमेंट्स की एक साफ-सुथरी सूची देने के बजाय, शोधकर्ता इसे वास्तविक और अव्यवस्थित टेक्स्ट चैट की एक धारा (stream) देते हैं। AI को दोस्तों, सहकर्मियों और परिवार के बीच होने वाली बातचीत को सुनना होता है, यह समझना होता है कि कौन से कार्यक्रम तय किए जा रहे हैं, और फिर उसके अनुसार कैलेंडर को अपडेट करना होता है। लेकिन यहाँ एक मोड़ है: ये चैट्स भटकाव से भरी होती हैं। इनमें बिना किसी मतलब की बगल की बातचीत, बीच में ही योजनाएं बदलना, और ऐसे संदेश शामिल हैं जो सुनने में तो 'कैंसिलेशन' जैसे लगते हैं पर असल में नहीं होते। AI को एक जासूस, एक लिपिक (scribe) और एक समय-प्रबंधक (time-manager) तीनों एक साथ बनना पड़ता है।

शोधकर्ताओं ने इस परीक्षण को बनाने के लिए हजारों फर्जी लेकिन बहुत ही वास्तविक दिखने वाले चैट लॉग्स बनाए। उन्होंने अलग-अलग व्यक्तित्वों और लक्ष्यों वाले "पात्रों" को प्रोग्राम किया, और फिर ऐसे जटिल परिदृश्य सिम्युलेट किए जहाँ लोग मीटिंग का समय तय करते हैं, बीमार महसूस करने के कारण योजना रद्द करते हैं, या ऐसी चीज़ों को शेड्यूल करने की कोशिश करते हैं जो वास्तव में कभी होती ही नहीं। उन्होंने इसमें "शोर" (noise) भी जोड़ा—यानी वे रैंडम संदेश जिनका मुख्य घटना से कोई लेना-देना नहीं था—यह देखने के लिए कि क्या AI विचलित हो जाता है। लक्ष्य सरल था: क्या AI केवल इन चैट्स को पढ़कर एक सही टाइमटेबल बना सकता है और उसे अपडेट कर सकता है?

जब उन्होंने आठ अलग-अलग शक्तिशाली AI मॉडल्स को इस परीक्षण से गुज़ारा, तो परिणाम "बुरा नहीं है" और "ओह नहीं" का मिश्रण थे। सबसे बड़ा आश्चर्य यह था कि AI मॉडल अत्यधिक उत्साही (over-eager) होते हैं। एक ऐसे कुत्ते की कल्पना करें जो हर हिलते हुए पत्ते पर भौंकता है; ये AI भी बिना किसी बदलाव के कैलेंडर को अपडेट करने की लगातार कोशिश कर रहे थे। वास्तव में, DeepSeek-V3.2 जैसे कुछ मॉडल्स के लिए, उन्होंने तब भी बदलाव करने की कोशिश की जब उन्हें चुप रहना चाहिए था, और ऐसा उन्होंने 96% से अधिक बार किया। वे मदद करने का मौका चूक जाने के डर से इतने व्याकुल थे कि उन्होंने अंततः अराजकता पैदा कर दी।

एक अन्य बड़ी बाधा थी निरस्तीकरण (cancellation)। यदि कोई उपयोगकर्ता कहता है, "मेरी तबीयत ठीक नहीं लग रही, शायद मैं नहीं आ पाऊँगा," तो एक इंसान जानता है कि यह एक कैंसिलेशन है। AI वास्तव में यह पहचानने में काफी अच्छा था कि डिलीशन की आवश्यकता हो सकती है (उन्होंने वास्तविक निरस्तीकरणों में से लगभग आधे को पकड़ा), लेकिन वे इसके बारे में निश्चित होने में संघर्ष कर रहे थे। उन्होंने अक्सर उन कार्यक्रमों को भी हटा दिया जो अभी भी चल रहे थे या गलत योजनाओं को हटा दिया। शोध पत्र सुझाव देता है कि यहाँ तक कि सबसे उन्नत मॉडल्स, जैसे कि GPT-5.1 नाम का मॉडल, भी कठिन परिदृश्यों में केवल 26.7% मामलों में ही सही उत्तर दे पाए। इसका मतलब है कि लगभग चार में से तीन मामलों में, AI ने शेड्यूल बिगाड़ दिया।

अध्ययन में यह भी पाया गया कि इन डिजिटल दिमागों की एक अजीब कमजोरी (blind spot) है: वे वास्तव में यह नहीं समझते कि वे किसकी मदद कर रहे हैं। जब कोई उपयोगकर्ता कहता है, "मैं पार्टी में नहीं जा सकता," तो AI अक्सर केवल अतिथि सूची से उपयोगकर्ता का नाम हटा देता है लेकिन पार्टी को कैलेंडर पर छोड़ देता है। यह एक ऐसे वेटर की तरह है जो, जब आप कहते हैं कि आपका पेट भर गया है, तो बस आपके नाम को आरक्षण से हटा देता है लेकिन आपके लिए मेज को सजा हुआ छोड़ देता है। AI घटना को बाहर से देख रहा है, एक तीसरे पक्ष के पर्यवेक्षक की तरह, बजाय इसके कि वह उपयोगकर्ता के जूते में पैर रखकर यह समझे कि, "ओह, मैं (उपयोगकर्ता) नहीं जा रहा हूँ, इसलिए मेरे लिए यह कार्यक्रम समाप्त हो गया है।"

संक्षेप में, हालांकि ये AI एजेंट्स स्मार्ट हो रहे हैं, लेकिन वे अभी तक आपके सक्रिय जीवन प्रबंधक (proactive life manager) बनने के लिए तैयार नहीं हैं। वे बहुत जल्दबाज़ी करने वाले हैं, जटिल बातचीत में भ्रमित हो जाते हैं, और "शायद" और "नहीं" के बीच के अंतर को समझने में संघर्ष करते हैं। शोधकर्ताओं को उम्मीद है कि PROEVENT का उपयोग करके, जहाँ वे स्पष्ट रूप से दिखा सकें कि ये AI कहाँ विफल होते हैं, भविष्य के संस्करण अधिक धैर्यवान, सटीक और अंततः एक मददगार मानव मित्र की तरह बनना सीख सकेंगे जो ठीक जानता है कि आपको छाता कब थमाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →