← नवीनतम पेपर
🤖 machine learning

ProactBench: Beyond What The User Asked For

ProactBench संवादात्मक सक्रियता (conversational proactivity)—LLMs द्वारा निहित उपयोगकर्ता आवश्यकताओं को पहचानने और उन पर कार्य करने की क्षमता—का मूल्यांकन करने के लिए एक नया बेंचमार्क पेश करता है, जो इसे इमर्जेंट (Emergent), क्रिटिकल (Critical) और रिकवरी (Recovery) चरणों में विभाजित करता है और यह प्रदर्शित करता है कि रिकवरी प्रदर्शन एक विशिष्ट, कठिन मूल्यांकन संकेत है जिसे मौजूदा बेंचमार्क द्वारा नहीं पकड़ा जा सकता है।

मूल लेखक: Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त से बात कर रहे हैं जो एक विशेषज्ञ सहायक (expert assistant) है। आप कहते हैं, "मैं एक घंटे में एयरपोर्ट के लिए निकल रहा हूँ, और मुझे अभी एहसास हुआ कि मैं अपना चार्जर पैक करना भूल गया।"

एक रिएक्टिव (reactive) सहायक (वह तरह का AI जो आज अधिकांश AI है) कहेगा: "ठीक है, मैंने इसे नोट कर लिया है। आपकी उड़ान के लिए शुभकामनाएँ!" उसने आपके अनुरोध का उत्तर तो बिल्कुल सही दिया, लेकिन उसने इस तथ्य को अनदेखा कर दिया कि आप बिना पावर के फंसने वाले हैं।

एक प्रोएक्टिव (proactive) सहायक कहेगा: "चूंकि आप एक घंटे में निकल रहे हैं, इसलिए आपके पास नया खरीदने का समय नहीं होगा। क्या आपके बैग में एक पोर्टेबल बैटरी है? साथ ही, आपकी फ्लाइट शाम 6 बजे की है, इसलिए यदि आप गेट मिस करते हैं, तो आपको तुरंत एयरलाइन को कॉल करना होगा। यह रहा उनका नंबर।"

यह शोध पत्र, ProactBench, एक नया परीक्षण है जिसे यह देखने के लिए बनाया गया है कि क्या AI उस दूसरे प्रकार के दोस्त की तरह बन सकता है। यह पूछता है: क्या AI वह देख सकता है जो आपने नहीं कहा और आपके कहने से पहले ही आपकी मदद कर सकता है?

प्रोएक्टिविटी के तीन "क्षण" (The Three "Moments" of Proactivity)

लेखकों ने महसूस किया कि प्रोएक्टिव होना केवल एक कौशल नहीं है; यह बातचीत के विभिन्न समयों पर होता है। उन्होंने इसे तीन "ट्रिगर्स" में विभाजित किया, जैसे वीडियो गेम में चेकपॉइंट्स होते हैं:

  1. इमर्जेंट (Emergent - शुरुआती संकेत):

    • परिदृश्य: आप बातों-बातों में जिक्र करते हैं कि आपके बॉस ऑफिस में नहीं हैं।
    • प्रोएक्टिव कदम: AI महसूस करता है, "ओह, अगर बॉस बाहर हैं, तो अभी कोई भी इस जरूरी अनुरोध को अप्रूव नहीं कर सकता," और एक वैकल्पिक समाधान सुझाता है।
    • परीक्षण: क्या AI ने एक छोटे से विवरण को एक छिपी हुई समस्या से जोड़ा?
  2. क्रिटिकल (Critical - पहेली सुलझाना):

    • परिदृश्य: कुछ चरणों के दौरान, आप उल्लेख करते हैं कि आपका बजट कम है, आपका सूटकेस भारी है, और कल सुबह जल्दी आपकी फ्लाइट है।
    • प्रोएक्टिव कदम: AI इन तीनों सुरागों को जोड़ता है और कहता है, "चूंकि आप बजट के प्रति सचेत हैं और आपका बैग भारी है, इसलिए आपको टैक्सी के बजाय बस लेनी चाहिए, और आपको बस पकड़ने के लिए सुबह 4 बजे जागना होगा।"
    • परीक्षण: क्या AI ने एक नया, उपयोगी निष्कर्ष बनाने के लिए बिखरे हुए कई विवरणों को जोड़ा?
  3. रिकवरी (Recovery - "रुको, एक और बात"):

    • परिदृश्य: आप कहते हैं, "ठीक है, योजना तय है। मेरा काम हो गया!"
    • प्रोएक्टिव कदम: एक सामान्य AI कहता है, "बहुत बढ़िया! आपकी यात्रा सुखद हो!" एक प्रोएक्टिव AI कहता है, "बहुत बढ़िया! बस एक बात: चूंकि आप वह भारी उपकरण अपनी हैचबैक कार में लोड कर रहे हैं, याद रखें कि प्रोजेक्टर को अंत में रखें ताकि पहुँचने पर वह सबसे पहले बाहर निकाला जा सके।"
    • परीक्षण: यह सबसे कठिन हिस्सा है। क्या AI ने काम तकनीकी रूप से समाप्त होने के बाद भी, बिना परेशान किए, मूल्य जोड़ा?

उन्होंने इसका परीक्षण कैसे किया (The "Secret Sauce")

यह सुनिश्चित करने के लिए कि AI केवल अनुमान नहीं लगा रहा है या टेस्ट के उत्तर नहीं पढ़ रहा है, शोधकर्ताओं ने एक "तीन-एजेंट" प्रणाली बनाई, जैसे तीन अभिनेताओं वाला एक नाटक:

  • डायरेक्टर (प्लानर): यह AI स्क्रिप्ट लिखता है और यह तय करता है कि कब सहायक का परीक्षण करना है। वह गुप्त लक्ष्य और "रूब्रिक" (ग्रेडिंग शीट) को जानता है, लेकिन वह सहायक को नहीं बताता।
  • एक्टर (यूजर एजेंट): यह AI इंसान की भूमिका निभाता है। वह डायरेक्टर के निर्देशों का पालन करता है लेकिन स्वाभाविक रूप से बोलता है, जिसमें अलग-अलग व्यक्तित्व (बातूनी, गुस्सैल, सटीक, आदि) शामिल हैं।
  • परफॉर्मर (असिस्टेंट मॉडल): यह वह AI है जिसका परीक्षण किया जा रहा है। वह केवल बातचीत को देखता है। उसे पता नहीं है कि उसका ग्रेडिंग की जा रही है, उसे गुप्त लक्ष्य का पता नहीं है, और न ही उसे पता है कि "यूजर" वास्तव में कैसा है।

यह सेटअप AI को टेस्ट के सवालों को रटने या केवल अच्छा दिखने की कोशिश करने से रोकता है।

उन्हें क्या मिला

शोधकर्ताओं ने 198 बातचीत पर 16 अलग-अलग AI मॉडलों (उपलब्ध सबसे स्मार्ट मॉडलों) का परीक्षण किया। यहाँ बड़ा आश्चर्य है:

  • "रिएक्टिव" गैप: अधिकांश मॉडल सीधे सवालों के जवाब देने में माहिर हैं। वे उन उत्कृष्ट छात्रों की तरह हैं जिन्हें टेस्ट में 'A' ग्रेड मिलता है यदि शिक्षक ठीक वही सवाल पूछे जो पूछा गया है।
  • "प्रोएक्टिव" गैप: जब बात रिकवरी चरण (वह "रुको, एक और बात" वाला क्षण) की आई, तो लगभग सभी मॉडल बुरी तरह विफल रहे। यहाँ तक कि सबसे स्मार्ट AI भी केवल 37% बार ही सफल हो पाया।
  • विसंगति (The Disconnect): कोडिंग, गणित या तर्क (मानक AI टेस्ट) में अच्छा होना, यह भविष्यवाणी नहीं करता था कि कौन सा AI प्रोएक्टिव होने में अच्छा होगा। आपके पास एक ऐसा जीनियस कोडर हो सकता है जो आपकी जरूरतों को समझने में बहुत बुरा हो।

मानवीय निर्णय (The Human Verdict)

शोधकर्ताओं ने AI के जवाबों का मूल्यांकन करने के लिए वास्तविक मनुष्यों का उपयोग किया।

  • क्या लोग इसे पसंद करते हैं? हाँ! जब AI प्रोएक्टिव था, तो मनुष्यों ने मानक "विनम्र लेकिन खाली" प्रतिक्रिया की तुलना में 80% बार इसे पसंद किया।
  • क्या यह केवल एक "जी-हजूर" (Yes-Man) बनना है? नहीं। टेस्ट ने विशेष रूप से उन AI को दंडित किया जो केवल हर बात से सहमत होते थे या सामान्य सलाह देते थे। AI को मददगार होने के लिए बातचीत के विशिष्ट विवरणों का उपयोग करना था।

मुख्य निष्कर्ष (The Bottom Line)

ProactBench दिखाता है कि हालांकि AI आदेशों का पालन करने में स्मार्ट होता जा रहा है, लेकिन वह अभी भी एक मददगार साथी बनने की दिशा में सीख रहा है। यह वर्तमान में वह करने में बहुत अच्छा है जो उसे बताया जाता है, लेकिन यह पहचानने में संघर्ष करता है कि आपको क्या चाहिए, इससे पहले कि आप कहें। लेखकों का सुझाव है कि यह केवल बुद्धिमत्ता की कमी नहीं है; यह "पॉलिसी" या व्यवहार का अंतर है। सबसे अच्छे AI मॉडल एक विचारशील मित्र की तरह होने की सीख रहे हैं जो आपकी जरूरतों का पूर्वानुमान लगा सके, न कि केवल एक बहुत तेज़ कैलकुलेटर की तरह।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →