← नवीनतम पेपर
🤖 AI

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench उत्पादन-उन्मुख वर्कफ़्लो में भाषा-मॉडल एजेंटों के मूल्यांकन के लिए एक नवीन बेंचमार्क पेश करता है, जो कार्यात्मक पूर्णता को जोखिम-आधारित दंड से अलग करने वाले एक दोहरे-मीट्रिक ढांचे के माध्यम से तीन जटिलता स्तरों में 220 मानकीकृत कार्यों का आकलन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल डोमेन-प्रतिबंधित वितरण में संघर्ष करते हैं और कार्यात्मक सफलता अकेले उच्च-गुणवत्ता वाले कार्य परिणामों को सुनिश्चित करने के लिए अपर्याप्त है।

मूल लेखक: Summer Sun

प्रकाशित 2026-07-28
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Summer Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने छोटे से व्यवसाय को चलाने में मदद करने के लिए एक सुपर-स्मार्ट रोबोट सहायक को काम पर रख रहे हैं। आप केवल यह नहीं चाहते कि रोबोट आपके सवालों के सही जवाब दे; आप चाहते हैं कि वह वास्तव में काम करे। आप चाहते हैं कि वह आपके बिखरे हुए नोट्स ले, आपके टूल्स का उपयोग करे, सख्त नियमों का पालन करे, और आपको एक तैयार रिपोर्ट सौंपे जिसे आप कल वास्तव में उपयोग कर सकें। यह "AI एजेंट्स" की दुनिया है—ऐसे कंप्यूटर प्रोग्राम जो केवल चैट नहीं करते, बल्कि कार्य भी करते हैं। लंबे समय तक, वैज्ञानिकों ने इन रोबोटों का परीक्षण ट्रिविया प्रश्न पूछकर या यह देखकर किया कि क्या वे गणित की समस्या हल कर सकते हैं। लेकिन वास्तविक दुनिया में, सही उत्तर मिलना ही काफी नहीं है। यदि रोबोट फ़ाइल सहेजना भूल जाता है, ऐसे टूल का उपयोग करता है जिसे छूने की उसे अनुमति नहीं थी, या अपने डेटा के लिए किसी स्रोत की झूठी जानकारी देता है, तो पूरा काम विफल हो जाता है। हमें यह जांचने का एक तरीका चाहिए कि रोबोट केवल स्मार्ट ही नहीं है, बल्कि विश्वसनीय, सुरक्षित भी है और वास्तव में काम पूरा करके देता है।

यही वह चीज़ है जिसे पेपर "SQBench" संबोधित करता है। लेखकों ने, जिनका नेतृत्व समर सन (Summer Sun) कर रहे हैं, SQBench नामक एक नया परीक्षण मैदान बनाया है ताकि यह देखा जा सके कि AI एजेंट्स वास्तविक दुनिया के कार्यों को कितनी अच्छी तरह संभालते हैं। केवल यह जांचने के बजाय कि उत्तर सही है या नहीं, वे यह देखते हैं कि अंतिम "डिलीवरेबल" (तैयार उत्पाद) उपयोगी और सुरक्षित है या नहीं। उन्होंने 220 अलग-अलग काम बनाए, जो "इस फ़ाइल को खोजें" जैसे सरल कार्यों से लेकर "इन वित्तीय रिकॉर्ड का विश्लेषण करें" जैसे जटिल व्यावसायिक परिदृश्यों तक फैले हुए हैं। उन्होंने 27 अलग-अलग AI मॉडलों का परीक्षण किया यह देखने के लिए कि कौन से मॉडल वास्तव में बिना किसी नियम को तोड़े काम पूरा कर सकते हैं। सबसे बड़ा आश्चर्य? यहाँ तक कि सर्वश्रेष्ठ AI मॉडल भी इन वास्तविक दुनिया के कामों में अभी भी काफी अनाड़ी हैं। जबकि शीर्ष मॉडल लगभग 60% कार्यों को "पूरा" करने में सफल रहा, केवल लगभग 18% जटिल व्यावसायिक कार्यों को बिना किसी जोखिम भरी गलती के पूरी तरह से संपन्न किया गया। यह पेपर दिखाता है कि "स्मार्ट" होना "विश्वसनीय" होने के समान नहीं है, और हमें AI को इस आधार पर मापना शुरू करना होगा कि वह कितने सुरक्षित और उपयोगी परिणाम वितरित करता है, न कि इस आधार पर कि वह कितने प्रश्नों के उत्तर दे सकता है।

नया रिपोर्ट कार्ड: "सही उत्तर" से "सुरक्षित डिलीवरी" तक

AI के परीक्षण के पुराने तरीके को स्कूल में होने वाले पॉप क्विज़ की तरह समझें। यदि आप गणित की समस्या सही हल करते हैं, तो आपको 'A' ग्रेड मिलता है। लेकिन वास्तविक दुनिया में, कल्पना करें कि यदि आपने गणित तो सही किया लेकिन उत्तर एक नैपकिन के पीछे लिखा जो फेंक दिया गया, या यदि आपने एक ऐसे कैलकुलेटर का उपयोग किया जिसे परीक्षा में लाने की अनुमति नहीं थी। आपके पास सही संख्या हो सकती है, लेकिन आप असाइनमेंट में विफल रहे।

इस पेपर के लेखक तर्क देते हैं कि हमें एक नए प्रकार के रिपोर्ट कार्ड की आवश्यकता है। वे इसे SQBench कहते हैं (जो "SQ" के लिए "शाकियू" (Shaqiu), जो इसके पीछे का समुदाय है, और "Bench" के लिए "बेंचमार्क" से बना है)। उन्होंने इस परीक्षण को यह देखने के लिए डिज़ाइन किया है कि क्या एक AI एजेंट एक जिम्मेदार कर्मचारी की तरह कार्य कर सकता है। यह परीक्षण तीन स्तरों पर बना है, जैसे कि बढ़ती कठिनाई वाला एक वीडियो गेम:

  • स्तर 1 (L1): बुनियादी बातें। ये सरल, परमाणु कार्य हैं। क्या रोबोट एक विशिष्ट निर्देश का पालन कर सकता है? क्या वह एक फ़ाइल ढूंढ सकता है? क्या वह ऐसा कोड लिख सकता है जो क्रैश न हो? यह इस बात का परीक्षण करने जैसा है कि क्या रोबोट अपने जूते के फीते बांध सकता है।
  • स्तर 2 (L2): कॉम्बो मूव्स। यहाँ, रोबोट को कई कौशलों को एक साथ जोड़ना होगा। उसे एक स्प्रेडशीट पढ़नी पड़ सकती है, एक सर्च टूल का उपयोग करना पड़ सकता है, और फिर एक सारांश लिखना पड़ सकता है। यह रोबोट को सैंडविच बनाने के लिए कहने जैसा है: ब्रेड लें, मांस लें, उन्हें एक साथ रखें, और फिर उसे लपेट दें।
  • स्तर 3 (L3): बॉस बैटल। यह वास्तविक दुनिया का काम है। रोबोट को सख्त व्यावसायिक नियमों के भीतर काम करना होगा, जैसे स्वास्थ्य सेवा डेटा या वित्तीय रिपोर्टों को संभालना जहाँ गलती करना खतरनाक हो सकता है। उसे कानूनों का पालन करना होगा, राज सुरक्षित रखने होंगे, और एक ऐसी रिपोर्ट तैयार करनी होगी जिस पर एक इंसान वास्तव में भरोसा कर सके।

"स्ट्रिक्ट पास" का नियम: क्यों "ठीक है" पर्याप्त नहीं है

यहाँ इस पेपर का सबसे महत्वपूर्ण हिस्सा है: लेखकों ने महसूस किया कि केवल कार्य को पूरा करना ही पर्याप्त नहीं है। एक AI रिपोर्ट तो पूरी कर सकता है, लेकिन यदि उसने अपने दावे का समर्थन करने के लिए एक फर्जी वेबसाइट लिंक बना दिया, या यदि उसने गलती से उस फ़ाइल को हटा दिया जिसे उसे नहीं छूना चाहिए था, तो वह रिपोर्ट बेकार है।

इसे ठीक करने के लिए, उन्होंने एक 10D रिस्क मैट्रिक्स बनाया। इसे एक "सुरक्षा निरीक्षक" की तरह समझें जो रोबोट के काम के पूरा होने के बाद उसके काम की जांच करता है। निरीक्षक 10 विशिष्ट प्रकार की समस्याओं की तलाश करता है, जैसे:

  • D1: तथ्यों या स्रोतों को मनगढ़ंत बनाना (Hallucination)।
  • D2: फॉर्मेटिंग नियमों की अनदेखी करना (जैसे गलत फॉन्ट में लिखना)।
  • D3: सुरक्षा या गोपनीयता के नियमों को तोड़ना।
  • D4: समय बर्बाद करना या बहुत अधिक संसाधनों का उपयोग करना।
  • D8: अच्छा दिखने के लिए झूठ बोलना या गलतियों को छिपाना।

स्कोरिंग सिस्टम इस प्रकार काम करता है:

  1. पूर्णता (Completion): क्या रोबोट ने काम पूरा किया? (हाँ/नहीं)।
  2. जोखिम दंड (Risk Penalty): क्या रोबोट ने काम करते समय किसी नियम का उल्लंघन किया? यदि उसने कोई तथ्य मनगढ़ंत बनाया, तो उसे दंड मिलेगा। यदि उसने सुरक्षा नियम तोड़ा, तो उसे भारी दंड मिलेगा।
  3. स्ट्रिक्ट पास (Strict Pass): "स्ट्रिक्ट पास" प्राप्त करने के लिए, रोबोट के पास Completion = 1 (उसने काम पूरा किया) होना चाहिए और Risk Penalty = 0 (उसने एक भी नियम नहीं तोड़ा) होना चाहिए।

यह एक बहुत ऊँचा मानक है। यह कहने जैसा है कि, "आप केवल होमवर्क जमा नहीं कर सकते; आपको इसे समय पर, सही फॉन्ट के साथ, बिना किसी धोखाधड़ी और बिना किसी मनगढ़ंत तथ्य के जमा करना होगा।"

परीक्षणों ने वास्तव में क्या पाया

लेखकों ने 27 अलग-अलग AI मॉडलों को इस 220-कार्य वाली बाधा से गुजारा। उन्होंने मॉडलों को भाग्य आजमाने के लिए बार-बार प्रयास नहीं करने दिया; प्रत्येक मॉडल को प्रत्येक कार्य के लिए केवल एक ही मौका मिला। यहाँ क्या हुआ:

  • सर्वश्रेष्ठ प्रदर्शन करने वाला: Kimi K3 नाम के मॉडल ने सबसे अच्छा प्रदर्शन किया, जिसने 60.5% का Weighted Pass@1 प्राप्त किया। इसका अर्थ है कि इसने लगभग 60% कार्यों को सफलतापूर्वक पूरा किया और सुरक्षा जांच पास की।
  • बड़ी खाई: सर्वश्रेष्ठ मॉडल भी लगभग आधे समय विफल रहा। लेकिन असली कहानी विवरणों में है।
  • "L3" की समस्या: जब कार्य स्तर 3 (जटिल व्यावसायिक परिदृश्य) तक पहुँचे, तो स्कोर नाटकीय रूप से गिर गया। सभी मॉडलों के लिए स्तर 3 के लिए औसत "स्ट्रिक्ट पास" दर केवल 18.5% थी। प्रत्येक मॉडल ने सरल कार्यों की तुलना में इन जटिल, वास्तविक दुनिया के कार्यों पर खराब प्रदर्शन किया।
  • "लगभग पहुँच गए" वाले फेलियर: पेपर में पाया गया कि 2,348 कार्यों में से जिनमें मॉडलों ने काम पूरा किया था (Completion = 1), 113 कार्य (4.8%) अभी भी स्ट्रिक्ट पास में विफल रहे क्योंकि उन्होंने किसी जोखिम को ट्रिगर किया था। उदाहरण के लिए, एक मॉडल ने एक बेहतरीन रिपोर्ट लिखी होगी, लेकिन यदि उसने एक फर्जी साइटेशन लिंक शामिल किया, तो वह विफल हो गया। यह साबित करता है कि काम पूरा करना ही पर्याप्त नहीं है; काम की गुणवत्ता और सुरक्षा भी उतनी ही महत्वपूर्ण है।

यह क्यों मायने रखता है

यह पेपर दिखाता है कि हम वर्तमान में यह परीक्षण करने में बहुत अच्छे हैं कि क्या AI "सोच" सकता है (प्रश्नों के उत्तर देना), लेकिन हम यह परीक्षण करने में खराब हैं कि क्या AI "काम" कर सकता है (सुरक्षित, उपयोगी परिणाम देना)। वर्तमान पीढ़ी के AI मॉडल एक प्रतिभाशाली इंटर्न की तरह हैं जो विचारों के मंथन में तो बहुत अच्छे हैं लेकिन फ़ाइलें सहेजना भूल जाते हैं या गलती से गलत लोगों को ईमेल भेज देते हैं।

लेखक सावधानी से कहते हैं कि यह परीक्षण (SQBench v1.0) केवल एक झलक है। उन्होंने 220 विशिष्ट कार्यों का परीक्षण किया, और परिणाम बदल सकते हैं यदि वे विभिन्न उद्योगों या कार्यों का परीक्षण करते हैं। उन्होंने यह भी नोट किया कि उन्होंने हर एक उत्तर की जाँच करने के लिए मानव विशेषज्ञों का उपयोग नहीं किया, इसलिए इसमें कुछ अनिश्चितता है। हालाँकि, पैटर्न स्पष्ट है: डोमेन बाधाओं के तहत डिलीवरी (Delivery under domain constraints) एक साझा कमजोरी है। चाहे वित्त हो, स्वास्थ्य सेवा हो, या विनिर्माण, AI एजेंट्स वर्तमान में सख्त नियमों और सुरक्षा आवश्यकताओं के बीच तालमेल बिठाने में संघर्ष कर रहे हैं।

पेपर निष्कर्ष निकालता है कि हमें "पूर्णता" (completion) का जश्न मनाना बंद करना चाहिए और "सुरक्षित डिलीवरी" का जश्न मनाना शुरू करना चाहिए। हमें AI को केवल इस आधार पर नहीं मापना चाहिए कि वह कितने प्रश्नों के उत्तर दे सकता है, बल्कि इस आधार पर कि वह कितनी बार बिना कोई गड़बड़ी किए काम पूरा कर सकता है। जब तक हम ऐसा नहीं कर सकते, AI एजेंट्स स्मार्ट तो हो सकते हैं, लेकिन वे वास्तविक दुनिया के लिए पूरी तरह तैयार नहीं हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →