← नवीनतम पेपर
💻 computer science

ProcBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

यह शोध पत्र ProcBench प्रस्तुत करता है, जो एक मानक ऑन्टोलॉजी और जोखिम-आधारित स्कोरकार्ड के माध्यम से प्रक्रिया-स्तरीय दोषों और नियंत्रण संरक्षण का विश्लेषण करके LLM कोडिंग एजेंटों का मूल्यांकन करने वाला एक ढांचा है, जो कई डेटासेट में पारंपरिक केवल-परिणाम वाले बेंचमार्क की तुलना में अधिक गहन नैदानिक अंतर्दृष्टि प्रदान करता है।

मूल लेखक: Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने घर में एक जटिल रिसाव (leak) को ठीक करने के लिए एक रोबोट सहायक को काम पर रख रहे हैं।

पुराना तरीका (वर्तमान बेंचमार्क):
अभी, यदि आप किसी रोबोट को रिसाव ठीक करने के लिए कहते हैं, तो आप केवल परिणाम देखते हैं: क्या पानी रुक गया? यदि पानी रुक जाता है, तो आप रोबोट को एक गोल्ड स्टार देते हैं। यदि पानी टपकता रहता है, तो आप उसे थम्स डाउन देते हैं।

लेकिन यह कहानी का बहुत सा हिस्सा छोड़ देता है। क्या होगा यदि रोबोट ने:

  • रिसाव ठीक करने से पहले आपका पूरा पानी का भंडार पी लिया हो?
  • पाइप खोजने से पहले दीवार में एक ही छेद को 50 बार छेद दिया हो?
  • काम के बीच में ही अपने औजार कहाँ छोड़े, यह भूल गया हो?
  • अंततः सफल होने से पहले एक घंटे तक गोल-गोल घूमने के लूप में फंसा रहा हो?

यदि पानी रुक जाता है, तो पुराना सिस्टम कहता है, "बहुत अच्छा काम किया!" लेकिन वास्तव में, रोबोट अराजक, अपव्ययी और नियंत्रण में रखने में कठिन था।

नया तरीका (ProcBench):
इस पेपर के लेखक, ProcBench, कहते हैं: "हमें रोबोट को इस आधार पर ग्रेड देना चाहिए कि उसने काम कैसे किया, न कि केवल इस आधार पर कि क्या उसने काम पूरा किया।"

उन्होंने एक नया स्कोरिंग सिस्टम बनाया है जो रोबोट की पूरी यात्रा को देखता है, जैसे एक रेफरी फुटबॉल के खेल को देखता है, न कि केवल अंतिम स्कोर को।

ProcBench कैसे काम करता है (उपमा)

एक कोडिंग एजेंट (रोबोट) को एक शेफ (रसोइया) के रूप में सोचें जो एक जटिल भोजन बनाने की कोशिश कर रहा है।

1. "प्रोसेस डिफेक्ट्स" (रसोई का बिखराव/गंदगी)
ProcBench उन विशिष्ट तरीकों को देखता है जिनसे शेफ काम करने की प्रक्रिया में गड़बड़ी कर सकता है, भले ही अंत में भोजन का स्वाद ठीक हो। वे इन गड़बड़ियों को चार मुख्य क्षेत्रों में वर्गीकृत करते हैं:

  • कॉन्टेक्स्ट मैनेजमेंट (बिखरा हुआ काउंटर):

    • घोस्ट कॉन्टेक्स्ट (Ghost Context): शेफ उस पुराने रेसिपी पेज को देखते रहने लगता है जिसे पहले ही सारांशित (summarize) किया जा चुका है, जिससे मानसिक स्थान बर्बाद होता है।
    • ओवरसाइज़्ड रूल्स (Oversized Rules): शेफ अपनी एप्रन में नियमों की एक 50 पन्नों की नियमावली लेकर घूम रहा है जिसकी उसे वास्तव में आवश्यकता नहीं है, जिससे उसकी गति धीमी हो जाती है।
    • थ्रैशिंग (Thrashing): शेफ फ्रिज के माध्यम से बार-बार चीजें निकालता है, उन्हें वापस रखता है, और फिर से निकालता है, कभी भी एक योजना पर स्थिर नहीं हो पाता।
  • टूल-यूज़ एफिशिएंसी (बर्बाद हुई गतिविधियाँ):

    • डुप्लिकेट स्टेप्स (Duplicate Steps): शेफ प्याज काटता है, चेक करता है कि क्या वह कट गया है, फिर से काटता है, फिर से चेक करता है, और तीसरी बार काटता है।
    • डेड स्टेप्स (Dead Steps): शेफ ओवन खोलता है, अंदर देखता है, उसे बंद कर देता है, और वास्तव में केक अंदर नहीं रखता। क्रिया हुई, लेकिन उसने कुछ बदला नहीं।
    • लॉन्ग चेन्स (Long Chains): शेफ एक काम करने के लिए 50 छोटे कदम उठाता है जिसे 5 कदमों में किया जा सकता था।
  • वर्कफ़्लो आर्किटेक्चर (खराब रसोई लेआउट):

    • रैपर वर्कफ़्लो (Wrapper Workflow): शेफ के पास एक सहायक है जो बिना कुछ उपयोगी किए बस शेफ के हाथ से नमक को उसके दूसरे हाथ में पकड़ा रहा है।
    • कॉन्टेक्स्ट कपलिंग (Context Coupling): शेफ और उसका सहायक एक-दूसरे के कार्यों में इतने उलझे हुए हैं कि यदि एक को छींक भी आए, तो पूरी रसोई ढह जाएगी।
  • टूल-इकोसिस्टम कंसिस्टेंसी (भ्रमित करने वाले बर्तन):

    • इनकंसिस्टेंट इंटरफेस (Inconsistent Interfaces): एक चम्मच पर "सूप" लिखा है, दूसरे पर "तरल" और तीसरे पर "सूप (गर्म)" लिखा है। शेफ भ्रमित हो जाता है और गलत चम्मच का उपयोग करता है।
    • वीक टूल्स (Weak Tools): दराज में एक बेहतरीन इलेक्ट्रिक व्हिस्क (फेंटने वाला यंत्र) है, लेकिन शेफ उसे कभी ढूंढ नहीं पाता और फोर्क का उपयोग करना जारी रखता है क्योंकि व्हिस्क छिपा हुआ था।

2. "कंट्रोल प्रिजर्वेशन" (सेफ्टी स्विच)
यह सबसे महत्वपूर्ण हिस्सा है। भले ही रोबोट गलतियाँ कर रहा हो, क्या आप (इंसान) कार्यभार संभाल सकते हैं?

  • इंटरप्रिटेबिलिटी (व्याख्यात्मकता): क्या आप समझ सकते हैं कि रोबोट क्या कर रहा है?
  • इंटरप्टिबिलिटी (बाधा डालने की क्षमता): क्या आप "पॉज" बटन दबा सकते हैं बिना रोबोट के क्रैश हुए?
  • करेक्टेबिलिटी (सुधारने की क्षमता): यदि रोबोट कोई गलती करता है, तो क्या आप पूरे भोजन को शुरू से शुरू किए बिना उसे ठीक कर सकते हैं?
  • रिवर्सिबिलिटी (उल्टा करने की क्षमता): क्या रोबोट एक बुरे कदम को वापस ले सकता है (undo)?
  • अथॉरिटी हैंडऑफ (अधिकार सौंपना): क्या रोबोट कह सकता है, "मैं फंस गया हूँ, अब आप संभालें," और वास्तव में आपको मौका दे सकता है?

"कैलिब्रेटेड स्कोरकार्ड" (रिपोर्ट कार्ड)

केवल "पास" या "फेल" कहने के बजाय, ProcBench एक विस्तृत रिपोर्ट कार्ड देता है।

  • यह केवल गलतियों को नहीं गिनता; यह जोखिम की गणना करता है।
  • यह एक "कैलिब्रेशन" प्रणाली (मौसम के पूर्वानुमान की तरह) का उपयोग करता है। यह कहने के बजाय कि "बारिश हो सकती है," यह कहता है, "बारिश होने की 70% संभावना है।" यह आपको समझने में मदद करता है कि एक गलती कितनी गंभीर है।
  • यह प्रोसेस (रसोई कितनी बिखरी हुई थी) के लिए एक स्कोर और कंट्रोल (रसोई कितनी सुरक्षित महसूस हुई) के लिए एक स्कोर देता है।

उन्होंने क्या पाया

लेखकों ने इसे विभिन्न AI रोबोटों का उपयोग करके 200 वास्तविक दुनिया के कोडिंग कार्यों (जैसे सॉफ़्टवेयर में बग ठीक करना या ऐप्स बनाना) पर परखा।

  1. यह काम करता है: उन्होंने पाया कि वे इन "बिखरी हुई रसोई" वाले व्यवहारों को विश्वसनीय रूप से पहचान सकते हैं।
  2. यह छिपे हुए दोषों को उजागर करता है: दो रोबोट दोनों कार्य को पूरा कर सकते हैं (Pass), लेकिन एक ने इसे कुशलतापूर्वक और सुरक्षित रूप से किया, जबकि दूसरे ने इसे अराजक और जोखिम भरा बनाया। पुराना सिस्टम दोनों को गोल्ड स्टार देगा। ProcBench अराजक वाले को कम स्कोर देता है।
  3. यह केवल मॉडल के बारे में नहीं है: एक शक्तिशाली AI दिमाग (मॉडल) एक अच्छी प्रक्रिया की गारंटी नहीं देता है। यदि रोबोट का "शरीर" (एजेंट फ्रेमवर्क) अनाड़ी है, तो पूरा सिस्टम विफल हो जाता है, भले ही दिमाग स्मार्ट हो।

निचोड़

ProcBench कोडिंग करने वाले AI को ग्रेड देने का एक नया तरीका है। यह हमें केवल अंतिम परिणाम देखने से रोकता है और हमें यात्रा (प्रक्रिया) को देखने के लिए मजबूर करता है। यह पूछता है: "क्या रोबोट ने समस्या को हल किया, या उसने बस एक गड़बड़ी पैदा करते हुए और नियंत्रण खोते हुए समाधान तक पहुँचने का रास्ता खोज लिया?"

यह डेवलपर्स को ऐसे AI बनाने में मदद करता है जो न केवल स्मार्ट है, बल्कि विश्वसनीय, सुरक्षित और प्रबंधित करने में आसान भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →