← नवीनतम पेपर
💻 computer science

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

यह शोध पत्र BulkPR-Bench प्रस्तुत करता है, जो सुरक्षित मर्ज क्रम (merge orders) को संयुक्त रूप से निर्धारित करके इंटरैक्टिंग पुल रिक्वेस्ट्स (pull requests) को नियंत्रित करने की कोडिंग एजेंटों की क्षमता का मूल्यांकन करने के लिए एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल रिलेशनल डिपेंडेंसीज़ (relational dependencies) को संभालने में सुधार के बावजूद, पूरे क्यू (whole-queue) के विश्वसनीय शासन को प्राप्त करने में संघर्ष करते हैं।

मूल लेखक: Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruinin
प्रकाशित 2026-08-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल, अराजक निर्माण स्थल की कल्पना करें जहाँ सैकड़ों टीमें एक ही गगनचुंबी इमारत में एक साथ अलग-अलग कमरे बनाने की कोशिश कर रही हैं। सॉफ्टवेयर की दुनिया में, इन "कमरों" को पुल रिक्वेस्ट (PRs) कहा जाता है—जो कोडबेस में प्रस्तावित बदलाव हैं। आमतौर पर, एक टीम लीडर (या एक स्वचालित प्रणाली) एक समय में एक प्रस्ताव की जाँच करता है। यदि वह ठीक दिखता है, तो वे उसे अंदर आने देते हैं। यदि वह खराब दिखता है, तो वे उसे वापस भेज देते हैं। यह तब तक ठीक काम करता है जब हर कोई अलग-अलग, स्वतंत्र कार्यों पर काम कर रहा हो।

लेकिन क्या होता है जब टीमें एक-दूसरे के काम में हस्तक्षेप करने लगती हैं? मान लीजिए टीम A एक नया दरवाजा बना रही है, जबकि टीम B ठीक उसके बगल में एक खिड़की लगाने की कोशिश कर रही है, और टीम C उस दीवार को मजबूत करने की कोशिश कर रही है जिसकी जरूरत दरवाजे और खिड़की दोनों को है। यदि आप पूरी तस्वीर देखे बिना उन्हें एक-एक करके अंदर आने देते हैं, तो अंत में आपके पास एक ऐसा दरवाजा हो सकता है जो फिट न बैठे, एक ऐसी खिड़की हो सकती है जो दरवाजे को बाधित करे, या एक ऐसी दीवार हो सकती है जो ढह जाए। यह इंटरैक्टिंग पुल रिक्वेस्ट (interacting pull requests) की समस्या है। कंप्यूटर वैज्ञानिकों के लिए बड़ा सवाल यह है: क्या हम एक "स्मार्ट मैनेजर" (एक AI एजेंट) बना सकते हैं जो केवल एक समय में एक कमरे की जाँच नहीं करता, बल्कि पूरे निर्माण स्थल को देखता है, यह पता लगाता है कि कौन सी टीमें आपस में लड़ रही हैं, किन्हें मिलकर काम करने की आवश्यकता है, और बिना इमारत को गिराए उन सभी को अंदर लाने का सही क्रम तय करता है?

यह बिल्कुल वही है जिसे शोध पत्र BulkPR-Bench संबोधित करता है। शोधकर्ताओं ने एक विशाल, जटिल परीक्षण बनाया है ताकि यह देखा जा सके कि क्या वर्तमान AI कोडिंग असिस्टेंट इन स्मार्ट प्रबंधकों के रूप में कार्य कर सकते हैं। उन्होंने 18 अलग-अलग वास्तविक दुनिया के सॉफ्टवेयर प्रोजेक्ट्स और 581 नए, जटिल बदलावों के साथ एक परिदृश्य तैयार किया। लक्ष्य केवल यह देखना नहीं था कि क्या AI एक एकल बग को ठीक कर सकता है, बल्कि यह देखना था कि क्या वह बदलावों की एक पूरी कतार (queue) को प्रबंधित कर सकता है, उनके बीच छिपे हुए संबंधों (जैसे "टीम A के समाप्त होने तक टीम B शुरू नहीं कर सकती") को समझ सकता है, और उन्हें सुरक्षित रूप से मर्ज कर सकता है।

परिणाम "बुरे नहीं हैं" और "अभी लंबा रास्ता तय करना बाकी है" का मिश्रण थे। AI एजेंट कुछ परेशानी वाले स्थानों को पहचानने में आश्चर्यजनक रूप से अच्छे थे। सबसे अच्छे AI मॉडल उन जटिल बदलावों के समूहों को सुरक्षित रूप से मर्ज करने में लगभग 66.6% सफल रहे जिन्हें उन्हें संभालना था, जो पुराने, सरल तरीकों से बेहतर है जो केवल एक-एक करके जाँच करते हैं (जो केवल लगभग 53.1% ही प्राप्त कर पाए)। हालाँकि, जब बात अंतिम लक्ष्य की आई—यानी बिना किसी गलती के एक पूरी कतार में प्रत्येक बदलाव को सफलतापूर्वक मर्ज करने की—तो AI संघर्ष करता रहा। पूरी कतार को प्रबंधित करने के 324 प्रयासों में से, केवल 8 ही पूर्णतः सफल रहे।

शोध पत्र सुझाव देता है कि हालांकि ये AI "प्रबंधक" यह समझने में बेहतर हो रहे हैं कि विभिन्न कोड परिवर्तन एक-दूसरे से कैसे संबंधित हैं, लेकिन वे अभी भी पूरी तरह से अकेले एक निर्माण स्थल चलाने के लिए पर्याप्त विश्वसनीय नहीं हैं। वे अक्सर छिपे हुए संघर्षों को मिस कर देते हैं या क्रम गलत कर देते हैं, जिससे असुरक्षित मर्ज होते हैं। शोधकर्ताओं ने पाया कि AI को एक साथ अधिक जानकारी देने (एक समय में अधिक बदलाव देखने) से मदद मिली, लेकिन इससे समस्या पूरी तरह हल नहीं हुई। संक्षेप में, AI छोटे समूहों के लिए एक अच्छा फोरमैन बनने की सीख रहा है, लेकिन यह अभी पूरी इमारत के लिए जनरल कॉन्ट्रैक्टर बनने के लिए तैयार नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →