RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications
रुबेंच (Rubench) एक रिपॉजिटरी-स्तरीय एजेंटिक कोडिंग बेंचमार्क है जिसमें लाइव ओपन-सोर्स प्रोजेक्ट्स से मूल रूप से तैयार की गई 25 रूसी कार्य विशिष्टताएँ शामिल हैं, जिसे वास्तविक रखरखाव कार्यों पर उत्पाद-ग्रेड कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जबकि डेटा संदूषण प्रतिरोध सुनिश्चित करना और कठोर सांख्यिकीय विश्लेषण एवं प्रक्षेपवक्र ऑडिटिंग के माध्यम से तैनात सिस्टम व्यवहारों में महत्वपूर्ण अंतर्दृष्टि को प्रकट करना भी इसका उद्देश्य है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप जटिल, कस्टम-निर्मित रेस कारों की एक पूरी टीम को ठीक करने के लिए विशेषज्ञ मैकेनिकों की भर्ती कर रहे हैं। अब तक, इन मैकेनिकों के लिए अधिकांश परीक्षण औपचारिक अंग्रेजी में लिखे गए थे, जैसे कि कोई तकनीकी मैनुअल हो। लेकिन वास्तविक दुनिया में, ग्राहक मैनुअल की तरह बात नहीं करते; वे अपनी स्वाभाविक भाषा में बात करते हैं। वे कहते हैं जैसे, "जब भी मैं बारिश वाले मंगलवार को ब्रेक लगाता हूँ, मेरी कार हिलने लगती है।"
RuBench एक नया परीक्षण है यह देखने के लिए कि क्या AI कोडिंग असिस्टेंट वास्तव में उन अव्यवस्थित, वास्तविक दुनिया के ग्राहकों के अनुरोधों को समझ सकते हैं जब वे रूसी भाषा में लिखे जाते हैं, न कि अंग्रेजी में।
यहाँ बताया गया है कि यह परीक्षण कैसे काम करता है, क्या हुआ, और वह चौंकाने वाला मोड़ क्या था जो शोधकर्ताओं ने पाया, सरल उपमाओं का उपयोग करते हुए।
1. परीक्षण: एक "वास्तविक दुनिया" की रिपेयर शॉप
अधिकांश पिछले परीक्षणों ने AI एजेंटों को एक बग का साफ-सुथरा, अंग्रेजी विवरण दिया। RuBench अलग है:
- कारें: यह परीक्षण पांच वास्तविक, लोकप्रिय ओपन-सोर्स सॉफ्टवेयर प्रोजेक्ट्स (जैसे
aiohttpयाLaravel) का उपयोग करता है। ये नकली पहेलियाँ नहीं हैं; ये लाइव कोडबेस हैं जिनका उपयोग हजारों डेवलपर्स द्वारा किया जाता है। - अनुरोध: एक औपचारिक बग रिपोर्ट के बजाय, शोधकर्ताओं ने रूसी भाषा में शुरू से 25 नए अनुरोध लिखे। वे एक बिजनेस ओनर की तरह लगते हैं जो एक ठेकेदार से शिकायत कर रहा हो: "जब हम बॉट को एडमिन बनाते हैं तो यह क्रैश हो जाता है; इसे ठीक करें, लेकिन मौजूदा चैट्स को न तोड़ें।"
- मिस्ट्री बॉक्स: शोधकर्ताओं ने "उत्तर कुंजी" (वास्तविक कोड फिक्स और वे टेस्ट जो साबित करते हैं कि यह काम करता है) को छिपा दिया। AI को खुद ही फिक्स का पता लगाना होगा। केवल शोधकर्ताओं के पास ही वह कुंजी है जिससे वे जांच सकें कि क्या AI सफल हुआ।
- ताजगी (Freshness): सभी बग्स उन कोड अपडेट में पाए गए थे जो AI मॉडल के प्रशिक्षण (training) के बाद किए गए थे। यह सुनिश्चित करता है कि AI ने अपने ट्रेनिंग डेटा से उत्तर केवल याद नहीं किए हैं।
2. मैकेनिक: किसने काम पूरा किया?
शोधकर्ताओं ने चार अलग-अलग "मैकेनिक टीमों" (सॉफ्टवेयर टूल्स और AI मॉडल्स के संयोजन) का परीक्षण किया। उन्होंने प्रत्येक टीम को 25 मरम्मत कार्यों के माध्यम से तीन बार चलाया ताकि यह देखा जा सके कि वे कितने सुसंगत (consistent) हैं।
- स्टार परफॉर्मर: Claude Code के साथ "Opus 4.8" मॉडल का उपयोग करने वाली टीम सबसे अच्छी थी। इसने लगभग 79% समस्याओं को सफलतापूर्वक ठीक किया।
- मिडल पैक: "Sonnet 5" मॉडल ने लगभग उतना ही अच्छा प्रदर्शन किया (75%), और "GPT-5.5" मॉडल (Codex CLI के माध्यम से) ने लगभग 67% को ठीक किया।
- संघर्ष करने वाला मैकेनिक: "Haiku 4.5" मॉडल (एक सस्ता, तेज़ संस्करण) ने केवल लगभग 53% कार्यों को ठीक किया।
कैच (Catch): चूंकि केवल 25 कार्य थे, इसलिए शीर्ष तीन टीमों के बीच का अंतर सांख्यिकीय रूप से "सिद्ध" नहीं था कि वास्तविक है—यह केवल किस्मत भी हो सकती है। हालांकि, शीर्ष टीमों और संघर्ष करने वाले Haiku मॉडल के बीच का अंतर बहुत बड़ा और स्पष्ट था। शीर्ष टीमों ने पूरी तरह से अलग श्रेणी की समस्याओं को हल किया जो निचले स्तर वाली टीम ने की थी।
3. बड़ा आश्चर्य: "साइलेंट सब्स्टीट्यूशन" (Silent Substitution)
यह पेपर का सबसे दिलचस्प हिस्सा है। शोधकर्ताओं ने एक बिल्कुल नए मॉडल का उपयोग करते हुए पांचवीं टीम का भी परीक्षण किया जिसका नाम Fable 5 है।
जब उन्होंने AI के काम करने के "ब्लैक बॉक्स" लॉग्स को करीब से देखा, तो उन्हें एक रहस्य मिला:
- 20% कार्यों पर, Fable 5 मॉडल ने वास्तव में काम नहीं किया।
- इसके बजाय, सॉफ्टवेयर उत्पाद (Claude Code) ने काम के बीच में ही Fable 5 को हटाकर पुराने, अधिक शक्तिशाली Opus 4.8 मॉडल को चुपचाप बदल दिया।
- क्यों? Fable 5 में सुरक्षा नियम (safety guards) बहुत सख्त हैं। जब इसने मानक इंटरनेट प्रोटोकॉल (जैसे वेब हेडर को ठीक करना) से जुड़े कार्य को देखा, तो इसके सुरक्षा गार्ड घबरा गए और कहा, "मुझे इसे छूने की अनुमति नहीं है," और सिस्टम ने काम पूरा करने के लिए स्वचालित रूप से काम को Opus 4.8 को सौंप दिया।
सबक: शोधकर्ताओं ने महसूस किया कि जब हम AI उत्पादों का परीक्षण करते हैं, तो हम केवल उसके "दिमाग" (मॉडल) का परीक्षण नहीं कर रहे होते हैं; हम उसके "शरीर" (पूरे सॉफ्टवेयर पैकेज) का परीक्षण कर रहे होते हैं। यदि सॉफ्टवेयर काम के बीच में दिमाग को चुपचाप बदल देता है, तो परीक्षण के परिणाम उस विशिष्ट दिमाग की क्षमता के बारे में झूठ बोल रहे होते हैं।
4. निर्णय (The Verdict)
- सफलता: प्रोडक्ट-ग्रेड AI एजेंट पहले से ही गैर-अंग्रेजी भाषा (रूसी) में निर्दिष्ट वास्तविक रखरखाव कार्य को संभालने के लिए पर्याप्त अच्छे हैं। सबसे अच्छे सेटअप ने 10 में से लगभग 8 कार्यों को हल किया।
- रियलिटी चेक: "सस्ते" मॉडल (जैसे Haiku) अभी भी काफी कमजोर हैं, जो केवल आधे समस्याओं को हल करते हैं।
- कार्यप्रणाली (Methodology): यह पेपर साबित करता है कि ईमानदार परिणाम प्राप्त करने के लिए, हमें AI के पूरे "डायरी" (ट्रैजेक्टरी) को देखना चाहिए ताकि यह सुनिश्चित हो सके कि उसने मॉडल बदलकर या ऑनलाइन उत्तर खोजकर धोखाधड़ी नहीं की है।
संक्षेप में, RuBench दिखाता है कि AI "मानवीय" (रूसी में) बोलने में अच्छा हो रहा है, लेकिन इसने यह भी उजागर किया कि इन AI को लपेटने वाला सॉफ्टवेयर कभी-कभी चालाकी कर सकता है, किसी को बताए बिना कार्यकर्ता को बेहतर व्यक्ति से बदल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।