← नवीनतम पेपर
🤖 machine learning

Merge-Bench: Resolve Merge Conflicts with Large Language Models

यह शोध पत्र Merge-Bench को पेश करता है, जो वास्तविक दुनिया के मर्ज संघर्षों (merge conflicts) का एक बड़े पैमाने का डेटासेट है, और LLMergeJ प्रस्तुत करता है, जो Group Relative Policy Optimization के साथ प्रशिक्षित एक जावा-विशिष्ट मॉडल है जो कई वाणिज्यिक LLMs से बेहतर प्रदर्शन करता है, हालांकि वर्तमान में सबसे अच्छे मॉडल भी 11 प्रोग्रामिंग भाषाओं में 60% से कम संघर्षों को हल करते हैं।

मूल लेखक: Benedikt Schesch, Michael D. Ernst

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benedikt Schesch, Michael D. Ernst

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ग्रुप प्रोजेक्ट पर काम कर रहे हैं जहाँ दो दोस्त एक ही समय में एक ही डॉक्यूमेंट को एडिट कर रहे हैं। दोस्त A एक पैराग्राफ बदलता है, और दोस्त B ठीक उसी पैराग्राफ को बदल देता है। जब आप उनके काम को मिलाने (combine करने) की कोशिश करते हैं, तो कंप्यूटर उलझ जाता है और चिल्लाने लगता है, "मुझे नहीं पता कि कौन सा वर्ज़न रखना है!" इसे मर्ज कॉन्फ्लिक्ट (merge conflict) कहा जाता है।

आमतौर पर, किसी इंसान को बीच में आना पड़ता है, दोनों वर्ज़न को पढ़ना पड़ता है, यह समझना पड़ता है कि दोस्तों का वास्तव में मतलब क्या था, और मैन्युअल रूप से उस गड़बड़ को ठीक करना पड़ता है। इसमें समय लगता है और गलतियाँ होने की संभावना रहती है।

यह पेपर इस बारे में है कि कैसे "स्मार्ट" AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग करके कंप्यूटर को इन गड़बड़ियों को स्वचालित रूप से ठीक करना सिखाया जा सकता है। यहाँ उनके काम का सरल विवरण दिया गया है:

1. समस्या: कंप्यूटर अनपढ़ है

पारंपरिक टूल्स उन रोबोट की तरह हैं जो केवल अक्षरों को देखते हैं। यदि दोस्त A ने "cat" लिखा और दोस्त B ने "dog" लिखा, तो रोबोट बस एक टकराव देखता है। वह यह नहीं समझ पाता कि शायद वे पालतू जानवरों के बारे में बात कर रहे थे, या शायद एक टाइपिंग की गलती थी। उसे यह समझाने के लिए एक इंसान की ज़रूरत होती है कि इरादा क्या था।

2. समाधान: एक नया प्रशिक्षण मैदान (Merge-Bench)

AI को ये कॉन्फ्लिक्ट्स ठीक करना सिखाने के लिए, आपको उदाहरणों के एक विशाल पुस्तकालय की आवश्यकता होती है जो यह दिखाए कि "यहाँ गड़बड़ थी, और यहाँ बताया गया है कि एक मानव विशेषज्ञ ने इसे कैसे ठीक किया।"

  • पुराना तरीका: अन्य शोधकर्ताओं ने इन पुस्तकालयों को हाथ से बनाने या टेस्ट चलाने की कोशिश की। यह धीमा, महंगा था, और कभी-कभी AI टेस्ट के उत्तरों को रट लेता था (चीटिंग करता था) बजाय इसके कि वह ठीक करना सीखे।
  • नया तरीका (Merge-Bench): लेखकों ने Merge-Bench नामक एक विशाल, स्वचालित पुस्तकालय बनाया। उन्होंने GitHub से 1,439 अलग-अलग सार्वजनिक कोड प्रोजेक्ट्स से 7,938 वास्तविक जीवन के कॉन्फ्लिक्ट्स निकाले।
    • उपमा (Analogy): कल्पना कीजिए कि एक शिक्षक है जिसे हर होमवर्क असाइनमेंट को हाथ से ग्रेड करने की ज़रूरत नहीं है। इसके बजाय, उनके पास एक मशीन है जो स्वचालित रूप से छात्रों द्वारा की गई गलतियों के वास्तविक उदाहरण और शिक्षक द्वारा लिखे गए सही उत्तरों को इकट्ठा करती है। क्योंकि मशीन सारा काम करती है, इसलिए वे एक ऐसा पुस्तकालय बना सकते हैं जो बहुत बड़ा है और कभी खत्म नहीं होता।

3. छात्र: LLMergeJ

लेखकों ने LLMergeJ नामक एक विशिष्ट AI मॉडल को प्रशिक्षित किया ( "J" का अर्थ जावा है, वह प्रोग्रामिंग भाषा जिस पर उन्होंने ध्यान केंद्रित किया)।

  • उन्होंने इसे कैसे सिखाया: मॉडल को केवल उत्तर दिखाने (एक मानक शिक्षक की तरह) के बजाय, उन्होंने रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक एक विधि का उपयोग किया।
    • उपमा: इसे कुत्ते को प्रशिक्षित करने जैसा समझें। यदि कुत्ता सही ट्रिक का अनुमान लगाता है, तो उसे ट्रीट (इनाम) मिलता है। यदि वह गलत अनुमान लगाता है, तो उसे कुछ नहीं मिलता। यदि वह अनुमान लगाने से मना कर देता है और बस "मुझे नहीं पता" कहता है (कॉन्फ्लिक्ट को बरकरार रखता है), तो उसे एक छोटा सा टुकड़ा मिलता है।
    • AI ने हजारों बार प्रयास किया। जब उसने कोड को मिलाने का सही तरीका खोज लिया, तो उसे एक बड़ा इनाम मिला। समय के साथ, उसने न केवल यह सीखा कि उत्तर कैसा दिखता है, बल्कि यह भी सीखा कि वहां तक पहुँचने के लिए समस्या के बारे में कैसे सोचना है।

4. परिणाम: छोटा कुत्ता, बड़े करतब

उन्होंने अपने 14-बिलियन पैरामीटर वाले मॉडल का परीक्षण सबसे बड़े, सबसे महंगे व्यावसायिक AI मॉडल्स (जैसे Gemini, Claude, और Grok) के खिलाफ किया।

  • चौंकाने वाला तथ्य: उनका छोटा, कस्टम-ट्रेन्ड मॉडल उपलब्ध लगभग सभी विशाल व्यावसायिक मॉडल्स से बेहतर प्रदर्शन करता है। उन्होंने लगभग 59% कॉन्फ्लिक्ट्स को सही ढंग से हल किया (मामूली फॉर्मेटिंग अंतरों को छोड़कर)।
  • तुलना: सबसे अच्छा कमर्शियल मॉडल (Gemini 2.5 Pro) थोड़ा बेहतर था, लेकिन लेखकों के मॉडल ने अन्य मॉडल्स को काफी बड़े अंतर से पीछे छोड़ दिया।
  • सबक: एक छोटा मॉडल जिसे रिवॉर्ड्स (इनाम) का उपयोग करके विशेष रूप से मर्ज कॉन्फ्लिक्ट्स को ठीक करने के लिए प्रशिक्षित किया गया है, वह एक विशाल, सामान्य-उद्देश्य वाले मॉडल से बेहतर है जिसे केवल एक बार यह काम करने के लिए कहा गया था।

5. यह क्यों महत्वपूर्ण है

  • कोई चीटिंग नहीं: उनकी टेस्टिंग पद्धति कोड टेस्ट चलाने पर निर्भर नहीं है (जिसे AI कभी-कभी धोखा दे सकता है)। यह कोड की सीधे तौर पर तुलना करती है कि डेवलपर ने वास्तव में क्या किया था।
  • स्केलेबल (Scalable): क्योंकि उन्हें डेटा को लेबल करने के लिए इंसानों की ज़रूरत नहीं थी, इसलिए वे अपने ट्रेनिंग सेट को जितना चाहें उतना बड़ा बना सकते थे।
  • लैंग्वेज एगोस्टिक (Language Agnostic): हालांकि उन्होंने केवल जावा पर अपना मॉडल प्रशिक्षित किया था, लेकिन उन्होंने 11 अलग-अलग भाषाओं (C, Python, Rust, आदि) पर बड़े कमर्शियल मॉडल्स का परीक्षण किया। उन्होंने पाया कि सभी भाषाओं में AI का व्यवहार समान था, जिससे पता चलता है कि उनकी विधि किसी भी प्रोग्रामिंग भाषा के लिए काम कर सकती है।

सारांश

लेखकों ने एक विशिष्ट AI एथलीट (LLMergeJ) को कोड कॉन्फ्लिक्ट्स को हल करने के लिए प्रशिक्षित करने हेतु एक विशाल, स्वचालित जिम (Merge-Bench) बनाया। रिवॉर्ड-आधारित प्रशिक्षण प्रणाली का उपयोग करके, उन्होंने एक अपेक्षाकृत छोटे AI को इस विशिष्ट कार्य में सबसे बड़े, सबसे महंगे AI मॉडल्स से बेहतर प्रदर्शन करने के लिए प्रशिक्षित किया, जिससे यह सिद्ध हुआ कि सॉफ्टवेयर की गड़बड़ियों को ठीक करने के मामले में विशेष प्रशिक्षण, सामान्य आकार (general size) से बेहतर होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →