← नवीनतम पेपर
🤖 machine learning

QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization

यह शोध पत्र PRepair को प्रस्तुत करता है, जो एक सेल्फ-ब्रेकिंग और सेल्फ-रिपेयरिंग रणनीति को एडिट-अवेयर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (EA-GRPO) के साथ नियोजित करके कोड रिपेयर के लिए लार्ज लैंग्वेज मॉडल्स में ओवर-एडिटिंग की समस्या को कम करता है ताकि सही कोड के पुन: उपयोग को अधिकतम करते हुए बग्स को सटीक रूप से ठीक किया जा सके।

मूल लेखक: Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ QiMeng-PRepair पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद किया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।

🛠️ समस्या: "ज़रूरत से ज़्यादा उत्साही" मैकेनिक

कल्पना कीजिए कि आपकी एक कार है जिसमें एक छोटी सी समस्या है: बाईं हेडलाइट में एक ढीला पेंच (screw) है। आप इसे एक मैकेनिक (AI मॉडल) के पास ले जाते हैं।

  • पुराना तरीका (Standard AI): मैकेनिक कार को देखता है, कहता है, "मुझे एक समस्या दिख रही है," और फिर पूरा इंजन बदलने, पूरी कार को दोबारा पेंट करने और सभी टायर बदल देने की प्रक्रिया शुरू कर देता है।

    • परिणाम: कार अब ठीक चल रही है (बग ठीक हो गया है), लेकिन आपको कार के हर एक हिस्से की जांच करनी होगी ताकि यह सुनिश्चित हो सके कि उन्होंने कुछ और तो नहीं तोड़ दिया। यह बहुत बड़ा झमेला है, महंगा है और भ्रमित करने वाला है। पेपर में, इसे "Over-editing" कहा गया है। AI बग को ठीक तो कर देता है लेकिन मूल कोड के स्ट्रक्चर को बिगाड़ देता है, जिससे इंसानों के लिए इस पर भरोसा करना या इसकी समीक्षा करना कठिन हो जाता है।
  • नया तरीका (PRepair): मैकेनिक कार को देखता है, ढीले पेंच को ढूंढता है, उसे कस देता है, और बाकी सब कुछ बिल्कुल वैसा ही छोड़ देता है जैसा वह था।

    • परिणाम: कार ठीक हो गई है, मूल डिज़ाइन सुरक्षित है, और आपको केवल एक छोटे से स्थान की जांच करनी है। यह "Precise Repair" है।

🧠 मुख्य विचार: "Edit-Aware" ट्रेनिंग

शोधकर्ताओं ने महसूस किया कि अधिकांश AI मॉडल केवल "सही या गलत" उत्तर पाने के लिए प्रशिक्षित किए जाते हैं। उन्हें इस बात की परवाह नहीं होती कि वहां तक पहुँचने के लिए उन्होंने कितना बदलाव किया है।

इसे ठीक करने के लिए, उन्होंने एक नई ट्रेनिंग विधि बनाई जिसे PRepair (Precise Repair) कहा जाता है। इसे एक छात्र को विध्वंसक (demolition expert) के बजाय एक सर्जन बनने के लिए प्रशिक्षित करने जैसा समझें।

स्टेप 1: Self-Breaking (द "Saboteur" गेम)

AI को चीजें ठीक करना सिखाने के लिए, पहले आपको चीजों को तोड़ना सीखना होगा। लेकिन आप हर संभव स्थिति के लिए हर बार किसी इंसान से कोड तुड़वा नहीं सकते (इसमें बहुत समय लगता है)।

  • उपमा: कल्पना कीजिए कि AI एक खेल खेल रहा है जहाँ उसे अपना खुद का होमवर्क तोड़ना है।
    1. AI कोड का एक बेहतरीन टुकड़ा लेता है।
    2. वह एक "Saboteur" (तोड़-फोड़ करने वाला) की भूमिका निभाता है, और उसमें छोटे, चालाकी भरे बग डाल देता है (जैसे + को - में बदलना या कोई नंबर बदल देना)।
    3. महत्वपूर्ण कदम: यह एक विशेष रणनीति (Min-Max Sampling) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि वह कोड को कई अलग-अलग तरीकों से तोड़ता है, ताकि वह बार-बार एक ही चीज़ को न तोड़ना सीखे।

स्टेप 2: Self-Repairing (द "Surgeon" ट्रेनिंग)

अब जब AI के पास खुद द्वारा बनाया गया खराब कोड का ढेर है, तो उसे उन्हें ठीक करना है। लेकिन यहाँ ट्विस्ट यह है: शिक्षक (रिवॉर्ड सिस्टम) बहुत सख्त है।

  • पुराना शिक्षक: "बहुत बढ़िया! तुमने बग ठीक कर दिया। यह लो एक गोल्ड स्टार।" (भले ही आपने पूरा पेज ही दोबारा लिख दिया हो)।
  • नया शिक्षक (EA-GRPO): "तुमने बग तो ठीक कर दिया, लेकिन तुमने 50 लाइनें भी बदल दीं जो पहले से ही सही काम कर रही थीं। इसके लिए दंड (penalty) मिलेगा। यदि तुमने केवल उन 2 लाइनों को बदला जो टूटी हुई थीं, तो तुम्हें गोल्ड स्टार मिलेगा। यदि तुमने बहुत अधिक बदलाव किए, तो तुम्हें 'डिंग' (चेतावनी) मिलेगी।"

यह नया शिक्षक Edit-Aware Reward नामक मेट्रिक का उपयोग करता है। यह AI को निम्नलिखित के लिए पुरस्कृत करता है:

  1. उत्तर सही प्राप्त करना।
  2. जितना संभव हो सके उतना कम बदलाव करना।

🚀 बोनस: प्रक्रिया को तेज़ करना

पेपर में एक और दिलचस्प प्रभाव भी मिला। क्योंकि AI को अब न्यूनतम बदलाव करने के लिए प्रशिक्षित किया गया है, नया कोड पुराने कोड के बहुत समान दिखता है।

  • उपमा: कल्पना कीजिए कि आप एक पत्र टाइप कर रहे हैं।
    • पुराना AI: आप शुरू से एक पूरा नया पत्र टाइप करते हैं। कंप्यूटर को हर एक शब्द टाइप करना पड़ता है।
    • PRepair AI: आप केवल उन दो शब्दों को टाइप करते हैं जो गलत थे। कंप्यूटर बाकी के हिस्से का "अनुमान" (speculate) लगा सकता है क्योंकि वह पहले से ही वहां मौजूद है।
    • परिणाम: AI तेज़ काम करता है क्योंकि उसे पूरी चीज़ दोबारा टाइप नहीं करनी पड़ती। यह एक ऐसे "Autocorrect" की तरह है जो वास्तव में पूरी तरह से काम करता है।

🌟 यह क्यों महत्वपूर्ण है?

  1. विश्वास (Trust): डेवलपर्स को एक बदले हुए कोड की दीवार को घूरने की ज़रूरत नहीं है ताकि वे एक फिक्स को ढूंढ सकें। वे भरोसा कर सकते हैं कि AI केवल उसी हिस्से को छुएगा जो टूटा हुआ है।
  2. सुरक्षा (Safety): काम करने वाले हिस्सों को दोबारा न लिखकर, AI अनजाने में नए बग पैदा करने की संभावना कम कर देता है।
  3. गति (Speed): चूंकि बदलाव छोटे हैं, इसलिए AI फिक्स को बहुत तेज़ी से जेनरेट कर सकता है, जिससे यह रियल-टाइम कोडिंग असिस्टेंट के लिए व्यावहारिक बन जाता है।

📝 संक्षेप में

QiMeng-PRepair AI को कोड ठीक करने के लिए प्रशिक्षित करने का एक नया तरीका है। एक बुलडोजर की तरह काम करने के बजाय जो लीकी नल (leaky faucet) को ठीक करने के लिए पूरे घर को फिर से बनाता है, यह एक मास्टर प्लंबर की तरह काम करता है जो केवल लीक को ठीक करता है। यह ऐसा इसलिए करता है क्योंकि यह AI को अपना कोड तोड़ने और फिर उन ब्रेक्स को न्यूनतम प्रयास के साथ ठीक करने के लिए भारी इनाम देकर सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →