← नवीनतम पेपर
💻 computer science

SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding

यह शोध पत्र SWE-Manager को प्रस्तुत करता है, जो एक 8B सुदृढीकरण लर्निंग (reinforcement learning) मॉडल है जो तकनीकी प्रबंधकों की नकल करते हुए सॉफ्टवेयर समस्याओं के लिए सबसे अच्छे उम्मीदवार प्रस्ताव को चुनता है और कोड निष्पादित किए बिना एक "गोल्डन" समाधान संश्लेषित करता है, जिससे SWE-Lancer Manager बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

प्रकाशित 2026-07-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जहाज (एक सॉफ्टवेयर प्रोजेक्ट) के कप्तान हैं और एक तूफान आ गया है (एक बग या एक नया फीचर अनुरोध)। इससे पहले कि आप जहाज को दिशा दे सकें, आपको यह तय करना होगा कि कौन सा रास्ता लेना है

वास्तविक दुनिया में, आपका चालक दल केवल अनुमान नहीं लगाता। उनके पास तीन अलग-अलग नाविकों द्वारा तीन अलग-अलग रास्तों के सुझाव हो सकते हैं:

  • नाविक A कहता है, "रीफ (चट्टानों) के बीच से शॉर्टकट लें! यह तेज़ है, लेकिन जोखिम भरा है।"
  • नाविक B कहता है, "द्वीप के चारों ओर से जाएं। यह सुरक्षित है, लेकिन इसमें तीन दिन लगेंगे।"
  • नाविक C कहता है, "पहले इंजन ठीक करते हैं, फिर चलते हैं। यह सबसे विस्तृत है, लेकिन यह महंगा है।"

आमतौर पर, एक मानव प्रबंधक को इन तीनों की बात सुननी होती है, जोखिमों को तौलना होता है, मौसम (समस्या के विशिष्ट संदर्भ) की जांच करनी होती है, और सबसे अच्छा प्लान चुनना होता है। यह पेपर, SWE-Manager, पूछता है: क्या एक AI वह मैनेजर बनना सीख सकता है?

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, सरल भाषा में:

1. समस्या: AI लिखने में अच्छा है, चुनने में बुरा

वर्तमान में, AI मॉडल (जैसे वे जो कोड लिखते हैं) एक समाधान उत्पन्न करने में बहुत अच्छे होते हैं। लेकिन वास्तविक सॉफ्टवेयर टीमों में, लोग अक्सर कई समाधान लिखते हैं और फिर इस पर बहस करते हैं कि कौन सा सबसे अच्छा है।

  • अंतराल (The Gap): AI को वास्तव में "मैनेजर की कुर्सी" पर बैठने, सभी विकल्पों को सुनने, उनकी तुलना करने और यह कहने के लिए नहीं सिखाया गया है कि, "ठीक है, हम नाविक B के साथ जा रहे हैं, लेकिन आइए इसे तेज़ बनाने के लिए थोड़ा बदलाव करें।"
  • प्रश्न: क्या यह "विजेता चुनने" का कौशल केवल एक यादृच्छिक (random) मानवीय पसंद है, या क्या कोई तार्किक पैटर्न है जिसे एक AI सीख सकता है?

2. जासूसी कार्य: वास्तविक मैनेजर क्या करते हैं?

शोधकर्ताओं ने जासूसों की तरह काम किया। उन्होंने GitHub (जहाँ प्रोग्रामर अपना कोड साझा करते हैं) पर हजारों वास्तविक चर्चाओं का अध्ययन किया जहाँ लोग बग को ठीक करने के तरीके पर बहस कर रहे थे। उन्होंने पाया कि मानव प्रबंधक कैसे चुनाव करते हैं, इसके बारे में तीन बड़े रहस्य हैं:

  • रहस्य #1: यह यादृच्छिक नहीं है। मैनेजर्स केवल अपनी पसंद नहीं चुनते। वे हमेशा कुछ "उच्च-स्तरीय नियमों" का उपयोग करते हैं, जैसे: "क्या यह सुरक्षित है?" "क्या यह अन्य चीजों को तोड़ देगा?" "क्या इसे बाद में ठीक करना आसान है?"
  • रहस्य #2: यह एक तुलना है, न कि एक परीक्षण। आप किसी प्रस्ताव का अकेले मूल्यांकन नहीं कर सकते। आपको उन्हें विशेष संदर्भ में एक दूसरे के विरुद्ध तुलना करनी होगी। (उदाहरण के लिए, "नाविक A तेज़ है, लेकिन चूंकि हम तूफान में हैं, इसलिए गति से अधिक सुरक्षा महत्वपूर्ण है।")
  • रहस्य #3: सबसे अच्छा प्लान एक मिश्रण है। अक्सर, अंतिम योजना केवल एक नाविक का विचार नहीं होती। यह एक "गोल्डन प्रपोजल" (स्वर्ण प्रस्ताव) होता है जो नाविक A के बेहतरीन हिस्सों, नाविक B की सुरक्षा और नाविक C की व्यापकता को लेता है, और उन्हें एक पूर्ण योजना में मिला देता है।

3. समाधान: SWE-Manager (AI मैनेजर)

इन रहस्यों के आधार पर, टीम ने SWE-Manager बनाया। इसे एक नए प्रकार के AI के रूप में सोचें जो केवल कोड नहीं लिखता; यह बातचीत का प्रबंधन (manage the conversation) करता है।

केवल "यहाँ कोड है" कहने के बजाय, SWE-Manager तीन चीजें करता है:

  1. इश्यू (Issue) को पढ़ता है: यह समस्या को समझता है।
  2. उम्मीदवारों की समीक्षा करता है: यह सभी अलग-अलग प्रस्तावों (जैसे नाविकों के रास्ते) को देखता है।
  3. "गोल्डन" संश्लेषण (Synthesis): यह सबसे अच्छा दिशा चुनता है, यह बताता है कि इसने इसे क्यों चुना, और फिर एक नया, "गोल्डन प्रपोजल" लिखता है जो सभी उम्मीदवारों के सर्वोत्तम विचारों को एक स्पष्ट निर्देश में जोड़ता है।

उन्होंने एक विशिष्ट संस्करण बनाया जिसे SWE-Manager-8B (एक 8-बिलियन पैरामीटर वाला मॉडल) कहा जाता है, जिसे एक विशेष दो-चरणीय प्रक्रिया का उपयोग करके प्रशिक्षित किया गया था:

  • चरण 1 (स्कूल): उन्होंने इसे तुलना करने और समझाने के प्रारूप (format) को सिखाया (Supervised Fine-Tuning)।
  • चरण 2 (अभ्यास): उन्होंने इसे चुनाव करने का अभ्यास करने दिया और जब इसने सही चुनाव किया तो इसे पुरस्कृत किया, जिससे इसे एक मैनेजर की तरह "सोचना" सिखाया गया (Reinforcement Learning)।

4. परिणाम: क्या AI मैनेजर काम करता है?

उन्होंने AI को दो तरीकों से टेस्ट किया:

टेस्ट A: "बॉस कौन है?" टेस्ट (चयन)
उन्होंने AI को एक समस्या और तीन अलग-अलग समाधान दिए, और उससे पूछा कि वह उस विकल्प को चुने जिसे एक मानव मैनेजर चुनता।

  • परिणाम: SWE-Manager-8B इसे 53% बार सही चुनता है।
  • तुलना: एक बहुत ही शक्तिशाली, प्रसिद्ध AI (GPT-5) इसे केवल 44% बार सही चुन पाता है। भले ही SWE-Manager एक छोटा, सस्ता मॉडल है, यह सही रास्ता चुनने में बेहतर था।

टेस्ट B: "क्या यह निर्माण में मदद करता है?" टेस्ट (कार्यान्वयन)
उन्होंने एक वर्कफ़्लो (जिसे P2A कहा जाता है) सेट किया जहाँ:

  1. एक AI प्रस्ताव लिखता है।
  2. SWE-Manager सबसे अच्छे प्रस्ताव को चुनता है और "गोल्डन प्रपोजल" लिखता है।
  3. एक तीसरा AI उस गोल्डन प्रपोजल के आधार पर सुधार (fix) बनाने की कोशिश करता है।
  • परिणाम: जब SWE-Manager मैनेजर था, तो टीम ने सफलतापूर्वक 55.6% समस्याओं को ठीक किया।
  • तुलना: यह बिना किसी मैनेजर के काम करने (जिसने 48.5% ठीक किया) से बेहतर था और इसने मैनेजर के रूप में विशाल GPT-5 के प्रदर्शन के बराबर प्रदर्शन किया।

मुख्य निष्कर्ष

यह पेपर साबित करता है कि सही योजना चुनना एक ऐसा कौशल है जिसे AI सीख सकता है।

यह केवल कोड लिखने के लिए पर्याप्त स्मार्ट होने के बारे में नहीं है; यह विकल्पों की तुलना करने, जोखिमों को समझने और सर्वोत्तम विचारों को एक एकल, स्पष्ट निर्देश में संयोजित करने के लिए पर्याप्त स्मार्ट होने के बारे में है। एक AI को "टेक्निकल मैनेजर" के रूप में कार्य करने के लिए प्रशिक्षित करके, हम सॉफ्टवेयर विकास को अधिक विश्वसनीय और कुशल बना सकते हैं, यहाँ तक कि छोटे, सस्ते AI मॉडल के साथ भी।

संक्षेप में: पेपर दिखाता है कि यदि आप एक AI को एक अच्छा निर्णायक (judge) और एक अच्छा संपादक (editor) बनने के लिए सिखाते हैं, तो यह मनुष्यों को सॉफ्टवेयर बनाने में मदद करने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →