Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer
यह शोध पत्र यह प्रदर्शित करता है कि एक बड़े भाषा मॉडल (large language model) को लॉन्ग-होराइजन ऑफिस वर्कफ़्लो (long-horizon office workflows) पर पोस्ट-ट्रेनिंग देने से इसके सॉफ्टवेयर इंजीनियरिंग प्रदर्शन में महत्वपूर्ण सुधार होता है, जो चार मुख्य लक्ष्य-निर्देशित निष्पादन व्यवहारों—लक्ष्य चयन (goal selection), अवस्था निर्माण (state construction), निष्ठा रखरखाव (fidelity maintenance), और सत्यापन (verification)—को सुदृढ़ करता है, जो विभिन्न डोमेन में प्रभावी रूप से स्थानांतरित होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को मास्टर शेफ बनने के लिए प्रशिक्षित कर रहे हैं। आपको लग सकता है कि इसे यह सिखाने का सबसे अच्छा तरीका इसे लाखों रेसिपी खिलाना, इसे प्याज काटना सिखाना और इसे सूफ़ले (soufflé) बनाने का अभ्यास करने देना है। लेकिन क्या होगा अगर एक महान शेफ बनने का रहस्य केवल रेसिपी जानना नहीं है? क्या होगा अगर असली कौशल एक विशाल, डरावनी डिनर पार्टी को छोटे, प्रबंधनीय चरणों में तोड़ने, आपके द्वारा एकत्र की गई सभी सामग्रियों का हिसाब रखने, और काम करते समय मेजबान की आहार संबंधी प्रतिबंधों को याद रखने और वास्तव में भोजन को चखने में है ताकि यह सुनिश्चित हो सके कि परोसने से पहले यह तैयार है?
यह "एजेंटिक" (agentic) AI की दुनिया है—ऐसे कंप्यूटर प्रोग्राम जो केवल सवालों के जवाब नहीं देते बल्कि वास्तव में चीजें करते हैं, जैसे वेब ब्राउज़ करना, फाइलों को संपादित करना या परीक्षण चलाना। लंबे समय तक, वैज्ञानिकों ने सोचा कि इन रोबोट्स को ठीक उसी काम पर प्रशिक्षित करने की आवश्यकता है जो वे अंततः करेंगे। यदि आप चाहते थे कि एक रोबोट कंप्यूटर कोड को ठीक करे, तो आपको इसे कंप्यूटर कोड ठीक करने के लाखों उदाहरणों के साथ प्रशिक्षित करना होगा। लेकिन यह नया शोध पत्र एक अजीब सवाल पूछता है: क्या होगा अगर हम रोबोट को एक मास्टर ऑफिस वर्कर बनना सिखा दें? क्या होगा अगर हम इसे स्प्रेडशीट व्यवस्थित करना, मीटिंग शेड्यूल करना और दस्तावेज़ प्रबंधित करना सिखाएं, और फिर इसे सॉफ्टवेयर ठीक करने के लिए कहें? क्या एक अच्छे ऑफिस वर्कर होने के कौशल इसे बेहतर सॉफ्टवेयर इंजीनियर बनने में मदद करेंगे?
शोधकर्ताओं ने Surge AI में इस विचार का परीक्षण करने का निर्णय लिया। उन्होंने एक बहुत ही स्मार्ट AI मॉडल लिया और उसे "लॉन्ग-होरिज़न" (long-horizon) ऑफिस वर्क का क्रैश कोर्स दिया। ये सरल कार्य नहीं थे जैसे "एक ईमेल भेजें।" ये जटिल, बहु-चरणीय साहसिक कार्य थे जहाँ AI को कई टूल्स को संभालना था, स्थिति का मानसिक मानचित्र रखना था, और यह सुनिश्चित करना था कि विवरणों में खो जाने के दौरान वह बड़े चित्र (big picture) से न भटक जाए। उन्होंने AI को इन 363 ऑफिस कार्यों पर प्रशिक्षित किया, लेकिन यहाँ मुख्य बात यह है: इनमें से किसी भी प्रशिक्षण कार्य का सॉफ्टवेयर या कोडिंग से कोई लेना-देना नहीं था।
परिणाम क्या रहा? जब उन्होंने एक प्रसिद्ध सॉफ्टवेयर इंजीनियरिंग चुनौती जिसे SWE-Bench Pro कहा जाता है, पर AI का परीक्षण किया, तो यह काफी बेहतर हो गया। इसने अपनी सफलता दर में 5.8 प्रतिशत अंक की वृद्धि की। शोध पत्र सुझाव देता है कि जटिल, बहु-चरणीय ऑफिस वर्कफ़्लो को प्रबंधित करने का तरीका सीखकर, AI ने लक्ष्य-निर्देशित निष्पादन (goal-directed execution) के लिए एक सार्वभौमिक "मांसपेशी" सीखी। इसने सीखा कि कैसे एक लक्ष्य निर्धारित किया जाए, स्थिति की एक मानसिक तस्वीर बनाई जाए, काम उलझने पर भी मूल योजना पर टिके रहा जाए, और अपने काम की दोबारा जांच की जाए। लेखक तर्क देते हैं कि ये कौशल एक स्विस आर्मी नाइफ की तरह हैं: एक बार जब आप सीख जाते हैं कि इनका उपयोग एक फाइलिंग कैबिनेट को व्यवस्थित करने के लिए कैसे किया जाए, तो आप इनका उपयोग कंप्यूटर प्रोग्राम को डीबग करने के लिए कर सकते हैं, भले ही सतह पर दोनों काम पूरी तरह से अलग दिखते हों।
गुप्त नुस्खा: "गोल लूप" (The Goal Loop)
यह समझने के लिए कि यह कैसे काम करता है, कल्पना कीजिए कि AI एक विशाल, शाखाओं वाले भूलभुलैया (maze) में नेविगेट करने वाला एक खोजकर्ता है। शोध पत्र AI की रणनीति को "गोल-डायरेक्टेड एग्जीक्यूशन" (GDE) कहता है। इसे एक चार-चरणीय नृत्य के रूप में सोचें जिसे AI बार-बार करता है, जैसे वीडियो गेम में एक लूप:
- लक्ष्य निर्माण (Goal Formation): AI पूछता है, "जीत की रेखा के करीब पहुँचने के लिए मुझे अगला कदम क्या उठाना चाहिए?"
- स्थिति निर्माण (State Construction): यह चारों ओर देखता है और कहता है, "ठीक है, मैं अभी क्या जानता हूँ? मुझे अभी क्या पता चला?" यह वर्तमान स्थिति का एक मानसिक मानचित्र बनाता है।
- लक्ष्य स्थिरता (Goal Stability): यह अपने दिशा-सूचक यंत्र (compass) की जाँच करता है। "क्या मैं अभी भी मुख्य खजाने की ओर बढ़ रहा हूँ, या मैं किसी चमकदार पत्थर की वजह से भटक गया हूँ?" यह सुनिश्चित करता है कि इसके द्वारा उठाए गए छोटे कदम मुख्य लक्ष्य को न भूल जाएं।
- सत्यापन (Verification): अंत में, यह पूछता है, "क्या मैंने वास्तव में इसे कर लिया? क्या मेरे पास प्रमाण है?" यह केवल अनुमान नहीं लगाता; यह साक्ष्य की जाँच करता है।
शोध पत्र का तर्क है कि जटिल कार्य—चाहे वह किसी कंपनी का बजट व्यवस्थित करना हो या वीडियो गेम में बग को ठीक करना हो—इन सभी लूपों से बने होते हैं। कभी-कभी लूप एक दूसरे के भीतर होते हैं, जैसे रूसी गुड़िया (Russian dolls)। आपके पास एक बड़ा लक्ष्य होता है (ऐप ठीक करें), जो छोटे लक्ष्यों में टूट जाता है (बग खोजें), जो और भी छोटे लक्ष्यों में टूट जाता है (इस विशिष्ट फ़ाइल को पढ़ें)।
प्रयोग: स्प्रेडशीट से सॉफ्टवेयर तक
शोधकर्ताओं ने एक विशाल AI मॉडल (Qwen3.5-122B-A10B) लिया और उसे एक विशेष प्रशिक्षण आहार दिया। इसे कोड खिलाने के बजाय, उन्होंने इसे 363 वास्तविक ऑफिस परिदृश्य दिए। कल्पना कीजिए कि AI एक वर्चुअल इंटर्न के रूप में कार्य कर रहा है। उसे निम्नलिखित कार्य करने थे:
- दस्तावेजों और स्प्रेडशीट को खोजना।
- अनुसंधान करने के लिए वेब ब्राउज़र का उपयोग करना।
- शेड्यूल बनाना और फाइलों का प्रबंधन करना।
- विभिन्न डिजिटल टूल्स के बीच समन्वय करना।
ये कार्य कठिन डिज़ाइन किए गए थे। इनके लिए आवश्यक था कि AI एक साथ कई चीजों को ट्रैक रखे, विभिन्न टूल्स के बीच स्विच करे, और यह सुनिश्चित करे कि वह कहानी के सूत्र को न खो दे। AI ने इन कार्यों का अभ्यास तब तक किया जब तक कि वह इसमें बहुत कुशल नहीं हो गया। महत्वपूर्ण रूप से, प्रशिक्षण डेटा में शून्य सॉफ्टवेयर इंजीनियरिंग कार्य शामिल थे। AI ने अपने प्रशिक्षण के दौरान कोडिंग की एक भी लाइन नहीं देखी।
फिर परीक्षण आया। शोधकर्ताओं ने प्रशिक्षित AI को SWE-Bench Pro पर समस्याओं को हल करने के लिए कहा, जो एक बेंचमार्क है जो यह परीक्षण करता है कि एक AI वास्तविक दुनिया के सॉफ्टवेयर बग को कितनी अच्छी तरह ठीक कर सकता है। उन्होंने प्रशिक्षित AI की तुलना उसी मॉडल से की जो ऑफिस कौशल सीखने से पहले था।
परिणाम: एक सार्वभौमिक कौशल
प्रशिक्षित AI एक सितारा साबित हुआ। सॉफ्टवेयर इंजीनियरिंग टेस्ट पर इसकी सफलता दर 20.5% से बढ़कर 26.3% हो गई। यह 5.8 प्रतिशत अंक का सुधार है।
लेकिन सबसे दिलचस्प बात केवल स्कोर नहीं थी; बल्कि यह थी कि AI में कैसे बदलाव आया। शोधकर्ताओं ने AI की "विचार प्रक्रिया" (trajectory) का बारीकी से अध्ययन किया और पाया कि प्रशिक्षित AI ऑफिस कार्यों और सॉफ्टवेयर कार्यों, दोनों में चार-चरणीय नृत्य बहुत बेहतर तरीके से कर रहा था।
यहाँ बताया गया है कि क्या बदला, शोध पत्र के उदाहरणों का उपयोग करते हुए:
- बेहतर लक्ष्य निर्माण (Better Goal Formation): अ प्रशिक्षित AI अक्सर एक ऐसा "स्थानीय रूप से प्रशंसनीय" (locally plausible) लक्ष्य चुन लेता था जो वास्तव में गलत था। उदाहरण के लिए, एक सॉफ्टवेयर कार्य में, यह एक पूरे फंक्शन को फिर से लिखने की कोशिश कर सकता था जबकि एक साधारण हेल्पर टूल पहले से मौजूद था। प्रशिक्षित AI ने, ऑफिस कार्यों में सही अगला कदम चुनना सीखकर, महसूस किया, "अरे, इसके लिए पहले से ही एक टूल है," और उसका उपयोग किया।
- बेहतर स्थिति निर्माण (Better State Construction): अ प्रशिक्षित AI अक्सर महत्वपूर्ण जानकारी को फेंक देता था। एक ऑफिस कार्य में, इसने स्प्रेडशीट सेल में एक फॉर्मूला देखा और सोचा, "यह नंबर नहीं है, मैं इसे अनदेखा कर दूँगा।" लेकिन प्रशिक्षित AI ने महसूस किया, "रुको, यह फॉर्मूला उस नंबर की गणना करता है जिसकी मुझे आवश्यकता है," और डेटा को सुरक्षित रखा। इसने स्थिति का बेहतर मानसिक मानचित्र बनाना सीख लिया।
- बेहतर लक्ष्य स्थिरता (Better Goal Stability): यह बड़े चित्र को न खोने के बारे में है। एक सॉफ्टवेयर कार्य में, अ प्रशिक्षित AI ने एक विफल टेस्ट देखा और कोड को बदल दिया ताकि टेस्ट पास हो जाए, भले ही इससे मूल आवश्यकता टूट गई हो। प्रशिक्षित AI ने "पैरेंट गोल" (मूल आवश्यकता) को याद रखा और स्थानीय समस्या को खुद को विचलित नहीं करने दिया। यह एक प्रोजेक्ट मैनेजर की तरह था जो प्रिंटर जाम होने पर भी डेडलाइन को याद रखता है।
- बेहतर सत्यापन (Better Verification): अ प्रशिक्षित AI अक्सर अपने काम की सतही तौर पर जाँच करता था। यह कह सकता था, "मैंने फ़ाइल एक्सपोर्ट कर दी, इसलिए मैं पूरा हो गया।" प्रशिक्षित AI अधिक गहन था। इसने जाँच की कि क्या फ़ाइल में वास्तव में सही डेटा है और क्या परिवर्तनों ने सिस्टम के अन्य हिस्सों को प्रभावित किया। इसने केवल बॉक्स को टिक नहीं किया; इसने वास्तविकता की जाँच की।
व्यापक दृष्टिकोण
शोध पत्र सुझाव देता है कि जटिल, लॉन्ग-होरिज़न ऑफिस कार्यों पर AI को प्रशिक्षित करके, उन्होंने इसके विचारों और कार्यों को व्यवस्थित करने की क्षमता को मजबूत किया। AI ने यह नहीं सीखा कि कोड कैसे करना है; इसने यह सीखा कि कैसे सीखना है और कैसे जटिल योजनाओं को निष्पादित करना है। स्प्रेडशीट प्रबंधित करने, कई फाइलों को ट्रैक रखने और रिपोर्ट को सत्यापित करने के कौशल, सॉफ्टवेयर को डीबग करने के लिए आवश्यक कौशलों के आश्चर्यजनक रूप से समान निकले।
लेखक सावधानी बरतते हुए कहते हैं कि यह एक "व्यवहार संबंधी विवरण" (behavioral account) है। वे यह दावा नहीं कर रहे हैं कि AI के मस्तिष्क के अंदर इंसान की तरह एक वास्तविक "गोल स्टैक" है। इसके बजाय, वे देख रहे हैं कि AI का व्यवहार इस तरह दिखता है जैसे वह इन चार क्षमताओं का उपयोग कर रहा हो। डेटा दिखाता है कि जब AI इन व्यवहारों में एक डोमेन (ऑफिस वर्क) में बेहतर होता है, तो वह दूसरे डोमेन (सवेयर) में भी बेहतर होता है, बिना किसी प्रत्यक्ष प्रशिक्षण के।
यह एक जिम्नास्ट को प्रशिक्षित करने जैसा है। आप उन्हें बैलेंस बीम पर प्रशिक्षित कर सकते हैं, और हालांकि वे वॉल्ट (vault) का अभ्यास नहीं कर रहे हैं, उनकी कोर स्ट्रेंथ, संतुलन और फोकस में सुधार होता है। जब वे अंततः वॉल्ट पर कदम रखते हैं, तो वे बेहतर प्रदर्शन करते हैं क्योंकि उनके अंतर्निहित "जिम्नास्टिक कौशल" को तेज किया गया है। इस मामले में, "जि gymnastics" एक लंबे, जटिल कार्य को बिना रास्ता भटके प्रबंधित करने की क्षमता है।
शोध पत्र यह दावा नहीं करता है कि यह एक जादुई समाधान है जो AI की सभी समस्याओं को हल कर देता है, न ही यह कहता है कि यह AI को सुधारने का एकमात्र तरीका है। लेकिन यह एक दिलचस्प नया दृष्टिकोण प्रदान करता है: शायद हमें AI को दुनिया की हर नौकरी सिखाने की आवश्यकता नहीं है। शायद हमें बस इसे एक अच्छा, व्यवस्थित, लक्ष्य-उन्मुख कार्यकर्ता बनना सिखाने की आवश्यकता है, और यह बाकी सब खुद समझ लेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।