TOM-SWE: User Mental Modeling For Software Engineering Agents
यह शोध पत्र ToM-SWE को प्रस्तुत करता है, जो एक डुअल-एजेंट आर्किटेक्चर है जो उपयोगकर्ता के इरादे को समझने और निरंतर मेमोरी बनाए रखने के लिए एक सॉफ्टवेयर इंजीनियरिंग एजेंट को थ्योरी-ऑफ-माइंड पार्टनर के साथ जोड़ता है, जिससे बेंचमार्क मूल्यांकन और पेशेवर डेवलपर्स के साथ एक वास्तविक अध्ययन दोनों में कार्य सफलता दर और उपयोगकर्ता संतुष्टि में उल्लेखनीय सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ ToM-SWE पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के माध्यम से समझाया गया है।
बड़ी समस्या: "भुलक्कड़" कोडिंग रोबोट
कल्पना कीजिए कि आपने आपको वेबसाइट बनाने में मदद करने के लिए एक बेहद बुद्धिमान लेकिन भूलने की बीमारी (amnesiac) वाले रोबोट सहायक को काम पर रखा है।
- रोबोट: यह कोड लिखने, बग्स ठीक करने और टेस्ट चलाने में अविश्वसनीय रूप से स्मार्ट है।
- समस्या: हर बार जब आप एक नई बातचीत शुरू करते हैं, तो रोबोट को इस बात की कोई याद नहीं रहती कि आप कौन हैं। उसे यह नहीं पता कि आपको लंबे स्पष्टीकरण पसंद नहीं हैं, कि आप विशिष्ट टूल्स का उपयोग करना पसंद करते हैं, या कि आप हमेशा कोड को डिप्लॉय करने से पहले उसका परीक्षण करना चाहते हैं।
- परिणाम: आपको बार-बार अपनी बात दोहरानी पड़ती है। "इसे छोटा करो," "इस लाइब्रेरी का उपयोग करो," "मुझसे इतने सारे सवाल मत पूछो।" रोबोट केवल अंदाज़ा लगाता रहता है, जो अक्सर गलत होता है, जिससे समय बर्बाद होता है और आप निराश होते हैं।
वर्तमान AI कोडिंग एजेंट ऐसे ही रोबोट की तरह हैं: वे तकनीकी काम में तो बहुत अच्छे हैं लेकिन आपको समझने में बहुत खराब हैं।
समाधान: "मन की बात पढ़ने वाला" साथी (ToM-SWE)
इस पेपर के लेखकों ने ToM-SWE नामक एक नया सिस्टम बनाया है। केवल एक रोबोट के बजाय, उन्होंने एक दो-सदस्यीय टीम बनाई है:
- बिल्डर (SWE Agent): यह मूल कोडिंग रोबोट है। इसका पूरा ध्यान कोड लिखने, टेस्ट चलाने और त्रुटियों को ठीक करने पर है। इसे आपकी पर्सनैलिटी की चिंता करने की ज़रूरत नहीं है; यह बस भारी काम करता है।
- मन की बात पढ़ने वाला (ToM Agent): यह एक नया, हल्का (lightweight) साथी है। इसका एकमात्र काम आपको समझना है। यह देखता है कि आप कैसे बात करते हैं, आपको क्या पसंद है, और आपने अतीत में क्या किया है। यह आपकी प्राथमिकताओं का एक "मेंटल मॉडल" बनाता है।
वे मिलकर कैसे काम करते हैं:
बिल्डर के कोडिंग शुरू करने से पहले, वह मन की बात पढ़ने वाले से पूछता है: "हे, इस यूजर को क्या पसंद है? क्या उन्हें छोटे जवाब चाहिए? क्या वे Python या JavaScript का उपयोग करते हैं? क्या उन्होंने पिछले हफ्ते किसी विशिष्ट टूल का उल्लेख किया था?"
मन की बात पढ़ने वाला अपने नोट्स चेक करता है और कहता है, "यह यूजर एक प्रोफेसर है जिन्हें संक्षिप्त उत्तर पसंद हैं और वे होस्टिंग के लिए Vercel पसंद करते हैं। उनसे बहुत अधिक सवाल न पूछें।"
इसके बाद बिल्डर अपनी योजना को एडजस्ट करता है और आपके स्टाइल के अनुसार बिल्कुल सटीक कोड लिखता है।
"मेंटल मॉडल" का उदाहरण
मन की बात पढ़ने वाले को एक बहुत ही ध्यान देने वाले व्यक्तिगत सहायक की तरह समझें जो आपकी आदतों की डायरी रखता है।
- सेशन 1: आप सिस्टम को बताते हैं, "मेरे लिए एक वेबसाइट बनाओ।" मन की बात पढ़ने वाला नोट करता है: यूजर एक प्रोफेसर है, अकादमिक शैली पसंद करता है, Vercel पसंद करता है।
- सेशन 2 (अगले सप्ताह): आप फिर से कहते हैं, "मेरे लिए एक वेबसाइट बनाओ।"
- पुराना रोबोट: "ठीक है, मैं एक जेनेरिक वेबसाइट का अंदाज़ा लगाता हूँ।"
- ToM-SWE: बिल्डर मन की बात पढ़ने वाले से पूछता है। मन की बात पढ़ने वाला कहता है, "पिछली बार याद है? यह एक यूनिवर्सिटी प्रोजेक्ट के लिए है। अकादमिक फोंट का उपयोग करें और Vercel पर होस्ट करें।"
- परिणाम: कोड बिल्कुल वैसा ही है जैसा आप चाहते थे, भले ही आपने इसे दोबारा नहीं कहा।
उन्होंने इसका परीक्षण कैसे किया
शोधकर्ताओं ने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने दो प्रकार के परीक्षण किए:
"सिमुलेशन" टेस्ट (बेंचमार्क्स):
उन्होंने एक नकली दुनिया बनाई जहाँ AI को एक "सिम्युलेटेड यूजर" (एक अन्य AI जो इंसान की तरह व्यवहार कर रहा है) के साथ बात करनी थी। उन्होंने सिम्युलेटेड यूजर को अलग-अलग व्यक्तित्व दिए (जैसे, एक जो बहुत बातें करता है, एक जो बहुत संक्षिप्त है)।- परिणाम: ToM-SWE टीम ने 59.7% कार्यों को सफलतापूर्वक पूरा किया। सबसे अच्छे पिछले रोबोट (OpenHands) ने केवल 18.1% कार्य पूरे किए।
- "संतुष्टि" स्कोर: सिम्युलेटेड यूजर्स ने ToM-SWE टीम को बहुत अधिक रेटिंग दी (5 में से 3.62) क्योंकि टीम ने बेहतर तरीके से "सुना" और उन्हें अनावश्यक सवालों से परेशान नहीं किया।
"वास्तविक जीवन" का टेस्ट (ह्यूमन स्टडी):
उन्होंने 17 वास्तविक पेशेवर डेवलपर्स को उनके वास्तविक, दैनिक काम पर तीन सप्ताह के लिए इस सिस्टम का उपयोग करने दिया।- परिणाम: डेवलपर्स ने मन की बात पढ़ने वाले के सुझावों को 86% बार उपयोगी पाया।
- उन्हें क्या पसंद आया: सिस्टम कहता था जैसे, "आप आमतौर पर नए फंक्शन्स के लिए टेस्ट जोड़ते हैं, इसलिए मैंने यहाँ भी उन्हें जोड़ दिया है," या "आप न्यूनतम कोड बदलाव पसंद करते हैं, इसलिए मैंने बदलाव छोटे रखे हैं।"
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि AI के लिए वास्तव में मददगार होने के लिए, इसे केवल एक कोड जनरेटर नहीं होना चाहिए। इसे एक सहयोगी (collaborator) होना चाहिए जो मानवीय इरादे (intent) को समझ सके।
- पुराना तरीका: आप AI को बताते हैं कि क्या करना है, और वह बाकी चीज़ों का अंदाज़ा लगाता है।
- नया तरीका (ToM-SWE): AI याद रखता है कि आप कौन हैं, आपको क्या पसंद है, और आप कैसे काम करते हैं, ताकि वह आपके पूछने से पहले ही आपकी ज़रूरतों का अनुमान लगा सके।
एक वाक्य में सारांश
ToM-SWE एक दो-एजेंट सिस्टम है जहाँ एक एजेंट कोड लिखता है और दूसरा "मन की बात पढ़ने वाला" एजेंट आपकी व्यक्तिगत प्राथमिकताओं और आदतों को याद रखता है, जिससे यह टीम आपके साथ बहुत अधिक कुशलता से और कम हताशा के साथ काम कर पाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।