Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Fixing
यह शोध पत्र GUIRepair को प्रस्तुत करता है, जो एक क्रॉस-मोडल रीजनिंग फ्रेमवर्क है जो विजुअल GUI लक्षणों को निष्पादन योग्य संदर्भ (executable context) में अनुवादित करने और विजुअल फीडबैक के माध्यम से सुधारों को सत्यापित करने के लिए Image2Code और Code2Image घटकों को एकीकृत करके मल्टीमॉडल ऑटोमेटेड प्रोग्राम रिपेयर को बढ़ाता है, जिससे SWE-bench M बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक मास्टर मैकेनिक हैं जो एक बहुत ही विशिष्ट, पेचीदा कार की समस्या को ठीक करने की कोशिश कर रहे हैं। आमतौर पर, कार का मालिक आपको कॉल करता है और कहता है, "मेरे इंजन से अजीब सी आवाज़ आ रही है," और आप उस विवरण के आधार पर उसे ठीक करते हैं। वर्तमान AI "प्रोग्राम रिपेयर" टूल्स इसी तरह काम करते हैं: वे बग के टेक्स्ट विवरण को पढ़ते हैं और उसे ठीक करने के लिए कोड को देखते हैं।
लेकिन क्या होगा अगर समस्या "विजुअल" (दृश्य संबंधी) हो? क्या होगा अगर कार का मालिक कहे, "डैशबोर्ड की लाइट गलत रंग में ब्लिंक कर रही है," और आपको एक फोटो भेजे? अधिकांश मौजूदा AI मैकेनिक भ्रमित हो जाते हैं। वे टेक्स्ट तो पढ़ सकते हैं, लेकिन वे फोटो को वास्तव में "देख" नहीं पाते या यह नहीं समझ पाते कि वह तस्वीर इंजन के पुर्जों से कैसे जुड़ी है। वे केवल एक स्नैपशॉट देखकर यह समझने में संघर्ष करते हैं कि किस बोल्ट को कसना है।
यह पेपर एक नए AI मैकेनिक से परिचय कराता है जिसे GUIRepair कहा जाता है। इसे विशेष रूप से इन "विजुअल" सॉफ्टवेयर बग्स को संभालने के लिए डिज़ाइन किया गया है, जैसे कि किसी वेबसाइट पर टूटा हुआ बटन या किसी ऐप पर ग्लिच वाला मैप।
यहाँ बताया गया है कि GUIReppair कैसे काम करता है, जिसे दो मुख्य सुपरपावर्स में विभाजित किया गया है:
1. "फोटो-टू-ब्लूप्रिंट" ट्रांसलेटर (Image2Code)
जब एक मानव डेवलपर फोटो में बग देखता है, तो वह केवल पिक्सल को नहीं घूरता; वह सोचता है, "आह, वह Calendar कंपोनेंट इस वजह से गड़बड़ कर रहा है क्योंकि Dialog बॉक्स को जिस तरह सेट किया गया है वैसा है।" वह मन ही मन उस तस्वीर को कोड लॉजिक में अनुवादित करता है।
AI आमतौर पर इसे अच्छी तरह से नहीं कर पाता है। GUIRepair इसे एक जासूस की तरह काम करके ठीक करता है जो समस्या का एक लघु मॉडल (miniature model) बनाता है।
- प्रक्रिया: यह बग रिपोर्ट (फोटो और टेक्स्ट) को देखता है और नियमों को समझने के लिए प्रोजेक्ट के निर्देश मैनुअल (डॉक्यूमेंटेशन) को खोजता है।
- जादू: इसके बाद यह एक छोटा, अस्थायी कोड लिखता है जो फोटो से सटीक दृश्य को फिर से बनाता है। यह बिल्कुल वैसा ही है जैसे AI केवल ब्लिंक करती लाइट को देखने के लिए कार का एक "टेस्ट ड्राइव" संस्करण बनाता है।
- यह क्यों मदद करता है: अब, फोटो का अनुमान लगाने के बजाय, AI के पास एक वर्किंग मॉडल है। वह देख सकता है, "ओह, मैं देख पा रहा हूँ कि कौन सी कोड लाइन उस लाइट को ब्लिंक करने के लिए मजबूर कर रही है।" यह इसे बग को ठीक करने के लिए सही जगह खोजने में मदद करता है।
2. "फिक्स-एंड-चेक" मिरर (Code2Image)
एक बार जब AI को लगता है कि उसके पास एक समाधान (fix) है, तो उसे यह जानने की आवश्यकता होती है कि क्या वास्तव में काम बन गया है। सामान्य टेक्स्ट-आधारित कोडिंग में, आप एक टेस्ट चलाते हैं जो "पास" या "फेल" कहता है। लेकिन विजुअल बग्स के लिए, एक टेक्स्ट टेस्ट पर्याप्त नहीं है। आपको देखना होगा कि क्या लाइट अब सही रंग की है।
GUIRepair के पास इस स्थिति को संभालने के लिए एक दूसरा सुपरपावर है:
- प्रक्रिया: यह उस फिक्स को लेता है जो इसने अभी लिखा है और उसे पहले बनाए गए "लघु मॉडल" पर लागू करता है।
- जादू: यह कोड को चलाता है और परिणाम का एक नया स्क्रीनशॉट लेता है। फिर यह इस नई तस्वीर की तुलना मूल "टूटी हुई" तस्वीर से करता है।
- यह क्यों मदद करता है: AI इन दोनों छवियों को अगल-बगल रखकर देखता है और कहता है, "ठीक है, पहली तस्वीर में, कैलेंडर गलत जगह पर तैर रहा था। इस नई तस्वीर में, यह सही जगह पर है। फिक्स काम कर गया!" यह AI को यह देखने का एक तरीका देता है कि क्या उसका रिपेयर सफल है, बजाय इसके कि वह केवल अनुमान लगाए।
परिणाम: एक बेहतर मैकेनिक
शोधकर्ताओं ने इस नए मैकेनिक का परीक्षण वास्तविक दुनिया के सॉफ्टवेयर बग्स (जिन्हें SWE-bench M कहा जाता है) की एक बड़ी सूची पर किया, जिनमें विजुअल समस्याएं शामिल थीं।
- प्रतियोगिता: उन्होंने GUIRepair की तुलना सबसे अच्छे मौजूदा AI सिस्टम (दोनों मुफ्त और सशुल्क कमर्शियल) के साथ की।
- स्कोर:
- एक मानक शक्तिशाली AI मॉडल का उपयोग करते हुए, GUIRepair ने 157 समस्याओं को ठीक किया, जो अगले सबसे अच्छे ओपन-सोर्स टूल को काफी बड़े अंतर से पीछे छोड़ देता है।
- जब उन्होंने एक और भी स्मार्ट "रीजनिंग" AI मॉडल (जिसे o4-mini कहा जाता है) का उपयोग किया, तो GUIRepair ने 175 समस्याओं को ठीक किया, जो शीर्ष कमर्शियल सिस्टम को 22 सुधारों से पीछे छोड़ देता है।
निचोड़ (The Bottom Line)
पेपर का दावा है कि AI को तस्वीरों को कोड में अनुवादित करना (समस्या को समझने के लिए) और कोड को वापस तस्वीरों में अनुवादित करना (समाधान की जांच करने के लिए) सिखाकर, यह वर्तमान तरीकों की तुलना में विजुअल सॉफ्टवेयर बग्स को बहुत बेहतर तरीके से हल कर सकता है। यह एक मैकेनिक को चश्मा देने जैसा है ताकि वह अंततः उस समस्या को "देख" सके जिसे वह ठीक करने की कोशिश कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।