AGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models
यह शोध पत्र JAGG (Jacobian-Aggregated Group Gradient) प्रस्तुत करता है, जो डिफ्यूजन मॉडल प्रक्षेपवक्रों (trajectories) के लगभग रैखिक परिवर्तन का लाभ उठाकर मध्यवर्ती जैकोबियन (intermediate Jacobians) को अनुमानित करने और ग्रुप ग्रेडिएंट्स को एकत्रित करने के लिए है, जिससे बिना किसी महत्वपूर्ण गुणवत्ता हानि के डिफ्यूजन ट्रांसफॉर्मर्स के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) प्रशिक्षण की कम्प्यूटेशनल लागत को लगभग 2 कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डिजिटल कलाकार को बेहतर चित्र बनाना सिखाने की कोशिश कर रहे हैं। यह कलाकार कोई इंसान नहीं है; यह एक जटिल कंप्यूटर प्रोग्राम है जिसे "डिफ्यूजन मॉडल" कहा जाता है। इस मॉडल को एक ऐसे मूर्तिकार के रूप में सोचें जो शोर (noise) और स्टैटिक से भरी मिट्टी के एक ब्लॉक से शुरुआत करता है और धीरे-धीरे उस शोर को हटाता जाता है, कदम-दर-कदम, जब तक कि एक आदर्श मूर्ति उभर न आए। इस मूर्तिकार को वह कला बनाने के लिए सिखाने के लिए जो इंसान वास्तव में पसंद करते हैं, हम "रीइन्फोर्समेंट लर्निंग" नामक एक तकनीक का उपयोग करते हैं। यह एक खेल की तरह है जहाँ मूर्तिकार छेनी चलाने के कुछ अलग-अलग प्रयास करता है, एक जज (रिवॉर्ड मॉडल) से एक स्कोर प्राप्त करता है, और फिर अगली बार बेहतर करने के लिए उस स्कोर से सीखता है।
समस्या यह है कि यह सीखने की प्रक्रिया अविश्वसनीय रूप से महंगी है। हर बार जब मूर्तिकार एक छोटा सा प्रहार करता है (एक "स्टेप"), तो कंप्यूटर को मूर्तिकार के मस्तिष्क को ठीक से समायोजित करने के लिए एक विशाल, ऊर्जा-खपत वाली गणना करनी पड़ती है। यदि मूर्ति को पूरा होने में 20 कदम लगते हैं, तो कंप्यूटर को हर एक सबक के लिए 20 बार यह भारी गणित करना पड़ता है। यह एक नया नृत्य सीखने के लिए हर एक चाल के बाद रुकने, कोच से पूरी आलोचना माँगने, अपनी पूरी मांसपेशियों की स्मृति (muscle memory) को फिर से लिखने और फिर से शुरू करने जैसा है। उच्च-रिज़ॉल्यूशन वाली छवियों के लिए, इसमें इतना समय और बिजली लगती है कि इन मॉडलों को प्रभावी ढंग से प्रशिक्षित करना लगभग असंभव हो जाता है।
यहीं पर JAGG नामक एक नया विचार आता है। इस शोध के पीछे के शोधकर्ताओं ने एक चतुर प्रश्न पूछा: "क्या हमें वास्तव में हर एक चाल के बाद रुकने और सब कुछ फिर से कैलकुलेट करने की आवश्यकता है?" उन्होंने देखा कि मूर्तिकला की प्रक्रिया के शुरुआती, अव्यवस्थित चरणों में, परिवर्तन बहुत सुचारू और अनुमानित तरीके से होते हैं—लगभग एक सीधी रेखा की तरह। यदि आप जानते हैं कि मूर्तिकला कहाँ से शुरू होती है और कुछ कदमों के बाद वह कहाँ पहुँचती है, तो आप वास्तव में भारी गणित किए बिना बीच में क्या हुआ, इसका अनुमान लगा सकते हैं।
यह शोध पत्र JAGG (जैकोबियन-एग्रीगेटेड ग्रुप ग्रेडिएंट) नामक एक विधि पेश करता है। प्रत्येक स्टेप के बाद सबक की गणना करने के बजाय, JAGG मॉडल को कदमों का एक समूह (मान लीजिए, चार चालें एक साथ) लेने देता है और केवल दो बार भारी "ब्रेन अपडेट" गणित करता है: एक बार समूह की शुरुआत में और एक बार समूह के अंत में। बीच के चरणों के लिए, यह एक स्मार्ट शॉर्टकट का उपयोग करता है। यह मान लेता है कि शुरुआत और अंत के बीच का रास्ता एक सीधी रेखा है और बीच के खाली स्थानों को भर देता है।
शोधकर्ताओं ने गणितीय रूप से सिद्ध किया है कि यदि मूर्तिकला की प्रक्रिया पूरी तरह से सुचारू और रैखिक (linear) है, तो यह शॉर्टकट वास्तव में सटीक है—यह ठीक वही उत्तर देता है जो हर बार कठिन परिश्रम करने से मिलता है। वास्तविक दुनिया में, जहाँ चीजें पूरी तरह से सीधी नहीं होती हैं, उन्होंने पाया कि यह शॉर्टकट छवि निर्माण के "शोर वाले" शुरुआती चरणों के दौरान अविश्वसनीय रूप से अच्छा काम करता है। इस पद्धति का उपयोग करके, वे इन मॉडलों को प्रशिक्षित करने में लगने वाले समय को प्रति स्टेप लगभग 17% से 18% तक कम करने में सक्षम हुए।
सबसे अच्छी बात? चित्रों की गुणवत्ता पर कोई बुरा प्रभाव नहीं पड़ा। जब उन्होंने विभिन्न मॉडलों (जैसे Flux और QwenImage) पर JAGG का परीक्षण किया, तो उत्पन्न चित्र उतने ही अच्छे थे जितने कि धीमी, पारंपरिक विधि से बनाए गए चित्र। वास्तव में, कुछ मामलों में, इस शॉर्टकट ने मॉडल को अधिक स्थिरता से सीखने में भी मदद की। शोध पत्र दिखाता है कि भारी काम कब करना है, इस बारे में थोड़ा चतुर होकर, हम अंतिम कलाकृति की सुंदरता से समझौता किए बिना, इन शक्तिशाली एआई कलाकारों को बहुत तेज़ और सस्ता बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।