-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data
यह शोध पत्र -ट्रैजेक्टरी बैलेंस (f-Trajectory Balance) को प्रस्तुत करता है, जो लॉस फंक्शन्स (loss functions) का एक परिवार है जो मीन स्क्वायर एरर (mean square error) दृष्टिकोण को सभी -डाइवर्जेंस (f-divergences) तक विस्तारित करता है, जिससे जेनरेटिव मॉडल्स और एलएलएम (LLMs) को उनके संबंधित ऑन-पॉलिसी (on-policy) -डाइवर्जेंस ग्रेडिएंट्स के विशिष्ट अनुकूलन गुणों (जैसे कि मोड कवरिंग) को संरक्षित करते हुए ऑफ-पॉलिसी (off-policy) डेटा के साथ प्रशिक्षित करना सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक विशाल, अंधेरी गुफा प्रणाली की खोज करना सिखा रहे हैं। गुफा में कई छिपे हुए कक्ष (जिन्हें "मोड्स" कहा जाता है) हैं, जिनमें से कुछ में सोना (उच्च पुरस्कार) है, और कुछ बस खाली या खतरनाक हैं। आपका लक्ष्य रोबोट को जितने संभव हो सके उतने अलग-अलग सोने के कक्षों को खोजना सिखाना है, बजाय इसके कि वह केवल एक बड़ी सोने की खान को खोज ले और बाकी सब कुछ अनदेखा कर दे।
यह पेपर इन रोबोटों को प्रशिक्षित करने में मदद करने के लिए "शिक्षण उपकरण" (लॉस फंक्शन्स) का एक नया सेट पेश करता है, चाहे वे नई दवाओं के लिए अणु (molecules) बना रहे हों, कला बना रहे हों, या कोड लिख रहे हों।
यहाँ सरल उपमाओं का उपयोग करके पेपर के विचारों का विवरण दिया गया है:
1. समस्या: "गोल्ड रश" बनाम "एक्सप्लोरर" (खोजकर्ता)
अतीत में, इन रोबोटों को सिखाने का मानक तरीका एक गोल्ड रश (सोने की दौड़) जैसा था। रोबोट सोने के एक छोटे से स्थान को पाता, उत्साहित होता, और फिर अपना सारा समय वहीं खुदाई करने में बिता देता। वह गुफा के अन्य सभी सोने की खदानों को अनदेखा कर देता।
- तकनीकी शब्दों में: इसे "मोड-सीकिंग" (mode-seeking) कहा जाता है। मॉडल कुछ उच्च-संभावना वाले उत्तरों पर सिमट जाता है और बाकी विविधता को अनदेखा कर देता है।
- पेपर का लक्ष्य: हम "मोड-कवरिंग" (mode-covering) चाहते हैं। हम चाहते हैं कि रोबोट फैलकर और खोज करके गुफा का एक संपूर्ण मानचित्र प्राप्त करे, जिसमें छोटे सोने के भंडार भी शामिल हों।
2. पुराना उपकरण: "स्क्वेयर्ड KL" लॉस (Squared KL Loss)
हाल ही में, शोधकर्ताओं ने एक चतुर तरीका खोजा जिससे "स्क्वेयर्ड एरर" विधि (यह मापना कि रोबोट क्या सोचता है और उसे क्या सोचना चाहिए) का उपयोग करके रोबोट को सिखाया जा सकता है।
- उपमा: कल्पना कीजिए कि एक शिक्षक छात्र का मूल्यांकन कर रहा है। यदि छात्र गलत उत्तर देता है, तो शिक्षक केवल यह नहीं कहता कि "गलत"। वे गलती के "वर्ग" (square) की गणना करते हैं।
- लाभ: यह विधि बहुत स्थिर है। यह तब भी काम करती है जब छात्र पुराने नोट्स (ऑफ-पॉलिसी डेटा) से सीख रहा हो, न कि लाइव पाठों से।
- दोष: भले ही यह स्थिर है, लेकिन यह विशिष्ट "स्क्वेयर्ड" विधि अभी भी एक गोल्ड रश की तरह व्यवहार करती है। यह स्वाभाविक रूप से रोबोट को केवल कुछ उत्तरों पर ध्यान केंद्रित करने के लिए प्रेरित करती है, जिससे विविधता छूट जाती है।
3. नया समाधान: "f-ट्रैजेक्टरी बैलेंस" (f-Trajectory Balance) परिवार
लेखकों ने महसूस किया कि "स्क्वेयर्ड" विधि वास्तव में एक बहुत बड़े शिक्षण उपकरणों के परिवार का केवल एक विशिष्ट स्वाद है। वे इस परिवार को f-ट्रैजेक्टरी बैलेंस कहते हैं।
इस परिवार को एक रेडियो के डायल या वॉल्यूम नॉब के रूप में सोचें।
- डायल को एक तरफ घुमाने पर (कम संख्याएं): आपको ऐसे उपकरण मिलते हैं जो एक सुपर एक्सप्लोरर की तरह कार्य करते हैं। ये उपकरण रोबोट को फैलने और हर संभव सोने की खान को खोजने के लिए मजबूर करते हैं, यहाँ तक कि उन तक पहुँचना भी कठिन है। यह ड्रग डिस्कवरी (दवा की खोज) के लिए बेहतरीन है जहाँ आप कोई भी ऐसा अणु खोजना चाहते हैं जो काम कर सके, न कि केवल सबसे स्पष्ट वाला।
- डायल को दूसरी तरफ घुमाने पर (उच्च संख्याएं): आपको ऐसे उपकरण मिलते हैं जो एक गोल्ड डिगर (सोना खोदने वाला) की तरह कार्य करते हैं। ये उपकरण रोबूल को छोटी खदानों को अनदेखा करने और सबसे बड़ी, सबसे स्पष्ट सोने की ढेरी पर तीव्रता से ध्यान केंद्रित करने के लिए कहते हैं। यह तब उपयोगी है जब आप केवल एक सबसे अच्छा उत्तर चाहते हैं।
- मध्य मार्ग: आप अन्वेषण (exploration) और फोकस के बीच मिश्रण प्राप्त करने के लिए डायल को कहीं भी सेट कर सकते हैं।
4. यह एक बड़ी बात क्यों है
पेपर दो मुख्य चीजें सिद्ध करता है:
- "मैजिक स्विच": उन्होंने दिखाया कि आप मानक "स्क्वेयर्ड" टूल को इनमें से किसी भी नए "डायल" टूल से बदल सकते हैं, और गणित अभी भी पूरी तरह से काम करता है। रोबोट उतना ही अच्छा सीखता है, लेकिन एक अलग व्यक्तित्व के साथ (अधिक खोजी या अधिक केंद्रित)।
- स्थिरता: पुराने टूल की तरह, ये नए उपकरण भी काम करते हैं यदि रोबोट पुराने डेटा (ऑफ-पॉलिसी) से सीख रहा है। यह वास्तविक दुनिया के अनुप्रयोगों जैसे कि लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए महत्वपूर्ण है, जहाँ प्रशिक्षण अक्सर एसिंक्रोनस (asynchronous) रूप से होता है (रोबोट पुराने डेटा से सीखता है जो कुछ समय पहले उत्पन्न हुआ था)।
5. वास्तविक दुनिया के परीक्षण (गुफा के मानचित्र)
लेखकों ने तीन अलग-अलग "गुफाओं" में इन उपकरणों का परीक्षण किया:
- ग्रिड गेम: एक साधारण कंप्यूटर भूलभुलैया जिसके चार कोनों में सोना भरा है। मानक टूल ने केवल एक कोना खोजा। नए "एक्सप्लोरर" टूल्स ने तेजी से चारों कोनों को खोज लिया।
- मॉलिक्यूल डिस्कवरी (SynFlowNet): उन्होंने नए रासायनिक अणुओं को उत्पन्न करने का प्रयास किया। "एक्सप्लोरर" डायल को घुमाकर, उन्होंने बहुत अधिक विविध और अद्वितीय अणुओं को उत्पन्न किया जो संभावित रूप से दवाओं के रूप में काम कर सकते हैं, बजाय इसके कि वे एक ही कुछ रसायनों के रूपांतर ही बनाते रहें।
- लार्ज लैंग्वेज मॉडल्स (LLMs): उन्होंने AI मॉडल को गणित की समस्याओं को हल करने के लिए ट्यून किया। नए टूल्स ने AI को समस्याओं को हल करने के विभिन्न तरीकों को खोजने की अनुमति दी, बिना एक ही उत्तर को दोहराने के लूप में फंसे, भले ही प्रशिक्षण डेटा विलंबित (asynchronous) था।
सारांश
यह पेपर एक नए प्रकार का रोबोट नहीं बनाता है। इसके बजाय, यह उन्हें प्रशिक्षित करने के लिए निर्देशों का एक नया सेट बनाता है।
- पुराना तरीका: "सबसे बड़ी सोने की खान खोजो और वहीं खुदाई करो।" (स्थिर, लेकिन उबाऊ)।
- नया तरीका: "यहाँ एक डायल है। आप एक गोल्ड डिगर, एक सुपर एक्सप्लोरर, या दोनों के बीच कुछ भी बनने का चुनाव कर सकते हैं। और आप जो भी चुनें, प्रशिक्षण स्थिर रहेगा और पुराने डेटा के साथ भी काम करेगा।"
यह इंजीनियरों को उनके AI मॉडल की रचनात्मकता या फोकस को नियंत्रित करने के लिए एक सरल नॉब देता है, बिना प्रशिक्षण प्रक्रिया को बाधित किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।