← नवीनतम पेपर
🤖 machine learning

Routing by Reaching: Composition of Pre-trained GFlowNets for Multi-Objective Generation

यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करता है जो बिना पुनरप्रशिक्षण के बहु-उद्देश्यीय पीढ़ी कार्यों को कुशलतापूर्वक संभालने के लिए इन्फरेंस के समय प्री-ट्रेंड GFlowNets को संयोजित करता है, जो लीनियर स्केलेराइजेशन के लिए सटीक रिकवरी और नॉन-लीनियर ऑपरेटर्स के लिए बाउंडेड एप्रोक्सिमेशन प्रदान करते हुए संयुक्त रूप से प्रशिक्षित बेसलाइन्स के समान प्रदर्शन प्राप्त करता है।

मूल लेखक: Seokwon Yoon, Youngbin Choi, Seunghyuk Cho, Seungbeom Lee, MoonJeong Park, Dongwoo Kim

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seokwon Yoon, Youngbin Choi, Seunghyuk Cho, Seungbeom Lee, MoonJeong Park, Dongwoo Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक आदर्श नया व्यंजन बनाने की कोशिश कर रहे हैं। आपके पास सामग्रियों की एक सूची है, लेकिन आपके पास नियमों की एक सूची भी है: यह मसालेदार होना चाहिए, लेकिन बहुत ज्यादा तीखा नहीं; यह मीठा होना चाहिए, लेकिन बहुत अधिक चिपचिपा नहीं; और इसे बनाना सस्ता होना चाहिए, लेकिन फिर भी यह शानदार दिखना चाहिए। आर्टिफिशियल इंटेलिजेंस की दुनिया में, वैज्ञानिक "जेनरेटिव फ्लो नेटवर्क्स" (या GFlowNets) नामक विशेष उपकरणों का उपयोग करते हैं जो इन शेफ की तरह काम करते हैं। खाना बनाने के बजाय, वे दवाइयों के लिए अणुओं या जटिल ग्राफों जैसे नए निर्माण "बनाते" हैं। ये उपकरण बेहतरीन हैं क्योंकि वे केवल एक "सर्वश्रेष्ठ" उत्तर नहीं खोजते; बल्कि वे विविध, आशाजनक विकल्पों से भरी एक पूरी रसोई की खोज करते हैं, जिससे आपको विभिन्न स्वादों के अनुकूल कई विकल्प मिलते हैं।

हालाँकि, वास्तविक जीवन अव्यवful है। आमतौर पर, आप केवल एक चीज़ नहीं चाहते; आप एक साथ कई चीज़ों को संतुलित करना चाहते हैं, जैसे कि एक ऐसा अणु बनाना जो मजबूत भी हो और सुरक्षित भी। समस्या यह थी कि करने का पुराना तरीका हर एक नियम के संयोजन के लिए एक नया शेफ काम पर रखने जैसा था। यदि आप रेसिपी को "मसालेदार और सस्ता" से बदलकर "मीठा और सुरक्षित" करना चाहते थे, तो आपको पुराने शेफ को हटाना पड़ता था और शुरू से एक बिल्कुल नया शेฟ प्रशिक्षित करना पड़ता था। यह धीमा, महंगा और बर्बादी भरा था। बड़ा सवाल वैज्ञानिकों ने यह पूछा है: क्या हम पहले से प्रशिक्षित शेफों की एक टीम ले सकते हैं जो अपने विशिष्ट व्यंजनों में विशेषज्ञ हैं और उन्हें बिना दोबारा प्रशिक्षित किए तुरंत एक नया, जटिल स्वाद बनाने के लिए एक साथ काम करने के लिए कह सकते हैं?

यह शोध पत्र एक चतुर नई विधि पेश करता है जिसे "रूटिंग बाय रीचिंग" (Routing by Reachng) कहा जाता है, जो इस सवाल का जवाब "हाँ" में देता है। लेखक एक ढांचा प्रस्तावित करते हैं जो एक स्मार्ट कंडक्टर की तरह कार्य करता है, जो पहले से प्रशिक्षित AI शेफ (GFlowNets) के एक समूह को लेता है और नए, बहु-उद्देश्यीय व्यंजनों को बनाने के लिए उनके निर्देशों को मौके पर ही मिलाता है। प्रत्येक नए लक्ष्य के लिए एक नया मॉडल प्रशिक्षित करने के बजाय, सिस्टम बस यह देखता है कि प्रत्येक मौजूदा मॉडल के लिए प्रक्रिया के एक निश्चित चरण तक पहुँचने की कितनी संभावना है और फिर उनके निर्णयों को मिलाने के लिए उस जानकारी का उपयोग एक भार (weight) के रूप में करता है।

शोधकर्ताओं ने पाया कि सरल संयोजनों के लिए, जैसे कि विभिन्न लक्ष्यों को भार के साथ जोड़ना (एक प्रक्रिया जिसे लीनियर स्केलराइजेशन कहा जाता है), यह मिश्रण विधि गणितीय रूप से पूर्ण है—यह ठीक वही वितरण बनाती है जो आपको तब मिलता यदि आपने शुरू से एक नया मॉडल प्रशिक्षित किया होता। अधिक जटिल, गैर-रेखीय संयोजनों के लिए (जैसे कि तर्क का उपयोग करना कि "A होना चाहिए लेकिन B नहीं"), विधि हर एक मामले में गणितीय रूप से पूर्ण नहीं है, लेकिन लेखक सिमुलेशन के माध्यम से दिखाते हैं कि यह सबसे महत्वपूर्ण क्षेत्रों में अविश्वसनीय रूप से सटीक है: उच्च-गुणवत्ता वाले, उच्च-इनाम वाले क्षेत्रों में जहाँ वास्तव में आप अपने समाधान खोजना चाहते हैं।

इसका परीक्षण करने के लिए, टीम ने दो बहुत अलग चरणों पर प्रयोग चलाए। पहले, उन्होंने एक साधारण 2D ग्रिड गेम का उपयोग किया, जैसे कि एक वीडियो गेम मैप, जहाँ वे देख सकते थे कि AI इनाम वाले क्षेत्रों तक कितनी अच्छी तरह नेविगेट करता है। यहाँ, उनकी विधि पिछले दृष्टिकोणों की तुलना में काफी अधिक सटीक थी, विशेष रूप से जब उन्होंने मिश्रण में अधिक उद्देश्य जोड़े। फिर, वे वास्तविक दुनिया में पहुँचे: ड्रग डिस्कवरी के लिए नए अणुओं को उत्पन्न करना। उन्होंने अणु निर्माण के दो प्रकारों पर परीक्षण किया: एक जहाँ वे पूर्व-निर्मित टुकड़ों (fragments) को जोड़ते हैं और दूसरा जहाँ वे परमाणु-दर-परमाणु निर्माण करते हैं। इन वास्तविक दुनिया के परीक्षणों में, उनकी विधि उन मॉडलों के बराबर या उनसे बेहतर रही जिन्हें प्रत्येक नए लक्ष्य के लिए भारी पुनर्र्प्रशिक्षण की आवश्यकता होती है। शायद सबसे प्रभावशाली बात यह है कि जब उन्होंने "तार्किक" नियमों का उपयोग किया (जैसे "उच्च बाइंडिंग एफिनिटी लेकिन कम विषाक्तता"), तो उनकी विधि पिछले सर्वश्रेष्ठ तरीके की तुलना में उत्तर उत्पन्न करने में लगभग 30 से 65 गुना तेज़ थी, जिसे हर एक चरण पर भारी गणना करनी पड़ती थी।

यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण पूर्व-प्रशिक्षित AI मॉडलों को पुन: प्रयोज्य बिल्डिंग ब्लॉक्स में बदल देता है। जिस तरह एक संगीतकार नए गाने बनाने के लिए रिकॉर्ड किए गए ट्रैक को मिक्स कर सकता है बिना वाद्ययंत्रों को दोबारा रिकॉर्ड किए, उसी तरह यह विधि वैज्ञानिकों को तुरंत नए AI व्यवहारों की रचना करने की अनुमति देती है। हालाँकि यह विधि कोई जादुई समाधान नहीं है जो हर संभव समस्या को हल कर दे (यह तब सबसे अच्छा काम करती है जब मूल मॉडल अच्छी तरह से प्रशिक्षित हों और लक्ष्य बहुत अधिक विरोधाभासी न हों), यह एक लचीका, तेज़ और अत्यधिक सटीक तरीका प्रदान करती है जिससे निरंतर पुनर्र्प्रशिक्षण की भारी लागत के बिना जटिल वैज्ञानिक समस्याओं का पता लगाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →