← नवीनतम पेपर
🤖 machine learning

Trust Region Q Adjoint Matching

यह शोध पत्र ट्रस्ट रीजन Q-एडजॉइंट मैचिंग (TRQAM) प्रस्तुत करता है, जो एक स्थिर ऑफ-पॉलिसी फाइन-ट्यूनिंग एल्गोरिदम है जो क्रिटिक-प्रेरित अस्थिरता को कम करने के लिए प्रोजेक्टेड डुअल डिसेंट के माध्यम से प्रीट्रेन्ड फ्लो पॉलिसियों से पाथ-स्पेस KL डाइवर्जेंस को अनुकूल रूप से नियंत्रित करता है, जिससे 50 OGBench कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Yonghoon Dong, Kyungmin Lee, Changyeon Kim, Jaehyuk Kim, Jinwoo Shin

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yonghoon Dong, Kyungmin Lee, Changyeon Kim, Jaehyuk Kim, Jinwoo Shin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: एक मास्टर शेफ को नए व्यंजन बनाना सिखाना

कल्पना कीजिए कि आपके पास एक विश्व प्रसिद्ध शेफ (Pretrained Flow Policy) है, जिसने व्यंजनों के एक विशिष्ट सेट में महारत हासिल करने के लिए वर्षों बिताए हैं। वे इन व्यंजनों को बनाने में अविश्वसनीय रूप से कुशल हैं, लेकिन उन्होंने अपने विशिष्ट मेनू के बाहर कभी कुछ नहीं बनाया है।

अब, आप इस शेफ को फीडबैक के एक "टेस्टिंग मेनू" (Reinforcement Learning वाला हिस्सा) का उपयोग करके एक नया प्रकार का व्यंजन बनाना सिखाना चाहते हैं। आप चाहते हैं कि वे ग्राहकों की पसंद के आधार पर अपने खाना पकाने के कौशल में सुधार करें, लेकिन आप यह भी नहीं चाहते कि वे अपने मूल कौशल को भूल जाएं या प्रयोग करते समय रसोई को अनजाने में जला दें।

समस्या यह है कि शेफ की "सीखने की प्रक्रिया" जटिल है। यदि आप उन्हें बस यह कहते हैं, "इसे और स्वादिष्ट बनाओ!" तो वे बहुत अधिक प्रतिक्रिया दे सकते हैं। वे अपनी रेसिपी को इतनी नाटकीय रूप से बदलने की कोशिश कर सकते हैं कि वे व्यंजन को पूरी तरह से बर्बाद कर दें। शोध पत्र में इसे मॉडल कोलैप्स (model collapse) कहा गया है।

समस्या: एक "अति-उत्साही" आलोचक

AI की दुनिया में, एक "क्रिटिक" (जज) होता है जो बताता है कि व्यंजन कितना अच्छा है।

  • पुराना तरीका (QAM): पिछला सबसे अच्छा तरीका, जिसे QAM कहा जाता था, एक ऐसे जज की तरह था जो चिल्लाकर कहता, "इसमें नमक की कमी है!" शेफ ने बात सुनी, नमक डाला, और फिर से चखा। लेकिन अगर जज ने एक छोटी सी गलती की (उदाहरण के लिए, व्यंजन में वास्तव में कम नमक की आवश्यकता थी, लेकिन जज ने अधिक कहा), तो शेफ ने अत्यधिक सुधार (over-correct) किया। क्योंकि शेफ एक जटिल, बहु-चरणीय खाना पकाने की प्रक्रिया के माध्यम से जज के निर्देशों का पालन करने की कोशिश कर रहा था, वह छोटी सी गलती घातीय रूप से (exponentially) बढ़ गई
  • परिणाम: शेफ अंततः नमक की पूरी बाल्टी डाल देता, जिससे व्यंजन बर्बाद हो जाता। शोध पत्र के प्रयोगों में, इसके कारण AI बुरी तरह विफल हुआ, उसकी सफलता दर 80% से गिरकर लगभग शून्य हो गई।

समाधान: TRQAM (एक "सुरक्षा क्षेत्र" वाला शेफ)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे TRQAM (Trust Region Q-Adjoint Matching) कहा जाता है। इसे एक शेफ को सुरक्षा क्षेत्र (Safety Zone) या एक लीश (Leash/पट्टा) देने के रूप में सोचें।

  1. लीश (Trust Region): शेफ को जज को खुश करने के लिए बेकाबू होकर अपनी रेसिपी बदलने देने के बजाय, TRQм यह तय करता है कि शेफ एक बार में अपनी रेसिपी में कितना बदलाव कर सकता है। यह कहता है, "आप व्यंजन को स्वादिष्ट बनाने के लिए रेसिपी बदल सकते हैं, लेकिन आप अपनी मूल, प्रमाणित शैली से बहुत अधिक दूर नहीं जा सकते।"
  2. जादुई नॉब (λ\lambda): पेपर एक विशेष "नॉब" पेश करता है जिसे λ\lambda कहा जाता है।
    • यदि शेफ रेसिपी को बहुत अधिक बेतरतीब ढंग से बदल रहा है, तो नॉब लीश को कस देता है, जिससे उसे अपने मूल कौशल के करीब रहने के लिए मजबूर किया जाता है।
    • यदि शेफ बहुत अधिक सावधान हो रहा है, तो नॉब लीश को ढीला कर देता है, जिससे उसे अधिक अन्वेषण (explore) करने की अनुमति मिलती है।
  3. आंतरिक बनाम बाहरी (Internal vs. External): यही इस पेपर का असली मंत्र (secret sauce) है।
    • पुराने तरीकों ने शेफ पर लीश लागू करने के लिए खाना पकाने के बाद स्कोरकार्ड में एक "पेनल्टी" जोड़ने की कोशिश की (बाहरी)। यदि जज बहुत ज़ोर से चिल्ला रहा था, तो शेफ पेनल्टी को अनदेखा कर देता और बस चिल्लाहट का पालन करता।
    • TRQAM लीश को खाना पकाने की प्रक्रिया के अंदर ही बुन देता है (आंतरिक)। यह उस भौतिकी (physics) को ही बदल देता है कि शेफ अपने हाथ कैसे चलाता है। चाहे जज कितना भी ज़ोर से चिल्लाए, लीश शारीरिक रूप से शेफ को मूल रेसिपी से बहुत दूर जाने से रोकता है।

यह कैसे काम करता है (द "गिर्सानोव" ट्रिक)

पेपर एक गणितीय प्रमेय (Girsanov's theorem) का उपयोग करता है ताकि यह सिद्ध किया जा सके कि यह "लीश" पूरी तरह से काम करती है।

  • शेफ की खाना पकाने की प्रक्रिया को नदी के बहाव के रूप में कल्पना करें।
  • "जज" नदी को एक नए दिशा में धकेलना चाहता है।
  • TRQAM नॉब λ\lambda के आधार पर नदी की चौड़ाई (diffusion coefficient) को बदल देता है।
  • गणितीय रूप से यह सिद्ध करके कि नदी की चौड़ाई सीधे तौर पर यह नियंत्रित करती है कि पानी (policy) अपने मूल पथ से कितना विचलित हो सकता है, लेखक यह सुनिश्चित करते हैं कि "सुरक्षा क्षेत्र" कभी टूटा नहीं जा सके। यह केवल एक सुझाव नहीं है; यह इस AI के लिए भौतिकी का एक नियम है।

परिणाम: एक स्मार्ट, सुरक्षित शेफ

शोधकर्ताओं ने इसे 50 अलग-अलग कार्यों (जैसे पहेलियाँ सुलझाना, रोबोट चलाना, या भूलभुलैया में रास्ता खोजना) पर परखा।

  • प्रतियोगिता: अन्य तरीके (जैसे QAM, FQL, DSRL) उन शेफ की तरह थे जो या तो अपने पुराने तरीकों में फंस गए या जज को खुश करने के चक्कर में पागल हो गए।
  • विजेता: TRQAM सबसे सफल रहा।
    • "ऑफलाइन" चरण में (पिछले भोजन के डेटाबेस से सीखते हुए), TRQAM 68% बार सफल रहा।
    • दूसरा सबसे अच्छा तरीका केवल 46% बार सफल हुआ।
    • सबसे महत्वपूर्ण बात यह है कि जबकि अन्य तरीके अक्सर "कोलैप्स" (पूरी तरह विफल) हो जाते थे जब जज कोई गलती करता था, TRQAM स्थिर रहा और अच्छा खाना बनाना जारी रखा।

सारांश

TRQAM AI रोबोट्स को उनके पुराने कौशल को भूले बिना या पागल हुए बिना नए कौशल सीखने का एक नया तरीका है। यह एक "सुरक्षा क्षेत्र" को सीधे सीखने की प्रक्रिया में गणितीय रूप से बुनकर ऐसा करता है, जिससे यह सुनिश्चित होता है कि भले ही AI का "जज" गलती करे, AI बहुत अधिक प्रतिक्रिया देकर अपने प्रदर्शन को नष्ट नहीं करेगा। यह एक ऐसे शेफ के बीच का अंतर है जो घबराकर रसोई जला देता है, और एक ऐसे शेफ के बीच है जो एक सुरक्षित, प्रमाणित ढांचे के भीतर रहते हुए सावधानी से अपनी रेसिपी को समायोजित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →