← नवीनतम पेपर
💬 NLP

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

यह शोध पत्र एक ऐसे ढांचे (framework) को प्रस्तुत करता है जो निरंतर सामान्यीकरण प्रवाह (continuous normalizing flows) से वितरण संबंधी पुरस्कारों (distributional rewards) के साथ उन्हें प्रशिक्षित करके LLM-जनित एजेंट स्पष्टीकरणों को बढ़ाता है, जो मानव निर्णय की बहुलवादी प्रकृति को प्रभावी ढंग से मॉडल करते हैं और तार्किक सुदृढ़ता, कार्यक्षमता और संज्ञानात्मक भार में मौजूदा RLHF और RLAIF बेसलाइन से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान लेकिन बेहद रहस्यमयी रोबोट दोस्त है। यह रोबोट निर्णय लेने में माहिर है—चाहे वह कोई जटिल रणनीति वाला खेल खेलना हो, गणित की समस्या हल करना हो, या घर के भीतर रास्ता खोजना हो—लेकिन यह कभी नहीं बताता कि उसने जो किया वह क्यों किया। यह बस काम करता जाता है।

यदि आप इस रोबोट के साथ सुरक्षित रूप से रहना चाहते हैं, तो आपको इसकी सोच को समझने की आवश्यकता है। लेकिन समस्या यह है कि यदि आप रोबोट से खुद को समझाने के लिए कहते हैं, तो हो सकता है कि वह ऐसी कहानी बना ले जो सुनने में तो अच्छी लगे लेकिन वास्तव में सच न हो, या वह ऐसा स्पष्टीकरण दे जो इतना भ्रमित करने वाला हो कि आप समझ ही न सकें कि वह क्या सोच रहा है।

यह शोध पत्र रोबोट्स (और AI मॉडल्स) को उनके निर्णयों के लिए ईमानदार, स्पष्ट और उपयोगी स्पष्टीकरण देना सिखाने का एक नया तरीका पेश करता है। उन्होंने इसे कैसे किया, यहाँ कुछ मजेदार उपमाओं के माध्यम से बताया गया है:

1. समस्या: "शोर वाला" अनुवादक (The "Noisy" Translator)

आमतौर पर, जब हम चाहते हैं कि एक AI चीजों को समझाना सीखे, तो हम एक "टीचर AI" से स्पष्टीकरणों को ग्रेड देने के लिए कहते हैं।

  • पुराना तरीका: कल्पना कीजिए कि आप एक अनुवादक से छात्र के निबंध को ग्रेड देने के लिए कह रहे हैं। लेकिन यह अनुवादक थोड़ा थका हुआ है और कभी-कभी गलतियाँ भी करता है। यदि अनुवादक कहता है, "यह निबंध बुरा है," तो छात्र अच्छा लिखने की कोशिश करना छोड़ सकता है, भले ही वह निबंध वास्तव में अच्छा रहा हो। अनुवादक का "शोर" (गलतियाँ) छात्र को भ्रमित कर देता है।
  • शोध पत्र की अंतर्दृष्टि: लेखकों ने महसूस किया कि एक "अच्छा स्पष्टीकरण" क्या बनाता है, इस पर मानवीय राय बिखरी हुई और विविध होती है। एक व्यक्ति सोच सकता है कि एक स्पष्टीकरण तार्किक है, जबकि दूसरा सोच सकता है कि यह बहुत लंबा है। एक अकेला "टीचर AI" इन सभी अलग-अलग मानवीय विचारों को नहीं पकड़ सकता। यह मौसम का अनुमान लगाने के लिए केवल एक व्यक्ति से पूछने जैसा है जो गलत हो सकता है।

2. समाधान: "डिनोइजिंग" मशीन (The "Denoising" Machine)

लेखकों ने एक विशेष उपकरण बनाया है जिसे रेक्टिफाइड फ्लो मॉडल (Rectified Flow Model) कहा जाता है। इसे AI फीडबैक के लिए एक हाई-टेक नॉइज़-कैंसलिंग हेडफ़ोन के रूप में समझें।

  • यह कैसे काम करता है:
    1. वे कई "टीचर AI" से स्पष्टीकरणों को ग्रेड देने के लिए कहते हैं। ये शिक्षक थोड़े शोर वाले (गलतियाँ करने वाले) होते हैं।
    2. रेक्टिफाइड फ्लो एक स्मार्ट फ़िल्टर की तरह कार्य करता है। यह उन सभी शोर वाले ग्रेड्स को लेता है और उनके नीचे छिपे वास्तविक संकेत को खोजने के लिए उन्हें "स्मूथ" (सुचारू) करता है।
    3. उपमा: कल्पना कीजिए कि आप लोगों के चिल्लाने वाले कमरे में एक गाना सुनने की कोशिश कर रहे हैं। "टीचर AI" चिल्लाने वाले लोग हैं। रेक्टिफाइड फ्लो वह नॉइज़-कैंसलिंग तकनीक है जो चिल्लाने को फ़िल्टर करती है ताकि आप संगीत (सच्ची मानवीय प्राथमिकता) को स्पष्ट रूप से सुन सकें।

3. "फ्लो" की अवधारणा: एक घुमावदार नदी को सीधा करना (Straightening a Winding River)

"फ्लो मैचिंग" नाम इस बात से आता है कि मॉडल कैसे सीखता है।

  • उपमा: कल्पना कीजिए कि एक नदी है जो एक सीधी रेखा (सरल, यादृच्छिक शोर) के रूप में शुरू होती है और एक जंगल के माध्यम से अपना रास्ता बनाते हुए एक जटिल, घुमावदार धारा बन जाती है।
  • अधिकांश AI मॉडल अंधे होकर घुमावों और मोड़ों का अनुमान लगाने की कोशिश करते हैं।
  • यह नया मॉडल नदी को सीधा करना सीखता है। यह जटिल, बिखरे हुए मानवीय विचारों को वापस एक सरल, सीधी रेखा में बदलने का सटीक रास्ता सीखता है। क्योंकि यह जानता है कि रास्ता सीधा है, यह प्रक्रिया को पूरी तरह से उल्टा कर सकता है: यह एक बिखरे हुए, शोर वाले ग्रेड को लेकर वापस एक स्पष्ट, पूर्ण "रिवॉर्ड" (पुरस्कार/संकेत) में बदल सकता है जो रोबोट को ठीक वही बताता है जो उसे करना चाहिए।

4. परिणाम: एक रोबोट जो "समझता है" (A Robot That "Gets It")

लेखकों ने इसका परीक्षण रणनीति वाले खेल खेलने वाले रोबोट्स और गणित की समस्या हल करने वाले AI पर किया।

  • पहले: रोबोट ऐसे स्पष्टीकरण देते थे जो या तो भ्रमित करने वाले थे या केवल उत्तर को बिना तर्क के दोहराते थे।
  • बाद में: रोबots ने ऐसे स्पष्टीकरण देना शुरू किया जो थे:
    • तार्किक: वे चरण-दर-चरण समझ में आने वाले थे।
    • कार्यवाही योग्य (Actionable): आप स्पष्टीकरण का उपयोग यह अनुमान लगाने के लिए कर सकते थे कि रोबोट आगे क्या करेगा।
    • विश्वसनीय: मनुष्य उन्हें समझने में बहुत आसान और पढ़ने में कम मानसिक थकान देने वाला पाते थे।

यह क्यों महत्वपूर्ण है

इसे एक रोबोट को केवल एक स्मार्ट छात्र के बजाय एक अच्छा शिक्षक बनाने के रूप में सोचें।

  • अतीत में, हम केवल चाहते थे कि रोबोट सही उत्तर दे।
  • अब, हम चाहते हैं कि वे यह समझाएं कि वे वहां तक कैसे पहुंचे ताकि हम उन पर भरोसा कर सकें।
  • यह तरीका सुनिश्चित करता है कि रोबोट हमें खुश करने के लिए केवल अनुमान नहीं लगा रहा है या झूठ नहीं बोल रहा है; यह वास्तव में अपनी वास्तविक निर्णय लेने की प्रक्रिया को इस तरह से प्रतिबिंबित करना सीख रहा है जिसे मनुष्य समझ सकें।

संक्षेप में: इस शोध पत्र ने एक "स्मार्ट फ़िल्टर" बनाया है जो रोबोट्स को उनकी सोच को स्पष्ट, ईमानदार और तार्किक रूप से समझाने के लिए सिखाने हेतु बिखरे हुए AI फीडबैक को साफ करता है, जिससे वे मनुष्यों के लिए अधिक सुरक्षित और विश्वसनीय साथी बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →