← नवीनतम पेपर
💬 NLP

Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models

यह शोध पत्र फास्ट-स्लो थिंकिंग रिवॉर्ड मॉडल्स (F/S-RM) को प्रस्तुत करता है, जो ड्यूल प्रोसेस थ्योरी से प्रेरित एक हाइब्रिड आर्किटेक्चर है जो एक कॉन्फिडेंस-आधारित एक्टिवेशन मैकेनिज्म के माध्यम से कुशल स्केलर प्रेडिक्शन को सटीक चेन-ऑफ-थॉट रीजनिंग के साथ एकीकृत करता है, जिससे कंप्यूटेशनल लागत को काफी कम करते हुए बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Jiayun Wu, Peixu Hou, Shan Qu, Peng Zhang, Ning Gu, Tun Lu

प्रकाशित 2026-03-24
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiayun Wu, Peixu Hou, Shan Qu, Peng Zhang, Ning Gu, Tun Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दो AI सहायकों के बीच से कौन सा बेहतर उत्तर देता है, यह तय करने के लिए जजों की एक टीम को काम पर रख रहे हैं। आपके पास दो प्रकार के जज उपलब्ध हैं, लेकिन दोनों में कमियां हैं:

  1. "फास्ट" जज (सहज विशेषज्ञ): यह जज उत्तरों पर एक नज़र डालता है और तुरंत चिल्ला उठता है, "A बेहतर है!" या "B बेहतर है!" वे अविश्वसनीय रूप से तेज़ और सस्ते हैं, लेकिन कभी-कभी वे सूक्ष्म विवरणों को मिस कर देते हैं या पेचीदा सवालों में भ्रमित हो जाते हैं।
  2. "स्लो" जज (गहन विचारक): यह जज उत्तरों को ध्यान से पढ़ता है, अपने तर्क की व्याख्या करते हुए एक लंबा निबंध लिखता है, तथ्यों की जांच करता है, और फिर अपना निर्णय देता है। वे लगभग हमेशा सही होते हैं, लेकिन धीमे, महंगे और बहुत अधिक समय और ऊर्जा लेने वाले होते हैं।

समस्या:
वर्तमान AI सिस्टम आमतौर पर आपको एक चुनने के लिए मजबूर करते हैं। यदि आप गति चाहते हैं, तो आप सटीकता खो देते हैं। यदि आप सटीकता चाहते हैं, तो आप समय और कंप्यूटिंग शक्ति की भारी कीमत चुकाते हैं।

समाधान: "फास्ट-स्लो थिंकिंग" रिवॉर्ड मॉडल (F/S-RM)
यह पेपर एक शानदार हाइब्रिड जज पेश करता है जो स्वचालित रूप से इन दो मोड के बीच स्विच कर सकता है। इसे एक सुपर-इंटेलिजेंट बाउंसर के रूप में सोचें जो यह तय करता है कि आपकी आईडी (ID) की जांच करने के लिए उसे कितनी मेहनत करनी चाहिए।

यह कैसे काम करता है (उपमा)

1. "गट चेक" (फास्ट थिंकिंग)
जब कोई प्रश्न आता है, तो मॉडल तुरंत एक "अंतर्ज्ञान" (gut feeling) वाला निर्णय लेता है। वह खुद से पूछता है: "क्या मैं उत्तर को तुरंत जानता हूँ?"

  • यदि उत्तर स्पष्ट है (जैसे, "कौन सा बेहतर है: एक सहायक प्रतिक्रिया या एक बदतमीज प्रतिक्रिया?"), तो मॉडल वहीं रुक जाता है। वह एक त्वरित स्कोर देता है। परिणाम: सुपर फास्ट, शून्य बर्बाद ऊर्जा।
  • यदि मॉडल अनिश्चित महसूस करता है (जैसे, "इन दो जटिल गणितीय प्रमाणों में से कौन सा सही है?"), तो उसे एहसास होता है कि उसका "अंतर्ज्ञान" पर्याप्त मजबूत नहीं है।

2. "डीप डाइव" (स्लो थिंकिंग)
यदि मॉडल अनिश्चित है, तो वह "स्लो मोड" को सक्रिय करता है। वह एक 'चेन ऑफ थॉट' लिखना शुरू करता है (जैसे एक जासूस केस फाइल लिख रहा हो), अंतिम निर्णय लेने से पहले स्टेप-बाय-स्टेप फायदे और नुकसान का विश्लेषण करता है।

  • परिणाम: उच्च सटीकता, लेकिन इसमें अधिक समय और ऊर्जा लगती है।

3. "कॉन्फिडेंस स्विच"
जादुई तत्व एक डुअल-कॉन्फिडेंस मैकेनिज्म है। यह एक स्मार्ट थर्मोस्टेट की तरह है। मॉडल लगातार दो चीजों की निगरानी करता है:

  • इंट्यूशन कॉन्फिडेंस (अंतर्ज्ञान का विश्वास): मैं अपने पहले अनुमान को लेकर कितना आश्वस्त हूँ?
  • क्लैरिटी कॉन्फिडेंस (स्पष्टता का विश्वास): क्या मेरा दिमाग धुंधला है, या मैं स्पष्ट रूप से देख पा रहा हूँ?

यदि दोनों कॉन्फिडेंस लेवल उच्च हैं, तो यह "फास्ट मोड" में रहता है। यदि वे गिरते हैं, तो यह स्विच को "स्लो मोड" पर बदल देता है। यह सुनिश्चित करता है कि मॉडल केवल तभी कठिन काम करे जब उसे वास्तव में इसकी आवश्यकता हो।

यह एक बड़ी बात क्यों है?

  • यह दोनों दुनियाओं का सर्वश्रेष्ठ है: परीक्षणों में, यह हाइब्रिड मॉडल मौजूदा सर्वोत्तम मॉडलों की तुलना में 1.2% अधिक सटीक था।
  • यह भारी संसाधनों की बचत करता है: क्योंकि यह आसान सवालों के लिए "स्लो मोड" को छोड़ देता है, इसने उन मॉडलों की तुलना में 20.8% कंप्यूटिंग पावर (टोकन) बचा ली जो हमेशा गहराई से सोचते हैं।
  • यह कुशल है: कल्पना कीजिए कि एक कार जो शहर में 30 मील प्रति घंटे की रफ्तार से चलती है (ईंधन बचाने के लिए) लेकिन जरूरत पड़ने पर स्वचालित रूप से 100 मील प्रति घंटे पर स्विच हो जाती है। यह मॉडल वही करता है।

निचोड़

यह पेपर गति और बुद्धिमत्ता के बीच के क्लासिक ट्रेड-ऑफ को हल करता है। AI को या तो एक तेज़ अनुमान लगाने वाला या एक धीमा विचारक बनाने के बजाय, इसने एक ऐसा AI बनाया है जो जानता है कि कब जल्दी अनुमान लगाना है और कब गहराई से सोचना है। यह AI को ऊर्जा बचाने के लिए जानना सिखाने जैसा है, जिससे इसे चलाना सस्ता और साथ ही साथ स्मार्ट बनाया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →