← नवीनतम पेपर
💬 NLP

Small Reward Models via Backward Inference

यह शोध पत्र FLIP को प्रस्तुत करता है, जो एक संदर्भ-मुक्त (reference-free) रिवॉर्ड मॉडलिंग दृष्टिकोण है जो प्रतिक्रियाओं से निर्देशों को पुनर्गठित करने के लिए बैकवर्ड इन्फरेंस (backward inference) का लाभ उठाता है, जो LLM-as-a-Judge बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है और छोटे भाषा मॉडलों के साथ डाउनस्ट्रीम कार्यों को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय के संपादक हैं, और आपके पास विभिन्न लेखकों द्वारा लिखी गई हजारों कहानियाँ हैं। आपका काम सबसे अच्छी कहानियों को चुनकर प्रकाशित करना है।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, एक रिवॉर्ड मॉडल (Reward Model) बिल्कुल यही करता है। यह एक "जज" की तरह काम करता है जो तय करता है कि AI का कौन सा जवाब अच्छा है और कौन सा बुरा।

लंबे समय तक, इसे करने का मानक तरीका "LLM-as-a-Judge" था। यह एक बहुत ही बुद्धिमान, प्रसिद्ध प्रोफेसर को हर कहानी को पढ़ने और उसे ग्रेड देने के लिए काम पर रखने जैसा है। समस्या यह है कि यह प्रोफेसर महंगा है, धीमा है, और यदि आप एक कम अनुभवी प्रोफेसर (एक छोटा AI मॉडल) को यह काम करने के लिए रखते हैं, तो वे अक्सर गलतियाँ करते हैं, भ्रमित हो जाते हैं, या आसानी से धोखा खा जाते हैं।

इस पेपर के लेखक, FLIP, कहते हैं: "ठहरिए। हम जज से सिर्फ कहानी को 'ग्रेड' करने के लिए क्यों कह रहे हैं? चलिए कुछ अलग कोशिश करते हैं।"

मुख्य विचार: "रिवर्स डिटेक्टिव" (उल्टा जासूस)

कहानी को केवल यह पूछने के बजाय कि, "क्या यह एक अच्छी कहानी है?", FLIP एक अलग सवाल पूछता है: "अगर मैं इस कहानी को पढ़ूँ, तो आपको क्या लगता है कि लेखक को क्या निर्देश (प्रॉम्ट) दिए गए थे?"

इसे बैकवर्ड इन्फरेंस (Backward Inference) कहा जाता है।

यह समझने के लिए यहाँ एक सरल उपमा (analogy) दी गई है:

उपमा: मिस्ट्री डिनर (रहस्यमय रात्रिभोज)

कल्पना कीजिए कि आप एक रेस्टोरेंट में जाते हैं और मेज पर खाने की एक प्लेट देखते हैं।

  • पुराना तरीका (LLM-as-a-Judge): आप खाने को देखते हैं और कहते हैं, "हम्म, यह स्वादिष्ट लग रहा है। मैं इसे 9/10 देता हूँ।" लेकिन क्या होगा अगर खाना वास्तव में जला हुआ है, और आपको बस उसकी खुशबू पसंद आ रही है? या क्या होगा अगर शेफ ने खराब स्वाद को छिपाने के लिए बस ऊपर से कोई सजावट कर दी है? एक छोटा, कम बुद्धिमान जज धोखा खा सकता है।
  • FLIP का तरीका: आप खाने को देखते हैं और अनुमान लगाने की कोशिश करते हैं कि ग्राहक ने वेटर को क्या ऑर्डर दिया था।
    • यदि खाना एक परफेक्ट स्टेक है, तो आप अनुमान लगा सकते हैं कि ऑर्डर था: "रोसमेरी के साथ मीडियम-रेयर स्टेक पकाएं।"
    • यदि खाना सूप का एक कटोरा है, तो आप अनुमान लगा सकते हैं कि ऑर्डर था: "मेरे लिए टमाटर के सूप का एक कटोरा लाएं।"

जादुई ट्रिक:
यदि वास्तविक ऑर्डर "मीडियम-रेयर स्टेक पकाएं" था, लेकिन मेज पर जो खाना है वह सूप है, तो "रिवर्स डिटेक्टिव" (FLIP) अनुमान लगाएगा कि ऑर्डर था "सूप लाएं।"

  • बेमेल (Mismatch): अनुमानित ऑर्डर ("सूप") वास्तविक ऑर्डर ("स्टेक") से मेल नहीं खाता है।
  • परिणाम: FLIP कहता है, "अरे, यह एक बुरा जवाब है! खाना ऑर्डर से मेल नहीं खा रहा है!"

यदि खाना एक परफेक्ट स्टेक है, तो अनुमानित ऑर्डर वास्तविक ऑर्डर के साथ पूरी तरह मेल खाता है। FLIP कहता है, "बहुत बढ़िया! यह निर्देशों से मेल खाता है।"

यह "छोटे" AI मॉडल्स के लिए बेहतर क्यों है?

यह पेपर स्मॉल लैंग्वेज मॉडल्स (SLMs) पर केंद्रित है। इन्हें जूनियर डिटेक्टिव्स (कनिष्ठ जासूसों) के रूप में समझें।

  • समस्या: जूनियर डिटेक्टिव जटिल कहानियों को ग्रेड करने में बुरे होते हैं। वे सूक्ष्म गलतियों को मिस कर सकते हैं या पेचीदा शब्दों से भ्रमित हो सकते हैं।
  • आश्चर्य: जूनियर डिटेक्टिव कहानियों को लिखने या अनुमान लगाने में वास्तव में बहुत अच्छे होते हैं। यदि आप उन्हें एक कहानी दिखाते हैं, तो वे अक्सर बहुत सटीक रूप से उस प्रॉम्ट का अनुमान लगा सकते हैं जिसने उसे बनाया था।

FLIP इसी ताकत का लाभ उठाता है। यह छोटे मॉडल को एक सख्त जज (जिसमें वे कमजोर हैं) बनने के बजाय एक रचनात्मक रिवर्स-इंजीनियर (जिसमें वे अच्छे हैं) बनने के लिए कहता है।

उन्होंने क्या पाया?

  1. बड़ी जीत: जब उन्होंने 13 अलग-अलग छोटे AI मॉडल्स पर इसका परीक्षण किया, तो FLIP पारंपरिक "जज" तरीके को भारी अंतर से पीछे छोड़ गया (औसत रूप से लगभग 80% बेहतर)।
  2. धोखा देना कठिन: बुरे तत्व सिस्टम को "गेम" करने की कोशिश करते हैं, जैसे कि जज को ठगने के लिए नकली प्रशंसा या भ्रमित करने वाला टेक्स्ट जोड़ना। FLIP को धोखा देना बहुत कठिन है क्योंकि यदि आप नकली टेक्स्ट जोड़ते हैं, तो "अनुमानित ऑर्डर" अजीब दिखेगा और मूल अनुरोध से मेल नहीं खाएगा।
  3. लंबे जवाबों के लिए बेहतर: जवाब जितना लंबा होगा, जासूस के पास मूल ऑर्डर का अनुमान लगाने के लिए उतने ही अधिक सुराग होंगे। FLIP जवाब लंबे होने के साथ और भी बेहतर होता जाता है।
  4. सस्ता: इसे काम करने के लिए आपको सुपर-कंप्यूटर या "रेफरेंस आंसर" (एक आदर्श उदाहरण) की आवश्यकता नहीं है। आपको बस छोटे AI को रिवर्स-इंजीनियरिंग करने की आवश्यकता है।

निष्कर्ष

यह पेपर FLIP (FLipped Inference for Prompt reconstruction) का प्रस्ताव करता है। यह एक चतुर तरीका है जो कहता है: "AI को काम को ग्रेड करने के लिए मत कहें; इसे निर्देशों का अनुमान लगाने के लिए कहें।"

निर्देशों का अनुमान लगाकर उन्हें वास्तविक निर्देशों के साथ तुलना करके, सिस्टम एक स्कोर प्राप्त करता है। यदि वे मेल खाते हैं, तो AI ने अच्छा काम किया। यदि वे नहीं मिलते, तो वह विफल रहा।

यह हमें छोटे, सस्ते, तेज़ AI मॉडल्स को अन्य AI को ग्रेड करने का काम करने की अनुमति देता है, बिना महंगे सुपर-कंप्यूटर या परफेक्ट रेफरेंस जवाबों की आवश्यकता के। यह एक कमजोरी (छोटे मॉडल जज बनाने में बुरे हैं) को एक ताकत (छोटे मॉडल प्रॉम्ट का अनुमान लगाने में अच्छे हैं) में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →