← नवीनतम पेपर
💬 NLP

AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling

AdaJudge एक एकीकृत ढांचा है जो बैकबोन रिप्रेजेंटेशन्स को भेदभाव-उन्मुख स्थान में संयुक्त रूप से अनुकूलित करके और स्टैटिक पूलिंग को एक एडेप्टिव मल्टी-व्यू एग्रीगेशन मॉड्यूल से बदलकर रिवॉर्ड मॉडलिंग को बढ़ाता है, जिससे यह प्रमुख बेंचमार्क पर मौजूदा मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Yongliang Miao, Yangyang Liang, Mengnan Du

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yongliang Miao, Yangyang Liang, Mengnan Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दो कहानियों में से बेहतर कहानी चुनने के लिए एक जज को काम पर रख रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस "जज" को रिवॉर्ड मॉडल (Reward Model) कहा जाता है। इसका काम एक सवाल और दो संभावित उत्तरों को देखना है, और फिर एक स्कोर देना है कि इंसान किसे पसंद करेंगे।

लंबे समय तक, इन AI जजों ने अपना काम करने के लिए एक बहुत ही कठोर, 'एक ही ढर्रे वाला' (one-size-fits-all) तरीका इस्तेमाल किया है। AdaJudge नामक पेपर तर्क देता है कि यह पुराना तरीका दोषपूर्ण है और यह इन जजों को बनाने का एक स्मार्ट और अधिक लचीला तरीका प्रस्तावित करता है।

समस्या और समाधान का विवरण, सरल उपमाओं (analogies) का उपयोग करते हुए यहाँ दिया गया है:

समस्या: "एक ही चाल वाला" जज (The "One-Trick" Judge)

कल्पना कीजिए कि एक जज के पास किताब पढ़ने के केवल दो तरीके हैं:

  1. "आखिरी पन्ना" जज (The "Last Page" Judge): यह जज यह तय करने के लिए कि कहानी अच्छी है या नहीं, केवल कहानी के बिल्कुल आखिरी वाक्य को पढ़ता है।
  2. "औसत पन्ना" जज (The "Average Page" Judge): यह जज हर एक पन्ना पढ़ता है, गुणवत्ता का औसत निकालता है, और उसके आधार पर निर्णय लेता है।

पेपर बताता है कि इन दोनों जजों में एक बड़ी कमी (blind spot) है:

  • "आखिरी पन्ना" जज एक ऐसी कहानी को पकड़ने में माहिर है जिसका अंत बहुत बुरा हो (जैसे गणित का सवाल जिसका उत्तर गलत हो), लेकिन वे यह नहीं देख पाते कि कहानी के बीच में झूठ या खराब तर्क भरे हुए थे।
  • "औसत पन्ना" जज यह नोटिस करने में माहिर है कि क्या पूरी कहानी सुरक्षित और विनम्र महसूस होती है, लेकिन यदि कहानी 100 पन्नों की है, तो "बुरे" हिस्से "अच्छे" हिस्सों के बीच दब सकते हैं, जिससे एक खतरनाक कहानी भी सुरक्षित दिखने लगती है।

उपमा: यह एक जटिल भोजन का न्याय करने जैसा है।

  • यदि आप केवल आखिरी निवाला चखते हैं (Last Token), तो आप यह मिस कर सकते हैं कि सूप शुरू से ही नमकीन था।
  • यदि आप बीच से एक चम्मच लेते हैं (Mean Pooling), तो आप यह मिस कर सकते हैं कि अंत में मिठाई जल गई थी।
  • पुराने AI जज इन दोनों में से किसी एक चखने के तरीके को चुनने और उसी पर टिके रहने के लिए मजबूर थे, चाहे वे किसी भी तरह के भोजन (कार्य/task) का न्याय कर रहे हों। इससे गलतियाँ हुईं।

समाधान: AdaJudge (अनुकूलनशील जज - The Adaptive Judge)

लेखकों ने AdaJudge बनाया है, जो एक नया फ्रेमवर्क है जो एक स्मार्ट, बहु-परिप्रेक्ष्य वाले जासूस (multi-perspective detective) की तरह काम करता है। टेक्स्ट को पढ़ने का एक ही तरीका थोपने के बजाय, AdaJudge उस विशिष्ट प्रश्न के आधार पर अपनी रणनीति बदल देता है जिसका वह उत्तर दे रहा है।

यह दो चरणों में काम करता है:

चरण 1: लेंस को तेज करना (Adaptive Representation Refinement)

जज द्वारा पढ़ना शुरू करने से पहले ही, AdaJudge AI के दिमाग को एक "वर्कआउट" देता है।

  • उपमा: कल्पना कीजिए कि AI का दिमाग एक धुंधला कैमरा है। उत्तर की तस्वीर लेने से पहले, AdaJudge एक विशेष फिल्टर का उपयोग करके इमेज को शार्प (तीक्ष्ण) करता है। यह उन सूक्ष्म सुरागों (जैसे एक छोटा सा तार्किक दोष या छिपा हुआ सुरक्षा उल्लंघन) को उभारता है जिन्हें कैमरा आमतौर पर मिस कर देता है।
  • यह कैसे काम करता है: यह जानकारी को "परिष्कृत" (refine) करने के लिए कुछ अतिरिक्त, हल्के लेयर्स के माध्यम से टेक्स्ट को चलाता है, जिससे एक अच्छे उत्तर और एक बुरे उत्तर के बीच के अंतर को पहचानना आसान हो जाता है।

चरण 2: डायनेमिक पैनल (Multi-Perspective Aggregation)

यही मुख्य नवाचार है। एक अकेले जज के बजाय, AdaJudge तीन विशेषज्ञों का एक पैनल स्थापित करता है, और इसके पास एक स्मार्ट मैनेजर होता है जो यह तय करता है कि प्रत्येक पर कितना ध्यान देना है।

  • विशेषज्ञ A (The Last Token): अंतिम निष्कर्ष पर ध्यान केंद्रित करता है।
  • विशेषज्ञ B (The Mean): समग्र भाव (vibe) और निरंतरता को देखता है।
  • विशेषज्ञ C (The Attention): पूरे टेक्स्ट को विशिष्ट, बिखरे हुए सुरागों (जैसे पैराग्राफ 3 में छिपा हुआ सुरक्षा उल्लंघन) के लिए स्कैन करता है।

स्मार्ट मैनेजर (The Router):
जब कोई प्रश्न आता है, तो मैनेजर प्रॉम्प्ट को देखता है और पूछता है: "यह किस तरह का कार्य है?"

  • यदि यह गणित (Math) का सवाल है: मैनेजर कहता है, "हमें अंतिम उत्तर की सावधानीपूर्वक जांच करने की आवश्यकता है!" और वह मुख्य रूप से विशेषज्ञ A की बात सुनता है।
  • यदि यह सुरक्षा (Safety) का प्रश्न है: मैनेजर कहता है, "हमें छिपे हुए खतरों के लिए पूरे टेक्स्ट को स्कैन करने की आवश्यकता है!" और वह मुख्य रूप से विशेषज्ञ C की बात सुनता है।
  • यदि यह रचनात्मक लेखन (Creative Writing) का कार्य है: मैनेजर कहता है, "आइए प्रवाह और टोन को देखें," और वह मुख्य रूप से विशेषज्ञ B की बात सुनता है।

यह हर एक प्रश्न के लिए तुरंत होता है। AI केवल एक रणनीति नहीं चुनता; यह अपनी रणनीति को अनुकूलित (adapt) करता है।

परिणाम

पेपर ने इस नए जज का परीक्षण पुराने "एक ही चाल वाले" जजों और कुछ बहुत बड़े, महंगे AI मॉडल्स के खिलाफ किया।

  • बेहतर सटीकता: AdaJudge ने कठिन बेंचमार्क (RM-Bench और JudgeBench) पर लगातार उच्च स्कोर किया।
  • दक्षता (Efficiency): भले ही आधार के रूप में एक छोटे, सस्ते AI मॉडल का उपयोग किया गया हो, AdaJudge ने पुराने, कठोर तरीकों का उपयोग करने वाले बहुत बड़े, महंगे मॉडल्स से बेहतर प्रदर्शन किया।
  • लचीलापन: इसने "गणित बनाम सुरक्षा" के संघर्ष को हल किया। यह गणितीय तर्क में सख्त होने के साथ-साथ सुरक्षा जांच में भी पूरी तरह सक्षम था, जबकि पुराने जज एक के लिए दूसरे का त्याग करने को मजबूर थे।

सारांश

AdaJudge को एक ऐसे जज से अपग्रेड करने जैसा है जो हमेशा आखिरी पन्ने पर आवर्धक लेंस (magnifying glass) का उपयोग करता है, बजाय एक ऐसे जज के जिसके पास विशेषज्ञों की एक टीम और एक स्मार्ट मैनेजर है। मैनेजर मामले को देखता है, तय करता है कि किस विशेषज्ञ की सबसे अधिक आवश्यकता है, और सबसे निष्पक्ष, सटीक निर्णय लेने के लिए उनके अंतर्दृष्टि (insights) को जोड़ता है। यह AI अलाइनमेंट (AI को मानवीय प्राथमिकताओं का पालन करना सिखाना) को बहुत अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →