← नवीनतम पेपर
🤖 machine learning

DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

यह शोध पत्र DynaCF का प्रस्ताव करता है, जो एक गतिशील पुन: भारण (dynamic reweighting) ढांचा है जो काउंटरफैक्चुअल विक्षोभों (counterfactual perturbations) के माध्यम से शॉर्टकट संवेदनशीलता को ऑनलाइन मापकर और वास्तविक प्राथमिकता संकेतों पर निर्भरता को प्रोत्साहित करने के लिए प्रशिक्षण के दौरान संवेदनशील नमूनों के भार को कम करके रिवॉर्ड मॉडल में शॉर्टकट लर्निंग को कम करता है।

मूल लेखक: Fengyuan Liu, Yongliang Miao, Zirui He, Yanguang Liu, Fei Sun, Mengnan Du

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengyuan Liu, Yongliang Miao, Zirui He, Yanguang Liu, Fei Sun, Mengnan Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप निबंधों को ग्रेड देने के लिए एक शिक्षक को काम पर रख रहे हैं। आपका लक्ष्य इस शिक्षक को इस आधार पर निर्णय लेने के लिए कहना है कि विचार कितने अच्छे हैं। हालाँकि, एक समस्या है: वह शिक्षक आलसी है और शॉर्टकट लेने लगता है। गहरे चिंतन को पढ़ने के बजाय, वे केवल सतही चीजों को देखते हैं जैसे:

  • "क्या निबंध वास्तव में लंबा है?" (लंबा = बेहतर)
  • "क्या इसमें फैंसी बुलेट पॉइंट्स हैं?" (फॉर्मेटेड = बेहतर)
  • "क्या यह बहुत आत्मविश्वासी लग रहा है?" (विनम्र लहजा = बेहतर)

यदि शिक्षक इन शॉर्टकट्स पर निर्भर रहता है, तो वह एक खोखले लेकिन चमकदार निबंध को 'A' ग्रेड दे सकता है और एक शानदार लेकिन छोटे निबंध को 'C' ग्रेड दे सकता है। AI चैटबॉट्स के साथ भी बिल्कुल ऐसा ही होता है, जिन्हें सिखाने के लिए रिवॉर्ड मॉडल्स (Reward Models) का उपयोग किया जाता है। ये "शिक्षक" हैं जो AI को सिखाते हैं कि इंसानों को क्या पसंद है। लेकिन अक्सर, ये AI शिक्षक गहराई के बजाय शैली (style) पर ध्यान केंद्रित करके धोखाधड़ी करना सीख जाते हैं।

यह पेपर DynaCF नामक एक नई विधि पेश करता है ताकि इस धोखाधड़ी को रोका जा सके। यह कैसे काम करता है, इसे एक सरल उपमा (analogy) से समझते हैं:

समस्या: "तथ्य के बजाय शैली" वाला शिक्षक

अतीत में, शोधकर्ताओं ने इसे ठीक करने की कोशिश की थी कि "बुरी आदतों" (जैसे "लंबे निबंध पसंद न करना") की एक सूची बनाई जाए और शिक्षक को उन्हें अनदेखा करने के लिए कहा जाए। लेकिन यह पेपर तर्क देता है कि यह एक स्थिर नियम पुस्तिका (static rulebook) के साथ धोखेबाज को रोकने की कोशिश करने जैसा है। धोखेबाज अनुकूलित (adapt) हो जाता है! यदि आप लंबे निबंधों को प्रतिबंधित करते हैं, तो वे फैंसी फोंट का उपयोग करना शुरू कर सकते हैं। यदि आप फोंट को प्रतिबंधित करते हैं, तो वे अधिक बुलेट पॉइंट्स का उपयोग कर सकते हैं। "शॉर्टकट" बदल जाता है, लेकिन धोखाधड़ी बनी रहती है।

समाधान: DynaCF (एक "रियलिटी चेक" कोच)

DynaCF एक कोच की तरह है जो वास्तविक समय में शिक्षक को ग्रेड देते हुए देखता है और प्रत्येक निबंध पर एक "क्या होगा अगर?" (What If?) टेस्ट करता है।

  1. "क्या होगा अगर" टेस्ट (Counterfactuals):
    कल्पना कीजिए कि शिक्षक ने अभी-अभी एक निबंध को ग्रेड दिया और उसे बहुत लंबा होने और बुलेट पॉइंट्स होने के कारण उच्च स्कोर दिया।
  • DynaCF हस्तक्षेप करता है और कहता है, "रुको। आइए इसी निबंध को लें, लेकिन बुलेट पॉइंट्स हटा दें और इसे छोटा कर दें, जबकि इसके समान विचार बरकरार रखें।"
  • यह "काउंटरफैक्चुअल" (Counterfactual) वाला हिस्सा है: निबंध का एक ऐसा संस्करण जो अर्थ में समान है लेकिन शैली में भिन्न है।
  1. रियलिटी चेक (Sensitivity):
    DynaCF शिक्षक से इस नए, छोटे संस्करण को ग्रेड देने के लिए कहता है।
  • परिदृश्य A (अच्छा शिक्षक): शिक्षक कहता है, "हम्म, विचार अभी भी बेहतरीन हैं। स्कोर लगभग समान है।" इसका मतलब है कि शिक्षक सामग्री (content) को देख रहा है।
  • परिदृश्य B (धोखेबाज शिक्षक): शिक्षक घबरा जाता है और कहता, "ओह नहीं! यह छोटा है और इसमें कोई बुलेट पॉइंट नहीं है! स्कोर आधा हो गया!" इसका मतलब है कि शिक्षक लंबाई और फॉर्मेट पर भरोसा करके धोखा दे रहा था, न कि विचारों पर।
  1. डायनेमिक दंड (Reweighting):
    यही DynaCF का जादू है। यह शिक्षक को बर्खास्त नहीं करता या निबंध को हटाता नहीं है। इसके बजाय, यह इस बात को समायोजित करता है कि शिक्षक उस विशिष्ट निबंध से कितना सीखता है।
  • यदि शिक्षक "क्या होगा अगर" टेस्ट में विफल रहा (परिदृश्य B), तो DynaCF कहता है, "ठीक है, हम जानते हैं कि आप इस पर धोखाधड़ी कर रहे थे। हम इस निबंध का वॉल्यूम कम कर देंगे ताकि आप इससे गलत सबक न सीखें।"
  • यदि शिक्षक ने टेस्ट पास किया (परिदृश्य A), तो DynaCF कहता है, "बहुत बढ़िया! हम इसका वॉल्यूम बढ़ा देंगे ताकि आप इस मजबूत उदाहरण से सीख सकें।"

"डायनेमिक" क्यों महत्वपूर्ण है

पेपर इस बात पर जोर देता है कि यह एक बार में होने वाला सुधार नहीं है। एक शिक्षक सोमवार को धोखाधड़ी कर सकता है लेकिन शुक्रवार तक ईमानदार बनना सीख सकता है।

  • स्थिर (Static) विधियाँ साल की शुरुआत में लिखी गई एक नियम पुस्तिका की तरह हैं। यह पुरानी हो जाती है।
  • DynaCF एक कोच की तरह है जो अभ्यास के दौरान हर दिन शिक्षक के काम की जांच करता है। वह पूछता है, "क्या आप अभी धोखाधड़ी कर रहे हैं?" और तुरंत प्रशिक्षण को समायोजित करता है।

परिणाम

लेखकों ने विभिन्न बेंचमार्क (जैसे RM-Bench और RewardBench) का उपयोग करके AI मॉडल (विशेष रूप से Qwen3 मॉडल) पर इसका परीक्षण किया।

  • परिणाम: DynaCF के साथ प्रशिक्षित मॉडल "नकली" स्टाइल ट्रिक्स को अनदेखा करने और वास्तविक उत्तर की गुणवत्ता पर ध्यान केंद्रित करने में बहुत बेहतर हो गए।
  • प्रमाण: जब "कठिन" (Hard) प्रश्नों (जहाँ स्टाइल ट्रिक्स काम नहीं करतीं) और "सुरक्षा" (Safety) प्रश्नों (जहाँ आप केवल विनम्र होकर गलत नहीं हो सकते) पर परीक्षण किया गया, तो DynaCF मॉडल मानक मॉडलों की तुलना में काफी अधिक स्कोर करते हैं।

संक्षेप में

DylaCF AI को "सिस्टम को गेम करने" (game the system) से रोकता है क्योंकि यह लगातार पूछता है, "यदि हम सतह की शैली को बदल दें लेकिन अर्थ को समान रखें, तो क्या आपकी राय बदल जाएगी?" यदि उत्तर "हाँ" है, तो AI को फिलहाल के लिए उस विशिष्ट उदाहरण को अनदेखा करने के लिए कहा जाता है। यह AI को यह सीखने के लिए मजबूर करता है कि वास्तव में एक प्रतिक्रिया को क्या अच्छा बनाता है, न कि केवल वह जो अच्छा दिखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →