← नवीनतम पेपर
🤖 AI

Preference Leakage: A Contamination Problem in LLM-as-a-judge

यह शोध पत्र "प्रेफरेंस लीकेज" (preference leakage) की पहचान और अनुभवजन्य रूप से सत्यापन करता है, जो एक व्यापक संदूषण समस्या है जहाँ LLM जज उन स्टूडेंट मॉडल्स के प्रति महत्वपूर्ण पूर्वाग्रह प्रदर्शित करते हैं जिनके साथ उनका कोई संबंध होता है (जैसे कि एक ही मॉडल होना, एक इनहेरिटेंस लिंक होना, या एक ही परिवार से संबंधित होना), जिससे वे LLM-as-a-judge मूल्यांकन प्रतिमानों की विश्वसनीयता को चुनौती देते हैं।

मूल लेखक: Dawei Li, Renliang Sun, Yue Huang, Ming Zhong, Bohan Jiang, Jiawei Han, Xiangliang Zhang, Wei Wang, Huan Liu

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dawei Li, Renliang Sun, Yue Huang, Ming Zhong, Bohan Jiang, Jiawei Han, Xiangliang Zhang, Wei Wang, Huan Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Preference Leakage" (पसंद का रिसाव) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

मुख्य विचार: "शिक्षक-ग्रेडर" का हितों का टकराव

कल्प-िए कि आप एक कुकिंग स्कूल चला रहे हैं। आपके पास दो मुख्य काम हैं:

  1. रेसिपी जनरेटर (शिक्षक): आप अपने छात्रों को सीखने के लिए नई, शानदार रेसिपी बनाते हैं।
  2. मुख्य निर्णायक (ग्रेडर): आप छात्रों के अंतिम व्यंजनों को चखते हैं और उन्हें स्कोर देते हैं ताकि यह देखा जा सके कि सबसे अच्छा शेफ कौन है।

समस्या: क्या होगा यदि "शिक्षक" और "ग्रेडर" वास्तव में एक ही व्यक्ति हैं, या दो ऐसे लोग हैं जो एक ही घर में पले-बढ़े हैं और एक जैसा खाना खाते हैं?

यह पेपर इस समस्या को "Preference Leakage" कहता है। यह तब होता है जब वह AI जो ट्रेनिंग डेटा बनाता है और वह AI जो छात्रों को ग्रेड देता है, आपस में बहुत करीब से जुड़े होते हैं। क्योंकि उनका एक ही "पारिवारिक इतिहास" है या वे समान चीजों पर प्रशिक्षित हुए हैं, ग्रेडर अनजाने में (या अवचेतन रूप से) उस छात्र की शैली को पसंद करने लगता है जिसने शिक्षक से सीखा है, भले ही उस छात्र का व्यंजन वास्तव में सबसे अच्छा न हो।


वे "संबंधित" किन तीन तरीकों से हैं

लेखकों ने पाया कि AI की दुनिया में यह "पारिवारिक संबंध" तीन मुख्य तरीकों से होता है:

  1. "एक ही व्यक्ति" वाला परिदृश्य: डेटा जनरेट करने वाला AI और डेटा को ग्रेड देने वाला AI बिल्कुल एक ही मॉडल है।
    • उपमा: आप स्वयं परीक्षा के प्रश्न लिख रहे हैं और फिर उत्तरों को ग्रेड दे रहे हैं। स्वाभाविक रूप से आप उन उत्तरों को उच्च अंक देंगे जो आपकी अपनी लेखन शैली जैसे लगते हैं।
  2. "माता-पिता-बच्चा" वाला परिदृश्य: ग्रेडर को शिक्षक द्वारा जनरेट किए गए डेटा का उपयोग करके फाइन-ट्यून (प्रशिक्षित) किया गया था।
    • उपमा: ग्रेडर, शिक्षक का बच्चा है। बच्चे ने माता-पिता को देखकर खाना बनाना सीखा, इसलिए वे प्याज काटने के माता-पिता के विशिष्ट तरीके को पसंद करते हैं। जब वे उस छात्र को जज करते हैं जिसने माता-पिता से सीखा है, तो वे सोचते हैं, "ओह, यह छात्र बिल्कुल मेरे पिताजी की तरह प्याज काटता है! यह निश्चित रूप से बहुत अच्छा होगा!"
  3. "भाई-बहन" वाला परिदृश्य: शिक्षक और ग्रेडर अलग-अलग मॉडल हैं लेकिन एक ही "परिवार" (जैसे, GPT-4 और GPT-4o, या Llama-3 और Llama-3.1) से हैं।
    • उपमा: वे भाई-बहन हैं जो एक ही घर में पले-बढ़े हैं। उनके पास एक ही तरह की अजीब आदतें, बोलचाल और व्यवहार हैं। जब उनमें से एक दूसरे के छात्र को जज करता है, तो वे उस "फैमिली वाइब" को पहचान लेते हैं और बोनस स्कोर देते हैं।

यह खतरनाक क्यों है

AI की दुनिया में, हम यह तय करने के लिए इन "निर्णायकों" का उपयोग करते हैं कि कौन से मॉडल सबसे स्मार्ट हैं। हम जानना चाहते हैं कि कौन कोड लिखने, चुटकुले सुनाने या गणित की समस्याओं को हल करने में सबसे अच्छा है।

लेकिन यदि Preference Leakage हो रहा है, तो:

  • स्कोर नकली हैं: एक छात्र मॉडल को उच्च स्कोर इसलिए नहीं मिलता क्योंकि वह वास्तव में स्मार्ट है, बल्कि इसलिए मिलता है क्योंकि वह ग्रेडर के पसंदीदा परिवार के सदस्य जैसा सुनाई देता है।
  • इसे पहचानना कठिन है: छात्र द्वारा उत्तर कुंजी (answer key) देखकर नकल करने के विपरीत (जिसे पकड़ना आसान है), यह बहुत सूक्ष्म है। छात्र नकल नहीं कर रहा है; ग्रेडर बस परिचितता के कारण पक्षपाती है।
  • यह छोटे मॉडलों को नुकसान पहुँचाता है: आश्चर्यजनक रूप से, पेपर में पाया गया कि छोटे छात्र मॉडल सबसे अधिक प्रभावित होते हैं। क्यों? क्योंकि वे डेटा से जटिल "सत्य" नहीं सीख सकते, इसलिए वे केवल शिक्षक की शैली और फॉर्मेटिंग (जिसे "spurious features" कहा जाता है) की नकल करते हैं। ग्रेडर इस परिचित शैली को देखता है और सोचता है, "मुझे यह पसंद है!"

"Spurious Features" (गुप्त हैंडशेक)

शोधकर्ताओं ने पाया कि AI ग्रेडर जरूरी नहीं कि उत्तर के अर्थ को देख रहे हों। वे स्टाइल मार्कर (शैली के संकेत) देख रहे हैं।

  • उपमा: कल्पना कीजिए कि एक ग्रेडर जो एक विशिष्ट प्रकार के फॉन्ट या कॉमा के उपयोग के तरीके को पसंद करता है। एक छात्र जो उस फॉन्ट की नकल करता है उसे उच्च स्कोर मिलता है, भले ही उसका निबंध निरर्थक हो।
  • पेपर में पाया गया कि यदि आप "शैली" (फॉन्ट, वाक्य की लय, विशिष्ट शब्द) को हटा दें और केवल अर्थ को रखें, तो पक्षपात गायब हो जाता है। ग्रेडर "परिवार के सदस्य" का पक्ष लेना बंद कर देता है।

उन्होंने इसका परीक्षण कैसे किया

लेखकों ने एक बड़ा प्रयोग चलाया:

  1. उन्होंने नकली ट्रेनिंग डेटा बनाने के लिए शक्तिशाली AI (जैसे GPT-4) का उपयोग किया।
  2. उन्होंने उस डेटा का उपयोग छोटे "छात्र" (Student) मॉडल्स को प्रशिक्षित करने के लिए किया।
  3. उन्होंने मूल शक्तिशाली AI (शिक्षक) से छात्रों को ग्रेड देने के लिए कहा।
  4. परिणाम: शिक्षक ने अपने ही "बच्चों" को उनकी योग्यता से काफी अधिक स्कोर दिए।

उन्होंने यह भी कोशिश की कि AI को यह कहकर ठीक किया जाए, "पक्षपाती मत बनो!" या AI को चरण-दर-चरण अपना तर्क समझाने के लिए कहा। इससे ज्यादा मदद नहीं मिली। केवल एक ही चीज़ ने अच्छी तरह काम किया, जो था "कॉन्टेक्स्टुअल कैलिब्रेशन" (Contextual Calibration), जो एक तटस्थ तीसरे पक्ष की तरह है जो पक्षपात को खत्म करने के लिए बाद में स्कोर को एडजस्ट करता है।

निष्कर्ष (Takeaway)

यह पेपर AI समुदाय के लिए एक चेतावनी है। हम वर्तमान में एक ऐसी प्रणाली बना रहे हैं जहाँ AI पाठ्यपुस्तकें लिखता है और AI परीक्षाओं को ग्रेड करता है। यदि लेखक और ग्रेडर आपस में संबंधित हैं, तो पूरी प्रणाली पक्षपाती है।

समाधान? हमें यह सुनिश्चित करने की आवश्यकता है कि डेटा जनरेट करने वाला AI और परिणाम को ग्रेड देने वाला AI अजनबी हों। यदि वे एक ही परिवार से हैं, तो हमें उनके स्कोर पर भरोसा करने में बहुत सावधान रहना होगा, क्योंकि वे शायद केवल अपनों का पक्ष ले रहे होंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →