← नवीनतम पेपर
🤖 AI

Unbiased Alignment for Large Language Models with Noisy Preferences

यह शोध पत्र एक सैद्धांतिक ढांचे को प्रस्तुत करता जिसमें अनबायस्ड रिवॉर्ड मॉडल (URM) और अनबायस्ड डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (UDPO) लॉस शामिल हैं, ताकि लार्ज लैंग्वेज मॉडल्स को बिना किसी स्वच्छ ग्राउंड-ट्रुथ सुपरविजन की आवश्यकता के, सीधे शोर वाले (noisy) प्रेफरेंस डेटासेट्स से सुदृढ़ और शोर-सहिष्णु संरेखण (alignment) प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन छात्र (एक लार्ज लैंग्वेज मॉडल) को अच्छी कहानियाँ लिखना या प्रश्नों के उत्तर देना सिखाने की कोशिश कर रहे हैं। आपके पास फीडबैक कार्डों का एक ढेर है, जो लोगों के एक समूह द्वारा बताया गया है कि कौन से उत्तर "अच्छे" हैं और कौन से "बुरे"।

समस्या क्या है? फीडबैक देने वाले लोग पूर्ण नहीं हैं। कुछ थके हुए हैं, कुछ भ्रमित हैं, और कुछ के अपने व्यक्तिगत पूर्वाग्रह भी हो सकते हैं। वास्तविक दुनिया में, इन फीडबैक कार्डों में से लगभग 20% से 40% गलत हो सकते हैं। यदि आप आँख मूंदकर कार्डों का अनुसरण करते हैं, तो छात्र गलत सबक सीख जाता है और गलतियाँ करना शुरू कर देता है।

यह पेपर छात्र को सिखाने का एक नया तरीका पेश करता है जो फीडबैक कार्डों के "शोर" (गलतियों) को अनदेखा करता है और उसके नीचे छिपे सत्य पर ध्यान केंद्रित करता है।

मुख्य विचार: "नॉइज़-कैंसलिंग" हेडफ़ोन

शोर भरे फीडबैक को एक ऐसे गाने की तरह समझें जो बहुत अधिक स्टैटिक इंटरफेरेंस (स्थिर शोर) के साथ बज रहा है। मानक शिक्षण विधियाँ पूरे शोर को सुनकर गाना सीखने की कोशिश करती हैं, जिसके परिणामस्वरूप एक विकृत धुन निकलती है।

लेखकों ने एक गणितीय "नॉइज़-कैंसलिंग" प्रणाली बनाई है। उन्होंने महसूस किया कि यदि आप जानते हैं कि शोर कैसे होता है (उदाहरण के लिए, "20% बार, लोग अपने उत्तर बदल देते हैं"), तो आप गणितीय रूप से उस प्रक्रिया को उलट सकते हैं। यह एक रेसिपी की तरह है जो कहती है, "यदि केक बहुत नमकीन है, तो सही स्वाद वापस पाने के लिए ठीक इतना नमक घटा दें।"

उन्होंने दो विशिष्ट उपकरण बनाए हैं:

  1. URM (अनबायस्ड रिवॉर्ड मॉडल): यह शिक्षण के पहले चरण के लिए है। आमतौर पर, मॉडल उत्तरों को एक "स्कोर" देना सीखता है। यदि फीडबैक शोर भरा है, तो स्कोरिंग सिस्टम भ्रमित हो जाता है। URM एक फिल्टर की तरह काम करता है जो मॉडल के देखने से पहले ही स्कोर को साफ करता है, यह सुनिश्चित करता है कि मॉडल सही "अच्छे बनाम बुरे" के अंतर को सीखे।
  2. UDPO (अनबायस्ड डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन): यह दूसरे चरण के लिए है, जहाँ मॉडल वास्तव में लिखना सीखता है। केवल शोर भरे फीडबैक का सीधे पालन करने के बजाय, UDPO भ्रम को "उल्टा" करने के लिए एक विशेष गणितीय सूत्र का उपयोग करता है। यह मॉडल को सही व्यवहार सीखने की अनुमति देता है, भले ही शिक्षक कभी-कभी गलत हो।

यह कैसे काम करता है: "जादुई सूत्र"

पेपर का दावा है कि आपको यह जानने की आवश्यकता नहीं है कि कौन से विशिष्ट फीडबैक कार्ड गलत हैं। आपको बस सामान्य "शोर दर" (फीडबैक कितना अस्त-व्यस्त है) जानने की आवश्यकता है।

वे एक चर (variable) का उपयोग करते हैं जिसे aa कहा जाता है (जो शोर दर पर आधारित है)।

  • डाउनवर्ड कम्पैटिबिलिटी ट्रिक: कल्पना करें कि आप अनुमान लगा रहे हैं कि फीडबैक कितना अस्त-व्यट है। यदि आप अनुमान लगाते हैं कि यह बहुत अस्त-व्यस्त है (उच्च शोर दर), लेकिन वास्तव में यह केवल थोड़ा अस्त-व्यस्त है, तो आपकी विधि फिर भी पूरी तरह से काम करेगी। यह भारी-भरत रेन बूट पहनने जैसा है—भले ही केवल हल्की बूंदाबांदी हो, आप सूखे रहेंगे। हालाँकि, यदि आप अनुमान लगाते हैं कि मौसम धूप वाला है लेकिन वास्तव में भारी बारिश हो रही है, तो आप भीग जाएंगे। लेखकों ने सिद्ध किया है कि यदि आप शोर का अधिक अनुमान लगाते हैं, तो भी उनकी विधि सुरक्षित है।

परिणाम: खेल जीतना

शोधकर्ताओं ने वास्तविक दुनिया के डेटासेट (जैसे चैट बातचीत और सारांश कार्यों) पर परीक्षण किया और अधिक शोर जोड़ने के लिए कृत्रिम रूप से शोर पैदा किया ताकि देखा जा सके कि यह कैसा प्रदर्शन करता है।

  • बेसलाइन: मानक विधियाँ (जैसे DPO) बुरी तरह विफल होने लगती हैं जब शोर बढ़ जाता है। वे भ्रमित हो जाती हैं और खराब प्रदर्शन करती हैं।
  • नई विधि: उनके URM और UDPO तरीके मजबूत बने रहते हैं। यहाँ तक कि जब 40% फीडबैक गलत (उल्टा) था, तब भी उनके मॉडल ने सही व्यवहार करना सीखा।
  • प्रमाण: उन्होंने गणितीय रूप से दिखाया कि उनकी विधि केवल "किस्मत से जीत" नहीं गई है। यह एक शोर भरे क्लासरूम से भी "सर्वश्रेष्ठ संभव" शिक्षक (बेयस ऑप्टिमल क्लासिफायर) को रिकवर करने के लिए सिद्ध है।

संक्षेप में

यह पेपर कहता है: "अपने शोर भरे फीडबैक डेटा को फेंकिए मत। इसके बजाय, सीखते समय इसे साफ करने के लिए हमारे नए गणितीय उपकरणों का उपयोग करें।"

वे एक "नॉइज़-कैंसलिंग" लॉस फंक्शन (सीखने का एक गणितीय नियम) प्रदान करते हैं जो AI मॉडलों को मानवीय फीडबैक से सही ढंग से सीखने में मदद करता है, जिससे वे भ्रमित न हों। यह मानव मूल्यों के साथ AI को संरेखित करने का एक अधिक मजबूत और सुरक्षित तरीका है, यह सुनिश्चित करता है कि भले ही फीडबैक देने वाले इंसान थके हुए या पक्षपाती हों, AI सही सबक सीखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →