← नवीनतम पेपर
🤖 AI

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

यह शोधपत्र BiasGRPO प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो सैम्पल्ड कंप्लीशन्स (sampled completions) के बीच रिवार्ड्स को नॉर्मलाइज़ करके लार्ज लैंग्वेज मॉडल्स में सोशल बायस मिटिगेशन को स्थिर करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन का लाभ उठाता है, जिससे यह DPO की एक्सप्लोरेशन सीमाओं और PPO की ट्रेनिंग अस्थिरता पर विजय प्राप्त करते हुए कई बेंचमार्क्स पर दोनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Saket Reddy, Ke Yang, ChengXiang Zhai

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saket Reddy, Ke Yang, ChengXiang Zhai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी समस्या: एक रोबोट को निष्पक्ष होना सिखाना

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) को कहानियाँ लिखने और सवालों के जवाब देने के लिए प्रशिक्षित कर रहे हैं। समस्या यह है कि रोबोट ने पूरे इंटरनेट से सीखा है, जो मानवीय पूर्वाग्रहों (prejudices), रूढ़ियों (stereotypes) और अनुचित विचारों से भरा हुआ है।

आप रोबोट को निष्पक्ष और निष्पक्षता से रहना सिखाना चाहते हैं। लेकिन पेचीदा हिस्सा यह है: निष्पक्षता के लिए कोई एक "सही" उत्तर नहीं है।

  • यदि आप पूछते हैं, "एक अच्छा नेता कौन है?" तो एक पक्षपाती व्यक्ति कह सकता है "पुरुष," जबकि एक निष्पक्ष व्यक्ति कह सकता है "कोई भी।"
  • गणित के विपरीत, जहाँ 2+22+2 हमेशा $4$ होता है, सामाजिक निष्पक्षता व्यक्तिपरक (subjective) होती है। यह किसी को "सुंदर" सूर्यास्त पेंट करना सिखाने जैसा है; इसे करने के कई तरीके हैं, और राय बहुत भिन्न हो सकती है।

पुराने तरीके: वे संघर्ष क्यों कर रहे थे

यह शोध पत्र रोबोट को निष्पक्ष होने के लिए सिखाने के दो पिछले तरीकों को देखता है, और बताता है कि वे कहाँ अटक गए:

  1. "पाठ्यपुस्तक" विधि (DPO):

    • यह कैसे काम करती है: आप रोबोट को "अच्छा उत्तर" बनाम "बुरा उत्तर" के पहले से लिखे गए उदाहरणों वाली एक पाठ्यपुस्तक देते हैं। रोबोट बस इन जोड़ों को रट लेता है।
    • दोष: यह केवल उत्तर कुंजी (answer key) पढ़कर परीक्षा की तैयारी करने जैसा है। रोबोट विशिष्ट उदाहरणों को सीख जाता है लेकिन उन नई, अजीब स्थितियों को नहीं संभाल पाता जिन्हें उसने पहले नहीं देखा है। इसमें एक्सप्लोरेशन (अन्वेषण) की कमी है।
  2. "स्कोरकार्ड के साथ कोच" विधि (PPO):

    • यह कैसे काम करती है: रोबोट एक उत्तर लिखने की कोशिश करता है, और एक अलग "कोच" (क्रिटिक मॉडल) उसे एक स्कोर देता है। यदि स्कोर अधिक है, तो रोबोट वही करता रहता है; यदि कम है, तो वह रुक जाता है।
    • दोष: पूर्वाग्रह जैसी व्यक्तिपरक दुनिया में, कोच अक्सर भ्रमित रहता है। क्या यह उत्तर थोड़ा पक्षपाती है या बहुत अधिक? कोच का स्कोर बहुत अधिक उतार-चढ़ाव (high variance) करता है, जिससे रोबोट अस्थिर और चंचल हो जाता है। यह एक ऐसे कोच की तरह है जो एक सेकंड "अच्छा काम किया!" चिल्लाता है और अगले ही पल "भयानक!"—जिससे खिलाड़ी (रोबोट) को समझ ही नहीं आता कि वास्तव में क्या करना है।

नया समाधान: BiasGRPO (द "ग्रुप हडल")

लेखक एक नई विधि प्रस्तावित करते हैं जिसे BiasGRPO कहा जाता है। एक अकेले कोच या स्थिर पाठ्यपुस्तक के बजाय, वे एक "ग्रुप हडल" (समूह चर्चा) का उपयोग करते हैं।

उपमा (Analogy):
कल्पना कीजिए कि रोबोट से एक पेचीदा, संभावित रूप से पक्षपाती प्रश्न पूछा गया है। केवल एक उत्तर लिखने के बजाय, वह एक ही समय में चार अलग-अलग उत्तर लिखता है (एक "समूह" या completions)।

फिर, किसी अदृश्य मानक के विरुद्ध कोच से ग्रेडिंग कराने के बजाय, रोबोट उन चार उत्तरों की आपस में तुलना करता है:

  • "ठीक है, उत्तर A वास्तव में बुरा था। उत्तर B ठीक था। उत्तर C थोड़ा पक्षपाती था। उत्तर D सबसे अच्छा था।"
  • रोबोट सीखता है: "भले ही मेरे सभी उत्तर पूर्णतः सही नहीं थे, लेकिन उत्तर D दूसरों की तुलना में सबसे कम पक्षपाती था। मुझे उत्तर D की तरह अधिक प्रयास करना चाहिए।"

यह गेम-चेंजर क्यों है:

  • कोई भ्रमित कोच नहीं: आपको एक अलग क्रिटिक मॉडल की आवश्यकता नहीं है जो गलत हो सकता है। आप बस समूह को देखते हैं और कहते हैं, "इनमें से सबसे अच्छा कौन था?"
  • स्थिरता (Stability): भले ही रोबक चार खराब उत्तर उत्पन्न करे, फिर भी वह सीख सकता है क्योंकि वह पहचान सकता है कि कौन सा उत्तर सापेक्ष रूप से बेहतर था। यह एक अराजक, उच्च-विचलन वाली समस्या को एक स्पष्ट, सापेक्ष संकेत में बदल देता है।
  • एक्सप्लोरेशन (अन्वेषण): "कोच" विधि की तरह, रोबोट अपने स्वयं के उत्तर उत्पन्न करता है, इसलिए वह नई स्थितियों को संभालने के लिए सीखता है, न कि केवल पाठ्यपुस्तक को रटता है।

टूलकिट जो उन्होंने बनाया

इसे सफल बनाने के लिए, टीम ने केवल गणित नहीं बदला; उन्होंने एक पूरा टूलकिट बनाया:

  1. एक विशाल डेटासेट: उन्होंने रोबोट को विभिन्न परिदृश्यों पर प्रशिक्षित करने के लिए 11 अलग-अलग विषयों (जैसे जाति, लिंग और धर्म) को कवर करने वाले हजारों उदाहरण एकत्र किए और बनाए।
  2. एक कस्टम "बायस डिटेक्टर" (पूर्वाग्रह पहचानकर्ता): उन्होंने एक छोटा, सुपर-फास्ट कंप्यूटर प्रोग्राम (रिवॉर्ड मॉडल) बनाया जो विशेष रूप से पूर्वाग्रह को पहचानने के लिए डिज़ाइन किया गया है। यह इतना कुशल है कि यह रोबोट की सीखने की गति को धीमा नहीं करता है और न ही यह रोबोट को दुनिया के तथ्यों (जो वह पहले से जानता है) को भूलने देता है।

परिणाम: कौन जीता?

उन्होंने पुराने तरीकों के मुकाबले अपने नए तरीके का परीक्षण एक "रोबोट ओलंपिक" (बेंचमार्क्स) का उपयोग करके किया:

  • विजेता: BiasGRPO के साथ प्रशिक्षित रोबोट हर श्रेणी में जीता। वह सबसे निष्पक्ष और गैर-पक्षपाती बना।
  • बोनस: अन्य विधियों के विपरीत जो रोबोट को "मूर्ख" बना देती हैं (केवल दयालु होने के लिए तथ्यों को भूल जाना), BiasGRPO रोबोट निष्पक्ष होने के साथ-साथ सच बताने में और भी स्मार्ट हो गया।
  • प्रमाण: जब हमने रोबोट के सीखने के तरीके को देखा, तो "ग्रुप हडल" विधि सुचारू और स्थिर थी। पुरानी "कोच" विधि ऊबड़-खाबड़ और डगमगाती हुई थी, और "पाठ्यपुस्तक" विधि बहुत जल्दी सीखना बंद कर देती थी।

मुख्य निष्कर्ष (Takeaway)

यह शोध पत्र तर्क देता है कि पूर्वाग्रह जैसे जटिल, व्यक्तिपरक मानवीय मुद्दों से निपटने के लिए, आपको एक आदर्श जज की आवश्यकता नहीं है। आपको बस एक-दूसरे से तुलना करने के लिए विकल्पों के एक समूह की आवश्यकता है। रोबोट को "सबसे कम बुरा" विकल्प खोजने के लिए अपने स्वयं के विचारों की तुलना करने देकर, आप इसे बिना उसका दिमाग खराब किए निष्पक्ष होने के लिए सिखाने का एक स्थिर और प्रभावी तरीका प्राप्त करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →