← नवीनतम पेपर
💬 NLP

Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning

यह शोध पत्र एक नवीन फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करता है जो स्टीयरिंग टोकन कैलिब्रेशन को हाइब्रिड केएल-डाइवर्जेंस (KL-divergence) और कानमैन-ट्वर्स्की (Kahneman-Tversky) अनुकूलन उद्देश्य के साथ जोड़ता है ताकि बड़े भाषा मॉडलों (LLMs) के आउटपुट वितरणों को कई राउंड में प्रभावी ढंग से नियंत्रित और संरेखित किया जा सके, जो लिंग, नस्ल और भावना जैसे गुणों के संबंध में सांख्यिकीय रूप से प्रतिनिधि सामग्री उत्पन्न करने में मौजूदा विधियों की सीमाओं को संबोधित करता है।

मूल लेखक: Yanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, लेकिन थोड़ी जिद्दी कहानीकार है जिसका नाम "LLM" है। आप इस कहानीकार से एक विशिष्ट नौकरी, जैसे कि "यूके में एक नर्स" के बारे में 100 लघु कथाएँ लिखने के लिए कहते हैं।

समस्या: जिद्दी कहानीकार
वास्तविक दुनिया में, नर्सिंग में पुरुष और महिला दोनों शामिल होते हैं। लेकिन यदि आप अपने LLM कहानीकार को 100 कहानियाँ स्वतंत्र रूप से लिखने के लिए कहते हैं, तो वह अनजाने में 90 कहानियाँ महिला नर्सों के बारे में और केवल 10 कहानियाँ पुरुष नर्सों के बारे में लिख सकता है। ऐसा इसलिए नहीं है कि मॉडल "बुरा" है; बल्कि इसलिए है क्योंकि इसने इंटरनेट से सीखा है कि "नर्स" का अर्थ आमतौर पर "महिला" होता है।

यदि आप इसे फिर से "निर्माण श्रमिकों" (Construction Workers) के बारे में 100 कहानियाँ लिखने के लिए कहते हैं, तो यह 99 कहानियाँ पुरुषों के बारे में और 1 महिला के बारे में लिख सकता है, भले ही आप एक संतुलित मिश्रण चाहते थे।

समस्या यह है कि वर्तमान AI मॉडल एक अच्छी कहानी लिखने में तो बहुत माहिर हैं, लेकिन कई कहानियाँ सुनाने के जब बात आती है, तो वे बड़ी तस्वीर (big picture) को संभालने में बहुत खराब हैं। वे एक ही "रट" (rut) में फंस जाते हैं, वास्तविक दुनिया की विविधता या आपके द्वारा निर्धारित किसी विशिष्ट लक्ष्य को दर्शाने के बजाय, बार-बार एक ही तरह के रूढ़िवादी विचारों (stereotypes) को दोहराते रहते हैं।

समाधान: "ट्रैफिक पुलिस" और "संपादक"
शोधकर्ताओं ने इस समस्या को ठीक करने के लिए एक चतुर दो-भाग वाली प्रशिक्षण विधि विकसित की है। इसे AI को एक नया सेट उपकरण देने के रूप में समझें: एक ट्रैफिक पुलिस (Traffic Cop) और एक सख्त संपादक (Strict Editor)

1. ट्रैफिक पुलिस (Steering Tokens और KL Loss)

सबसे पहले, वे AI को सिखाते हैं कि कहानी लिखना शुरू करने से पहले एक विशेष "गुप्त कोड" या ट्रैफिक पुलिस टोकन का उपयोग कैसे किया जाए।

  • यह कैसे काम करता है: एक नर्स के बारे में कहानी लिखने से पहले, AI को एक टोकन चुनना होगा। मान लीजिए कि यह "पुरुष" के लिए टोकन "A" या "महिला" के लिए टोकन "B" चुनता है।
  • लक्ष्य: शोधकर्ता AI को इस तरह प्रशिक्षित करते हैं कि यदि आप 70% पुरुष नर्स और 30% महिला नर्स चाहते हैं, तो ट्रैफिक पुलिस 100 में से 70 बार टोकन "A" और 30 बार टोकन "B" चुने।
  • उपमा: एक कैसीनो डीलर की कल्पना करें। यदि आप चाहते हैं कि कार्डों का वितरण एक विशिष्ट अनुपात में हो (जैसे, 70% लाल, 30% काला), तो डीलर (ट्रैफिक पुलिस) को ठीक उसी तरह कार्ड बांटने के लिए प्रशिक्षित किया जाता है, चाहे खिलाड़ी आमतौर पर क्या उम्मीद करते हों।

2. सख्त संपादक (Semantic Alignment और KTO)

यहाँ पेचीदा हिस्सा आता है। सिर्फ इसलिए कि AI ने "पुरुष" टोकन नहीं चुना है, इसका मतलब यह नहीं है कि उसके बाद जो कहानी वह लिखेगा वह वास्तव में एक पुरुष के बारे में होगी। हो सकता है कि वह गलती से टोकन चुन ले और फिर भी एक महिला के बारे में कहानी लिख दे।

  • सुधार: वे एक "सख्त संपादक" (KTO नामक तकनीक का उपयोग करके) जोड़ते हैं। यह संपादक जाँच करता है: "क्या आपने 'पुरुष' टोकन चुना? बहुत बढ़िया! अब, क्या आपके द्वारा लिखी गई कहानी वास्तव में एक पुरुष का वर्णन करती है?"
  • लक्ष्य: यदि AI "पुरुष" चुनता है लेकिन एक महिला के बारे में लिखता है, तो संपादक उसे एक बड़ा "F" (दंड) देता है। यदि AI "पुरुष" चुनता है और एक पुरुष के बारे में लिखता है, तो उसे "A" (पुरस्कार) मिलता है।
  • उपमा: एक शेफ के बारे में सोचें जिसे एक "तीखा" व्यंजन बनाने के लिए कहा गया है। ट्रैफिक पुलिस यह सुनिश्चित करती है कि वह 50% बार "तीखा" लेबल चुने। सख्त संपादक भोजन को चखता है ताकि यह सुनिश्चित हो सके कि वह वास्तव में तीखा है। यदि शेफ लेबल चुनता है लेकिन एक सादा सूप परोसता है, तो संपादक उसे वापस रसोई में भेज देता है।

परिणाम: एक पूरी तरह से संतुलित मेनू
ट्रैफिक पुलिस (जो विकल्पों की आवृत्ति को नियंत्रित करता है) और सख्त संपादक (जो यह सुनिश्चित करता है कि सामग्री चुनाव से मेल खाती है) को मिलाकर, शोधकर्ताओं ने एक ऐसा AI बनाया जो:

  1. वास्तविकता को दर्शाता है: यदि आप वास्तविक दुनिया के आंकड़ों के लिए कहते हैं (जैसे, "अमेरिकी जनगणना के आंकड़ों के आधार पर निर्माण श्रमिकों के बारे में कहानियाँ लिखें"), तो AI सटीक नंबरों के साथ मेल खाने वाला मिश्रण तैयार करेगा।
  2. निष्पक्षता लागू करता है: यदि आप एक पूरी तरह से संतुलित मिश्रण (50/50) चाहते हैं ताकि पूर्वाग्रह से बचा जा सके, तो AI यह भी कर सकता है, भले ही वास्तविक दुनिया संतुलित न हो।

यह क्यों महत्वपूर्ण है
पहले, यदि आप चाहते थे कि AI कई पीढ़ियों में निष्पक्ष या सांख्यिकीय रूप से सटीक रहे, तो आपको केवल बेहतर होने की उम्मीद करनी पड़ती थी या इसे जटिल प्रॉम्प्ट के माध्यम से चकमा देने की कोशिश करनी पड़ती थी (जो आमतौर पर विफल हो जाते थे)। यह नई विधि AI को एक डायल (dial) देने के समान है जिसे आप घुमाकर आउटपुट में पुरुषों, महिलाओं या विभिन्न भावनाओं के सटीक प्रतिशत को सेट कर सकते हैं, बिना उसकी एक अच्छी कहानी बताने की क्षमता को तोड़े।

यह एक अराजक भीड़ से "विविध होने" के लिए कहने (जिसका परिणाम आमतौर पर एक गड़बड़ी होती है) और एक पेशेवर इवेंट प्लानर को नियुक्त करने के बीच का अंतर है, जो जानता है कि पार्टी को परफेक्ट बनाने के लिए प्रत्येक प्रकार के कितने लोगों को आमंत्रित करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →