Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
यह शोध पत्र एक नवीन फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करता है जो स्टीयरिंग टोकन कैलिब्रेशन को हाइब्रिड केएल-डाइवर्जेंस (KL-divergence) और कानमैन-ट्वर्स्की (Kahneman-Tversky) अनुकूलन उद्देश्य के साथ जोड़ता है ताकि बड़े भाषा मॉडलों (LLMs) के आउटपुट वितरणों को कई राउंड में प्रभावी ढंग से नियंत्रित और संरेखित किया जा सके, जो लिंग, नस्ल और भावना जैसे गुणों के संबंध में सांख्यिकीय रूप से प्रतिनिधि सामग्री उत्पन्न करने में मौजूदा विधियों की सीमाओं को संबोधित करता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, लेकिन थोड़ी जिद्दी कहानीकार है जिसका नाम "LLM" है। आप इस कहानीकार से एक विशिष्ट नौकरी, जैसे कि "यूके में एक नर्स" के बारे में 100 लघु कथाएँ लिखने के लिए कहते हैं।
समस्या: जिद्दी कहानीकार
वास्तविक दुनिया में, नर्सिंग में पुरुष और महिला दोनों शामिल होते हैं। लेकिन यदि आप अपने LLM कहानीकार को 100 कहानियाँ स्वतंत्र रूप से लिखने के लिए कहते हैं, तो वह अनजाने में 90 कहानियाँ महिला नर्सों के बारे में और केवल 10 कहानियाँ पुरुष नर्सों के बारे में लिख सकता है। ऐसा इसलिए नहीं है कि मॉडल "बुरा" है; बल्कि इसलिए है क्योंकि इसने इंटरनेट से सीखा है कि "नर्स" का अर्थ आमतौर पर "महिला" होता है।
यदि आप इसे फिर से "निर्माण श्रमिकों" (Construction Workers) के बारे में 100 कहानियाँ लिखने के लिए कहते हैं, तो यह 99 कहानियाँ पुरुषों के बारे में और 1 महिला के बारे में लिख सकता है, भले ही आप एक संतुलित मिश्रण चाहते थे।
समस्या यह है कि वर्तमान AI मॉडल एक अच्छी कहानी लिखने में तो बहुत माहिर हैं, लेकिन कई कहानियाँ सुनाने के जब बात आती है, तो वे बड़ी तस्वीर (big picture) को संभालने में बहुत खराब हैं। वे एक ही "रट" (rut) में फंस जाते हैं, वास्तविक दुनिया की विविधता या आपके द्वारा निर्धारित किसी विशिष्ट लक्ष्य को दर्शाने के बजाय, बार-बार एक ही तरह के रूढ़िवादी विचारों (stereotypes) को दोहराते रहते हैं।
समाधान: "ट्रैफिक पुलिस" और "संपादक"
शोधकर्ताओं ने इस समस्या को ठीक करने के लिए एक चतुर दो-भाग वाली प्रशिक्षण विधि विकसित की है। इसे AI को एक नया सेट उपकरण देने के रूप में समझें: एक ट्रैफिक पुलिस (Traffic Cop) और एक सख्त संपादक (Strict Editor)।
1. ट्रैफिक पुलिस (Steering Tokens और KL Loss)
सबसे पहले, वे AI को सिखाते हैं कि कहानी लिखना शुरू करने से पहले एक विशेष "गुप्त कोड" या ट्रैफिक पुलिस टोकन का उपयोग कैसे किया जाए।
- यह कैसे काम करता है: एक नर्स के बारे में कहानी लिखने से पहले, AI को एक टोकन चुनना होगा। मान लीजिए कि यह "पुरुष" के लिए टोकन "A" या "महिला" के लिए टोकन "B" चुनता है।
- लक्ष्य: शोधकर्ता AI को इस तरह प्रशिक्षित करते हैं कि यदि आप 70% पुरुष नर्स और 30% महिला नर्स चाहते हैं, तो ट्रैफिक पुलिस 100 में से 70 बार टोकन "A" और 30 बार टोकन "B" चुने।
- उपमा: एक कैसीनो डीलर की कल्पना करें। यदि आप चाहते हैं कि कार्डों का वितरण एक विशिष्ट अनुपात में हो (जैसे, 70% लाल, 30% काला), तो डीलर (ट्रैफिक पुलिस) को ठीक उसी तरह कार्ड बांटने के लिए प्रशिक्षित किया जाता है, चाहे खिलाड़ी आमतौर पर क्या उम्मीद करते हों।
2. सख्त संपादक (Semantic Alignment और KTO)
यहाँ पेचीदा हिस्सा आता है। सिर्फ इसलिए कि AI ने "पुरुष" टोकन नहीं चुना है, इसका मतलब यह नहीं है कि उसके बाद जो कहानी वह लिखेगा वह वास्तव में एक पुरुष के बारे में होगी। हो सकता है कि वह गलती से टोकन चुन ले और फिर भी एक महिला के बारे में कहानी लिख दे।
- सुधार: वे एक "सख्त संपादक" (KTO नामक तकनीक का उपयोग करके) जोड़ते हैं। यह संपादक जाँच करता है: "क्या आपने 'पुरुष' टोकन चुना? बहुत बढ़िया! अब, क्या आपके द्वारा लिखी गई कहानी वास्तव में एक पुरुष का वर्णन करती है?"
- लक्ष्य: यदि AI "पुरुष" चुनता है लेकिन एक महिला के बारे में लिखता है, तो संपादक उसे एक बड़ा "F" (दंड) देता है। यदि AI "पुरुष" चुनता है और एक पुरुष के बारे में लिखता है, तो उसे "A" (पुरस्कार) मिलता है।
- उपमा: एक शेफ के बारे में सोचें जिसे एक "तीखा" व्यंजन बनाने के लिए कहा गया है। ट्रैफिक पुलिस यह सुनिश्चित करती है कि वह 50% बार "तीखा" लेबल चुने। सख्त संपादक भोजन को चखता है ताकि यह सुनिश्चित हो सके कि वह वास्तव में तीखा है। यदि शेफ लेबल चुनता है लेकिन एक सादा सूप परोसता है, तो संपादक उसे वापस रसोई में भेज देता है।
परिणाम: एक पूरी तरह से संतुलित मेनू
ट्रैफिक पुलिस (जो विकल्पों की आवृत्ति को नियंत्रित करता है) और सख्त संपादक (जो यह सुनिश्चित करता है कि सामग्री चुनाव से मेल खाती है) को मिलाकर, शोधकर्ताओं ने एक ऐसा AI बनाया जो:
- वास्तविकता को दर्शाता है: यदि आप वास्तविक दुनिया के आंकड़ों के लिए कहते हैं (जैसे, "अमेरिकी जनगणना के आंकड़ों के आधार पर निर्माण श्रमिकों के बारे में कहानियाँ लिखें"), तो AI सटीक नंबरों के साथ मेल खाने वाला मिश्रण तैयार करेगा।
- निष्पक्षता लागू करता है: यदि आप एक पूरी तरह से संतुलित मिश्रण (50/50) चाहते हैं ताकि पूर्वाग्रह से बचा जा सके, तो AI यह भी कर सकता है, भले ही वास्तविक दुनिया संतुलित न हो।
यह क्यों महत्वपूर्ण है
पहले, यदि आप चाहते थे कि AI कई पीढ़ियों में निष्पक्ष या सांख्यिकीय रूप से सटीक रहे, तो आपको केवल बेहतर होने की उम्मीद करनी पड़ती थी या इसे जटिल प्रॉम्प्ट के माध्यम से चकमा देने की कोशिश करनी पड़ती थी (जो आमतौर पर विफल हो जाते थे)। यह नई विधि AI को एक डायल (dial) देने के समान है जिसे आप घुमाकर आउटपुट में पुरुषों, महिलाओं या विभिन्न भावनाओं के सटीक प्रतिशत को सेट कर सकते हैं, बिना उसकी एक अच्छी कहानी बताने की क्षमता को तोड़े।
यह एक अराजक भीड़ से "विविध होने" के लिए कहने (जिसका परिणाम आमतौर पर एक गड़बड़ी होती है) और एक पेशेवर इवेंट प्लानर को नियुक्त करने के बीच का अंतर है, जो जानता है कि पार्टी को परफेक्ट बनाने के लिए प्रत्येक प्रकार के कितने लोगों को आमंत्रित करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।