Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge
यह शोध पत्र Wnuan को प्रस्तुत करता है, जो एक तीन-चरणीय पोस्ट-ट्रेनिंग पाइपलाइन है जो WnuanBench पर 91.51% स्वीकार्य-उत्तर दर प्राप्त करके और सामान्य निर्देश-अनुसरण क्षमताओं में संबंधित समझौते को परिमाणित करते हुए, बड़े भाषा मॉडलों को प्रोप्रायटरी एंटरप्राइज ज्ञान के अनुकूल प्रभावी ढंग से अनुकूलित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली, सुशिक्षित किशोर को एक बहुत ही विशिष्ट, जटिल व्यवसाय चलाना सिखाने की कोशिश कर रहे हैं। इस किशोर ने पहले से ही सार्वजनिक पुस्तकालय की लगभग हर किताब पढ़ ली है और वह इतिहास से लेकर कोडिंग तक किसी भी विषय पर चर्चा कर सकता है। लेकिन उसने कंपनी की आंतरिक नियम पुस्तिकाएं, सुरक्षा नियमावली या गुप्त प्रोजेक्ट फाइलें कभी नहीं देखी हैं। यदि आप उनसे केवल बाहरी दुनिया के ज्ञान के आधार पर उत्तरों का अनुमान लगाने को कहते हैं, तो वे आत्मविश्वास से भरे लग सकते हैं लेकिन विवरण गलत हो सकते हैं, या इससे भी बुरा, वे ऐसे तथ्य बना सकते हैं जो वास्तविक लगते हैं लेकिन सच नहीं होते (एक समस्या जिसे विशेषज्ञ "हैलुसिनेशन" या मतिभ्रम कहते हैं)।
यह एंटरप्राइज क्वेश्चन अनसरिंग (Enterprise Question Answering) की चुनौती है। कंपनियों के पास निजी दस्तावेजों का अंबार होता है जिनमें "असली" उत्तर होते हैं, लेकिन उनके AI मॉडल यह नहीं जानते। लक्ष्य AI को ये निजी रहस्य सिखाना है, बिना उसे एक मददगार, विनम्र और तार्किक बातचीत करने वाले के रूप में अपनी क्षमता खोने दिए। यह एक नाजुक संतुलन है: यदि आप इसे कंपनी के बारे में बहुत अधिक सिखाते हैं, तो यह एक सामान्य सहायक बनना बंद कर सकता है; यदि आप इसे पर्याप्त नहीं सिखाते हैं, तो यह अपना काम नहीं कर पाएगा। यह शोध पत्र इस पहेली को हल करने के लिए एक चतुर, तीन-चरणीय रेसिपी की खोज करता है, जो एक सामान्य-उद्देश्य वाले AI को कंपनी विशेषज्ञ में बदल देता है बिना उसका विवेक खोए।
द वुनैन रेसिपी (The Wnuan Recipe): AI को कंपनी विशेषज्ञ बनाना सिखाना
वुनान (Wnuan) से मिलिए, एक नया ट्रेनिंग पाइपलाइन जिसे एक सामान्य AI को एक विशेषज्ञ में बदलने के लिए डिज़ाइन किया गया है जो कंपनी के निजी दस्तावेजों को गहराई से जानता हो। AI को एक ऐसे छात्र के रूप में न देखें जो परीक्षा के लिए रट रहा है, बल्कि एक ऐसे नए कर्मचारी के रूप में देखें जिसे कंपनी की हैंडबुक, सुरक्षा प्रोटोकॉल और प्रोजेक्ट इतिहास को सीखने की आवश्यकता है, और साथ ही एक विनम्र इंसान बने रहने की भी।
इस पेपर के लेखकों ने अपने AI के लिए एक तीन-चरणीय प्रशिक्षण शिविर बनाया है, जिसे वे वुनान कहते हैं। यहाँ यह यात्रा चरण दर चरण कैसे आगे बढ़ती है, इसका विवरण दिया गया है।
चरण 1: हैंडबुक को क्विज़ शो में बदलना
सबसे पहले, टीम को हजारों नीरस, उबाऊ कंपनी दस्तावेजों (जैसे सुरक्षा नियमों या तकनीकी विशिष्टताओं के PDF) को कुछ ऐसा बनाना था जिससे AI वास्तव में सीख सके। आप AI को बस एक 500 पन्नों की नियमावली नहीं दे सकते और उम्मीद नहीं कर सकते कि वह उसे याद कर लेगा। इसके बजाय, उन्होंने डॉक्यूमेंट-टू-क्यू एंड ए (Document-to-QA) नामक प्रक्रिया का उपयोग किया।
कल्पना कीजिए कि एक सघन नियम पुस्तिका को लेकर एक स्मार्ट संपादक हर एक नियम को एक "प्रश्न और उत्तर" वाले फ्लैशकार्ड में बदल देता है। यदि नियम कहता है, "सभी कर्मचारियों को ज़ोन B में हार्ड हैट पहनना चाहिए," तो सिस्टम एक कार्ड बनाता है जो पूछता है, "आपको ज़ोन B में क्या पहनना चाहिए?" और उत्तर प्रदान करता है। उन्होंने यह 2,20,000 से अधिक उदाहरणों के लिए किया! उन्होंने AI से कुछ उत्तरों को फिर से लिखवाया भी ताकि यह सुनिश्चित हो सके कि वे बिल्कुल उसी विशिष्ट AI की तरह लगें जिसे वे प्रशिक्षित कर रहे हैं। इसने कंपनी के रहस्यों के लिए तैयार किया गया एक विशाल, कस्टम-मेड क्विज़ डेक बना दिया।
चरण 2: "रिप्ले" ब्रेक
अब कठिन हिस्सा आता है। यदि आप केवल कंपनी की हैंडबुक पढ़ते हैं, तो आप लोगों से बात करना या सामान्य समस्याओं को हल करना भूल सकते हैं। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (विनाशकारी विस्मृति) कहा जाता है। इसे रोकने के लिए, टीम ने जनरल-डेटा रिप्ले (General-Data Replay) नामक तकनीक का उपयोग किया।
इसे एक अध्ययन सत्र के रूप में सोचें जहाँ छात्र कुछ समय के लिए कंपनी की हैंडबुक पढ़ता है, लेकिन फिर खेल, विज्ञान या तर्क पहेलियों जैसे सामान्य विषयों पर चर्चा करने के लिए ब्रेक लेता है। शोध में पाया गया कि कंपनी के डेटा के साथ लगभग 48% सामान्य बातचीत के डेटा को मिलाना "स्वीट स्पॉट" (सही संतुलन) था। इसने AI को स्मार्ट और विनम्र बनाए रखा जबकि वह कंपनी के नियमों को सीख रहा था। इस ब्रेक के बिना, AI एक महान कंपनी विशेषज्ञ तो बन जाता, लेकिन एक खराब वार्ताकार बन जाता।
चरण 3: "रेसिडुअल एरर" ड्रिल
पहले दो चरणों के बाद, AI काफी अच्छा था, लेकिन वह अभी भी गलतियाँ कर रहा था। वह आसान सवालों को सही बताता था लेकिन कठिन सवालों पर लड़खड़ा जाता था। यहीं पर तीसरा चरण, रेसिडुअल-एरर रीइन्फोर्समेंट लर्निंग (Residual-Error Reinforcement Learning - RL) काम आता है।
पूरे क्विज़ डेक को दोबारा पढ़ने के बजाय, टीम ने विशेष रूप से उन प्रश्नों पर ध्यान केंद्रित किया जिन्हें AI ने गलत बताया था ("रेसिडुअल एरर्स")। उन्होंने इन गलतियों को एक कोच द्वारा एथलीट की कमजोरियों पर ध्यान केंद्रित करने की तरह माना। उन्होंने उन विशिष्ट त्रुटियों को ठीक करने के लिए AI को सिखाने के लिए एक विशेष रिवॉर्ड सिस्टम का उपयोग किया। यह ऐसा है जैसे कहना, "आपने आसान गणित के सवाल सही किए, लेकिन आइए इन तीन कठिन बीजगणित (algebra) के सवालों पर तब तक अभ्यास करें जब तक आप उनमें महारत हासिल न कर लें।"
परिणाम: एक छोटा मूल्य, एक बड़ी जीत
इस तीन-चरणीय प्रशिक्षण के परिणाम प्रभावशाली थे। किसी भी प्रशिक्षण से पहले, AI (वुनान-बेस) उनके टेस्ट सेट, जिसे वुनान-बेंच (Wnuan-Bench) कहा जाता है, के प्रश्नों के लगभग 52.76% के लिए केवल स्वीकार्य उत्तर दे सकता था।
- चरण 2 के बाद (SFT के साथ रिप्ले): स्कोर बढ़कर 80.06% हो गया। AI अब एक ठोस कर्मचारी था।
- चरण 3 के बाद (रेसिडुअल-एरर RL): स्कोर और भी ऊपर चढ़कर 91.51% हो गया। AI ने कंपनी के रहस्यों में महारत हासिल कर ली थी।
टीम ने यह भी जाँच की कि क्या AI ने एक सामान्य सहायक के रूप में कार्य करना भूल गया है। उन्होंने पाया कि हालांकि AI विशिष्ट, कठिन निर्देशों का पालन करने में थोड़ा कमजोर हुआ (एक सामान्य बेंचमार्क पर लगभग 5 अंकों की गिरावट), लेकिन इसने अपनी सामान्य बुद्धिमत्ता नहीं खोई। यह सौदा सार्थक था: AI एक बहुत बेहतर कंपनी विशेषज्ञ बन गया।
जो पेपर खारिज करता है (और जो नहीं करता)
लेखक अपने विचारों का परीक्षण करने में बहुत सावधान रहे। उन्होंने केवल यह अनुमान नहीं लगाया कि गलतियों पर ध्यान केंद्रित करना बेहतर है; उन्होंने इसे सिद्ध किया।
- गलतियों पर ध्यान केंद्रित करना काम करता है: उन्होंने अपने "रेसिडुअल-एरर" तरीके (केवल गलत उत्तरों पर ध्यान केंद्रित करना) की तुलना दो अन्य तरीकों से की: सब कुछ पढ़ना (फुल पूल) और प्रश्नों का एक रैंडम मिश्रण। "रेसिडुअल-एरर" विधि जीत गई, जो रैंडम विधि से 2.97 अंक और फुल पूल से 3.11 अंक बेहतर थी। यह सुझाव देता है कि एक बार जब AI बुनियादी बातें जान लेता है, तो अपनी विशिष्ट कमजोरियों पर ड्रिल करना सीखने का सबसे कुशल तरीका है।
- रिट्रीवल (Retrieval) कोई जादुई समाधान नहीं है: टीम ने एक सामान्य ट्रिक का भी परीक्षण किया जिसे RAG (Retrieval-Augmented Generation) कहा जाता है, जहाँ AI को टेस्ट के दौरान डेटाबेस में उत्तर खोजने की अनुमति दी जाती है। आश्चर्यजनक रूप से, पूरी तरह से प्रशिक्षित AI के लिए, उत्तर खोजना कुछ मामलों में इसे और भी खराब बना देता है। AI ने सामग्री को इतनी अच्छी तरह से सीख लिया था कि उसे खोजने की कोशिश उसे भ्रमित कर देती थी। यह सुझाव देता है कि इस प्रकार के प्रशिक्षण के लिए, ज्ञान को "बेक्ड-इन" (अंदर समाहित) रखना बेहतर है, बजाय इसके कि उसे चलते समय खोजा जाए।
- यह कोई सार्वभौमिक समाधान नहीं है: पेपर स्वीकार करता है कि यह तरीका इस कंपनी के आंतरिक दस्तावेजों के लिए बहुत अच्छा काम करता है। यह दावा नहीं करता कि यह दुनिया की हर AI समस्या को हल कर देगा। साथ ही, AI को एक ऐसे सहायक के रूप में डिज़ाइन किया गया है जिसे मनुष्य चेक करें, न कि एक ऐसे रोबोट के रूप में जो अपने आप अंतिम सुरक्षा या भर्ती निर्णय ले।
निष्कर्ष
वुनान का पेपर हमें विशेषज्ञों बनाने का एक स्पष्ट मार्ग दिखाता है। दस्तावेजों को क्विज़ में बदलकर, AI को संतुलित रखने के लिए सामान्य बातचीत को मिलाकर, और फिर विशेष रूप से उन गलतियों पर ड्रिल करके जो वह करता है, आप एक सामान्य-उद्देश्य वाले रोबोट को एक उच्च कुशल कंपनी विशेषज्ञ में बदल सकते हैं।
लेखक सुझाव देते हैं कि यह "स्टेज्ड" (चरणबद्ध) दृष्टिकोण ही कुंजी है: पहले बुनियादी बातें सिखाएं, फिर कमजोरियों को सुधारें। हालांकि AI अपनी जटिल निर्देशों का पालन करने की क्षमता में थोड़ी कमी लाता है, लेकिन सटीकता में भारी वृद्धि (52.76% से 91.51%) इसे एक विजेता रणनीति बनाती है उन कंपनियों के लिए जिन्हें अपने AI के लिए व्यवसाय के नियमों, प्रक्रियाओं और रहस्यों को जानना आवश्यक है। यह एक याद दिलाता है कि कभी-कभी, सीखने का सबसे अच्छा तरीका सब कुछ फिर से पढ़ना नहीं है, बल्कि उस पर तीव्रता से ध्यान केंद्रित करना है जो आपने गलत किया था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।