CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
CoAct एक नवीन ढांचा है जो उच्च-गुणवत्ता वाले प्राथमिकता डेटा की कमी को दूर करने के लिए रणनीतिक मानव-AI सहयोग के माध्यम से सेल्फ-रिवॉर्डिंग और एक्टिव लर्निंग को सहक्रियात्मक रूप से जोड़ता है, जिससे GSM8K, MATH और WebInstruct जैसे रीजनिंग बेंचमार्क पर महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बुद्धिमान लेकिन अनुभवहीन छात्र (AI) को जटिल गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं। आपके पास अभ्यास प्रश्नों का एक विशाल ढेर है, लेकिन आपके पास हर एक प्रश्न को जांचने के लिए पर्याप्त समय या पैसा नहीं है।
यह ठीक वही समस्या है जिसे COACT नामक शोध पत्र हल करता है। यह AI प्रशिक्षण का एक नया तरीका पेश करता है जो दो दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है: AI का स्वयं को पढ़ाना और मानव विशेषज्ञों का केवल तभी हस्तक्षेप करना जब अत्यंत आवश्यक हो।
सरल उपमाओं का उपयोग करके इसका विवरण यहाँ दिया गया है:
समस्या: "बहुत अधिक काम, बहुत कम समय" की दुविधा
AI को स्मार्ट बनाने के लिए, इसे "वरीयता डेटा" (preference data) से सीखने की आवश्यकता होती है। इसका अर्थ है उसे एक प्रश्न के दो उत्तर दिखाना और कहना, "उत्तर A अच्छा है, उत्तर B बुरा है।"
- पुराना तरीका 1 (Self-Rewarding): AI अपने स्वयं के होमवर्क को ग्रेड देता है।
- जोखिम: यह एक छात्र द्वारा स्वयं के टेस्ट को ग्रेड देने जैसा है। वे सोच सकते हैं कि उन्होंने सही उत्तर दिया है जबकि वे गलत थे, जिससे उनकी अपनी गलतियाँ ही सुदृढ़ होती हैं। यह तेज़ और सस्ता है, लेकिन अविश्वसनीय है।
- पुराना तरीका 2 (Active Learning): आप होमवर्क जांचने के लिए एक मानव विशेषज्ञ को काम पर रखते हैं।
- जोखिम: मनुष्य महंगे और धीमे होते हैं। आप केवल कुछ ही प्रश्नों को जांच सकते हैं, जिससे हजारों अन्य अभ्यास प्रश्न बिना उपयोग के रह जाते हैं।
समाधान: COACT (एक "स्मार्ट स्टडी ग्रुप")
COACT एक अध्ययन समूह (study group) की तरह है जहाँ छात्र (AI) और शिक्षक (मानव/ओरेकल) एक रणनीतिक लूप में मिलकर काम करते हैं। यह तीन चरणों में कैसे काम करता है, यहाँ देखें:
1. "सेल्फ-कंसिस्टेंसी" चेक (AI का अंतर्मन परीक्षण)
केवल एक उत्तर चुनने के बजाय, AI एक ही गणितीय समस्या को हल करने के आठ अलग-अलग तरीके बनाता है।
- उपमा: कल्पना कीजिए कि छात्र को एक ही समस्या को आठ बार हल करने के लिए कहा जाता है। यदि सात बार वे "42" प्राप्त करते हैं और एक बार "100" प्राप्त करते हैं, तो AI जानता है, "हे, मैं काफी आश्वस्त हूँ कि उत्तर 42 है।"
- जादू: यदि AI सुसंगत (consistent) है, तो वह अपने उत्तर पर भरोसा करता है और इसे "स्व-लेबल" (self-labeled) डेटा के रूप में उपयोग करता है। यदि वह भ्रमित है (उत्तर इधर-उधर हैं), तो उसे पता चल जाता है कि उसे मदद की ज़रूरत है।
2. "रणनीतिक शिक्षक" (The Oracle)
AI हर चीज़ के लिए मानव शिक्षक से मदद नहीं मांगता। वह केवल दो विशिष्ट प्रकार के प्रश्नों पर मदद मांगता है:
- प्रकार A: भ्रमित करने वाले। वे समस्याएँ जहाँ AI ने आठ अलग-अलग उत्तर दिए। शिक्षक को बुनियादी बातों को स्पष्ट करने की आवश्यकता है।
- प्रकार B: "अति-आत्मविश्वासी" जाल। यह सबसे चतुर हिस्सा है। कभी-कभी AI आठ बार एक ही गलत उत्तर देता है क्योंकि वह आत्मविश्वास के साथ गलत होता है (जैसे एक छात्र जिसने गलत फॉर्मूला रट लिया हो)। COACT इन आत्मविश्वासी लेकिन गलत उत्तरों को पहचानने के लिए एक विशेष "रडार" (जिसे k-NN distance कहा जाता है) का उपयोग करता है और उन्हें सुधारने के लिए शिक्षक के पास भेज देता है।
3. "होमवर्क जनरेटर" (Oracle-Guided Augmentation)
एक बार जब शिक्षक कुछ कठिन समस्याओं को ठीक कर देता है, तो AI केवल वहीं नहीं रुक जाता। वह उन सही उदाहरणों को देखता है जिन्हें शिक्षक ने सत्यापित किया है और कहता है, "ठीक है, मैं अब इस स्तर को समझ गया हूँ। मुझे अपने वर्तमान कौशल स्तर के लिए बिल्कुल सही नए अभ्यास प्रश्न उत्पन्न करने दें।"
- उपमा: यह एक ट्यूटर की तरह है जो कहता है, "तुम इस अवधारणा को समझ गए हो। अब, जो तुमने अभी सीखा है उसके आधार पर अपने स्वयं के अभ्यास प्रश्न लिखने का प्रयास करो।" यह उच्च-गुणवत्ता वाले अभ्यास सामग्री की एक कभी न खत्म होने वाली आपूर्ति बनाता है जिसे AI वास्तव में हल कर सकता है।
परिणाम: एक सुपरचार्ज्ड लर्निंग लूप
AI के स्वयं के ग्रेडिंग (आसान चीजों के लिए) और मानव विशेषज्ञ की ग्रेडिंग (कठिन और पेचीदा चीजों के लिए) को मिलाकर, COACT एक विशाल, उच्च-गुणवत्ता वाला डेटासेट बनाता है जिसके लिए लाखों मानव घंटों की आवश्यकता नहीं होती है।
प्रमाण:
जब उन्होंने गणित और तर्क संबंधी बेंचमार्क (जैसे GSM8K और MATH) पर इसका परीक्षण किया, तो AI में नाटकीय सुधार हुआ:
- यह स्कूली गणित में 13% बेहतर हुआ।
- यह उन्नत प्रतियोगिता गणित में 8% बेहतर हुआ।
- यह भौतिकी और सामान्य ज्ञान में भी बेहतर हुआ, जो यह साबित करता है कि इसने केवल उत्तर याद नहीं किए, बल्कि सीखना कैसे है यह सीखा है।
निचोड़ (The Bottom Line)
COACT AI प्रशिक्षण के लिए एक स्मार्ट, सेल्फ-ड्राइविंग कार की तरह है।
- जब रास्ता साफ हो, तो यह खुद चलता है (self-rewarding)।
- यह केवल तभी मानव प्रशिक्षक को बुलाता है जब यह किसी धुंधले चौराहे या भ्रमित करने वाले मोड़ पर पहुँचता है (active learning)।
- और एक बार जब यह एक नया रास्ता सीख लेता है, तो यह अन्वेषण करने के लिए अपने लिए नए रास्ते भी तैयार करता है (instruction augmentation)।
यह दृष्टिकोण पैसे बचाता है, समय बचाता है, और एक ऐसा स्मार्ट AI बनाता है जो अकेले किसी भी पद्धति द्वारा प्राप्त किए जाने वाले परिणाम से कहीं बेहतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।