LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training
यह शोध पत्र LEAF का प्रस्ताव करता है, जो एक रेट्रोस्पेक्टिव ट्री-आधारित सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) विधि है जो रोलआउट बैचों में साझा प्रीफिक्स को स्पैन-स्तरीय लाभ (स्पैन-लेवल एडवांटेज) प्रदान करके स्पीच-अवेयर लार्ज लैंग्वेज मॉडल पोस्ट-ट्रेनिंग में सुधार करता है, जिससे यह मौजूदा GRPO-शैली के दृष्टिकोणों और यहाँ तक कि छोटे मॉडलों वाले फुल-पैरामीटर बेसलाइनों को भी पीछे छोड़ देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र को बोले गए प्रॉम्प्ट (spoken prompt) के आधार पर कहानी लिखना सिखा रहे हैं। पुराने तरीके में (जिसे GRPO नामक विधि कहा जाता है), शिक्षक छात्र द्वारा लिखी गई पूरी कहानी को सुनता है, उसे एक अंतिम ग्रेड देता है, और फिर छात्र को कहता है: "पूरी कहानी के लिए बहुत अच्छा!" या "पूरी कहानी के लिए बुरा काम!"
इस दृष्टिकोण की समस्या यह है कि यह बहुत ही रूखा (blunt) है। यदि छात्र ने एक बेहतरीन शुरुआत की लेकिन एक बहुत खराब अंत किया, तो "बुरा ग्रेड" बेहतरीन शुरुआत को भी उतना ही दंडित करता है जितना कि खराब अंत को। इसके विपरीत, यदि छात्र की शुरुआत डगमगाती हुई रही लेकिन उसका समापन शानदार रहा, तो "अच्छा ग्रेड" डगमगाती हुई शुरुआत को भी पुरस्कृत करता है। शिक्षक को यह पता नहीं चलता कि छात्र कहाँ सही गया या कहाँ गलत।
पेश है, LEAF (Low-rank Exploration with Adaptive Forking)।
इलिनोइस विश्वविद्यालय के शोधकर्ता इन स्पीच एआई (speech AI) मॉडल को सिखाने का एक स्मार्ट तरीका प्रस्तावित करते हैं। केवल पूरी कहानी के लिए एक ग्रेड देने के बजाय, LEAF एक जासूस की तरह छात्र के काम को पीछे मुड़कर देखता है ताकि उन सटीक क्षणों को खोजा जा सके जहाँ कहानी ने एक नया मोड़ लिया।
LEAF कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:
1. "ग्रुप ट्रिप" की उपमा
कल्पना कीजिए कि आप 8 छात्रों को एक ही हाइकिंग ट्रिप (जिसे "rollout" कहा जाता है) पर भेजते हैं। वे सभी एक साथ शुरू करते हैं, पहले एक मील तक एक ही रास्ते पर चलते हैं। फिर, सड़क के एक मोड़ (fork) पर, कुछ छात्र बाईं ओर मुड़ जाते हैं, और कुछ दाईं ओर। अंततः, वे सभी अंत तक पहुँचते हैं, और आप उन्हें दृश्य कितना अच्छा था इसके आधार पर स्कोर देते हैं।
- पुराना तरीका (GRPO): आप उन सभी 8 छात्रों से कहते हैं, "बहुत अच्छा काम किया!" या "बुरा काम किया!" अंतिम दृश्य के आधार पर। आपको इस बात की परवाह नहीं है कि 4 छात्रों ने पहले मील पर गलत रास्ता लिया था।
- LEAF का तरीका: LEAF समूह को देखता है और कहता है, "एक मिनट रुकिए। सभी ने पहला मील एक साथ तय किया। फिर, पहले मील पर, समूह विभाजित हुआ। आइए उन लोगों को देखें जिन्होंने बाईं ओर का रास्ता लिया। क्या उन्हें बेहतर दृश्य मिला? हाँ? तो, 'बायां रास्ता' वाला निर्णय अच्छा था। आइए उन लोगों को देखें जिन्होंने दाईं ओर का रास्ता लिया। क्या उन्हें बदतर दृश्य मिला? हाँ? तो, 'दायां रास्ता' वाला निर्णय बुरा था।"
2. "फोर्क्स" (शाखाओं) को खोजना (The Branching)
स्पीच एआई में, मॉडल एक-एक करके शब्द बनाता है। कभी-कभी, वह भ्रमित हो जाता है या एक जोखिम भरा अनुमान लगाता है। LEAF भ्रम के इन क्षणों (जिन्हें "high-surprisal" बिंदु कहा जाता है) को खोजता है।
इसे एक "चूज़ योर ओन एडवेंचर" (Choose Your Own Adventure) पुस्तक की तरह समझें।
- मॉडल पहले कुछ वाक्य लिखता है।
- LEAF पूछता है: "क्या एआई मॉडल्स के समूह इन पहले वाक्यों पर सहमत थे?"
- यदि वे सहमत थे, तो LEAF इसे एक ठोस "बेस कैंप" मानता है।
- फिर, LEAF उस क्षण को खोजता है जहाँ मॉडल अलग होने लगे या अलग-अलग रास्ते लेने लगे। वह उस स्थान को एक "फोर्क" (Fork) के रूप में चिह्नित करता है।
3. "रिवाइंड और रिवॉर्ड" (Rewind and Reward)
एक बार जब LEAF इन फोर्क्स को खोज लेता है, तो यह टेप को रिवाइंड करता है। यह प्रतिक्रियाओं को उस पथ (path) के आधार पर समूहीकृत करता है जो उन्होंने फोर्क से पहले लिया था।
- यदि प्रतिक्रियाओं के एक समूह ने एक विशिष्ट प्रीफिक्स (वाक्य की शुरुआत) साझा किया और फिर एक उच्च स्कोर प्राप्त किया, तो LEAF विशेष रूप से उस शुरुआती भाग को अतिरिक्त क्रेडिट देता है।
- यदि एक समूह ने एक प्रीफिक्स साझा किया लेकिन फिर कम स्कोर प्राप्त किया, तो LEAF उस भाग को नकारात्मक क्रेडिट देता है, जो मॉडल को बताता है, "अपने वाक्यों की शुरुआत इस तरह से न करें।"
यह एक कोच की तरह है जो कहता है, "आपने पहला लैप बिल्कुल सही दौड़ा, लेकिन आप 50-मीटर के निशान पर लड़खड़ा गए। आइए हम उस विशिष्ट 50-मीटर वाले हिस्से को ठीक करने पर ध्यान केंद्रित करें, न कि पूरी दौड़ पर।"
यह एक बड़ी बात क्यों है?
पेपर का दावा है कि इस "रिट्रोस्पेक्टिव ट्री" (retrospective tree) पद्धति का उपयोग करके, LEAF एआई को पुराने तरीके की तुलना में बहुत बेहतर तरीके से सिखाता है, वह भी कम संसाधनों के साथ।
- स्मार्ट लर्निंग: यह एआई को केवल इसलिए बुरी आदतें सीखने से रोकता है क्योंकि अंत भाग्यशाली था, या अच्छी आदतें सीखने से रोकता है क्योंकि अंत दुर्भाग्यपूर्ण था।
- दक्षता (Efficiency): इसे सीखने के लिए नए किस्से/कहानियाँ बनाने की आवश्यकता नहीं है। यह केवल उन कहानियों का पुन: विश्लेषण करता है जो इसने पहले ही बनाई हैं, और उनके भीतर छिपी संरचना को खोजता है।
- बेहतर परिणाम: पेपर दिखाता है कि LEAF के साथ प्रशिक्षित मॉडल ऑडियो और स्पीच अनुवाद के बारे में सवालों के जवाब देने में पुराने तरीके से प्रशिक्षित मॉडलों की तुलना में बेहतर हैं। वास्तव में, LEAF के साथ प्रशिक्षित एक छोटा मॉडल, पुराने तरीके से प्रशिक्षित एक बहुत बड़े मॉडल से बेहतर प्रदर्शन करता है।
निचोड़ (The Bottom Line)
LEAF स्पीच एआई के लिए एक नया प्रशिक्षण तकनीक है जो पूरी बातचीत को एक एकल "अच्छी" या "बुरी" घटना के रूप में मानना बंद कर देता है। इसके बजाय, यह बातचीत को छोटे खंडों में तोड़ता है, सटीक रूप से पहचानता है कि एआई ने कब अच्छा या बुरा निर्णय लिया, और केवल उन विशिष्ट क्षणों को क्रेडिट (या दोष) देता है। यह एक ऐसे शिक्षक से अपग्रेड करने जैसा है जो एक साथ पूरे निबंध को ग्रेड देता है, बजाय उस शिक्षक के जो ठीक से बताता है कि किन वाक्यों पर काम करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।