← नवीनतम पेपर
🤖 machine learning

Language Modeling with Hyperspherical Flows

यह शोध पत्र S\mathbb{S}-FLM को प्रस्तुत करता है, जो एक हाइपरस्फेरिक लेटेंट फ्लो लैंग्वेज मॉडल है जो एक हाइपरस्फीयर पर वेक्टर रोटेशन के माध्यम से अनुक्रमों (sequences) को उत्पन्न करके पिछले फ्लो-आधारित दृष्टिकोणों की स्केलेबिलिटी और अर्थ संबंधी सीमाओं को दूर करता है, जिससे बड़े-शब्दावली वाले तर्क कार्यों (large-vocabulary reasoning tasks) पर प्रदर्शन में महत्वपूर्ण सुधार होता है और मास्क किए गए डिफ्यूजन मॉडल्स के साथ अंतर कम होता है।

मूल लेखक: Justin Deschenaux, Caglar Gulcehre

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Justin Deschenaux, Caglar Gulcehre

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: AI के साथ लिखने का एक नया तरीका

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना या गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं। वर्तमान में, सबसे अच्छे रोबोट (जिन्हें ऑटोरेग्रेसिव मॉडल कहा जाता है) एक व्यक्ति की तरह टाइपराइटर पर लिखते हैं: वे एक बार में एक अक्षर लिखते हैं, बाएं से दाएं। वे आगे नहीं देख सकते, और उन्हें अगला शब्द शुरू करने से पहले एक शब्द पूरा करना पड़ता है। यह धीमा है।

अन्य शोधकर्ताओं ने ऐसे रोबोट बनाने की कोशिश की जो पूरे वाक्य को एक साथ लिख सकें, जैसे एक चित्रकार कैनवास को भरता है। इन्हें डिफ्यूजन मॉडल कहा जाता है। हालांकि, टेक्स्ट के लिए इनके शुरुआती प्रयासों में दो बड़ी समस्याएं थीं:

  1. वे बहुत भारी थे: उन्होंने हर शब्द को संख्याओं की एक विशाल, अलग सूची (जैसे एक विशाल स्प्रेडशीट) के रूप में माना, जिससे उन्हें प्रशिक्षित करना धीमा और महंगा हो गया।
  2. वे भ्रमित हो जाते थे: जब वे एक अव्यवस्थित वाक्य को "साफ" करने की कोशिश करते थे, तो उन्हें समझ नहीं आता था कि किस दिशा में जाना है क्योंकि उनके द्वारा उपयोग किया जाने वाला गणित शब्दों के लिए तर्कसंगत नहीं था।

यह पेपर S-FLM (हाइपरस्फेरिकल फ्लो लैंग्वेज मॉडल) पेश करता है। यह रोबोट को लिखने सिखाने का एक नया तरीका है जो तेज़ है, हल्का है, और "शोर" (noise) से "अर्थ" (meaning) तक पहुँचने के मामले में अधिक समझदार है।


पुराने तरीके के साथ समस्या: "वन-हॉट" सूटकेस

कल्पना कीजिए कि आपके पास 50,000 शब्दों का शब्दकोश है।

  • पुराना तरीका (FLMs): "Cat" शब्द को दर्शाने के लिए, पुराने मॉडलों ने 50,000 स्लॉट वाला एक सूटकेस इस्तेमाल किया। उन्होंने "Cat" वाले स्लॉट में एक मार्बल रखा और बाकी 49,999 स्लॉट खाली छोड़ दिए। "Dog" को दर्शाने के लिए, वे मार्बल को "Dog" वाले स्लॉट में ले जाते थे।
    • समस्या: हर एक शब्द के लिए 50,000 स्लॉट वाला सूटकेस ले जाना अविश्वसनीय रूप से भारी और धीमा है। साथ ही, गणितीय रूप से, इस प्रणाली में "Cat" और "Dog" उतने ही दूर हैं जितने "Cat" और "Zebra", जो कि तर्कसंगत नहीं है क्योंकि कुछ शब्द दूसरों की तुलना में अधिक समान होते हैं।

S-FLM समाधान: "हाइपरस्फीयर" डांस फ्लोर

लेखकों ने उन विशाल सूटकेसों का उपयोग करना बंद करने का निर्णय लिया। इसके बजाय, उन्होंने सभी शब्दों को एक विशाल, बहु-आयामी डांस फ्लोर (जिसे हाइपरस्फीयर कहा जाता है) पर रख दिया।

  • रूपक (Metaphor): एक विशाल गेंद की कल्पना करें जहाँ उसकी सतह पर प्रत्येक बिंदु एक शब्द का प्रतिनिधित्व करता है। "Cat" सतह पर एक बिंदु है। "Dog" पास का एक अन्य बिंदु है। "Zebra" उससे दूर है।
  • यह कैसे काम करता है: उस विशाल सूटकेस को ले जाने के बजाय, मॉडल बस इस गेंद पर एक एकल बिंदु को थामे रहता है। शब्द बदलने के लिए, वह मार्बल को बदलता नहीं है; बल्कि वह गेंद की सतह पर बिंदु को घुमाता (rotate) है।
  • यह बेहतर क्यों है:
    • हल्का (Lightweight): अब आपको 50,000-स्लॉट वाले भारी सूटकेस की आवश्यकता नहीं है। आपको बस एक छोटा समन्वय तंत्र (जैसे अक्षांश और देशांतर) चाहिए जिससे आप बिंदु की स्थिति बता सकें। इससे प्रशिक्षण बहुत तेज़ और सस्ता हो जाता है।
    • बेहतर गणित: इस डांस फ्लोर पर, बिंदुओं के बीच की दूरी स्वाभाविक रूप से शब्दों की समानता से मेल खाती है। "Cat" और "Dog" पास हैं; "Cat" और "Airplane" दूर हैं। यह टेक्स्ट को "साफ" करने के गणित को बहुत सहज बनाता है।

मॉडल कैसे सीखता है: "डिनोइजिंग" (Denoising) गेम

कल्पना कीजिए कि रोबोट "चित्र पहचानने" का खेल खेल रहा है।

  1. सेटअप: आप रोबोट को एक "बिल्ली" की स्पष्ट तस्वीर दिखाते हैं।
  2. शोर (Noise): आप धीरे-धीरे तस्वीर को धुंधला करते हैं जब तक कि वह स्टैटिक स्नो (रैंडम शोर) जैसा न दिखने लगे।
  3. कार्य: रोबोट को उस स्टैटिक स्नो से सीखना होगा कि डांस फ्लोर पर बिंदु को कैसे घुमाना है ताकि वह वापस "बिल्ली" वाले स्थान पर पहुँच सके।

अतीत में, जब रोबोट शोर को ठीक करने की कोशिश करता था, तो वह कभी-कभी गलत दिशा में घूम जाता था क्योंकि "शोर" का कोई स्पष्ट अर्थ नहीं होता था।

  • S-FLM ट्रिक: क्योंकि मॉडल डांस फ्लोर (हाइपरस्फीयर) पर रहता है, यह शोर को वापस सही शब्द की ओर घुमाने (rotate) के लिए सीखता है, ठीक वैसे ही जैसे रेडियो स्टेशन ट्यून करने के लिए डायल घुमाया जाता है। यह एक विशिष्ट "वेलोसिटी फील्ड" सीखता है—एक मानचित्र कि सही शब्द तक पहुँचने के लिए किस दिशा में घूमना है।

गुप्त नुस्खा (Secret Sauce): शोर को कम करना

लेखकों ने इस खेल में "शोर" के बारे में कुछ दिलचस्प खोजा।

  • समस्या: यदि आप रोबोट को तब सुधारना सिखाते हैं जब तस्वीर लगभग साफ होती है (बहुत थोड़ा सा शोर बचा हो), तो रोबोट भ्रमित हो जाता है। यह घास के ढेर में सुई खोजने जैसा है जब घास का ढेर लगभग खाली हो; रोबोट ज़रूरत से ज़्यादा सोचने लगता है।
  • समाधान: लेखकों ने महसूस किया कि उन्हें रोबोट को तब सिखाना बंद कर देना चाहिए जब तस्वीर बहुत साफ हो। उन्होंने प्रशिक्षण को "ट्रंकेट" (truncate) किया, यानी वे केवल तब सिखाते हैं जब तस्वीर बहुत धुंधली होती है।
  • परिणाम: आसान, लगभग-साफ हिस्सों को अनदेखा करके, रोबोट कठिन पहेलियों को सुलझाने में बहुत बेहतर हो गया। इसने उन्हें गणितीय समस्याओं (GSM8K) और सुडोकू पहेलियों को पहले के प्रयासों की तुलना में बहुत बेहतर तरीके से हल करने में मदद की।

परिणाम: उन्होंने क्या हासिल किया?

पेपर ने इस नए रोबोट का तीन चीजों पर परीक्षण किया:

  1. सुडोकू (Sudoku): इसने मौजूदा सर्वश्रेष्ठ मॉडलों के लगभग बराबर प्रदर्शन किया, लेकिन बहुत हल्के आर्किटेक्चर के साथ।
  2. गणित की समस्याएँ (GSM8K): पिछले "फ्लो" मॉडल गणित में बहुत खराब थे (1% से भी कम सही)। S-FLM ने एक विशिष्ट डिकोडिंग ट्रिक (सबसे अच्छे पथ को चुनना) का उपयोग करके लगभग 18% सही उत्तर दिए। यह एक बड़ी छलांग है, हालांकि यह अभी भी बहुत अच्छे "टाइपराइटर" मॉडलों (जो ~63% प्राप्त करते हैं) से पीछे है।
  3. कहानियाँ लिखना (OpenWebText): इसने टेक्स्ट को उतना ही अच्छा लिखा जितना कि मौजूदा सर्वश्रेष्ठ मॉडल, लेकिन इसने पुराने तरीकों के भारी बोझ के बिना ऐसा किया।

सारांश

S-FLM को एक रोबोट लेखक को एक भारी-भरकम निर्माण श्रमिक (शब्दों के विशाल सूटकेस ले जाने वाले) से एक कुशल नर्तक (एक गोले पर बिंदुओं को घुमाने वाले) में अपग्रेड करने के रूप में देखें।

  • यह प्रशिक्षित करने में तेज़ है क्योंकि यह हल्का है।
  • यह अधिक समझदार है क्योंकि गोले की ज्यामिति (geometry) शब्दों के संबंधों से मेल खाती है।
  • यह तर्क संबंधी कार्यों पर बेहतर काम करता है क्योंकि लेखकों ने ठीक से समझा कि रोबोट को कितने "शोर" के साथ अभ्यास करने की आवश्यकता है।

हालाँकि यह जटिल गणित के लिए सबसे बेहतरीन "टाइपराइटर" मॉडलों को अभी तक नहीं हरा पाया है, लेकिन यह साबित करता है कि यह नया "डांस फ्लोर" दृष्टिकोण AI लेखकों के अगले पीढ़ी के निर्माण के लिए एक शक्तिशाली और कुशल तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →