← नवीनतम पेपर
💬 NLP

Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation

यह शोध पत्र ट्रजेक्टरी-शेप्ड डिस्क्रीट फ्लो मैचिंग (TS-DFM) प्रस्तुत करता है, जो एक डिस्टिलेशन विधि है जो प्रशिक्षण के दौरान शिक्षक प्रक्षेपवक्रों (trajectories) में अंधे स्टोकेस्टिक जंप्स को ऊर्जा-निर्देशित नेविगेशन से बदल देती है, जिससे एक कुछ-चरण वाला छात्र मॉडल मल्टी-स्टेप शिक्षकों और बड़े बेसलाइनों की तुलना में काफी कम परप्लेक्सिटी और तेज़ इन्फरेंस प्राप्त करने में सक्षम होता है।

मूल लेखक: Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को एक आदर्श कहानी लिखना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: "अंधा छलांग लगाने वाला" शिक्षक
अतीत में, शोधकर्ता डिस्क्रीट फ्लो मैचिंग (DFM) नामक एक विधि का उपयोग करते थे। इस शिक्षक को ऐसे सोचने के बारे में सोचें जो एक खाली पन्ने से एक पूरी कहानी तक पहुँचने के लिए छात्र का मार्गदर्शन करने की कोशिश करता है, लेकिन वह इसे बहुत ही अजीब तरीके से करता है।

शिक्षक एक पन्ने से शुरुआत करता है जो रैंडम बड़बड़ाहट (जैसे "बिल्ली चटाई पर बैठी" और "बैंगनी केला उड़ रहा" का मिश्रण) से भरा होता है। अंतिम कहानी तक पहुँचने के लिए, शिक्षक को सैकड़ों छोटे, अंधे अनुमान लगाने होते हैं। हर एक कदम पर, उन्हें निर्णय लेना होता है: "क्या मुझे यह शब्द बदलना चाहिए? यदि हाँ, तो किस शब्द में?"

समस्या यह है कि शिक्षक यह निर्णय परिणाम देखे बिना लेता है। यह एक अंधे जंगल में चलने जैसा है, एक कदम उठाना और यह उम्मीद करना कि आपने किसी बारूद के ढेर पर पैर नहीं रखा। यदि शिक्षक शुरुआत में एक गलत अनुमान लगा देता है (जैसे "cat" को "bat" में बदल देना जब उसे "cat" होना चाहिए था), तो वह गलती वहीं लॉक हो जाती है। उसके बाद का हर एक कदम इसी गलती पर आधारित होना चाहिए। जब तक शिक्षक 1,000वाँ कदम पूरा करता है, कहानी गलतियों से भरी होती है, लेकिन छात्र को उस बिखरी हुई, त्रुटिपूर्ण संस्करण को याद करने के लिए मजबूर किया जाता है क्योंकि यही एकमात्र उदाहरण था जो उसे दिया गया था।

नया विचार: "ट्रैजेक्टरी ही शिक्षक है"
इस शोध पत्र के लेखक तर्क देते हैं कि समस्या यह नहीं है कि छात्र पर्याप्त बुद्धिमान नहीं है; समस्या यह है कि शिक्षक का रास्ता टूटा हुआ है। शिक्षक बहुत अधिक अंधे अनुमान लगा रहा है।

वे एक नई विधि प्रस्तावित करते हैं जिसे TS-DFM (ट्रैजेक्टरी-शेप्ड डिस्क्रीट फ्लो मैचिंग) कहा जाता है। यह कैसे काम करता है, इसे एक सरल उपमा के माध्यम से समझते हैं:

दिशा-सूचक यंत्र (कम्पास) की उपमा

कल्पना कीजिए कि शिक्षक फिर से अंधे जंगल में चल रहा है, लेकिन अब उसके पास एक जादुई दिशा-सूचक यंत्र (कम्पास) है (जिसे "एनर्जी कम्पास" कहा जाता है)।

  1. अंधा छलांग (पुराना तरीका): शिक्षक एक कदम उठाने की कोशिश करता है और बस एक रैंडम दिशा चुन लेता है।
  2. निर्देशित छलांग (नया तरीका): कदम उठाने से पहले, शिक्षक रुकता है। वह कल्पना करता है कि वह पाँच अलग-अलग संभावित पथों में से कौन से रास्ते ले सकता है। वह अपना जादुई कम्पास ऊपर उठाता है, जो तुरंत उसे बताता है कि उन पाँच में से कौन सा पथ सबसे सुसंगत और उच्च गुणवत्ता वाली कहानी की ओर ले जाता है।
    • पथ A: "बिल्ली चटाई पर बैठी।" (अच्छा)
    • पथ B: "चमगादड़ चटाई पर बैठा।" (ठीक है, लेकिन अजीब)
    • पथ C: "बिल्ली टोपी पर बैठी।" (गलत संदर्भ)
    • ...और इसी तरह।

कम्पास कहता है, "पथ A के साथ जाओ।" शिक्षक फिर वह विशिष्ट, उच्च-गुणवत्ता वाला कदम उठाता है।

दो-चरणों वाली रणनीति

यह शोध पत्र इस कम्पास के लिए एक चतुर दो-चरणीय प्रक्रिया का वर्णन करता है:

  1. बड़ी तस्वीर की जाँच (सीक्वेंस चरण): कम्पास पूरे वाक्य को देखता है। यह अब तक के कहानी के सबसे अच्छे समग्र संस्करण को चुनता है। यह सुनिश्चित करता है कि कहानी बेतुकी बातों की ओर न भटक जाए।
    2.बारीक ट्यूनिंग की जाँच (टोकन चरण): भले ही पूरा वाक्य अच्छा दिखे, लेकिन एक विशिष्ट शब्द थोड़ा गलत हो सकता है। सिस्टम फिर व्यक्तिगत शब्दों के बारे में शिक्षक की अपनी "अंतरात्मा की आवाज़" (गणितीय आत्मविश्वास) की जाँच करता है। यदि शिक्षक बहुत आश्वस्त है कि एक शब्द "sat" होना चाहिए लेकिन पथ ने "sit" को चुना है, तो सिस्टम चुपचाप इसे वापस बदल देता है।

महत्वपूर्ण बात यह है कि यह कम्पास केवल तब उपयोग किया जाता है जब शिक्षक प्रशिक्षण (training) कर रहा होता है। एक बार जब छात्र सबक सीख जाता है, तो कम्पास फेंक दिया जाता है। छात्र को बाद में कहानी लिखने के लिए इसकी आवश्यकता नहीं होती; उन्हें बस उस सही पथ को याद रखने की आवश्यकता है जो शिक्षक ने उन्हें दिखाया था।

परिणाम: तेज़ और स्मार्ट

इस शोध पत्र का परीक्षण 170-मिलियन-पैरामीटर वाले मॉडल (एक मध्यम आकार का AI) पर किया गया।

  • गति: पुराने तरीके को एक वाक्य लिखने के लिए 1,024 चरणों की आवश्यकता थी। नया तरीका इसे केवल 8 चरणों में कर देता है। यह 128 गुना तेज़ है।
  • गुणवत्ता: भले ही नया तरीका 128 गुना तेज़ है, फिर भी कहानियाँ जो यह लिखता है वे वास्तव में बेहतर (कम "परप्लेक्सिटी", जिसका अर्थ है कम भ्रम और अधिक सुसंगतता) होती हैं, जो 1,024-चरण वाले धीमे शिक्षक की तुलना में है।
  • "बॉटलनेक" (अवरोध): यह शोध पत्र सिद्ध करता है कि इन AI मॉडलों की श्रेष्ठता की सीमा उनके छात्र के मस्तिष्क के आकार में नहीं है; बल्कि उस पथ की गुणवत्ता में है जो उनका शिक्षक उन्हें दिखाता है। पथ को ठीक करके, आप परिणाम को ठीक करते हैं।

सारांश

इसे गाड़ी चलाना सीखने की तरह समझें।

  • पुराना तरीका: एक ड्राइविंग इंस्ट्रक्टर जो सड़क की जांच किए बिना आपको बाएं, दाएं या सीधा मुड़ने के लिए कहता है, जिससे वह हजारों छोटे, रैंडंड मोड़ लेता है। आप गाड़ी चलाना सीखते हैं, लेकिन आप एक गड्ढे में जा गिरते हैं।
  • नया तरीका (TS-DFM): इंस्ट्रक्टर के पास एक GPS (कम्पास) है। हर मोड़ से पहले, वह पाँच संभावित मार्गों की जाँच करता है, सबसे सुरक्षित वाला चुनता है, और आपका मार्गदर्शन करता है। आप केवल कुछ ही मोड़ों में परफेक्ट रास्ता सीख जाते हैं।

यह शोध पत्र दिखाता है कि प्रशिक्षण के दौरान शिक्षक को सबसे अच्छा पथ चुनने के लिए एक "कम्पास" देकर, हम AI को बिना गुणवत्ता खोए अविश्वसनीय रूप से तेज़ी से टेक्स्ट लिखना सिखा सकते हैं। यह रैंडम टेक्स्ट और उस टेक्स्ट दोनों के लिए काम करता है जो "मास्क्स" (छिपे हुए शब्दों) के साथ शुरू होता है, जिससे एक ऐसी समस्या हल होती है जिसे पिछले तरीकों ने अच्छी तरह से नहीं संभाला था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →