← नवीनतम पेपर
💬 NLP

TABES: Trajectory-Aware Backward-on-Entropy Steering for Masked Diffusion Models

TABES ने Backward-on-Entropy (BoE) Steering पेश किया है, जो एक ग्रेडिएंट-निर्देशित इन्फरेंस फ्रेमवर्क है जो एक सिंगल बैकवर्ड पास और एक स्पार्स अटेंशन मैकेनिज्म का उपयोग करके Masked Diffusion Models में भविष्य की अनिश्चितता को कम करता है, जो कि महंगी सर्च-आधारित सैंपलिंग के लिए एक अधिक कुशल और गणितीय रूप से सिद्धांत-आधारित विकल्प प्रदान करता है।

मूल लेखक: Shreshth Saini, Avinab Saha, Balu Adsumilli, Neil Birkbeck, Yilin Wang, Alan C. Bovik

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shreshth Saini, Avinab Saha, Balu Adsumilli, Neil Birkbeck, Yilin Wang, Alan C. Bovik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल जिग्सॉ पज़ल (jigsaw puzzle) को हल करने की कोशिश कर रहे हैं, लेकिन इसमें एक मोड़ है: आपके पास डिब्बे पर बनी तस्वीर नहीं है, और आप एक बार में केवल कुछ ही टुकड़ों को देख सकते हैं।

वर्तमान में, अधिकांश AI मॉडल (विशेष रूप से "मास्क्ड डिफ्यूजन मॉडल्स") एक ऐसे व्यक्ति की तरह काम करते हैं जो केवल अपने हाथ में मौजूद टुकड़े को देखता है। वे कहते हैं, "मुझे 90% यकीन है कि यह नीला टुकड़ा यहाँ लगेगा," और वे उसे अपनी जगह पर फिट कर देते हैं। समस्या यह है कि यदि वे शुरुआत में ही बहुत सारे "आसान" टुकड़ों को गलत जगह पर फिट कर देते हैं, तो वे एक "जाल" (trap) बना देते हैं। जब तक उन्हें अपनी गलती का एहसास होता है, तब तक बाकी के पज़ल को उस गलती के इर्द-गिर्द फिट होने के लिए मजबूर होना पड़ता है। शोधकर्ता इसे "ट्रैजेक्टरी लॉक-इन" (Trajectory Lock-in) कहते हैं।

शोध पत्र, TABES, इस पज़ल को हल करने का एक स्मार्ट तरीका पेश करता है।

मुख्य विचार: "क्रिस्टल बॉल" रणनीति

केवल अपने हाथ में मौजूद टुकड़े को देखने के बजाय, शोधकर्ताओं ने AI को एक "क्रिस्टल बॉल" दे दी है।

एक टुकड़ा तय करने से पहले, AI एक त्वरित "क्या होगा अगर" (what if) सिमुलेशन करता है। वह पूछता है: "अगर मैं इस टुकड़े को यहाँ रखता हूँ, तो बाकी का पज़ल कितना स्पष्ट हो जाएगा?"

तकनीकी शब्दों में, वे केवल कॉन्फिडेंस (मैं इस एक टुकड़े के बारे में कितना आश्वस्त हूँ?) नहीं देख रहे हैं; वे इन्फॉर्मेशन गेन (यह टुकड़ा मुझे बाकी के पज़ल को सुलझाने में कितनी मदद करेगा?) की तलाश कर रहे हैं।

रूपक: जासूस बनाम तेज़ पाठक (The Detective vs. The Speed-Reader)

  • पुराना तरीका (Greedy Sampling): एक ऐसे जासूस की कल्पना करें जो केवल सबसे आसान, सबसे स्पष्ट सुरागों का पीछा करता है। उन्हें एक पदचिह्न मिलता है और वे तुरंत मान लेते हैं कि वही कातिल है। वे तेज़ी से चलते हैं, लेकिन अक्सर गलत व्यक्ति का पीछा करने लगते हैं क्योंकि उन्होंने उन सूक्ष्म सुरागों को नज़रअंदाज़ कर दिया जो सब कुछ बदल सकते थे।
  • TABES का तरीका (BoE Steering): यह जासूस अधिक रणनीतिक है। वे एक आसान सुराग देख सकते हैं, लेकिन वे सोचते हैं, "रुको, अगर मैं खिड़की पर उस अजीब से धब्बे की जांच करूँ, तो शायद यह पूरे मकसद (motive) को उजागर कर दे।" वे उन "महत्वपूर्ण" (pivotal) सुरागों को प्राथमिकता देते हैं—जो पूरे मामले को खोल देते हैं—भले ही वे सुराग शुरू में खोजने में कठिन हों।

वे इसे धीमे हुए बिना कैसे करते हैं? ("ActiveQuery" ट्रिक)

आमतौर पर, "आगे की सोच रखना" AI को अविश्वसनीय रूप से धीमा बना देता है क्योंकि इसे हजारों भविष्य की स्थितियों का सिमुलेशन करना पड़ता है। यह एक शतरंज खिलाड़ी की तरह है जो हर संभव चाल के लिए हर संभव टुकड़े की गणना करने की कोशिश करता है—एक चाल चलने में ही उसे वर्षों लग जाएंगे।

शोधकर्ताओं ने ActiveQueryAttention नामक एक शॉर्टकट का आविष्कार किया है।

इसे एक स्पॉटलाइट की तरह समझें। AI द्वारा आगे सोचने के लिए पूरे संसार की पुनर्गणना करने की कोशिश करने के बजाय, यह केवल उस विशिष्ट क्षेत्र पर एक चमकदार रोशनी डालता है जिस पर वह विचार कर रहा है। यह "बैकग्राउंड नॉइज़" (पृष्ठभूमि के शोर) को अनदेखा कर देता है जिसे वह वर्तमान में काम नहीं कर रहा है। यह AI को "स्मार्ट" और "आगे देखने" में सक्षम बनाता है, बिना उस भारी धीमेपन के जो गहरी सोच के लिए आमतौर पर आवश्यक होता है।

यह क्यों मायने रखता है?

शोधकर्ताओं ने गणित और कंप्यूटर कोडिंग जैसे जटिल कार्यों पर इसका परीक्षण किया।

  1. बेहतर सटीकता: क्योंकि AI वाक्य या समीकरण के "भार वहन करने वाले" (load-bearing) हिस्सों को पहले चुनता है, इसलिए इसके "हैलुसिनेट" (मनगढ़ंत बातें बनाने) या तार्किक लूप में फंसने की संभावना बहुत कम होती है।
  2. दक्षता (Efficiency): यह एक "स्वीट स्पॉट" पर पहुँचता है जहाँ यह पुराने तरीकों की तुलना में बहुत स्मार्ट है, लेकिन इसे अन्य "स्मार्ट" तरीकों की तरह भारी, महंगी कंप्यूटिंग शक्ति की आवश्यकता नहीं होती है।

संक्षेप में: TABES AI को एक "तेज़ पाठक" बनने के बजाय एक "रणनीतिकार" बनना सिखाता है जो पूरी कहानी की कुंजी की तलाश करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →