← नवीनतम पेपर
💬 NLP

Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context

यह शोध पत्र क्वांटटाइल टोकन रिग्रेशन (Quantile Token Regression) प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो इनपुट अनुक्रमों में समर्पित क्वांटटाइल टोकन सम्मिलित करता है और उन्हें प्रत्यक्ष इनपुट-आउटपुट पथों और स्थानीय ग्राउंडिंग को सक्षम करने के लिए रिट्रीवल-आधारित पड़ोसी संदर्भ (retrieval-based neighbor context) के साथ संवर्धित करता है, जिससे यह LLM-आधारित वितरण संबंधी रिग्रेशन कार्यों में मौजूदा बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Yilun Zhu, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Moyan Li, Mohsen Bayati, Bryan Wang, Shervin Malmasi

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilun Zhu, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Moyan Li, Mohsen Bayati, Bryan Wang, Shervin Malmasi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी घर के विवरण को पढ़कर, जिसे आपने पहले कभी नहीं देखा, उसकी कीमत का अनुमान लगाने की कोशिश कर रहे हैं।

पुराना तरीका (द "सिंगल गेस" समस्या):
आज के अधिकांश AI मॉडल एक घबराए हुए रियल एस्टेट एजेंट की तरह काम करते हैं जो आपको केवल एक संख्या देता है। "इस घर की कीमत 500,000है।"लेकिनक्याहोगाअगरबाजारअनिश्चितहो?क्याहोगाअगरयह500,000 है।" लेकिन क्या होगा अगर बाजार अनिश्चित हो? क्या होगा अगर यह 400k या $600k हो सकता है? पुराना AI आपको यह नहीं बताता। यह केवल एक एकल पॉइंट एस्टीमेट (point estimate) देता है, अनिश्चितता को नजरअंदाज कर देता है।

यहाँ तक कि नए AI मॉडल जो कीमतों की एक रेंज (सीमा) बताने की कोशिश करते हैं, वे अक्सर एक "बॉटलनेक" (bottleneck) दृष्टिकोण का उपयोग करते हैं। कल्पना कीजिए कि AI घर के विवरण को पढ़ता है, उस सारी जानकारी को एक एकल, नन्हे से मानसिक नोट में सिकोड़ देता है, और फिर केवल उस एक छोटे से नोट के आधार पर 99 अलग-अलग कीमतें (सबसे सस्ती से लेकर सबसे महंगी तक) अनुमानित करने की कोशिश करता है। यह एक ही बूंद पेंट का उपयोग करके एक उत्कृष्ट कृति (masterpiece) बनाने जैसा है। घर के विवरण और विशिष्ट मूल्य अनुमानों के बीच का संबंध कमजोर और अप्रत्यक्ष होता है।

नया तरीका (द "क्वांटाइल टोकन" दृष्टिकोण):
यह पेपर AI को यह सिखाने का एक स्मार्ट तरीका पेश करता है कि कैसे केवल एक संख्या के बजाय संभावनाओं की एक पूरी श्रृंखला (डिस्ट्रीब्यूशन) की भविष्यवाणी की जाए। इसके लिए वे दो मुख्य तरकीबों का उपयोग करते हैं:

1. "विशेषज्ञ इंटर्न" (क्वांटाइल टोकन)

AI को एक ही छोटे से मानसिक नोट से सभी 99 कीमतें अनुमानित करने के बजाय, लेखक AI को 99 विशेषज्ञ इंटर्न देते हैं।

  • प्रत्येक इंटर्न को एक विशिष्ट कार्य सौंपा गया है: एक 10वें पर्सेंटाइल (सबसे "सस्ती" कीमत) का अनुमान लगाता है, दूसरा 50वें (मध्यम/median) का, और तीसरा 90वें (सबसे "महंगी" कीमत) का।
  • जादू: ये इंटर्न सीधे घर के विवरण से बात कर सकते हैं। "सस्ती कीमत" वाला इंटर्न विवरण को देखता है और सोचता है, "ओह, यह घर छोटा है और एक खराब इलाके में है, इसलिए मैं कम कीमत का अनुमान लगाऊंगा।" "महंगी कीमत" वाला इंटर्न उसी विवरण को देखता है लेकिन सोचता है, "लेकिन इसमें एक शानदार दृश्य और नए उपकरण हैं, इसलिए मैं उच्च कीमत का अनुमान लगाऊंगा।"
  • यह क्यों काम करता है: उन्हें सब कुछ एक नोट में नहीं दबाना पड़ता। प्रत्येक इंटर्न अपने विशिष्ट अनुमान के लिए घर की अपनी विशेष समझ विकसित करता है। यह पूरे मूल्य रेंज की एक बहुत अधिक स्पष्ट और सटीक तस्वीर बनाता है।

2. "पड़ोस की निगरानी" (रिट्रीवल-ऑगमेंटेड कॉन्टेक्स्ट)

इंसान शून्य में कीमतों का अनुमान नहीं लगाते। यदि आप जानना चाहते हैं कि एक घर की कीमत क्या है, तो आप पास के समान घरों को देखते हैं।

  • लेखक AI को भी यही करना सिखाते हैं। भविष्यवाणी करने से पहले, AI अपने डेटाबेस में 8 ऐसे घर खोजता है जो आपके द्वारा पूछे गए घर के बहुत समान दिखते हैं।
  • ट्विस्ट: यह केवल उन समान घरों की कीमत को नहीं देखता है। यह उन समान घरों की कीमतों के पूरे इतिहास को देखता है। यह देखता है कि इस पड़ोस में समान घर आमतौर पर 450kऔर450k और 550k के बीच बिकते हैं, जिनमें कुछ मामले $600k तक भी जाते हैं।
  • यह क्यों काम करता है: यह AI को "स्थानीय साक्ष्य" (local evidence) प्रदान करता है। यह इसकी भविष्यवाणी को वास्तविकता में स्थापित करता है। यदि AI देखता है कि समान घरों की कीमत की सीमा बहुत विस्तृत है, तो वह आपके घर के लिए भी एक विस्तृत सीमा की भविष्यवाणी करता है। यदि समान घर बहुत स्थिर हैं, तो वह एक संकीर्ण (narrow) सीमा की भविष्यवाणी करता है।

परिणाम: सटीक और स्मार्ट भविष्यवाणियाँ

जब उन्होंने वास्तविक दुनिया के डेटा (जैसे Airbnb लिस्टिंग और Stack Overflow के सवाल कि उत्तर मिलने में कितना समय लगता है) पर इसका परीक्षण किया, तो परिणाम प्रभावशाली थे:

  • अधिक सटीक: AI के अनुमान सच्चाई के बहुत करीब थे।
  • तंग रेंज (Tighter Ranges): यह कहने के बजाय कि "कीमत 100और100 और 1,000,000 के बीच है" (जो तकनीकी रूप से सही है लेकिन बेकार है), AI ने कहा, "कीमत संभवतः 480kऔर480k और 520k के बीच है।"
  • कम डेटा के लिए बेहतर: यह तरीका विशेष रूप से तब चमका जब सीखने के लिए बहुत अधिक डेटा उपलब्ध नहीं था। यह एक स्मार्ट छात्र की तरह था जो कम पाठ्यपुस्तक होने के बावजूद परीक्षा में उत्कृष्ट प्रदर्शन कर सकता था क्योंकि उसे अपने "इंटर्न" और "पड़ोसियों" का प्रभावी ढंग से उपयोग करना पता था।

"लॉस फंक्शन" का सबक (द स्कोरकार्ड)

इस पेपर ने यह भी पता लगाया कि AI को कैसे ग्रेड किया जाए।

  • कुछ शिक्षक (लॉस फंक्शन्स) केवल इस बात पर ध्यान देते हैं कि AI ने औसत को सही पकड़ा या नहीं, और चरम सीमाओं (extremes) को नजरअंदाज कर देते हैं।
  • लेखकों ने एक बेहतर "स्कोरकार्ड" (जिसे Wasserstein loss कहा जाता है) पाया जो AI को पूरे वितरण के आकार (shape of the distribution) को सही करने के लिए पुरस्कृत करता है। यह केवल एक छात्र के अंतिम परीक्षा स्कोर को ग्रेड करने के बजाय, इस बात पर ग्रेड देने जैसा है कि उसने पूरे पाठ्यक्रम को कितनी अच्छी तरह समझा है, जिसमें कठिन हिस्से भी शामिल हैं।

संक्षेप में

यह पेपर AI को केवल एकल संख्या का अनुमान लगाने के बजाय संभावनाओं की पूरी कहानी बताने के लिए प्रशिक्षित करता है। यह ऐसा इसलिए करता है क्योंकि यह AI को कहानी के हर हिस्से के लिए विशेषज्ञों देता है और इसे वास्तविकता में जमीनी स्तर पर रखने के लिए समान उदाहरणों के पड़ोस से परामर्श करने देता है। परिणाम स्वरूप, एक ऐसा मॉडल मिलता है जो अनिश्चितता को बेहतर समझता है और आपको बहुत अधिक उपयोगी और सटीक भविष्यवाणियाँ देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →