← नवीनतम पेपर
📊 statistics

PFN-TS: Thompson Sampling for Contextual Bandits via Prior-Data Fitted Networks

यह शोध पत्र PFN-TS का प्रस्ताव करता है, जो एक थॉम्पसन सैंपलिंग एल्गोरिदम है जो शोर वाले भविष्य कहनेवाला वितरणों (predictive distributions) को सबसैम्पल्ड सेंट्रल लिमिट थ्योरम के माध्यम से माध्य-पुरस्कार नमूनों (mean-reward samples) में परिवर्तित करके, एकल फॉरवर्ड पास में बेयसियन पोस्टीरियर्स (Bayesian posteriors) को अनुमानित करने के लिए प्रायर-डेटा फिटेड नेटवर्क्स (Prior-Data Fitted Networks) का लाभ उठाता है, जिससे विभिन्न कॉन्टेक्स्टुअल बैंडिट बेंचमार्क पर मजबूत अनुभवजन्य प्रदर्शन और सैद्धांतिक रिग्रेट बाउंड्स प्राप्त होते हैं।

मूल लेखक: Yan Shuo Tan, Kenyon Ng, Ruizhe Deng, Sumetha Loganathan, Qiong Zhang, Bibhas Chakraborty

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Shuo Tan, Kenyon Ng, Ruizhe Deng, Sumetha Loganathan, Qiong Zhang, Bibhas Chakraborty

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कई अलग-अलग बटनों (कार्यों) वाले एक वेंडिंग मशीन के मैनेजर हैं। हर बार जब कोई ग्राहक आता है, तो उनका एक विशिष्ट मूड या स्थिति (संदर्भ/context) होती है, और आपको यह अनुमान लगाने की आवश्यकता होती है कि कौन सा बटन उन्हें सबसे अच्छा स्नैक (इनाम/reward) देगा। पेच यह है कि आप नहीं जानते कि किस मूड के लिए कौन सा बटन सबसे अच्छा है, और आपको यह तभी पता चलता है जब आप उसे दबा देते हैं। आपका लक्ष्य समय के साथ अधिक से अधिक खुश ग्राहक बनाना है जबकि गलत अनुमान लगाने की संख्या को कम करना है। यह एक "कॉन्टेक्स्टुअल बैंडिट" (Contextual Bandit) समस्या है।

इसे हल करने के लिए, आपको एक ऐसी रणनीति की आवश्यकता है जो एक्सप्लोरिंग (सीखने के लिए नए बटन आज़माना) और एक्सप्लोलेटिंग (उस जानकारी का उपयोग करना जो आप पहले से जानते हैं कि काम करती है) के बीच संतुलन बनाए रखे। थॉम्पसन सैंपलिंग (Thompson Sampling) नामक एक लोकप्रिय रणनीति है। यह एक ऐसे क्रिस्टल बॉल की तरह है जो हर बटन के लिए एक "सबसे अच्छा अनुमान" देता है, लेकिन एक ट्विस्ट के साथ: क्रिस्टल बॉल थोड़ी धुंधली है। यह संभावनाओं की एक सीमा (range) प्रदान करती है। आप उस बटन को चुनते हैं जो इस धुंधले अनुमान में सबसे अच्छा दिखता है, जो स्वाभाविक रूप से आपको उन बटनों को आज़माने के लिए प्रोत्साहित करता है जो बेहतरीन हो सकते हैं लेकिन जिनके बारे में आप अभी निश्चित नहीं हैं।

समस्या: क्रिस्टल बॉल बहुत शोर वाली (Noisy) है

वर्षों से, लोगों ने इन क्रिस्टल बॉल्स को बनाने के लिए सरल मॉडलों (जैसे सीधी रेखाओं) का उपयोग किया है। लेकिन मानवीय व्यवहार सीधा नहीं होता; यह जटिल, अव्यवस्थित और आश्चर्यों से भरा होता है। नए, स्मार्ट मॉडल जिन्हें प्रायर-डेटा फिटेड नेटवर्क्स (PFNs) (जैसे TabPFN) कहा जाता है, अद्भुत हैं। वे "सुपर-ट्रेन्ड शेफ" की तरह हैं जिन्होंने लाखों व्यंजनों का स्वाद चखा है। जब आप उन्हें कुछ सामग्रियां (डेटा) दिखाते हैं, तो वे तुरंत जान जाते हैं कि व्यंजन का स्वाद कैसा होगा, बिना उसे दोबारा पकाए।

हालाँकि, एक अड़चन है। ये सुपर-शेफ अंतिम स्वाद (शोर वाले इनाम) की भविष्यवाणी करने में माहिर हैं, लेकिन थॉम्पसन सैंपलिंग को रेसिपी की अनिश्चितता (अंतर्निहित औसत इनाम) के बारे में जानने की आवश्यकता होती है। शेफ आपको रेसिपी की अनिश्चितता सीधे तौर पर नहीं देते; वे केवल अंतिम व्यंजन देते हैं। रेसिपी की अनिश्चितता का पता लगाने के लिए शेफ को एक मिलियन बार व्यंजन पकाने के लिए कहना एक वास्तविक समय की वेंडिंग मशीन के लिए बहुत धीमा होगा।

समाधान: PFN-TS (एक स्मार्ट शॉर्टकट)

लेखकों ने इस वेंडिंग मशीन समस्या के लिए इन सुपर-शेफ मॉडलों का उपयोग करने का एक नया तरीका बनाया है: PFN-TS

1. "सब-सैम्पल्ड" शॉर्टकट (ज्यामितीय ग्रिड)
हर एक सामग्री संयोजन के लिए शेफ को व्यंजन पकाने के लिए कहने के बजाय (जिसमें बहुत समय लगता है), PFN-TS एक चतुर गणितीय ट्रिक का उपयोग करता है जिसे सब-सैम्पल्ड सेंट्रल लिमिट थ्योरम कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप जानना चाहते हैं कि एक नदी का जल स्तर कितना उतार-चढ़ाव भरा है। आप इसे एक साल तक हर सेकंड माप सकते हैं (बहुत अधिक काम!)। इसके बजाय, PFN-TS विशिष्ट, अंतराल पर जल स्तर को मापता है: दिन 1, दिन 2, दिन 4, दिन 8, दिन 16, और इसी तरह।
  • इन "ज्यामितीय" स्नैपशॉट्स को देखकर, एल्गोरिदम गणितीय रूप से नदी के समग्र उतार-चढ़ाव (अनिश्चितता) का बहुत सटीक अनुमान लगा सकता है, लेकिन बहुत कम प्रयास के साथ। यह सिस्टम को थॉम्पसन सैंपलिंग के लिए आवश्यक "धुंधला क्रिस्टल बॉल" प्राप्त करने की अनुमति देता है बिना प्रक्रिया को धीमा किए।

2. "मेमोरी" ट्रिक (कैशिंग)
पेपर नए "सुपर-शेफ" मॉडलों की एक विशेषता का भी उपयोग करता है जिसे KV-कैशिंग कहा जाता है।

  • उपमा: यदि आप शेफ से पूछते हैं, "क्या होता है अगर मैं नमक डालूँ?" और फिर "क्या होता है अगर मैं नमक और काली मिर्च डालूँ?", तो एक सामान्य शेफ नमक वाला हिस्सा भूल जाएगा और फिर से शुरू करेगा। लेकिन यह विशिष्ट शेफ "नमक" वाले हिस्से को याद रखता है और केवल "काली मिर्च" वाले हिस्से की गणना करता है।
  • PFN-TS इस मेमोरी का उपयोग पिछली गणनाओं को पुन: उपयोग करने के लिए करता है। जब वेंडिंग मशीन कई बटन चेक करती है, तो वह सब कुछ शुरू से फिर से कैलकुलेट नहीं करती; यह केवल उन हिस्सों को अपडेट करती है जो बदले हैं। यह सिस्टम को अविश्वसनीय रूप से तेज़ बनाता है।

3. "शेप-शिफ्टर" (अनुकूली एन्कोडिंग)
कभी-कभी, मशीन के बटन एक-दूसरे से पूरी तरह अलग होते हैं (जैसे सोडा बटन बनाम स्नैक बटन)। अन्य समय में, वे बहुत समान होते हैं (जैसे "तीखा" स्नैक बनाम "हल्का" स्नैक)।

  • Pền-TS में एक अंतर्निहित "शेप-शिफ्टर" है। यह एक ही समय में डेटा को व्यवस्थित करने के दो अलग-अलग तरीकों को आज़माता है। यह देखने के लिए कि कौन सा तरीका बेहतर काम कर रहा है, यह एक स्कोरिंग सिस्टम (CRPS) का उपयोग करता है। यदि बटन समान हैं, तो यह उन्हें एक मॉडल में मिला देता है। यदि वे अलग हैं, तो यह उन्हें अलग रखता है। यह सीखते समय स्वचालित रूप से सबसे अच्छी रणनीति चुनता है।

उन्होंने क्या पाया?

लेखकों ने अपने इस नए सिस्टम (PFN-TS) का कई अन्य तरीकों के विरुद्ध परीक्षण किया, जिसमें शामिल थे:

  • नकली डेटा: जटिल, गैर-रेखीय नियमों (जैसे प्रसिद्ध "फ्रीडमैन" फंक्शन्स) वाले सिम्युलेटेड परिदृश्य।
  • वास्तविक दुनिया का डेटा: OpenML लाइब्रेरी से आठ अलग-अलग डेटासेट (जैसे वयस्क आय या मशरूम के प्रकार की भविष्यवाणी करना)।
  • एक वास्तविक मोबाइल हेल्थ ट्रायल: "ड्रिंक लेस" (Drink Less) ऐप, जिसने यह पता लगाने की कोशिश की कि लोगों को शराब कम पीने में मदद करने के लिए सबसे अच्छी पुश-नोटिफिकेशन रणनीति क्या है।

परिणाम:

  • गैर-रेखीय कार्य (Non-linear tasks): PFN-TS स्पष्ट विजेता था। जब नियम जटिल और अव्यवस्थित थे, तो इसने सभी अन्य तरीकों को पीछे छोड़ दिया।
  • रेखीय कार्य (Linear tasks): जब नियम सरल थे (सीधी रेखाएं), तो इसने मानक रेखीय तरीकों के समान प्रदर्शन किया।
  • मोबाइल हेल्थ: "ड्रिंक लेस" ट्रायल में, PFN-TS ने उच्चतम अनुमानित मूल्य प्राप्त किया, जिसका अर्थ है कि यह लोगों को शराब कम करने में मदद करने के लिए सबसे प्रभावी रणनीति होती।

सारांश में

PFN-TS एक नया टूल है जो एक शक्तिशाली, प्री-ट्रेन्ड AI मॉडल (द "सुपर-शेफ") को अनिश्चित स्थितियों में एक आदर्श निर्णय लेने वाला बनने के लिए सिखाता है। यह अनिश्चितता का तेजी से अनुमान लगाने के लिए एक गणितीय शॉर्टकट का उपयोग करके और तेजी से चलने के लिए एक मेमोरी ट्रिक का उपयोग करके ऐसा करता है। यह स्वचालित रूप से अनुकूलित होता है कि समस्या सरल है या जटिल, जिससे यह सिंथेटिक परीक्षणों और वास्तविक दुनिया के मोबाइल स्वास्थ्य अनुप्रयोगों दोनों के लिए एक शीर्ष प्रदर्शन करने वाला टूल बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →