← नवीनतम पेपर
🤖 machine learning

TabQL: In-Context Q-Learning with Tabular Foundation Models

यह शोध पत्र TabQL का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो शून्य या कुछ-शॉट (zero- or few-shot) Q-वैल्यू अनुमान के माध्यम से तीव्र, इन-कॉन्टेक्स्ट अनुकूलन और बेहतर सैंपल दक्षता को सक्षम करने के लिए डीप Q-लर्निंग में पैरामीट्रिक Q-नेटवर्क को एक टैबुलर फाउंडेशन मॉडल से बदल देता है।

मूल लेखक: Qisai Liu, Zhanhong Jiang, Timilehin Ayanlade, Ashutosh Kumar Nirala, Yang Li, Aditya Balu, Soumik Sarkar

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qisai Liu, Zhanhong Jiang, Timilehin Ayanlade, Ashutosh Kumar Nirala, Yang Li, Aditya Balu, Soumik Sarkar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में रास्ता खोजना सिखा रहे हैं। पुराना तरीका (जिसे Deep Q-Learning या DQN कहा जाता है) ऐसा है जैसे रोबोट को हर मोड़, हर गलती और हर इनाम को रटने के लिए मजबूर करना, जहाँ वह हर कदम के साथ गणितीय गणनाओं के माध्यम से अपने "दिमाग" (न्यूरल नेटवर्क) को लगातार फिर से लिखता रहता है। यह काम तो करता है, लेकिन यह धीमा है, इसमें लाखों कदमों की आवश्यकता होती है, और यदि भूलभुलैया थोड़ी भी बदल जाए, तो रोबोट अक्सर जो उसने सीखा है उसे भूल जाता है।

यह शोध पत्र एक नई विधि पेश करता है जिसे TabQL (Tabular Q-Learning) कहा जाता है। TabQL को एक सुपर-स्मार्ट, प्री-ट्रेन्ड ट्यूटर (शिक्षक) देने जैसा समझें जिसे शून्य से फिर से प्रशिक्षित करने की आवश्यकता नहीं है। अपने दिमाग को फिर से लिखने के बजाय, रोबोट बस अपने हालिया अनुभवों का एक छोटा सा "चीट शीट" (cheat sheet) अपने ट्यूटर को दिखाता है, और ट्यूटर तुरंत सबसे अच्छा कदम तय कर लेता है।

यहाँ बताया गया है कि सरल उपमाओं (analogies) का उपयोग करके TabQL कैसे काम करता है:

1. दो-चरणीय नृत्य: वार्म-अप और स्विच

TabQL सीधे नए तरीके पर नहीं कूदता है। यह एक दो-चरण वाला दृष्टिकोण अपनाता है:

  • चरण 1: वार्म-अप (द "ट्रेनिंग व्हील्स" चरण):
    सबसे पहले, रोबोट कुछ समय के लिए पुराने, मानक तरीके (DQN) का उपयोग करता है। कल्पना कीजिए कि एक छात्र बुनियादी गणित के अभ्यास कर रहा है। यहाँ लक्ष्य तुरंत मास्टर बनना नहीं है, बल्कि नोट्स का एक अच्छा सेट तैयार करना है। रोबोट भूलभुलैया में थोड़ा घूमता है, कुछ गलतियाँ करता है, और डेटा (अवस्था, क्रिया, इनाम) का एक छोटा "रीप्ले बफर" एकत्र करता है। यह सुनिश्चित करता है कि नए सिस्टम में स्विच करने से पहले रोबोट को एक मोटा अंदाज़ा हो जाए कि वह कहाँ जा रहा है।

  • चरण 2: स्विच (द "कॉन्टेक्स्ट" चरण):
    एक बार जब रोबोट के पास पर्याप्त नोट्स हो जाते हैं, तो वह TabQL पर स्विच कर जाता है। जटिल गणितीय अपडेट करने के बजाय, रोबोट अपने सबसे हालिया "नोट्स" (हाल के अनुभवों की एक छोटी विंडो) को लेता है और उन्हें एक Tabular Foundation Model (TFM) को फीड करता है।

    • उपमा: कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं। हर जंप की भौतिकी (physics) की गणना करने के बजाय, आप अपनी पिछली 10 चालों को एक नोटबुक में देखते हैं। एक सुपर-इंटेलिजेंट सहायक (TFM) उन 10 चालों को पढ़ता है और कहता है, "आपने अभी जो किया, उसके आधार पर, अभी आपका सबसे अच्छा कदम यह है।"
    • TFM लाखों सामान्य डेटा समस्याओं (जैसे कि एक ट्यूटर जिसने हर प्रकार की गणित की समस्या देखी है) पर "प्री-ट्रेन्ड" है। इसे भूलभुलैया के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं है; इसे बस आपकी वर्तमान स्थिति का विशिष्ट संदर्भ (context) समझने की आवश्यकता है ताकि वह एक स्मार्ट उत्तर दे सके।

2. यह कैसे सीखता है: "इन-कॉन्टेक्स्ट" बनाम "ग्रेडिएंट डिसेंट"

  • पुराना तरीका (DQN): एक छात्र की तरह जो एक समस्या हल करने की कोशिश करता है, गलत होता है, और फिर अपनी पूरी गणित की समझ को ठीक करने के लिए दर्दनाक रूप से खुद को एडजस्ट करता है। यह लाखों बार होता है।
  • TabQL का तरीका: एक ऐसे छात्र की तरह जिसने पहले ही गणित की अवधारणा (concept) में महारत हासिल कर ली है। जब उसके सामने कोई नई समस्या आती है, तो वह बस अपनी नोटबुक से कुछ समान उदाहरण देखता है (संदर्भ) और तुरंत पैटर्न लागू करता है। उसे गणित को फिर से सीखने की ज़रूरत नहीं है; उसे बस अभी के लिए प्रासंगिक विशिष्ट उदाहरण देखने की ज़रूरत है।

शोध पत्र इसे "In-Context Learning" कहता है। रोबोट अपने आंतरिक भार (internal weights) को बदलकर (पुनः प्रशिक्षित करके) नहीं, बल्कि संदर्भ (context) को देखकर सीखता है।

3. "चीट शीट" की गुणवत्ता नियंत्रण

शोध पत्र एक महत्वपूर्ण विवरण नोट करता है: रोबोट प्रक्रिया के दौरान चीट शीट के लिए "लेबल" (उत्तर) उत्पन्न करने के लिए अभी भी पुराने DQN तरीके का उपयोग करता है।

  • जोखिम: यदि आप नए तरीके पर बहुत जल्दी स्विच कर देते हैं (पर्याप्त वार्म-अप करने से पहले), तो "चीट शीट" खराब नोट्स से भरी होगी। आपका सुपर-स्मार्ट ट्यूटर खराब नोट्स पढ़ेगा और गलत सलाह देगा।
  • समाधान: शोध पत्र एक "थ्रेशोल्ड" (सीमा) को सिद्ध करता है। आपको पर्याप्त वार्म-अप करना चाहिए ताकि नोट्स अच्छे हों। एक बार जब आप उस रेखा को पार कर लेते हैं, तो नया तरीका कार्यभार संभाल लेता है और पुराने तरीके की तुलना में बहुत तेज़ी से सीखता है।

4. यह बेहतर क्यों है (परिणाम)

लेखकों ने कई ग्रिड-वर्ल्ड गेम्स (जैसे Taxi, CliffWalking, और FrozenLake) पर इसका परीक्षण किया।

  • गति: TabQL ने मानक DQN की तुलना में बहुत तेज़ी से "परफेक्ट स्कोर" प्राप्त किया। इसे भूलभुलैया सीखने के लिए बहुत कम कदमों की आवश्यकता थी।
  • स्थिरता: क्योंकि यह शोर वाले गणितीय अपडेट के बजाय हाल के डेटा में पैटर्न देखने पर निर्भर करता है, इसलिए इसके भ्रमित होने या चीजें "भूलने" की संभावना कम थी।
  • सामान्यीकरण (Generalization): जब भूलभुलैया की शुरुआती स्थितियाँ बदली गईं, तो TabQL पुराने तरीकों की तुलना में बेहतर ढंग से अनुकूलित हुआ, संभवतः इसलिए क्योंकि "ट्यूटर" विभिन्न परिदृश्यों में पैटर्न को अधिक आसानी से पहचान सकता था।

सारांश

TabQL रोबोट को निर्णय लेने के लिए सिखाने का एक नया तरीका है। रोबोट को हर कदम के साथ अपने दिमाग को दर्दनाक रूप से फिर से सीखने के लिए मजबूर करने के बजाय, TabQL रोबोट को एक प्री-ट्रेन्ड "ट्यूटर" देता है। रोबोट ट्यूटर को हाल ही में क्या हुआ था, इसके कुछ उदाहरण दिखाता है, और ट्यूटर तुरंत अगले सबसे अच्छे कदम की भविष्यवाणी करता है।

यह तब सबसे अच्छा काम करता है जब आप पहले रोबोट को थोड़ा "वार्म-अप" अभ्यास करने देते हैं ताकि उदाहरण अच्छे हों। एक बार जब यह हो जाता है, तो रोबोट पहले की तुलना में बहुत तेज़ी से और कुशलता से भूलभुलैया सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →