← नवीनतम पेपर
💻 computer science

Thinking with Reasoning Skills: Fewer Tokens, More Accuracy

यह शोध पत्र एक ऐसी विधि प्रस्तावित करता है जो इन्फरेंस (inference) के समय पूर्व-निर्मित (pre-distilled) पुन: प्रयोज्य तर्क कौशल को पुनः प्राप्त करके और उन्हें लागू करके रीजनिंग एलएलएम (reasoning LLMs) की सटीकता और दक्षता में सुधार करती है, जिससे पारंपरिक "शून्य से तर्क करने" (reasoning from scratch) वाले दृष्टिकोण की तुलना में टोकन की खपत और लागत में काफी कमी आती है।

मूल लेखक: Guangxiang Zhao, Qilong Shi, Xusen Xiao, Xiangzheng Zhang, Tong Yang, Lin Sun

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guangxiang Zhao, Qilong Shi, Xusen Xiao, Xiangzheng Zhang, Tong Yang, Lin Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत कठिन गणित की समस्या को हल करने या एक जटिल कंप्यूटर प्रोग्राम लिखने की कोशिश कर रहे हैं।

पुराना तरीका: "शून्य से तर्क करना" (Reasoning from Scratch)
वर्तमान में, अधिकांश उन्नत AI मॉडल (जैसे आज के "सोचने वाले" AI) हर नई समस्या को ऐसे देखते हैं जैसे उन्होंने पहले कभी इसके बारे में कुछ न सुना हो। वे शून्य से शुरुआत करते हैं। वे एक तरीका आजमाते हैं, उन्हें एहसास होता है कि यह गलत है, वे पीछे हटते हैं, दूसरा तरीका आजमाते हैं, फंस जाते हैं, और फिर से कोशिश करते हैं। वे बुनियादी बातों को समझने के लिए हजारों शब्द लिखते हैं।

  • उपमा: यह पहली बार केक बनाने की कोशिश करने जैसा है। आपके पास कोई रेसिपी नहीं है, इसलिए आप अनुमान लगाते हैं। आप बहुत अधिक आटा डाल देते हैं, चखते हैं, महसूस करते हैं कि यह खराब है, उसे फेंक देते हैं, फिर से शुरू करते हैं, बहुत अधिक चीनी डाल देते हैं, फिर से चखते हैं... जब तक आप अंततः एक केक बना लेते हैं, तब तक आपने बहुत सारी सामग्री (पैसे/टोकन) और समय बर्बाद कर दिया होता है।
  • समस्या: यह "प्रयास और त्रुटि" (trial and error) महंगा है। AI की दुनिया में, मॉडल जो भी शब्द सोचता है, उसकी कीमत चुकानी पड़ती है और उसमें समय लगता है।

नया विचार: "तर्क कौशल के साथ सोचना" (Thinking with Reasoning Skills - TRS)
यह पेपर एक स्मार्ट तरीके का प्रस्ताव देता है। AI को हर बार पहिए का पुन: आविष्कार करने के लिए मजबूर करने के बजाय, हम उसे "कौशल" (Skills) का एक डिजिटल टूलबॉक्स देते हैं।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "ग्रैंडमास्टर" सीखता है (ऑफलाइन)

सबसे पहले, हम एक बहुत ही स्मार्ट AI लेते हैं और उसे पुराने तरीके से (सभी प्रयास और त्रुटियों के साथ) हजारों कठिन समस्याओं को हल करने देते हैं। जब वह ऐसा करता है, तो एक "समराइज़र" (Summarizer - जैसे एक बुद्धिमान शिक्षक) उस प्रक्रिया को देखता है।

  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ एक छात्र को खाना बनाते हुए देख रहा है। छात्र टोस्ट जला देता है, बहुत अधिक नमक डाल देता है, और अंत में एक बेहतरीन सूप बनाता है। शिक्षक केवल देखता नहीं है; वह एक "चीट शीट" (Cheat Sheet) लिखता है: "सूप बनाते समय, हमेशा नमक डालने से पहले चखें। यदि ब्रेड जल जाए, तो तुरंत दोबारा शुरू करें।"
  • इन चीट शीट्स को "स्किल कार्ड्स" (Skill Cards) कहा जाता है। ये संक्षिप्त, पुन: प्रयोज्य निर्देश हैं जैसे "इस प्रकार के समीकरण के लिए इस गणितीय ट्रिक का उपयोग करें" या "इस कोडिंग लूप से बचें।"

2. "लाइब्रेरी" बनाई जाती है

इन सभी चीट शीट्स को एक लाइब्रेरी में स्टोर किया जाता है।

  • उपमा: यह रेसिपी या मैकेनिक मैनुअल की लाइब्रेरी की तरह है। इसमें "इसे सही तरीके से कैसे करें" और "जब आप गलती करें तो इसे कैसे ठीक करें" दोनों शामिल हैं।

3. "स्मार्ट स्टूडेंट" हल करता है (ऑनलाइन)

अब, जब कोई उपयोगकर्ता एक नया प्रश्न पूछता है, तो सिस्टम केवल यह नहीं कहता कि "सोचो!" बल्कि यह पहले लाइब्रेरी में देखता है।

  • उपमा: आप छात्र से पूछते हैं, "मैं केक कैसे बनाऊं?"
    • पुराना तरीका: छात्र अनुमान लगाता है और 5 असफल केक बनाता है।
    • नया तरीका (TRS): सिस्टम तेजी से लाइब्रेरी से "केक रेसिपी" स्किल कार्ड ढूंढता है और छात्र को थमा देता है। छात्र कार्ड पढ़ता है: "ओवन को 350 पर प्रीहीट करें। पहले सूखी सामग्री मिलाएं।"
    • छात्र अनुमान लगाना छोड़ देता है, विफलताओं को छोड़ देता है, और सीधे एक परफेक्ट केक बनाने की ओर बढ़ जाता है।

यह एक बड़ी बात क्यों है?

1. यह पैसे बचाता है (कम टोकन)
क्योंकि AI को अनुमान लगाने और पीछे हटने में समय बर्बाद करने की आवश्यकता नहीं होती है, इसलिए यह बहुत कम टेक्स्ट लिखता है।

  • वास्तविक दुनिया का प्रभाव: यदि आप एक कंपनी हैं जो AI के लिए भुगतान कर रही है, तो आप हर उस शब्द के लिए भुगतान कर रहे हैं जो AI सोचता है। TRS "सोचने वाले" शब्दों को कुछ मामलों में 50% तक कम कर देता है। यह वैसा ही है जैसे समान परिणाम प्राप्त करना लेकिन आधे बिल का भुगतान करना।

2. यह वास्तव में स्मार्ट है (बेहतर सटीकता)
आमतौर पर, जब आप AI को तेज़ होने के लिए मजबूर करते हैं (उसे "कम सोचने" के लिए कहकर), तो वह अधिक गलतियाँ करता है। वह महत्वपूर्ण चरणों को छोड़ देता है।

  • जादू: TRS अलग है। यह केवल AI को "जल्दी करने" के लिए नहीं कहता। यह इसे बताता है कि क्या करना है। इसे सही रास्ता देकर, यह समस्या को तेजी से और अधिक सटीकता से हल करता है। यह उस नियम को तोड़ता है जो कहता है कि "आपको गति और गुणवत्ता में से किसी एक को चुनना होगा।"

3. यह मानव विशेषज्ञों की तरह काम करता है
इंसान हर बार कार चलाने के लिए नया कौशल नहीं सीखते। वे "चाबी घुमाएं, दर्पण देखें, गैस दबाएं" जैसे कौशल को याद करते हैं। यह पेपर AI को यही सिखाता है: तर्क को शून्य से फिर से निकालने के बजाय एक "कौशल" को याद करना।

सारांश

TRS को AI को एक GPS देने के रूप में समझें, बजाय इसके कि उसे शहर में घूमते हुए मंजिल खोजने की उम्मीद में भटकने दिया जाए।

  • TRS के बिना: AI इधर-उधर घूमता है, रास्ता भटक जाता है, गलत मोड़ लेता है, और गंतव्य तक पहुँचने से पहले बहुत अधिक गैस (टोकन) जला देता है।
  • TRS के साथ: AI मैप (स्किल लाइब्रेरी) देखता है, सबसे अच्छा रास्ता देखता है, और सीधे वहां तक पहुँच जाता है।

परिणाम: आपको सही उत्तर मिलता है, तेजी से, और बहुत कम लागत पर। यह शक्तिशाली AI को कोडिंग असिस्टेंट, गणित ट्यूटर या बिजनेस टूल्स जैसे वास्तविक दुनिया के उपयोग के लिए बहुत अधिक व्यावहारिक बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →