← नवीनतम पेपर
💬 NLP

GCoT-Decoding: Unlocking Deep Reasoning Paths for Universal Question Answering

यह शोध पत्र GCoT-decoding प्रस्तुत करता है, जो एक प्रॉम्प्ट-मुक्त, दो-चरणीय ब्रांचिंग रणनीति है जो त्रुटि बैकट्रैकिंग के साथ विविध तर्क पथों को उत्पन्न करके और सार्वभौमिक प्रदर्शन सुधार प्राप्त करने के लिए उन्हें सिमेंटिक सर्वसम्मति के माध्यम से एकत्रित करके चेन-ऑफ-थॉट रीजनिंग को निश्चित और मुक्त-रूप प्रश्न-उत्तर कार्यों दोनों तक विस्तारित करता है।

मूल लेखक: Guanran Luo, Wentao Qiu, Zhongquan Jian, Meihong Wang, Qingqiang Wu

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanran Luo, Wentao Qiu, Zhongquan Jian, Meihong Wang, Qingqiang Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, लेकिन थोड़ा बिखरा हुआ, जीनियस दोस्त (AI) है जो एक पहेली सुलझाने की कोशिश कर रहा है। आप उससे एक सवाल पूछते हैं, और वह ज़ोर से सोचना शुरू कर देता है।

पुराना तरीका (Standard AI):
आमतौर पर, आपको अपने जीनियस दोस्त को सोचने के लिए निर्देशों का एक बहुत ही विशिष्ट सेट देना होगा। "पहले, तथ्यों की सूची बनाओ। दूसरा, गणित करो। तीसरा, उत्तर बताओ।" यदि आप उसे सही निर्देश नहीं देते हैं, तो वह भ्रमित हो सकता है या गलत उत्तर दे सकता है।

"CoT-Decoding" वाला तरीका (पिछली तकनीक):
शोधकर्ताओं ने AI को बिना किसी निर्देश के खुद सोचने के लिए कहा। उन्होंने इसे कहा: "बस इस समस्या को हल करने के 10 अलग-अलग तरीके निकालो, और उनमें से उस एक को चुनो जो सबसे अधिक आत्मविश्वास से भरा लगे।"

  • समस्या: यह गणित की समस्याओं के लिए बहुत अच्छा काम करता था जहाँ उत्तर एक एकल संख्या होती है (जैसे "24")। लेकिन खुले अंत वाले प्रश्नों के लिए (जैसे, "इन तीन राष्ट्रपतियों में क्या समानता है?"), यह विफल रहा। क्यों? क्योंकि AI आपको दस अलग-अलग तरीकों से सही उत्तर दे सकता था ("वे सभी राष्ट्रपति थे," "वे सभी व्हाइट हाउस में रहे," "वे सभी नेता थे")। पुराना तरीका यह समझ नहीं पाता था कि ये सभी एक ही बात कह रहे हैं, इसलिए वह भ्रमित हो जाता था और गलत वाला चुन लेता था। साथ ही, AI अक्सर शुरुआत में ही एक ही गलत विचार को बार-बार दोहराने के "लूप" में फंस जाता था।

नया तरीका (GCoT-Decoding):
यह पेपर GCoT-Decoding पेश करता है, जो एक स्मार्ट टूर गाइड की तरह AI की सोचने की प्रक्रिया का मार्गदर्शन करता है। यह तीन चतुर चरणों में इस समस्या को हल करता है:

1. "फाइबोनैकी हाइकिंग" रणनीति (Exploration/अन्वेषण)

कल्पना कीजिए कि आप एक जंगल में छिपे हुए खजाने की तलाश कर रहे हैं।

  • पुरानी गलती: आप 10 हाइकर्स भेजते हैं, लेकिन वे सभी बिल्कुल एक ही रास्ते पर चलना शुरू कर देते हैं क्योंकि वह सबसे स्पष्ट दिखता है। वे सभी एक ही दलदल में खो जाते हैं।
  • GCoT का समाधान: सभी को पहले रास्ते पर भेजने के बजाय, गाइड एक विशेष मानचित्र (जिसे Fibonacci sampling कहा जाता है) का उपयोग करता है। यह कुछ को पहले रास्ते पर भेजता है, कुछ को कुछ कदम छोड़ देता है, और कुछ को और आगे भेज देता है।
  • यह क्यों काम करता है: यह सुनिश्चित करता है कि AI एक ही गलत विचार को दस बार खोजने में समय बर्बाद न करे। यह AI को मजबूर करता है कि वह जंगल के अलग-अलग कोनों में देखे, जिससे उस "सही" रास्ते को खोजने की संभावना बढ़ जाती है जो शायद सूची में कहीं गहराई में छिपा हो।

2. "अर्ली वार्निंग सिस्टम" (Backtracking/पीछे हटना)

कल्पना कीजिए कि आपका एक हाइकर एक चट्टान की ओर बढ़ने लगता है। वह कुछ कदम चलता है, और अचानक उसका आत्मविश्वास गिर जाता है (वह पसीना छोड़ने और लड़खड़ाने लगता है)।

  • पुरानी गलती: आप उसे तब तक चलते रहने देते हैं जब तक कि वह चट्टान से नीचे न गिर जाए, और फिर आप उसे फिर से शुरू करने के लिए कहते हैं।
  • GCoT का समाधान: गाइड के पास एक रडार है। जैसे ही हाइकर का आत्मविश्वास एक निश्चित स्तर (एक "लोकल मिनिमम") से नीचे गिरता है, गाइड चिल्लाता है, "रुको! पीछे मुड़ो!" हाइकर तुरंत उसी स्थान पर वापस मुड़ जाता है और वहां से एक अलग रास्ता आज़माता है।
  • यह क्यों काम करता है: यह गलतियों को जल्दी पकड़ लेता है, इससे पहले कि AI एक गलत कहानी बनाने में अपनी बहुत सारी ऊर्जा खर्च कर दे।

3. "ग्रुप हग" (Semantic Clustering/अर्थ संबंधी समूहन)

अब, कल्पना कीजिए कि आपके सभी हाइकर उत्तर लेकर वापस आ गए हैं।

  • पुरानी गलती: गाइड उत्तरों को शाब्दिक रूप से देखता है।
    • हाइकर A कहता है: "वे राष्ट्रपति थे।"
    • हाइकर B कहता है: "उन्होंने राष्ट्रपति के रूप में सेवा की।"
    • हाइकर C कहता है: "राष्ट्रपति।"
    • पुराना गाइड सोचता है कि ये तीन पूरी तरह से अलग उत्तर हैं और उस उत्तर को वोट देता है जो सबसे अधिक बार आया हो, भले ही सही उत्तर उनके बीच विभाजित हो गया हो।
  • GCoT का समाधान: गाइड एक "ग्रुप हग" (Semantic Clustering) का उपयोग करता है। यह शब्दों के बजाय उत्तरों के अर्थ को देखता है। वह समझ जाता है कि A, B और C सभी एक ही बात कह रहे हैं। वह उन्हें एक समूह में रखता है और उनके आत्मविश्वास स्कोर को जोड़ देता है।
  • यह क्यों काम करता है: भले ही AI एक ही उत्तर को 10 अलग-अलग तरीकों से कहे, GCoT समझ जाता है कि वे सभी एक ही टीम के सदस्य हैं और वह उस टीम की कुल शक्ति के आधार पर विजेता चुनता है।

परिणाम

यह नया तरीका आपकी AI को एक ऐसे छात्र से अपग्रेड करने जैसा है जिसे एक सख्त शिक्षक की आवश्यकता होती है, एक स्व-सुधार करने वाले जासूस में।

  • यह गणित की समस्याओं (जहाँ उत्तर एक संख्या है) पर काम करता है।
  • यह खुले अंत वाले प्रश्नों (जहाँ उत्तर एक वाक्य या पैराग्राफ है) पर भी काम करता है।
  • यह सही उत्तर ढूंढ लेता है, भले ही AI आत्मविश्वास से भरे गलत उत्तरों के साथ खुद को धोखा देने की कोशिश करे।

संक्षेप में, GCoT-Decoding AI को दूर तक देखना, जल्दी पीछे हटना और अपने शब्दों के पीछे के अर्थ को समझना सिखाता है, जिससे वह बिना किसी मानवीय मदद के हर तरह की पहेलियों को सुलझाने में बहुत अधिक स्मार्ट बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →