← नवीनतम पेपर
💬 NLP

Where Reasoning Breaks: Logic-Aware Path Selection by Controlling Logical Connectives in LLMs Reasoning Chains

यह शोध पत्र एक बहु-स्तरीय ढांचे का प्रस्ताव करता है जो तार्किक संयोजकों (logical connectives) को उच्च-एन्ट्रॉपी वाले विफलता बिंदुओं के रूप में पहचानकर और ग्रेडिएंट-आधारित स्टीयरिंग, स्थानीयकृत ब्रांचिंग और लक्षित ट्रांज़िशन प्राथमिकता अनुकूलन के माध्यम से विशेष रूप से इन जंक्शनों पर हस्तक्षेप करके LLM तर्क सटीकता और दक्षता में सुधार करता है।

मूल लेखक: Seunghyun Park, Yuanyuan Lei

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seunghyun Park, Yuanyuan Lei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ टूर गाइड को एक जटिल भूलभुलैया (maze) के माध्यम से रास्ता दिखाने की कोशिश कर रहे हैं। यह टूर गाइड एक लार्ज लैंग्वेज मॉडल (LLM) है। लक्ष्य उन्हें निकास (सही उत्तर) तक पहुँचाना है, जिसके लिए नियमों के एक विशिष्ट सेट का पालन करना होगा।

समस्या यह है कि गाइड सीधे रास्तों पर चलने में तो माहिर है, लेकिन वह चौराहों (intersections) पर भ्रमित हो जाता है। यदि वह केवल एक चौराहे पर गलत मोड़ ले लेता है, तो वह एक डेड एंड (बंद रास्ते) पर पहुँच सकता है, और क्योंकि वह बहुत आत्मविश्वासी है, उसे अपनी गलती का एहसास तब तक नहीं होगा जब तक कि बहुत देर न हो जाए।

यह शोध पत्र उन विशिष्ट, भ्रमित करने वाले चौराहों को खोजने और गाइड को सही रास्ता चुनने में मदद करने के लिए बेहतर संकेत बोर्ड लगाने के बारे में है।

बड़ी खोज: "रास्ते का दोराहा" (The Fork in the Road)

शोधकर्ताओं ने पाया कि गाइड हर जगह नहीं भटकता। वह विशेष रूप से तार्किक संयोजकों (logical connectives) पर भटक जाता है।

इन शब्दों को एक वाक्य के ट्रैफिक लाइट की तरह समझें: "इसलिए (Therefore)," "हालांकि (However)," "लेकिन (But)," "तो (So)," और "क्योंकि (Because)."

  • उपमा (The Analogy): कल्पना कीजिए कि आप गाड़ी चला रहे हैं। आप सीधे गाड़ी चलाने में ठीक हैं। लेकिन जब आप देखते हैं कि "बाएं मुड़ें" या "दाएं मुड़ें" का साइन लगा है, तो आप हिचकिचाते हैं। यदि आप गलत अनुमान लगाते हैं, तो आप गलत पड़ोस में पहुँच जाते हैं।
  • निष्कर्ष (The Finding): शोधकर्ताओं ने पाया कि जब AI "But" या "Therefore" कहने वाला होता है, तो वह वास्तव में बहुत अनिश्चित (उच्च एंट्रॉपी/high entropy) होता है। यह ऐसा है जैसे गाइड रास्ते के दोराहे पर खड़ा है, बाएं और दाएं देख रहा है, और सोच रहा है, "क्या मुझे पिछले विचार का खंडन करने के लिए 'But' कहना चाहिए? या निष्कर्ष निकालने के लिए 'So' कहना चाहिए?"
  • खतरा (The Danger): यदि गाइड यहाँ गलत शब्द चुन लेता है, तो पूरी कहानी बदल जाती है।
    • उदाहरण: "सेब लाल और मीठा है। इसलिए (Therefore), मैं इसे खाऊंगा।" (सही रास्ता)।
    • उदाहरण: "सेब लाल और मीठा है। हालांकि (However), मैं इसे खाऊंगा।" (यह समझ में नहीं आता, लेकिन अगर AI इसे चुन लेता है, तो यह एक अजीब निष्कर्ष की ओर ले जा सकता है)।

यह शोध पत्र दिखाता है कि इन जोड़ने वाले शब्दों में से केवल एक को बदलने से पूरा उत्तर "सही" से "गलत" में बदल सकता है।

समाधान: एक तीन-भाग वाला टूलकिट

पूरे गाइड को अधिक स्मार्ट बनाने के बजाय (जो कठिन और महंगा है), लेखकों ने एक ऐसा टूलकिट बनाया है जो केवल उन विशिष्ट "रास्ते के दोराहों" पर हस्तक्षेप करता है।

1. "मानसिक धक्का" (Gradient-Based Logical Steering)

  • कैसे काम करता है: कल्पना कीजिए कि गाइड कोई निर्णय लेने वाला है। बोलने से पहले, आप उसके कंधे पर धीरे से थपथपाते हैं और फुसफुसाते हैं, "हे, नियम याद रखो! हमें यहाँ तार्किक होना होगा।"
  • तकनीक: यह गाइड के दिमाग को नहीं बदलता (यह मॉडल को फिर से प्रशिक्षित नहीं करता है)। यह बस बोलने से ठीक पहले उनके आंतरिक विचारों को सही दिशा में थोड़ा सा मोड़ देता है। यह एक GPS की तरह है जो उन्हें सही लेन में रखने के लिए एक छोटा, तत्काल सुधार देता है।

2. "आगे की दृष्टि" (Localized Branching)

  • कैसे काम करता है: जब गाइड एक भ्रमित करने वाले चौराहे पर पहुँचता है, तो केवल पहला शब्द चुनने के बजाय जो उसके मन में आता है, सिस्टम कहता है, "एक सेकंड रुको। चलो जल्दी से अगले कुछ कदमों के लिए दो अलग-अलग रास्तों की कल्पना करते हैं।"
    • पथ A: "But..." -> क्या यह एक तार्किक निष्कर्ष की ओर ले जाता है?
    • पथ B: "So..." -> क्या यह एक तार्किक निष्कर्ष की ओर ले जाता है?
  • तकनीक: सिस्टम सबसे संभावित विकल्पों के लिए कुछ कदम आगे का सिमुलेशन करता है। यदि एक पथ डगमगाता हुआ (उच्च भ्रम) दिखता है और दूसरा ठोस दिखता है, तो यह ठोस वाले को चुनता है। यह एक घंटे तक गाड़ी चलाने और बाद में यह महसूस करने के बजाय, कि आप खो गए हैं, मुड़ने से पहले केवल 10 सेकंड के लिए मैप देखने जैसा है।

3. "सर्जिकल प्रशिक्षण" (Targeted Transition Preference Optimization)

  • कैसे काम करता है: कल्पना कीजिए कि आप गाइड को सिखा रहे हैं। पूरी विश्वकोश को दोबारा पढ़ने के बजाय (जिसमें बहुत समय लगता है), आप केवल उन विशिष्ट ट्रैफिक संकेतों पर उनका टेस्ट लेते हैं जिन्हें वे बार-बार गलत करते हैं।
  • तकनीक: शोधकर्ता AI को विशेष रूप से यह चुनने के लिए प्रशिक्षित करते हैं कि सही जोड़ने वाले शब्दों का उपयोग कैसे किया जाए। वे बाकी सब कुछ छोड़ देते हैं और अपनी 100% सीखने की ऊर्जा इस बात पर केंद्रित करते हैं कि AI को कब "But" कहना है और कब "Therefore" कहना है। यह गाइड को उन विशिष्ट क्षणों में बहुत बेहतर बनाता है बिना उन चीजों पर समय बर्बाद किए जो वे पहले से जानते हैं।

यह एक बड़ी बात क्यों है

आमतौर पर, AI को तर्क करने में स्मार्ट बनाने के लिए, लोग इसे "अधिक गहराई से सोचने" के लिए प्रेरित करते हैं (जैसे एक ही सवाल को मॉडल के माध्यम से कई बार चलाना, जैसे पांच अलग-अलग लोगों से पूछना और बहुमत के आधार पर निर्णय लेना)। यह धीमा है और बहुत अधिक कंप्यूटर पावर का उपयोग करता है।

यह शोध पत्र कहता है: "पूरी कार को धीमा मत चलाओ। बस तीखे मोड़ों पर स्टीयरिंग व्हील को ठीक करो।"

  • दक्षता (Efficiency): यह बहुत तेज़ है क्योंकि यह केवल महत्वपूर्ण क्षणों में हस्तक्षेप करता है।
  • सटीकता (Accuracy): यह उस "डोमिनो प्रभाव" को रोकता है जहाँ एक छोटी सी गलती पूरे उत्तर को खराब कर देती है।
  • सरलता (Simplicity): यह AI को एक ऐसे इंसान की तरह मानता है जिसे कठिन हिस्सों में थोड़ी मदद की आवश्यकता है, न कि उसे शुरू से फिर से बनाने की कोशिश करता है।

सारांश में

यह शोध पत्र तर्क देता है कि AI का तर्क इसलिए नहीं टूटता क्योंकि AI मूर्ख है, बल्कि इसलिए क्योंकि वह विचारों को जोड़ने वाले विशिष्ट शब्दों ("But," "So," "Therefore") पर भ्रमित हो जाता है। बेहतर संकेत लगाकर, मानचित्र की संक्षिप्त जांच करके और केवल उन विशिष्ट मोड़ों का अभ्यास करके, हम AI को धीमा किए बिना तर्क में बहुत स्मार्ट बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →