← नवीनतम पेपर
💻 computer science

Reliable Control-Point Selection for Steering Reasoning in Large Language Models

यह शोधपत्र एक विश्वसनीयता-संचालित पद्धति प्रस्तुत करता है जो स्थिरता फ़िल्टरिंग और सामग्री-उपस्थान प्रक्षेपण (content-subspace projection) का उपयोग करके कीवर्ड-लक्षित तर्क सीमाओं की उच्च अस्थिरता को दूर करते हुए बड़े भाषा मॉडलों को निर्देशित करती है, जिससे MATH-500 पर अत्याधुनिक प्रदर्शन प्राप्त होता है और मजबूत क्रॉस-मॉडल हस्तांतरणीयता प्रदर्शित होती है।

मूल लेखक: Haomin Zhuang, Hojun Yoo, Xiaonan Luo, Kehan Guo, Xiangliang Zhang

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haomin Zhuang, Hojun Yoo, Xiaonan Luo, Kehan Guo, Xiangliang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: अत्यधिक सोचने वाले को वश में करना

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान, अति-प्रतिभाशाली रोबोट (एक लार्ज लैंग्वेज मॉडल) है जो एक जटिल गणित की समस्या को हल करने की कोशिश कर रहा है। सही उत्तर पाने के लिए, रोबोट केवल एक नंबर नहीं थूकता; वह खुद से बात करता है। वह एक लंबा "चेन ऑफ थॉट" (सोच की श्रृंखला) लिखता है, जैसे कोई छात्र व्हाइटबोर्ड पर समस्या हल करते हुए नोट्स बनाता है।

कभी-कभी, यह रोबोट बहुत अच्छा होता है। वह अपने काम को दोबारा जांचने के लिए रुकता है, कहता है, "रुको, यह सही नहीं लग रहा है," और खुद को सुधारता है। यह अच्छी तर्कशक्ति (good reasoning) है।

लेकिन अक्सर, रोबोट एक लूप में फंस जाता है। वह बार-बार "रुको" या "मुझे सोचने दो" कहता रहता है, भले ही उसे इसकी जरूरत न हो। वह बिना किसी दिशा के समय और ऊर्जा बर्बाद करता है। यह खराब तर्कशक्ति (bad reasoning) (या "ओवर-थिंकिंग") है।

इस शोध पत्र का लक्ष्य रोबोट को खराब लूप्स को रोकने और अच्छे ठहरावों को बनाए रखने के लिए सिखाना है, और वह भी पूरे रोबोट को शुरू से फिर से ट्रेन किए बिना।


समस्या: "कीवर्ड" की गलती

पिछले शोधकर्ताओं ने इस समस्या को हल करने के लिए रोबोट के टेक्स्ट में विशिष्ट कीवर्ड्स (keywords) को खोजने की कोशिश की, जैसे "Wait" (रुको), "Verify" (जांचो), या "Let me think" (मुझे सोचने दो)।

उपमा:
कल्पना कीजिए कि आप एक शिक्षक हैं जो कक्षा में उन छात्रों को ढूंढने की कोशिश कर रहे हैं जो वास्तव में गहराई से सोच रहे हैं। आपने निर्णय लिया कि आप केवल उन छात्रों को देखेंगे जो लाल पेन पकड़े हुए हैं, क्योंकि आप सोचते हैं कि "लाल पेन = सोचना।"

आप चारों ओर घूमते हैं और हर उस छात्र की ओर इशारा करते हैं जिसने लाल पेन पकड़ा हुआ है। लेकिन यहाँ एक पेंच है:

  • कुछ छात्र इसलिए लाल पेन पकड़े हुए हैं क्योंकि वे गहराई से समस्या हल कर रहे हैं।
  • अन्य लोग केवल इसलिए लाल पेन पकड़े हुए हैं क्योंकि उन्हें वह रंग पसंद है, या वे कुछ डूडलिंग कर रहे हैं, या वे हार मानने वाले हैं।

शोधकर्ताओं ने पाया कि 93% मामलों में, जब रोबोट "Wait" जैसा कीवर्ड कहता है, तो वह वास्तव में केवल एक संयोग होता है। यह गहन चिंतन का वास्तविक क्षण नहीं है। यह केवल रोबोट द्वारा बेतरतीब ढंग से चुना गया एक शब्द है।

यदि आप इन कीवर्ड्स के आधार पर रोबोट को "स्टीयर" (नियंत्रित) करने की कोशिश करते हैं, तो आप अनिवार्य रूप रूप से एक ऐसी कक्षा को पढ़ाने की कोशिश कर रहे हैं जहाँ आप उन छात्रों की ओर इशारा कर रहे हैं जिनके पास संयोग से लाल पेन है, भले ही उनमें से अधिकांश कुछ भी उपयोगी नहीं कर रहे हैं। आप सिग्नल के बजाय शोर (noise) को बढ़ा देते हैं।

समाधान: "स्टेबिलिटी टेस्ट" (स्थिरता परीक्षण)

लेखकों ने महसूस किया कि वास्तविक सोच एक विशिष्ट तरीके से अस्थिर (unstable) होती है। यदि रोबंड वास्तव में फंसा हुआ है और उसे चिंतन करने की आवश्यकता है, तो यदि आप उसे वही समस्या फिर से करने के लिए कहते हैं, तो वह लगभग हमेशा "Wait" कहेगा। यदि वह केवल बेतरतीब ढंग से शब्द चुन रहा है, तो वह एक बार "Wait" कह सकता है, लेकिन यदि आप उसे फिर से प्रयास करने के लिए कहते हैं, तो वह बस कह सकता है "ठीक है, आगे बढ़ते हैं।"

नई विधि:
कीवर्ड्स को देखने के बजाय, शोधकर्ता "मेरे पीछे दोहराओ" (Repeat After Me) का खेल खेलते हैं।

  1. सेटअप: वे रोबोट के टेक्स्ट में वह स्थान ढूंढते हैं जहाँ वह "Wait" कहता है।
  2. परीक्षण: वे उस बिंदु तक के टेक्स्ट को लेते हैं और रोबोट को लगातार 10 बार उसी वाक्य को पूरा करने के लिए कहते हैं।
  3. स्कोर:
    • यदि रोबोट उन 10 प्रयासों में से 9 या 10 बार "Wait" (या इसी तरह का प्रतिबिंब) कहता है, तो यह एक स्टेबल बाउंड्री (Stable Boundary) है। यह चिंतन का एक वास्तविक क्षण है।
    • यदि रोबोट केवल 1 या 2 बार "Wait" कहता है, तो यह अनस्टेबल (Unstable) है। यह केवल एक इत्तेफाक था।

वे सभी "अनस्टेबल" क्षणों को हटा देते हैं और केवल "स्टेबल" क्षणों को ही रखते हैं।

"नॉइज़ फ़िल्टर": सिग्नल की सफाई

स्टेबल क्षणों को खोजने के बाद भी, एक समस्या बनी रहती है। रोबोट के विचार गणित की समस्या के विशिष्ट विवरणों (जैसे "क्या यह ज्यामिति की समस्या है?" या "क्या यह कैलकुलस की समस्या है?") के साथ मिश्रित होते हैं।

उपमा:
कल्पना कीजिए कि आप एक कमरे में एक गायक की आवाज़ (तर्क व्यवहार) रिकॉर्ड करने की कोशिश कर रहे हैं जहाँ हवा चल रही है (गणित की समस्या के विवरण)।

  • पिछले तरीकों ने गायक को रिकॉर्ड करने की कोशिश की लेकिन अंत में बहुत सारा हवा का शोर (wind noise) भी रिकॉर्ड कर लिया।
  • लेखकों ने एक गणितीय ट्रिक (जिसे कंटेंट-सबस्पेस प्रोजेक्शन कहा जाता है) का उपयोग किया जो नॉइज़-कैंसलिंग हेडफ़ोन की तरह काम करती है। उन्होंने "हवा" (गणित की समस्या के विशिष्ट विवरण) की पहचान की और उसे हटा दिया, जिससे केवल शुद्ध "गायक" (तर्क व्यवहार) बचा।

परिणाम: एक स्मार्ट रोबोट

इन दोनों चरणों को जोड़कर—केवल स्थिर क्षणों को रखना और गणित-विशिष्ट शोर को हटाना—उन्होंने एक "स्टीयरिंग वेक्टर" बनाया। इसे एक रिमोट कंट्रोल की तरह समझें जो रोबोट के मस्तिष्क को सही दिशा में धीरे से धकेलता है।

क्या हुआ?

  • पहले: रोबोट लगभग 61% गणित की समस्याओं को सही हल कर पा रहा था।
  • पुरानी विधि (SEAL): इसने 73% सही हल किए।
  • नई विधि: इसने 78% सही हल किए।

लेकिन सबसे अच्छी बात यह है कि उन्हें यह नया तरीका हर एक रोबोट को सिखाने की आवश्यकता नहीं पड़ी। उन्होंने इसे एक रोबोट (1.5B पैरामीटर मॉडल) को सिखाया, और फिर उन्होंने उसी "रिमोट कंट्रोल" को लिया और उसे दो अन्य अलग-अलग रोबोटों में लगा दिया। यह उन पर भी काम कर गया, जिससे वे बिना किसी अतिरिक्त प्रशिक्षण के और भी स्मार्ट बन गए।

सारांश

  1. समस्या: रोबोट अक्सर बिना वास्तव में सोचे, बेतरतीब ढंग से "Wait" कहता है।
  2. समाधान: शब्दों पर भरोसा न करें; पैटर्न पर भरोसा करें। यदि रोबोट हर बार आपसे दोबारा प्रयास करने के लिए कहने पर लगातार "Wait" कहता है, तो ही वह एक वास्तविक विचार है।
  3. परिणाम: नकली "Wait" क्षणों को फ़िल्टर करके और शोर को साफ करके, रोबोट गणित की समस्याओं को बहुत बेहतर तरीके से हल करता है और अत्यधिक सोचने में समय बर्बाद करना बंद कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →