← नवीनतम पेपर
🤖 AI

Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

यह शोध पत्र बिहेवियर क्यू रीजनिंग (Behavior Cue Reasoning) को प्रस्तुत करता है, जो एक ऐसी विधि है जो लार्ज लैंग्वेज मॉडल्स को विशिष्ट व्यवहारों से पहले विशेष टोकन संकेतों को उत्सर्जित करने के लिए प्रशिक्षित करती है, जिससे कुशल निरीक्षण संभव होता है जो प्रदर्शन से समझौता किए बिना व्यर्थ रीजनिंग टोकन को काफी कम करता है और सुरक्षित कार्यों को पुनः प्राप्त करता है।

मूल लेखक: Christopher Z. Cui, Taylor W. Killian, Prithviraj Ammanabrolu

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christopher Z. Cui, Taylor W. Killian, Prithviraj Ammanabrolu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली लेकिन बहुत अधिक बातें करने वाला छात्र (AI) है जो एक कठिन पहेली को हल करने की कोशिश कर रहा है। अंतिम उत्तर देने से पहले, वह अपने विचारों, गणनाओं और गलत शुरुआत के साथ एक लंबी, बिखरी हुई नोटबुक लिखता है।

समस्या यह है कि जब तक छात्र अपना अंतिम उत्तर लिख देता है, तब तक हो सकता है कि उसने अपनी नोटबुक में कोई ऐसी गलती की हो जिसे उसने कभी सुधारा नहीं, या उसने एक ही गलत विचार पर बार-बार लिखने में घंटों बर्बाद कर दिए हों। यदि आप (शिक्षक) केवल अंतिम उत्तर देखते हैं, तो आप नोटबुक में होने वाली गलतियों को तब तक नहीं देख सकते जब तक कि बहुत देर न हो जाए।

यह शोध पत्र आपको उस छात्र को अपने नोटबुक के भीतर विशेष "स्टिकी नोट्स" (जिन्हें Behavior Cues कहा जाता है) का उपयोग करने के लिए सिखाने का एक नया तरीका पेश करता है। ये नोट्स ट्रैफिक लाइट या संकेत बोर्ड की तरह कार्य करते हैं जो शिक्षक को बताते हैं कि छात्र उस समय वास्तव में क्या कर रहा है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. तीन जादुई स्टिकी नोट्स

शोधकर्ताओं ने AI को प्रशिक्षित किया है कि वह अपनी सोच की प्रक्रिया के महत्वपूर्ण क्षणों पर स्वतः तीन विशिष्ट वाक्यांश लिखे:

  • [answer]: यह ऐसा है जैसे छात्र हाथ उठाकर कह रहा हो, "अभी मेरा सबसे अच्छा अनुमान यह है।" हर बार जब उसका अनुमान बदलता है, तो उसे यह नोट लिखना होगा और अपने अनुमान को अपडेट करना होगा।
  • [continue]: यह छात्र द्वारा यह कहने जैसा है, "मैं अभी खत्म नहीं हुआ हूँ, मुझे और सोचने की आवश्यकता है।"
  • [stop]: यह छात्र द्वारा यह कहने जैसा है, "मैं आश्वस्त हूँ, मेरी सोचने की प्रक्रिया पूरी हो गई है, यह मेरा अंतिम उत्तर है।"

2. यह क्यों एक गेम चेंजर है

इन नोट्स के बिना, एक शिक्षक (या निगरानी प्रणाली) को यह समझने के लिए पूरी बिखरी हुई नोटबुक पढ़नी पड़ती है कि क्या छात्र सही रास्ते पर है। यह एक फिल्म को केवल उसके अंतिम फ्रेम को देखकर समझने की कोशिश करने जैसा है।

इन नोट्स के साथ, शिक्षक [answer] स्टिकी नोट्स को देखकर तुरंत छात्र के विकसित होते विचारों की प्रक्रिया को देख सकता है।

  • दक्षता (समय की बचत): यदि शिक्षक देखता है कि छात्र एक स्टिकी नोट पर सही उत्तर लिख रहा है, तो वह तुरंत कह सकता है, "रुको! तुम कर चुके हो। और सोचने में समय बर्बाद मत करो।" शोध पत्र दिखाता है कि यह सोचने के बर्बाद हुए समय को 50% तक कम कर सकता है।
  • सुरक्षा (गलतियों को रोकना): कल्पना कीजिए कि छात्र एक खेल खेल रहा है जहाँ उसे "लावा" से बचना है। यदि छात्र का अंतिम विचार लावा पर कूदना है, लेकिन पाँच मिनट पहले उसके [answer] स्टिकी नोट ने कहा था "घास पर कूदें," तो शिक्षक उस पहले सुरक्षित विचार को पकड़ सकता है और कह सकता है, "वास्तव में, आइए उस सुरक्षित घास वाले विचार के साथ चलते हैं।" इसने उन प्रयासों को बचाने में मदद की जो अन्यथा विफल हो जाते, जिससे सफलता दर में 80% का सुधार हुआ।

3. "ब्लैक बॉक्स" का लाभ

आमतौर पर, AI को नियंत्रित करने के लिए, आपको इसके मस्तिष्क (इसके आंतरिक कोड या छिपी हुई अवस्थाओं) के अंदर झांकने की आवश्यकता हो सकती है। यह शोध पत्र का तरीका विशेष है क्योंकि यह AI को एक ब्लैक बॉक्स की तरह मानता है। शिक्षक को यह जानने की आवश्यकता नहीं है कि AI का मस्तिष्क कैसे काम करता है; उन्हें बस AI द्वारा सतह पर लिखे गए विशेष स्टिकी नोट्स को पढ़ने की आवश्यकता है। यह एक "निरीक्षक" (एक कमजोर, सरल AI) को स्मार्ट AI को नियंत्रण में रखने के लिए बनाना बहुत आसान बनाता है।

4. परिणाम क्या दिखाते हैं

शोधकर्ताओं ने दो अलग-अलग प्रकार के AI मस्तिष्क और तीन अलग-अलग "दुनियाओं" में इसका परीक्षण किया:

  • गणित की समस्याएँ: AI ने कठिन गणितीय समस्याओं को पहले की तुलना में समान रूप से (या बेहतर) हल किया, लेकिन शिक्षक इसे उत्तर मिलने के बाद समय बर्बाद करने से रोक सकता था।
  • टेक्स्ट गेम्स: एक खेल में जहाँ AI को भोजन पकाना होता है, शिक्षक AI को बेकार घूमते रहने से रोक सकता था।
  • सुरक्षा खेल: "लावा" (खतरे वाले क्षेत्र) वाले एक खेल में, शिक्षक हस्तक्षेप कर सकता था और एक खतरनाक चाल को एक सुरक्षित चाल से बदल सकता था जिसे AI ने पहले ही सोच लिया था, जिससे विफलता दर 46% से बदलकर सफलता दर 96% हो गई।

मुख्य निष्कर्ष

यह शोध पत्र एक सरल लेकिन शक्तिशाली विचार प्रस्तावित करता है: AI को सिखाएं कि वह सोचते समय अपने विचारों की घोषणा करे।

AI को अपने विचारों पर "स्टिकी नोट्स" लगाने के लिए मजबूर करके, हम एक सरल पर्यवेक्षक के लिए इसे वास्तविक समय में देखना, काम पूरा होने पर इसे रोकना, या गलती होने पर इसे ठीक करना संभव बनाते हैं। यह AI की छिपी हुई, बिखरी हुई सोच की प्रक्रिया को पारदर्शी, नियंत्रणीय और बहुत अधिक सुरक्षित बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →