← नवीनतम पेपर
🤖 machine learning

The Algorithm Is Not the Behavior: Learned Priors Override Look-Ahead in a Chess-Playing Neural Network

यह अध्ययन प्रदर्शित करता है कि लीला चेस ज़ीरो (Leela Chess Zero) में, न्यूरल नेटवर्क का आंतरिक एल्गोरिद्मिक लुक-अहेड (look-ahead) शतरंज की पहेलियों को सही ढंग से हल करता है, लेकिन ये समाधान अंतिम आउटपुट में सीखे गए सुरक्षा पूर्वाग्रहों (safety priors) द्वारा व्यवस्थित रूप से ओवरराइड कर दिए जाते हैं, जो यह सिद्ध करता है कि एल्गोरिद्मिक संरचना की उपस्थिति एल्गोरिद्मिक व्यवहार की गारंटी नहीं देती है।

मूल लेखक: Elias Sandmann, Sebastian Lapuschkin, Wojciech Samek

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elias Sandmann, Sebastian Lapuschkin, Wojciech Samek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र "The Algorithm Is Not the Behavior" का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

मूल विचार: "दोबारा सोचने वाला" शेफ (The "Second-Guessing" Chef)

कल्पना कीजिए कि आपके पास एक विश्व प्रसिद्ध शेफ है जो एक शानदार गणितज्ञ भी है। आप इस शेफ को एक जटिल रेसिपी की पहेली देते हैं: "इस विशिष्ट व्यंजन को पूरी तरह से कैसे बनाया जाए?"

शेफ का मस्तिष्क दो चरणों में काम करता है:

  1. गणना चरण (The Calculation Stage): शेफ तुरंत आवश्यक सटीक चरणों की गणना करता है। वह 100% निश्चितता के साथ जानता है कि गुप्त सामग्री एक जोखिम भरी, तीखी चटनी है जो व्यंजन को बेहतरीन बना देगी।
  2. सुरक्षा चरण (The Safety Stage): परोसने से ठीक पहले, शेफ का "सेफ्टी मैनेजर" बीच में आ जाता है। यह मैनेजर अत्यधिक सतर्क है। वह सोचता है, "तीखी चटनी खतरनाक है! क्या होगा अगर ग्राहक को यह पसंद न आए? चलो बस सादा पानी ही परोस देते हैं। यह उबाऊ है, लेकिन सुरक्षित है।"

तो, शेफ को सही उत्तर पता है, वह इसकी सही गणना करता है, लेकिन अंत में जोखिम लेने के डर से वह इसे अनदेखा कर देता है।

यह शोध पत्र तर्क देता है कि Leela Chess Zero के साथ भी बिल्कुल यही होता है, जो दुनिया के सबसे शक्तिशाली शतरंज खेलने वाले AI प्रोग्रामों में से एक है।

खोज: "भूली हुई पहेलियाँ" (Forgotten Puzzles)

शोधकर्ताओं ने "Logit Lens" नामक टूल का उपयोग किया। इसे AI के मस्तिष्क के लिए एक एक्स-रे मशीन की तरह समझें। यह हमें AI की केवल अंतिम चाल देखने के बजाय, उसके सोचने की प्रक्रिया को परत दर परत (layer by layer) देखने की अनुमति देता है।

उन्होंने एक अजीब घटना देखी जिसे वे "भूली हुई पहेलियाँ" (Forgotten Puzzles) कहते हैं।

  • परिदृश्य: AI के सामने एक शतरंज की पहेली आती है जहाँ केवल एक ही जीतने वाली चाल होती है। अक्सर, यह जीतने वाली चाल एक 'बलिदान' (जीतने के लिए अपने एक मोहरे को छोड़ देना) से जुड़ी होती है।
  • आंतरिक विचार: जब शोधकर्ताओं ने AI के मस्तिष्क के भीतर देखा, तो उन्होंने पाया कि मध्यवर्ती परतों (middle layers) में, AI ने पहले ही सही, जीतने वाली चाल का पता लगा लिया था। वह भविष्य के चरणों की सही गणना कर रहा था। वह उत्तर "जानता" था।
  • अंतिम आउटपुट: लेकिन अंतिम परत में, अपनी चाल चलने से ठीक पहले, उसने अपना मन बदल लिया। उसने उस शानदार, जीतने वाली बलि के बजाय एक उबाऊ, सुरक्षित चाल चुन ली जो अंततः खेल हारने का कारण बनेगी।

AI ने पहेली को हल करने में विफल नहीं हुआ; वह समाधान पर कार्रवाई करने में विफल रहा।

ऐसा क्यों होता है? "सेफ्टी प्रायर" (The "Safety Prior")

शोधकर्ताओं ने पूछा: AI अपना मन आखिरी क्षण में क्यों बदल देता है?

उन्होंने पाया कि AI के पास एक मजबूत "सेफ्टी प्रायर" (Safety Prior) है। यह उसके प्रशिक्षण से सीखी गई एक आदत है। अधिकांश शतरंज के खेलों में, सुरक्षित रहना और अपने मोहरों की रक्षा करना एक अच्छी रणनीति होती है। AI ने सीखा है कि "सुरक्षा" और "खतरों से बचने" को सबसे ऊपर प्राथमिकता देनी है।

  • शुरुआती परतें (Early Layers): AI आक्रामक और सामरिक (tactical) है। वह विजयी बलिदान को देखता है।
  • अंतिम परतें (Late Layers): AI रूढ़िवादी हो जाता है। वह सोचता है, "वजीर (Queen) का बलिदान देना जोखिम भरा है! चलो वजीर को एक सुरक्षित स्थान पर ले चलते हैं।"

AI के मस्तिष्क में मौजूद "सेफ्टी मैनेजर", "गणितीय हल करने वाले" (Mathematical Solver) को दबा देता है। AI अपनी जीत को अपनी सुरक्षा की आवश्यकता को संतुष्ट करने के लिए कुर्बान कर देता है।

प्रमाण: AI को निर्देशित करना (Steering the AI)

यह साबित करने के लिए कि "सुरक्षा" ही असली कारण था, शोधकर्ताओं ने एक कारणत्मक प्रयोग (causal experiment) किया। उन्होंने "स्टीयरिंग" (Steering) नामक तकनीक का उपयोग किया।

कल्पना कीजिए कि आप AI के मस्तिष्क को एक विशिष्ट दिशा में धीरे से धकेल सकते हैं। शोधकर्ताओं ने AI के मस्तिष्क को इस तरह धकेला कि वह सुरक्षा की परवाह कम करे और आक्रामकता की अधिक करे

  • परिणाम: जब उन्होंने ऐसा किया, तो AI ने खुद पर संदेह करना बंद कर दिया। उसने अपनी "भूली हुई पहेलियों" में से 61.7% को वापस हासिल कर लिया। वह वापस उन्हीं शानदार, विजयी बलिदानों को करने लगा जिन्हें उसने मूल रूप से कैलकुलेट किया था।

इससे यह सिद्ध हुआ कि AI के पास पहेली को हल करने की क्षमता थी ही, बस वह अपनी ही सतर्क आदतों के कारण पीछे रह रहा था।

मुख्य निष्कर्ष (The Big Takeaway)

इस शोध पत्र का मुख्य निष्कर्ष गहरा है: सिर्फ इसलिए कि एक AI के पास "एल्गोरिदम" (सही उत्तर की गणना करने की क्षमता) है, इसका मतलब यह नहीं है कि वह वह "व्यवहार" (वास्तव में सही काम करना) भी दिखाएगा।

  • एल्गोरिद्मिक संरचना (Algorithmic Structure): AI के पास समस्या को हल करने के लिए सर्किट्री (circuitry) है।
  • एल्गोरिद्मिक व्यवहार (Algorithmic Behavior): AI वास्तव में सही उत्तर देता है।

यह शोध पत्र दिखाता है कि ये दोनों चीजें अलग हो सकती हैं। एक AI आंतरिक रूप से सत्य को जान सकता है लेकिन परस्पर विरोधी आंतरिक प्राथमिकताओं के कारण एक झूठ (या गलत चाल) दे सकता है—जैसे कि एक सुरक्षा की आदत किसी तार्किक निष्कर्ष को ओवरराइड कर देती है।

यह क्यों महत्वपूर्ण है

यह केवल शतरंज के बारे में नहीं है। लेखक सुझाव देते हैं कि यह अन्य AI सिस्टम, जैसे बड़े भाषा मॉडल (Chatbots) में भी हो सकता है।

  • एक चैटबॉट किसी प्रश्न के उत्तर में आंतरिक रूप से सही तथ्यात्मक जानकारी जान सकता है।
  • लेकिन उसका "सुरक्षा" या "विनम्रता" का प्रशिक्षण उस तथ्य को दबा सकता है, जिससे वह विनम्र या जोखिम भरा दिखने से बचने के लिए अस्पष्ट या गलत उत्तर दे सकता है।

यह शोध पत्र हमें चेतावनी देता है: हम केवल इसलिए किसी AI के आउटपुट पर भरोसा नहीं कर सकते क्योंकि हम जानते हैं कि वह गणित कर सकता है। हमें उसके "मस्तिष्क" के भीतर झांकने की आवश्यकता है ताकि यह देख सकें कि कहीं छिपी हुई आदतें उसकी बुद्धिमत्ता को बाधित तो नहीं कर रही हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →