← नवीनतम पेपर
💻 computer science

A distilled value head breaks search, but search remains an effective teacher, not a move selector: a case study in 19x19 Go

यह अध्ययन प्रदर्शित करता है कि जबकि एक मजबूत गो (Go) एआई से वैल्यू हेड (value head) को डिस्टिल करने के परिणामस्वरूप एक कैलिब्रेटेड लेकिन गैर-विभेदक (non-discriminative) मूल्यांकनकर्ता प्राप्त हो सकता है जो एमसीटीएस (MCTS) सर्च प्रदर्शन को बाधित करता है, स्वयं सर्च प्रक्रिया एक अत्यधिक प्रभावी शिक्षक बनी रहती है, क्योंकि पॉलिसी को एमसीटीएस विज़िट काउंट्स की नकल करने के लिए प्रशिक्षित करने से महत्वपूर्ण शक्ति लाभ प्राप्त होते हैं, बावजूद इसके कि सर्च इन्फरेंस के दौरान बेहतर चालें चुनने में विफल रहता है।

मूल लेखक: Taiki Kojima

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taiki Kojima

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन जिद्दी छात्र को शतरंज या गो (Go) जैसा जटिल रणनीति वाला खेल खेलना सिखा रहे हैं। आपके पास एक सुपर-स्मार्ट शिक्षक है (जिसे हम "द ऑरेकल" कह सकते हैं) जो बोर्ड को देख सकता है और आपको बिल्कुल सटीक बता सकता है कि कौन जीत रहा है। आमतौर पर, जब आप किसी छात्र को पढ़ाते हैं, तो आप उसे शिक्षक के खिलाफ खेलकर अभ्यास करने देते हैं, या आप उसे कुछ चालें आगे तक सोचने देते हैं ताकि वह देख सके कि क्या होता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस "आगे सोचने" की प्रक्रिया को मोंटे कार्लो ट्री सर्च (MCTS) कहा जाता है। यह एक सिम्युलेटर की तरह है जो एक सेकंड के एक छोटे से हिस्से में हजारों काल्पनिक गेम चलाकर सबसे अच्छी चाल का पता लगा लेता है।

आधुनिक एआई का बड़ा विचार यह है कि यदि आप एक स्मार्ट "दिमाग" (एक न्यूरल नेटवर्क) को इस "सिम्युलेटर" (MCTS) के साथ मिला दें, तो परिणाम अपराजेय होना चाहिए। दिमाग चाल का अनुमान लगाता है, और सिम्युलेटर उसकी दोबारा जांच करता है। लेकिन क्या होगा अगर सिम्युलेटर दिमाग को और भी खराब बना दे? क्या होगा अगर वह उपकरण, जो आपको सोचने में मदद करने के लिए बनाया गया था, वास्तव में आपको भ्रमित करने लगे? यह एक अजीब पहेली है जिसे शोधकर्ता ताइकी कोजिमा ने सुलझाया। वह दुनिया की चैंपियनशिप जीतने वाला रोबोट बनाने की कोशिश नहीं कर रहे थे; वह उस गड़बड़ी (glitch) को समझने की कोशिश कर रहे थे जहाँ "सोचने" वाले हिस्से ने "खेलने" वाले हिस्से को खराब कर दिया, भले ही "सोचने" वाला हिस्सा सिखाने के लिए अभी भी अविश्वसनीय रूप से उपयोगी था। यह एक कहानी है कि कैसे एक खराब दिशा-सूचक यंत्र (compass) भी एक शिक्षक के लिए एक बेहतरीन मानचित्र (map) हो सकता है।


दोषपूर्ण दिशा-सूचक यंत्र (The Glitchy Compass)

कंप्यूटर गो (एक खेल जो 19x19 ग्रिड पर खेला जाता है) की दुनिया में, शोधकर्ता आमतौर पर एआई को एक अत्यंत शक्तिशाली शिक्षक से सीखने के माध्यम से प्रशिक्षित करते हैं। इस अध्ययन में, शिक्षक एक प्रसिद्ध एआई था जिसे 'काटागो' (KataGo) कहा जाता है। शोधकर्ता ने एक छोटे, सरल एआई को लिया और नॉलेज डिस्टिलेशन (knowledge distillation) नामक तकनीक का उपयोग करके शिक्षक के दिमाग की नकल करने की कोशिश की। इसे ऐसे समझें जैसे एक छात्र शिक्षक के होमवर्क के उत्तरों को रटने की कोशिश कर रहा हो।

आमतौर पर, एक बार जब छात्र उत्तर सीख लेता है, तो आप उसे अपनी चाल चुनने से पहले अपने काम की दोबारा जांच करने के लिए अपने स्वयं के "सोचने के इंजन" (M-CTS) का उपयोग करने देते हैं। अपेक्षा यह थी कि इससे छात्र और भी मजबूत होगा। लेकिन यहाँ कहानी में मोड़ आता है: जब शोधकर्ता ने छात्र को अपनी चालें चुनने के लिए MCTS का उपयोग करने दिया, तो छात्र वास्तव में कमजोर हो गया।

छात्र, बिना किसी सोचने के इंजन के, खुद के खिलाफ लगभग 32% गेम जीत रहा था। लेकिन जैसे ही उसने चाल चुनने में मदद के लिए "सोचने के इंजन" को चालू किया, उसकी जीत की दर तेजी से गिर गई। यह ऐसा था जैसे एक छात्र जो गणित के सवालों को पूरी तरह से हल कर सकता था, अचानक कैलकुलेटर का उपयोग करने की अनुमति मिलते ही हर परीक्षा में फेल होने लगा।

टूटा हुआ वैल्यू हेड (The Broken Value Head)

शोधकर्ता को यह पता लगाना था कि "कैलकुलेटर" क्यों टूटा हुआ था। क्या कैलकुलेटर (सर्च एल्गोरिदम) स्वयं दोषपूर्ण था? या क्या छात्र का दिमाग (न्यूरल नेटवर्क) कैलकुलेटर को गलत जानकारी दे रहा था?

इसकी जांच करने के लिए, शोधकर्ता ने गणना के अंतिम चरण के लिए छात्र के दिमाग को शिक्षक के दिमाग से बदल दिया। अचानक, जीत की दर आसमान छू गई और 98.3% हो गई। इसने साबित कर दिया कि "कैलकुलेटर" (MCTS) पूरी तरह से काम कर रहा था। समस्या पूरी तरह से छात्र के दिमाग में थी।

विशेष रूप से, समस्या वैल्यू हेड (value head) में थी। एआई के संदर्भ में, "वैल्यू हेड" मस्तिष्क का वह हिस्सा है जो कहता है, "क्या यह स्थिति अच्छी है या बुरी?" छात्र का वैल्यू हेड वास्तविक स्कोर (कि स्थिति समग्र रूप से जीत रही है या हार रही है) का निर्णय लेने में काफी अच्छा था। लेकिन यह दो समान चालों की आपस में तुलना करने में बहुत बुरा था। यह नहीं बता सका कि दो समान चालों में से कौन सी थोड़ी बेहतर थी।

इसे एक ऐसे जज की तरह समझें जो आपको बता सकता है कि एक पेंटिंग "अच्छी" है या "बुरी", लेकिन जब आप उन्हें दो ऐसी पेंटिंग दिखाते हैं जो दोनों "अच्छी" हैं, तो वे यह नहीं बता पाते कि कौन सी बेहतर है। जब एआई ने इस भ्रमित जज का उपयोग करके सबसे अच्छी चाल चुनने की कोशिश की, तो वह लगातार गलतियाँ करता रहा। सर्च इंजन ने और गहराई से खोज की, और अधिक भ्रमित करने वाली तुलनाएं मिलीं, और इसने एआई के निर्णयों को और भी बदतर बना दिया।

समाधान: दिशा-सूचक यंत्र का उपयोग करना बंद करें, मानचित्र का उपयोग करें

शोधकर्ता ने दिमाग के उस हिस्से को फिर से प्रशिक्षित करके टूटे हुए जज को ठीक करने की कोशिश की। जज चालों की तुलना करने में थोड़ा बेहतर हुआ, लेकिन एआई अभी भी सर्च इंजन का उपयोग करके बेहतर खेलने में सक्षम नहीं था। सर्च इंजन एक चाल चुनने वाले के रूप में अभी भी खराब था।

इसलिए, शोधकर्ता ने एक पूरी तरह से अलग दृष्टिकोण अपनाया। एआई की चाल चुनने की क्षमता को ठीक करने के बजाय, उन्होंने निर्णय लेने के लिए सर्च इंजन का उपयोग केवल एक शिक्षक के रूप में करने का निर्णय लिया।

यहाँ जादू का तरीका है:

  1. एआई ने एक "विजिट डिस्ट्रीब्यूशन" (visit distribution) उत्पन्न करने के लिए सर्च इंजन का उपयोग करके एक गेम खेला। यह एक रिकॉर्ड है कि सर्च इंजन ने विभिन्न चालों पर कितना समय बिताया। भले ही सर्च इंजन ने गलत अंतिम चाल चुनी हो, लेकिन हो सकता है कि उसने सही चाल के बारे में बहुत अधिक समय तक सोचा हो।
  2. शोधकर्ता ने फिर एआई के दिमाग को केवल अंतिम चाल की नकल करने के बजाय इस "सोचने के पैटर्न" (विजिट डिस्ट्रीब्यूशन) की नकल करने के लिए प्रशिक्षित किया।
  3. उन्होंने उस "सेफ्टी एंकर" (safety anchor) को हटा दिया जो आमतौर पर एआई को बहुत अधिक बदलने से रोकता है।

परिणाम चौंकाने वाला था। सर्च इंजन को केवल एक "शिक्षक" के रूप में उपयोग करके, एआई में भारी सुधार हुआ।

  • जनरेशन 2 (पुराने तरीके का उपयोग करते हुए): एआई अपने पिछले संस्करण से बेहतर नहीं खेला।
  • जनरेशन 3 (सर्च इंजन को शिक्षक के रूप में उपयोग करते हुए): एआई ने मूल बेसलाइन के खिलाफ 94.1% और पिछले संस्करण के खिलाफ 82.4% गेम जीते।

यह पिछले जनरेशन के उपयोग किए गए प्रैक्टिस डेटा (सेल्फ-प्ले गेम्स) के आधे से भी कम डेटा का उपयोग करके हुआ। सर्च इंजन एक बुरा खिलाड़ी था (यह 73% बार गलत चालें चुनता था), लेकिन यह एक अद्भुत शिक्षक था।

यह क्यों महत्वपूर्ण है

पेपर यह निष्कर्ष निकालता है कि एक एआई की निर्णय लेने की क्षमता और पाठ सिखाने की क्षमता के बीच एक बड़ा अंतर है।

इसे एक ऐसे कोच की तरह समझें जो खुद खेल खेलने में बहुत बुरा है। यदि आप इस कोच से मैच खेलने के लिए कहते हैं, तो वह हार जाएगा। लेकिन यदि आप उन्हें एक मैच देखने और आपको यह बताने के लिए कहते हैं कि खिलाड़ियों को अपना ध्यान कहाँ केंद्रित करना चाहिए, तो वे शानदार हो सकते हैं। इस अध्ययन में सर्च इंजन उसी कोच की तरह था: वह विजेता को नहीं चुन सका, लेकिन उसके "अटेंशन मैप" (attention map) ने छात्र को सीखने के लिए ठीक कहाँ देखना है, यह दिखाया।

यह अध्ययन उन लोगों के लिए एक चेतावनी भी देता है जो एआई बना रहे हैं: अपने "स्कोरकार्ड" पर बहुत अधिक भरोसा न करें। शोधकर्ताओं ने पाया कि मानक मेट्रिक्स (जैसे कि एआई ने परीक्षण में चालों को कितनी अच्छी तरह से रैंक किया) अक्सर यह भविष्यवाणी करने में विफल रहे कि क्या एआई वास्तव में खेल को बेहतर ढंग से खेल पाएगा। कभी-कभी, एआई बेहतर हुआ भले ही परीक्षण के स्कोर खराब दिख रहे थे।

अंत में, यह केवल गो के बारे में नहीं है। यही समस्या अन्य एआई क्षेत्रों में भी होती है, जैसे कि लैंग्वेज मॉडल्स को प्रशिक्षित करना। कभी-कभी, उत्तर उत्पन्न करने के लिए उपयोग किया जाने वाला उपकरण सीधे उपयोग करने के लिए बहुत त्रुटिपूर्ण होता है, लेकिन उन उत्तरों को उत्पन्न करने की प्रक्रिया एआई को स्मार्ट बनाने का रहस्य रखती है। सबक? शिक्षक को सिर्फ इसलिए न छोड़ दें क्योंकि वह खेल नहीं खेल सकता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →