← नवीनतम पेपर
💬 NLP

UniMaia: Steering Chess Policies with Language for Human-like Play

यह शोध पत्र UniMaia को प्रस्तुत करता है, जो एक पैरामीटर-कुशल (parameter-efficient) फ्रेमवर्क है जो एंड-टू-एंड मल्टीमॉडल प्रशिक्षण की आवश्यकता के बिना, डोमेन-विशिष्ट प्रदर्शन को संरक्षित करते हुए, गेमप्ले शैली और सामर्थ्य पर मानव-समान नियंत्रणीयता प्राप्त करने के लिए भाषा प्रॉम्प्ट्स का उपयोग करके एक फ्रोजन (frozen) Lc0 चेस पॉलिसी नेटवर्क को निर्देशित करता है।

मूल लेखक: Sherman Siu (University of Waterloo), Lesley Istead (University of Waterloo)

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sherman Siu (University of Waterloo), Lesley Istead (University of Waterloo)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विश्व स्तरीय शतरंज प्रशिक्षक है जो अविश्वसनीय रूप से बुद्धिमान है और हर संभव चाल जानता है, लेकिन वह थोड़ा रोबोट जैसा भी है। वह हमेशा "परफेक्ट" खेल खेलता है, जो जीतने के लिए तो बहुत अच्छा है, लेकिन यदि आप यह देखना चाहते हैं कि एक इंसान कैसे खेल सकता है, या यदि आप चाहते हैं कि वे किसी विशिष्ट व्यक्ति (जैसे एक नौसिखिया या ग्रैंडमास्टर) की तरह खेलें, तो यह उबाऊ हो जाता है।

दूसरी ओर, आपके पास एक रचनात्मक कहानीकार है जो बातें करना पसंद करता है और "एक घबराए हुए नौसिखिए की तरह खेलें" या "सिसिलियन डिफेंस का उपयोग करें" जैसे निर्देशों का पालन करता है, लेकिन वह कहानीकार शतरंज में बहुत अच्छा नहीं है और अक्सर अवैध चालें चलता है या स्पष्ट खतरों को अनदेखा कर देता है।

UniMaia एक नया फ्रेमवर्क है जो इन दोनों दुनियाओं का सर्वश्रेष्ठ हिस्सा पाने की कोशिश करता है। यह "रोबोट कोच" (एक फ्रीज किया गया, प्री-ट्रेन्ड शतरंज AI जिसे Lc0 कहा जाता है) को एक "अनुवादक" (एक टेक्स्ट एनकोडर) देता है जो प्राकृतिक भाषा के निर्देशों को सुनता है।

यह इस प्रकार काम करता है, यहाँ कुछ सरल उपमाएँ दी गई हैं:

1. फ्रीज किया गया कोच और नया अनुवादक

शतरंज इंजन (Lc0) को एक परफेक्ट खिलाड़ी की फ्रीज की हुई मूर्ति के रूप में सोचें। आप इसे पिघला नहीं सकते या शून्य से फिर से प्रशिक्षित नहीं कर सकते क्योंकि इसमें बहुत अधिक समय और पैसा लगेगा, और आप इसकी अविश्वसनीय शतरंज कौशल को खो देंगे।

UniMaia इस मूर्ति को पिघलाता नहीं है। इसके बजाय, यह मूर्ति के चारों ओर एक ControlNet-शैली का "कंट्रोल पैनल" बनाता है। यह एक मूर्ति से डायल और लीवर जोड़ने जैसा है।

  • लीवर्स (Levers): ये एक टेक्स्ट एनकोडर (एक छोटा लैंग्वेज मॉडल) द्वारा नियंत्रित होते हैं।
  • इनपुट (Input): आप "एक 1200-रेटेड खिलाड़ी की तरह खेलें जो किंग'्स गैम्बिट ओपनिंग पसंद करता है" जैसा प्रॉम्प्ट टाइप करते हैं।
  • एक्शन (Action): टेक्स्ट एनकोडर आपके शब्दों को पढ़ता है और कंट्रोल पैनल के डायल को घुमाता है। ये डायल मूर्ति के मस्तिष्क में सूक्ष्म, सटीक समायोजन (रेसिडुअल अपडेट्स) भेजते हैं, जिससे उसे अधिक मानवीय तरीके से खेलने या एक विशिष्ट रणनीति का पालन करने के लिए प्रेरित किया जाता है, बिना मूर्ति की बोर्ड को समझने की मूल क्षमता को बदले।

2. "स्टीयरिंग व्हील" की उपमा

कल्पना कीजिए कि शतरंज इंजन एक हाई-परफॉर्मेंस रेस कार है। वह ट्रैक पर पूरी तरह से गाड़ी चलाना जानता है।

  • पुराना तरीका: कार को टैक्सी या डिलीवरी ट्रक की तरह चलाने के लिए, आपको पूरे इंजन को शून्य से फिर से बनाना पड़ता था।
  • UniMaia का तरीका: आप रेस कार के इंजन को बिल्कुल वैसा ही रखते हैं। आप बस एक स्मार्ट स्टीयरिंग व्हील स्थापित करते हैं जिसे वॉयस कमांड के माध्यम से प्रोग्राम किया जा सकता है। यदि आप कहते हैं, "एक सतर्क टैक्सी ड्राइवर की तरह चलें," तो स्टीयरिंग व्हील कार के पथ को थोड़ा अधिक रूढ़िवादी बनाने के लिए समायोजित करता है। यदि आप कहते हैं, "एक लापरवाह रेसर की तरह चलें," तो यह पथ को अधिक आक्रामक बनाने के लिए समायोजित करता है। इंजन अभी भी वही शक्तिशाली इंजन है, लेकिन आपका निर्देश के आधार पर इसका व्यवहार बदल जाता है।

3. "मानवीय" लक्ष्य

शोधकर्ताओं ने यह देखने की कोशिश की कि क्या वे AI को इंसान की तरह खेलने के लिए तैयार कर सकते हैं। इंसान गलतियाँ करते हैं, उनके पसंदीदा ओपनिंग्स होती हैं, और वे अपने कौशल स्तर (उनके "Elo" रेटिंग) के आधार पर अलग-अलग तरह से खेलते हैं।

  • परिणाम: UniMaia ने शतरंज इंजन को "स्टीयर" करने में सफलता प्राप्त की। जब इसे एक नौसिखिया की तरह खेलने के लिए कहा गया, तो इसने अधिक गलतियाँ कीं। जब इसे ग्रैंडमास्टर की तरह खेलने के लिए कहा गया, तो इसने अधिक सटीकता से खेला। यह टेक्स्ट विवरण के आधार पर विभिन्न शतरंज ओपनिंग्स के बीच स्विच भी कर सकता था।
  • समझौता (Trade-off): यहाँ एक सूक्ष्म संतुलन बनाना होता है। आप AI को जितना अधिक "मानव की तरह कार्य" करने या जटिल निर्देशों का पालन करने के लिए कहेंगे, शुद्ध, बिना निर्देशित शतरंज इंजन की तुलना में इसकी टॉप मूव भविष्यवाणी उतनी ही थोड़ी कम परफेक्ट हो जाएगी। हालांकि, यह उन मॉडलों के साथ बहुत प्रतिस्पर्धी बना रहता है जिन्हें विशेष रूप से केवल मानव चालों की भविष्यवाणी करने के लिए बनाया गया है।

4. "टाइम मशीन" फीचर (UniMaia-Aux)

शोधकर्ताओं ने इसका दूसरा संस्करण जोड़ा जिसे UniMaia-Aux कहा जाता है। यह कोच को एक टाइम मशीन और एक स्टॉपवॉच देने जैसा है।

  • टेक्स्ट निर्देशों के अलावा, यह संस्करण यह भी देखता है कि चाल कब चली गई थी, खिलाड़ी के पास घड़ी में कितना समय बचा था, और पिछले मूव के लिए उन्होंने कितना समय लिया था।
  • परिणाम: इसने AI को मानव व्यवहार को और भी बेहतर ढंग से समझने में मदद की। उदाहरण के लिए, यह अनुमान लगाने में बहुत बेहतर हो गया कि एक इंसान खेल की स्थिति और समय के दबाव के आधार पर कब "रेजिन" (हार मान लेना) करेगा, जो कि मानक संस्करण के लिए कठिन था।

5. डेटा डाइट (Data Diet)

इस सिस्टम को सिखाने के लिए, शोधकर्ताओं ने केवल रैंडम गेम नहीं खिलाए। उन्होंने Lichess से 5.2 बिलियन शतरंज खेलों का एक विशाल पुस्तकालय बनाया।

  • उन्होंने एक "प्रॉम्प्ट जनरेटर" बनाया जो स्वचालित रूप से इन खेलों के लिए लाखों अलग-अलग निर्देश लिखता था, जैसे कि "फ्रेंच डिफेंस खेलने वाला 1500 रेटेड खिलाड़ी।"
  • इसने सिस्टम को बिना किसी इंसान द्वारा हर निर्देश को हाथ से लिखे बिना, मानव खेलने की शैलियों की एक विशाल विविधता को समझने के लिए प्रशिक्षित किया।

सारांश

UniMaia यह सिद्ध करता है कि किसी शक्तिशाली AI को बनाने के लिए आपको उसे शून्य से फिर से बनाने की आवश्यकता नहीं है। एक फ्रीज किए गए विशेषज्ञ के साथ एक हल्का "भाषा अनुवादक" जोड़कर, आप प्राकृतिक भाषा के साथ उसके व्यवहार को नियंत्रित कर सकते हैं। यह एक ऐसा शतरंज AI बनाता है जो केवल एक कैलकुलेटर नहीं है, बल्कि एक लचीला साथी है जो विभिन्न मानव खिलाड़ियों की नकल कर सकता है, विशिष्ट रणनीतियों का पालन कर सकता है, और यहाँ तक कि घड़ी के दबाव को भी समझ सकता है, जबकि उसकी मूल शतरंज प्रतिभा बरकरार रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →