← नवीनतम पेपर
🤖 machine learning

Opponent State Inference Under Partial Observability: An HMM-POMDP Framework for 2026 Formula 1 Energy Strategy

यह शोध पत्र आंशिक अवलोकनशीलता के तहत 2026 फॉर्मूला 1 ऊर्जा रणनीतियों को अनुकूलित करने के लिए प्रतिद्वंद्वी ऊर्जा अवस्थाओं का अनुमान लगाने हेतु एक हिडन मार्कोव मॉडल और निर्णय लेने हेतु एक डीप क्यू-नेटवर्क को संयोजित करने वाले एक सुलभ द्वि-स्तरीय ढांचे का प्रस्ताव करता है, जो विशेष रूप से "काउंटर-हार्वेस्ट ट्रैप" को संबोधित करता है जहाँ प्रतिद्वंद्वी जानबूझकर अपने परिनियोजन संकेतों को छिपाते हैं।

मूल लेखक: Kalliopi Kleisarchaki

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kalliopi Kleisarchaki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि 2026 में फॉर्मूला 1 रेसिंग केवल इस बारे में नहीं है कि किसके पास सबसे तेज़ कार है, बल्कि इस बारे में है कि कौन सबसे अच्छा पोकर खिलाड़ी है।

पुराने दिनों में, ड्राइवरों को ठीक पता होता था कि उनके प्रतिद्वंद्वियों के पास कितना ईंधन और ऊर्जा बची है। यह शतरंज खेलने जैसा था जहाँ आप सभी के कार्ड देख सकते थे। लेकिन नए 2026 के नियमों ने खेल बदल दिया है। अब, हर कार में एक विशाल बैटरी होती है जिसे लगातार चार्ज और डिस्चार्ज करने की आवश्यकता होती है, और ड्राइवर चुन सकते हैं कि उन्हें "तेज़ जाना" (ऊर्जा जलाना) है या "चार्ज करने के लिए धीमा होना" (ऊर्जा संचय करना) है।

समस्या क्या है? आप अपने प्रतिद्वंद्वी की बैटरी नहीं देख सकते। आप केवल उनकी गति, उनके ब्रेकिंग और ट्रैक पर उनकी स्थिति देखते हैं। आपको अनुमान लगाना होगा कि वे अपनी कार के अंदर क्या कर रहे हैं।

यह पेपर एक सुपर-स्मार्ट डिटेक्टिव सिस्टम (एक AI) बनाने के तरीके पर एक गाइड है जो यह अनुमान लगा सके कि आपका प्रतिद्वंद्वी क्या सोच रहा है और उसके अनुसार अपनी अगली चाल की योजना बना सके।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. मुख्य समस्या: "ब्लाइंड डेट" (अंधाधुंध मुलाकात)

कल्पना कीजिए कि आप एक डेट पर हैं, लेकिन आपके पार्टनर ने मास्क पहना हुआ है। आप देख सकते हैं कि वे मुस्कुरा रहे हैं या त्योरियां चढ़ा रहे हैं (अवलोकन योग्य डेटा), लेकिन आप यह नहीं जानते कि वे वास्तव में खुश हैं, ऊब रहे हैं, या गुप्त रूप से भागने की योजना बना रहे हैं (छिपी हुई अवस्था/hidden state)।

2026 की F1 में, एक प्रतिद्वंद्वी ड्राइवर:

  • ऊर्जा से भरपूर हो सकता है: आप पर हमला करने के लिए तैयार।
  • खाली होने की कगार पर हो सकता है: बैटरी खत्म होने के कारण धीमा चलने के लिए मजबूर।
  • चाल चल रहा हो सकता है: आपको लुभाने के लिए कमजोर होने का नाटक करना (धीमा जाना), ताकि बाद में अपनी पूरी बैटरी दिखाकर आपको कुचल सके।

यह पेपर तीसरे परिदृश्य को "काउंटर-हार्वेस्ट ट्रैप" (Counter-Harvest Trap) कहता है। यह एक भ्रामक चाल है जहाँ एक ड्राइवर अपनी ताकत छुपाता है ताकि आपको अपनी ऊर्जा बर्बाद करने के लिए फंसा सके।

2. समाधान: बुद्धिमत्ता के दो स्तर

लेखकों ने इस रहस्य को सुलझाने के लिए एक दो-स्तरीय AI सिस्टम बनाया है।

स्तर 1: जासूस (HMM)

इसे कंप्यूटर के भीतर एक शरलॉक होम्स के रूप में सोचें।

  • सुराग: यह छह विशिष्ट चीजों पर नज़र रखता है: गति का अंतर, ब्रेकिंग दूरी, टायर का घिसना, और एक नया "थ्रॉटल सिग्नेचर" (कि ड्राइवर वास्तव में कार धीमी होने के दौरान कितना एक्सीलेटर दबा रहा है)।
  • रहस्य: यह इन सुरागों का उपयोग प्रतिद्वंद्वी की छिपी हुई अवस्था का अनुमान लगाने के लिए करता है।
  • बड़ा अपग्रेड (v2): पिछले संस्करणों में, AI केवल यह जानता था कि प्रतिद्वंद्वी "कम ऊर्जा" पर है। अब, यह "कम" के दो प्रकारों के बीच अंतर बता सकता है:
    • L-Harvest (द ट्रैप): ड्राइवर ऊर्जा बचाने के लिए जानबूझकर धीमा जा रहा है। वे एक जाल बिछा रहे हैं।
    • L-Derate (द वीकनेस): ड्राइवर को धीमा चलना पड़ रहा है क्योंकि उनकी बैटरी शारीरिक रूप से खत्म हो चुकी है। वे असुरक्षित हैं।
  • यह क्यों मायने रखता है: यदि AI को लगता है कि यह एक जाल है, तो वह हमला नहीं करेगा। यदि उसे लगता है कि यह एक कमजोरी है, तो वह हमला करेगा। यह अंतर ही इस पेपर की सबसे बड़ी सफलता है।

स्तर 2: जनरल (DQN)

इसे टीम प्रिंसिपल के रूप में सोचें जो अंतिम निर्णय लेता है।

  • यह जासूस की रिपोर्ट (जैसे, "89% संभावना है कि प्रतिद्वंद्वी जाल बिछा रहा है") लेता है और तय करता है कि क्या करना है।
  • विकल्प: क्या मुझे "बर्न" (तेज़ जाने और ओवरटेक करने के लिए अपनी ऊर्जा का उपयोग करना) करना चाहिए या "हार्वेस्ट" (ऊर्जा बचाना और प्रतीक्षा करना) करना चाहिए?
  • जनरल एक न्यूरल नेटवर्क (AI मस्तिष्क का एक प्रकार) का उपयोग करता है जिसने हजारों सिम्युलेटेड रेस से सीखा है ताकि जासूस के अनुमान के आधार पर सही निर्णय लिया जा सके।

3. "सुपर-क्लिपिंग" सुराग

पेपर एक नया "छठा सेंस" पेश करता है जिसे δ\deltathrottle कहा जाता है।

  • कल्पना कीजिए कि एक कार धीमी चल रही है, लेकिन ड्राइवर एक्सीलेटर को 100% तक दबा रहा है।
  • परिदृश्य A: ड्राइवर ऊर्जा बचाने के लिए धीमा होने की कोशिश कर रहा है (जाल)।
  • परिदृश्य B: ड्राइवर एक्सीलेटर दबा रहा है, लेकिन कार तेज़ नहीं हो पा रही है क्योंकि बैटरी खत्म हो गई है (कमजोरी)।
  • नया AI डेटा में इस सूक्ष्म अंतर को पहचान सकता है। यह किसी के थके होने का नाटक करने और वास्तव में थका हुआ होने के बीच के अंतर को सुनने जैसा है।

4. उन्होंने इसका परीक्षण कैसे किया

चूंकि 2026 का सीज़न अभी नहीं हुआ है (पेपर मार्च 2026 का है), वे वास्तविक रेस पर इसका परीक्षण नहीं कर सके। इसके बजाय, उन्होंने एक वीडियो गेम सिमुलेशन बनाया।

  • उन्होंने 40 अलग-अलग "मूड्स" वाले वर्चुअल वर्ल्ड के साथ एक दुनिया बनाई।
  • उन्होंने 20 नकली रेस चलाईं।
  • परिणाम: AI अविश्वसनीय रूप से अच्छा था। इसने प्रतिद्वंद्वी के बैटरी स्तर का 96.8% बार सही अनुमान लगाया (रैंडम अनुमान लगाने की संभावना केवल 25% थी)। यह "ट्रैप" को 96.3% बार पहचान सका।

5. कमी (सीमाएं)

पेपर एक बड़ी खामी स्वीकार करता है: AI यह मान लेता है कि प्रतिद्वंद्वी एक रोबोट है।

  • वर्तमान सिस्टम यह मानता है कि प्रतिद्वंद्वी ड्राइवर को पता नहीं है कि आप उन्हें देख रहे हैं।
  • वास्तव में, यदि एक प्रतिद्वंद्वी ड्राइवर को पता चलता है कि आपके पास एक सुपर-स्मार्ट AI है, तो वे आपके AI को धोखा देने के लिए अपनी रणनीति बदल सकते हैं।
  • लेखक कहते हैं, "यह केवल पहला कदम है। अगला पेपर AI को उस प्रतिद्वंद्वी के खिलाफ खेलना सिखाएगा जो खुद उसे धोखा देने की कोशिश कर रहा है।"

सारांश

यह पेपर 2026 F1 के लिए एक दो-चरणीय AI रणनीति प्रस्तुत करता है:

  1. डिटेक्ट (पता लगाना): यह अनुमान लगाने के लिए गणित का उपयोग करें कि प्रतिद्वंद्वी "दिखावा" (जाल बिछाना) कर रहा है या "वास्तव में टूट" (शक्ति खत्म होना) गया है।
  2. डिसाइड (निर्णय लेना): उस अनुमान का उपयोग यह तय करने के लिए करें कि हमला करना है या पीछे हटना है।

यह फॉर्मूला 1 को शुद्ध गति के खेल से मनोवैज्ञानिक युद्ध के खेल में बदल देता है, जहाँ विजेता वह होता है जो अपने प्रतिद्वंद्वी के दिमाग को पढ़ने में सबसे बेहतर होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →