← नवीनतम पेपर
🤖 AI

Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems

यह शोध पत्र लॉन्ग-होरिज़न संचयी-क्षति (cumulative-damage) समस्याओं के लिए पॉलिसी-ग्रेडिएंट विधियों में दो ऑर्थोगोनल विफलता मोड—पूर्णता (completion) और इष्टतमता (optimality)—की पहचान और अपघटन करता है, और ब्रिकलेयर तथा एनबीए करियर सिमुलेशन में अनुभवजन्य सत्यापन के माध्यम से यह प्रदर्शित करता है कि जबकि एक्शन-स्पेस प्रतिबंध कार्य पूर्णता को सक्षम करते हैं, वे अक्सर प्रारंभिक लालची प्रतिबद्धताओं (early greedy commitments) के कारण एक महत्वपूर्ण इष्टतमता अंतराल छोड़ देते हैं।

मूल लेखक: Wolfgang Maass, Sabine Janzen

प्रकाशित 2026-05-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wolfgang Maass, Sabine Janzen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को "करियर" का एक बहुत लंबा खेल खेलने के लिए प्रशिक्षित कर रहे हैं। लक्ष्य खेल में यथासंभव लंबे समय तक बने रहना और अधिक से अधिक अंक एकत्र करना है। हालाँकि, इसमें एक पेच है: वे चालें जो अभी आपको सबसे अधिक अंक देती हैं, वे धीरे-धीरे आपके रोबोट के पैरों को तोड़ देती हैं। यदि पैर बहुत अधिक टूट जाते हैं, तो खेल तुरंत समाप्त हो जाता है।

यह शोध पत्र, जिसका शीर्षक "कम्प्लीशन बनाम ऑप्टिमैलिटी" (Completion vs. Optimality) है, इस बात की जांच करता है कि स्मार्ट AI सीखने के तरीके (विशेष रूप से जिसे "पॉलिसी ग्रेडिएंट" कहा जाता है) इस प्रकार के खेल में अक्सर क्यों विफल हो जाते हैं। लेखकों, वोल्फगैंग मास और सबाइन जानसेन ने पाया कि AI दो पूरी तरह से अलग तरीकों से विफल होता है, और उन्हें ठीक करने के लिए अलग-अलग उपकरणों की आवश्यकता होती है।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. विफल होने के दो तरीके

लेखकों ने महसूस किया कि जब कोई AI खराब प्रदर्शन करता है, तो वह आमतौर पर दो अलग-अलग कार्यों में से एक में विफल हो रहा होता है, लेकिन मानक स्कोरिंग सिस्टम उन्हें आपस में मिला देते हैं:

  • विफलता A: "जल्दी छोड़ देना" (कम्प्लीशन विफलता/Completion Failure)

    • उपमा: कल्पना कीजिए कि एक मैराथन धावक पूरी गति से दौड़ना शुरू कर देता है क्योंकि वह फिनिश लाइन तक तेजी से पहुँचना चाहता है। वह पहले मील में ही अपनी मांसपेशियों को थका देता है और पूरी दौड़ छोड़ने के लिए मजबूर हो जाता है।
    • AI की समस्या: AI उस "लालची" चाल (वह चाल जो तत्काल सबसे अधिक अंक देती है) को देखता है और उसे अपनाता है। यह चाल गुप्त रूप से रोबोट के "स्वास्थ्य" को नुकसान पहुँचाती है। क्योंकि नुकसान का संकेत तब तक छिपा रहता है जब तक कि बहुत देर न हो जाए, AI उस नुकसानदेह चाल को तब तक लेता रहता है जब तक कि रोबोट टूट नहीं जाता और एपिसोड समाप्त नहीं हो जाता। वह करियर के बाद के उच्च-पुरस्कार वाले चरणों तक कभी पहुँच ही नहीं पाता।
  • विफलता B: "बहुत अधिक मेहनत करना" (ऑप्टिमैलिटी विफलता/Optimality Failure)

    • उपमा: कल्पना कीजिए कि एक धावक मैराथन को पूरा तो करता है, लेकिन उसने शुरुआत में इतनी ज़ोर से दौड़ लगाई थी कि अंत तक वह लंगड़ा रहा है और थका हुआ है। उसने दौड़ पूरी तो की, लेकिन यदि उसने अपनी गति नियंत्रित रखी होती, तो वह बहुत बेहतर दौड़ सकता था।
    • AI की समस्या: भले ही AI पूरे करियर में जीवित रहने में सफल हो जाए, फिर भी वह एक "जाल" में फंस जाता है। वह शुरुआत में ही 100% प्रयास करने के लिए सीख जाता है क्योंकि यह पहले कदम के लिए सबसे अच्छा कदम दिखता है। एक बार जब वह इस "सब-कुछ-दांव-पर-लगा-देने" वाली रणनीति के प्रति प्रतिबद्ध हो जाता है, तो वह उबर नहीं पाता। वह कुल स्कोर से भी कम प्राप्त करता जो वह तब प्राप्त कर सकता था यदि उसने धीरे-धीरे शुरुआत की होती।

2. दो प्रयोग

इसे सिद्ध करने के लिए, लेखकों ने दो अलग-अलग "करियर सिम्युलेटर" बनाए जो वीडियो गेम की तरह काम करते हैं:

  1. द ब्रिकलेयर (ईंट जोड़ने वाला): एक निर्माण श्रमिक का 49 साल का करियर जिसमें भारी वजन उठाना शामिल है।
  2. द NBA प्लेयर (NBA खिलाड़ी): एक बास्केटबॉल पावर फॉरवर्ड का 20 सीज़न का करियर।

दोनों खेलों में एक ही छिपा हुआ नियम है: बहुत जल्दी बहुत अधिक काम करें, और आप घायल हो जाएंगे (खेल समाप्त हो जाएगा)।

3. उन्होंने क्या पाया

लेखकों ने इन खेलों पर तीन अलग-अलग दृष्टिकोणों का परीक्षण किया:

  • "असली" AI (PPO): यह मानक AI है जो प्रयास और त्रुटि (trial and error) द्वारा सीखने की कोशिश कर रहा है।
    • परिणाम: यह कम्प्लीशन में विफल रहा। ब्रिकलेयर गेम में, इसने उम्र 27.8 पर छोड़ दिया (65 के बजाय)। NBA गेम में, इसने उम्र 22.6 पर छोड़ दिया (38 के बजाय)। इसने बहुत तेज़ दौड़ लगाई और टूट गया।
  • "अनरिस्ट्रिक्टेड" AI (नरम दंड के साथ): शोधकर्ताओं ने AI की मदद करने की कोशिश की, उसे एक "सॉफ्ट चेतावनी" (एक छोटा दंड) देकर यदि वह बहुत अधिक काम करता है, और उसे पूरे करियर की लंबाई देखने की अनुमति देकर।
    • परिणाम: इसने वास्तव में चीजों को और खराब बना दिया। AI और भी जल्दी छोड़ गया (उम्र 24.7)। दंड ने AI को भ्रमित कर दिया, जिससे या तो उसने काम करना पूरी तरह से बंद कर दिया या समय से पहले ही छोड़ दिया।
  • "रिस्ट्रिक्टेड" AI (फिक्स्ड-शेयर): शोधकर्ताओं ने AI को एक विशिष्ट नियम का पालन करने के लिए मजबूर किया: "आपको केवल 15% खतरनाक भारी काम करना चाहिए।" AI को केवल यह तय करने की अनुमति थी कि कितना कठिन काम करना है, न कि क्या काम करना है।
    • परिणाम: इस AI ने कम्प्लीशन हासिल किया। इसने बिना छोड़े पूरे 49 वर्ष या 20 सीज़न पूरे किए।
    • कैच (Catch): भले ही इसने पूरा किया, लेकिन यह ऑप्टिमैलिटी में विफल रहा। इसका स्कोर 0.52 था (एक ऐसे पैमाने पर जहाँ पूर्ण स्कोर 0.79 है)। यह जीवित तो रहा, लेकिन इसने सबसे अच्छा खेल नहीं खेला क्योंकि यह उस "शुरुआत में स्प्रिंट करने" के जाल में फंस गया था।

4. "पहला कदम" का जाल

सबसे दिलचस्प खोज यह है कि AI शुरुआत में बहुत अधिक मेहनत क्यों करता है।
लेखकों ने पाया कि AI प्रशिक्षण के पहले सेकंड में ही एक "लालची प्रतिबद्धता" (greedy commitment) कर लेता है।

  • रूपक: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। पहला प्रश्न आसान है और 100 अंक देता है। छात्र सोचता है, "मैं बस इसे बहुत तेज़ी से हल कर दूँगा!" वह ऐसा करता है, लेकिन ऐसा करने में, वह बाकी परीक्षा के लिए अपनी सारी मानसिक ऊर्जा खर्च कर देता है।
  • विज्ञान: AI गणना करता है कि "सब-कुछ-दांव-पर-लगा-देने" वाली चाल अभी बहुत बड़ा इनाम देती है। चूंकि नुकसान बाद में दिखाई देता है, इसलिए AI की पहली सहज प्रवृत्ति बड़े इनाम के लिए जाना है। एक बार जब वह उस "सब-कुछ-दांव-पर-लगा-देने" वाली रणनीति में बंध जाता है, तो बदलना बहुत देर हो जाती है। भले ही आप इसे लाखों वर्षों तक प्रशिक्षित करें, यह वही पहली गलती करता रहेगा।

5. निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि आप केवल एक उपकरण से इन समस्याओं को ठीक नहीं कर सकते।

  • AI को जल्दी छोड़ने से रोकने के लिए, आपको उसके विकल्पों को प्रतिबंधित करना होगा (उसे खतरनाक काम 100% समय नहीं करने के लिए मजबूर करना होगा)।
  • AI को खराब खेलने (भले ही वह जीवित रहे) से रोकने के लिए, आपको पहले कदम से इसके सीखने के तरीके को ठीक करने की आवश्यकता है, क्योंकि यह तुरंत एक बुरी आदत में "फंस" जाता है।

संक्षेप में: AI एक ऐसे कर्मचारी की तरह है जो या तो बहुत अधिक काम करने के कारण नौकरी बहुत जल्दी छोड़ देता है, या काम तो जारी रखता है लेकिन शुरुआत में बहुत अधिक मेहनत करने के कारण अपना करियर खत्म कर लेता है। यह पेपर दिखाता है कि AI को केवल यह कहना कि "बहुत अधिक काम न करें" पर्याप्त नहीं है; आपको खेल के नियमों और AI के पहले कदम के बारे में सोचने के तरीके को बदलना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →