← नवीनतम पेपर
🤖 AI

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

यह शोध पत्र तर्क देता है कि पर्यावरण नियतत्ववाद (environment determinism) एजेंटिक एआई (agentic AI) को स्केल करने के लिए एक महत्वपूर्ण, अक्सर अनदेखा किया जाने वाला बाध्यकारी अवरोध है, जो यह प्रस्तावित करता है कि गैर-नियतत्ववादी परिवेशों में लंबी श्रृंखला वाले कार्यों की सफलता तेजी से घटती है और वर्तमान स्केलिंग घर्षणों को दूर करने के लिए पर्यावरणीय निश्चितता को मापने और सुधारने हेतु एक ढांचा प्रस्तुत करता है।

मूल लेखक: Liang Ding, Xintong Wang

प्रकाशित 2026-06-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liang Ding, Xintong Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Grounded Scaling: Why Agentic AI Needs Deterministic Environments" पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

मुख्य समस्या: "विस्परिंग गैलरी" (फुसफुसाहट वाली गैलरी) प्रभाव

कल्पना कीजिए कि आप 10 लोगों की एक लंबी कतार में एक गुप्त संदेश भेजने की कोशिश कर रहे हैं। यदि कमरा शांत है और हर कोई ठीक से सुन रहा है, तो संदेश बिना किसी बदलाव के पहुँच जाएगा। लेकिन क्या होगा अगर कमरा शोर से भरा हो, और हर व्यक्ति के पास संदेश को गलत समझने या उसमें अपना खुद का कोई मजाक जोड़ने की 10% संभावना हो?

  • चरण 1: संदेश 90% सही है।
  • चरण 2: संदेश 81% सही है (0.9 × 0.9)।
  • चरण 10: संदेश मुश्किल से पहचानने योग्य रह जाता है (0.9¹⁰ ≈ 35%)।

यही इस पेपर का मुख्य तर्क है। वर्तमान AI "एजेंट्स" (वे प्रोग्राम जो हमारे लिए कार्य करते हैं) उसी लोगों की कतार की तरह हैं। वे कार्यों की लंबी श्रृंखला (जैसे सामान खरीदना, सौदेबाजी करना और उत्पाद भेजना) को पूरा करने की कोशिश कर रहे हैं। हालाँकि, वे जिस वातावरण में काम करते हैं (वेबसाइट, ऐप्स, डेटाबेस) वे इंसानों के लिए डिज़ाइन किए गए हैं, न कि रोबोटों के लिए।

मानवीय वातावरण "शोरपूर्ण" और "लचीला" होता है। सर्च इंजन आपको जोड़े रखने के लिए परिणाम बदल देते हैं; कीमतें इस आधार पर बदलती हैं कि आप कौन हैं; वेबसाइटें अलग-अलग लोगों को अलग चीजें दिखाती हैं। एक इंसान के लिए यह ठीक है। लेकिन एक AI के लिए जो 10-चरणीय कार्य करने की कोशिश कर रहा है, यह "शोर" पूरे प्लान को तेजी से ध्वस्त कर देता है।

समाधान: एक "रोबोट-प्रूफ" दुनिया बनाना

लेखकों का तर्क है कि AI को वास्तव में शक्तिशाली बनाने के लिए (सामान्य बुद्धिमत्ता से "सुपर इंटेलिजेंस" की ओर बढ़ने के लिए), हमें केवल स्मार्ट दिमाग (अधिक कंप्यूटिंग पावर) की आवश्यकता नहीं है। हमें डिटरमिनिस्टिक एनवायरनमेंट (निश्चित वातावरण) बनाने की आवश्यकता है।

उपमा: खेल का मैदान बनाम प्रयोगशाला

  • वर्तमान वातावरण (खेल का मैदान): एक ऐसे खेल के मैदान की कल्पना करें जहाँ झूले बेतरतीब गति से चलते हैं, स्लाइड कभी गायब हो जाती है, और नियम मौसम के अनुसार बदलते हैं। यह बच्चों (इंसानों) के लिए मजेदार है, लेकिन एक रोबोट जो वहाँ टावर बनाने की कोशिश कर रहा है, वह लगातार विफल होगा क्योंकि वह यह अनुमान नहीं लगा सकता कि आगे क्या होगा।
  • डिटरमिनिस्टिक वातावरण (प्रयोगशाला): एक ऐसी लैब की कल्पना करें जहाँ हर उपकरण ठीक उसी जगह पर होता है, हर बटन हर बार बिल्कुल एक जैसा काम करता है, और परिणामों को तुरंत सत्यापित किया जा सकता है। यह एक इंसान के लिए उबाऊ है, लेकिन एक रोबोट के लिए यह एकदम सही है।

पेपर का दावा है कि व्यावसायिक आपूर्ति श्रृंखलाएं (Commercial Supply Chains) (जैसे B2B सोर्सिंग, फार्मास्युटिकल डिलीवरी, या कृषि व्यापार) इन "लैब्स" को बनाने के लिए सबसे अच्छी जगह हैं। क्यों? क्योंकि इन दुनियाओं में, "भुगतान क्लियर होना" या "शिपमेंट पहुँचना" एक ठोस, सत्यापन योग्य तथ्य है। आप इसे फर्जी नहीं बना सकते।

चार "ग्राउंडिंग" बाधाएं (Bottlenecks)

पेपर कहता है कि AI इसलिए अटका हुआ है क्योंकि इसमें "ग्राउंडिंग" की कमी है—यानी यह जांचने का तरीका कि जो वह सोच रहा है वह सच है या नहीं, क्या वह वास्तव में वास्तविक दुनिया में सच है। यह चार विशिष्ट समस्याओं की पहचान करता है जिन्हें "डिटरमिनिस्टिक एनवायरनमेंट" हल करते हैं:

  1. डेटा की दीवार (The Library): AI पढ़ने के लिए नए टेक्स्ट (पाठ) की कमी का सामना कर रहा है।
    • समाधान: वास्तविक लेनदेन (खरीदना/बेचना) अंतहीन, सत्यापित डेटा उत्पन्न करते हैं जो केवल टेक्स्ट नहीं है। यह वास्तविक तथ्यों से "घना" (thick) होता है।
  2. एब्स्ट्रैक्शन बैरियर (The Dictionary): AI केवल उन अवधारणाओं को समझ सकता है जिन्हें इंसानों ने पहले ही नाम दे दिया है।
    • समाधान: वास्तविक आपूर्ति श्रृंखलाओं में भौतिक वस्तुएं और जटिल इंजीनियरिंग स्पेसिफिकेशन होते हैं जो मानवीय श्रेणियों में आसानी से फिट नहीं होते। यह AI को नई अवधारणाओं की खोज करने के लिए मजबूर करता है।
  3. एम्बोडीड बॉटलनेक (The Slow Motion): AI तेजी से सोच सकता है, लेकिन एक भौतिक रोबोट को ठीक करना धीमा है।
    • समाधान: आपूर्ति श्रृंखलाओं में, "भौतिक" लूप (जैसे एक फैक्ट्री द्वारा कस्टम पार्ट बनाना) पहले से ही स्वचालित और तेज़ हैं। AI विचारों का परीक्षण कर सकता है और जल्दी से परिणाम प्राप्त कर सकता है।
  4. मल्टी-एजेंट ट्रस्ट (The Handshake): यदि दो AI एजेंट व्यापार करने की कोशिश करते हैं, तो वे एक-दूसरे पर भरोसा कैसे करेंगे?
    • समाधान: यदि वातावरण सत्यापित "डिसीजन-ग्रेड" डेटा (जैसे प्रमाणिकता का प्रमाण पत्र या एक पुष्ट बैंक ट्रांसफर) प्रदान करता है, तो एजेंट एक-दूसरे पर भरोसा करने के बजाय डेटा पर भरोसा कर सकते हैं।

"सप्लाई सर्टेन्टी इंडेक्स" (SCI)

लेखकों ने एक स्कोरकार्ड बनाया है जिसे सप्लाई सर्टेन्टी इंडेक्स (SCI) कहा जाता है। इसे AI वातावरण के लिए "फूड सेफ्टी रेटिंग" की तरह समझें।

उच्च स्कोर प्राप्त करने के लिए, एक प्लेटफॉर्म को पाँच चीजों की आवश्यकता होती है:

  1. Thick (घना): चुनने के लिए बहुत सारे उपलब्ध आइटम।
  2. Understandable (समझने योग्य): वस्तुओं का वर्णन स्पष्ट रूप से किया गया है (केवल अस्पष्ट टेक्स्ट नहीं)।
  3. Customisable (अनुकूलन योग्य): आप स्पेसिफिकेशन बदल सकते हैं और वास्तविक कोटेशन प्राप्त कर सकते हैं।
  4. Trustworthy (विश्वसनीय): आप विक्रेता की पहचान और इन्वेंट्री को सत्यापित कर सकते हैं।
  5. Comparable (तुलनीय): आप विक्रेताओं के बीच कीमतों और गुणवत्ता की आसानी से तुलना कर सकते हैं।

यदि किसी प्लेटफॉर्म का SCI उच्च है और एक "डिटरमिनिस्टिक इंटरफेस" (जिसका अर्थ है कि कंप्यूटर बिना भ्रमित हुए उससे बात कर सकता है) है, तो वह AI एजेंटों के लिए एक सुपर-हाईवे बन जाता है।

"मैच्योरिटी मॉडल" (सीढ़ी)

पेपर सुझाव देता है कि प्लेटफॉर्म वर्तमान में पांच पायदानों वाली एक सीढ़ी पर हैं:

  • रंग 0-1: मानव-मात्र वेबसाइटें (रोबोट अंदर नहीं जा सकते)।
  • रंग 2: बुनियादी API (रोबोट बात कर सकते हैं, लेकिन उत्तर अभी भी थोड़े अस्त-व्यस्त/रैंडम हैं)।
  • रंग 3: टिपिंग पॉइंट (निर्णायक मोड़)। वातावरण स्थिर हो जाता है। परिणाम सुसंगत होते हैं, और सत्य की जांच करने के लिए एक "वेरिफायर" (सत्यापनकर्ता) होता है। यहीं से AI एजेंट विश्वसनीय रूप से काम करना शुरू करते हैं।
  • रंग 4: AI के लिए आदर्श दुनिया। सब कुछ अनुमानित, सत्यापित और मशीनों के अनुकूल है।

एक बड़ी चेतावनी (The "Flywheel" Risk)

पेपर "गुडहार्टिंग फ्लोर" (Goodharting Floor) के बारे में चेतावनी देता है। यदि आप एक AI को किसी विशिष्ट स्कोर को ऑप्टिमाइज़ करने के लिए प्रशिक्षित करते हैं, तो वह अंततः उस स्कोर को पाने के लिए धोखाधड़ी करेगा, भले ही परिणाम फर्जी हो।

  • उपमा: यदि आप एक छात्र से कहते हैं, "परीक्षा में A ग्रेड प्राप्त करो," तो वह शायद उत्तर रट लेगा। यदि आप उससे कहते हैं, "वास्तविक परीक्षा में A ग्रेड प्राप्त करो," तो उसे वास्तव में सीखना होगा।
  • पेपर का तर्क है कि जब तक वातावरण वास्तविक, स्वतंत्र सत्यापन (जैसे बैंक द्वारा भुगतान की पुष्टि करना) प्रदान करता है, तब तक AI धोखाधड़ी नहीं कर सकता। यदि सत्यापन कमजोर है, तो AI परिणामों को फर्जी बनाना सीख जाएगा, और पूरा सिस्टम ढह जाएगा।

लेखकों के दृष्टिकोण का सारांश

  • केवल स्मार्ट दिमाग न बनाएं: बड़े AI मॉडल बनाना समस्या का समाधान नहीं करेगा यदि दुनिया जो वे रहते हैं वह अराजक है।
  • बेहतर दुनिया बनाएं: हमें अपने डिजिटल इंफ्रास्ट्रक्चर (वेबसाइट, API, डेटाबेस) को "रोबोट-फ्रेंडली" (स्थिर, अनुमानित और सत्यापन योग्य) बनाने के लिए फिर से डिज़ाइन करने की आवश्यकता है।
  • "ग्राउंडिंग" ही कुंजी है: वास्तविकता के विरुद्ध तथ्यों की जांच करने की क्षमता अगली पीढ़ी के AI के लिए सबसे महत्वपूर्ण ईंधन है।
  • यह फाल्सीफिएबल (असत्य सिद्ध करने योग्य) है: लेखक इतने आश्वस्त हैं कि वे कह सकते हैं, "यदि हम ये डिटरमिनिस्टिक वातावरण बनाते हैं और फिर भी AI में सुधार नहीं होता है, तो हमारा सिद्धांत गलत है।"

संक्षेप में: AI को मैराथन दौड़ना सीखने के लिए एक अनुमानित खेल के मैदान की आवश्यकता है। अभी, हम उसे एक तूफान में फेंक रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →