← नवीनतम पेपर
🤖 AI

The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems

यह शोध पत्र 2025 एआई एजेंट इंडेक्स पेश करता है, जो तेजी से विकसित होते पारिस्थितिकी तंत्र की चुनौतियों का समाधान करने के लिए 30 अत्याधुनिक एआई एजेंटों की उत्पत्ति, क्षमताओं और सुरक्षा विशेषताओं को प्रलेखित करने वाला एक व्यापक संसाधन है, जो साथ ही सुरक्षा और सामाजिक प्रभावों के संबंध में डेवलपर्स की पारदर्शिता में महत्वपूर्ण अंतराल को भी उजागर करता है।

मूल लेखक: Leon Staufer, Kevin Feng, Kevin Wei, Luke Bailey, Yawen Duan, Mick Yang, A. Pinar Ozisik, Stephen Casper, Noam Kolt

प्रकाशित 2026-06-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leon Staufer, Kevin Feng, Kevin Wei, Luke Bailey, Yawen Duan, Mick Yang, A. Pinar Ozisik, Stephen Casper, Noam Kolt

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक हलचल भरी, अराजक निर्माण स्थल (construction site) के रूप में करें। वर्षों से, हम श्रमिकों (AI मॉडल्स) को ब्लूप्रिंट पढ़ना और सीमेंट मिलाना सीखते हुए देख रहे हैं। लेकिन हाल ही में, कुछ नया आया है: AI एजेंट्स। इन्हें केवल श्रमिकों के रूप में नहीं, बल्कि फोरमैन (पर्यवेक्षकों) के रूप में सोचें जो वास्तव में औजार उठा सकते हैं, दरवाजे खोल सकते हैं और बिना किसी मानवीय मदद के चीजें बनाना शुरू कर सकते हैं।

समस्या क्या है? निर्माण स्थल बहुत तेजी से बढ़ रहा है, और फोरमैन इतने गुप्त हैं कि वास्तव में कोई नहीं जानता कि कौन क्या बना रहा है, वे कितने सुरक्षित हैं, या क्या वे नियमों का पालन कर रहे हैं।

यह शोध पत्र, "द 2025 AI एजेंट इंडेक्स," एक ऐसी टीम की तरह है जिसने हेलमेट पहना है और साइट का विस्तृत इन्वेंट्री लेने के लिए घूम रही है। उन्होंने केवल फोरमैनों की गिनती नहीं की; उन्होंने उनके टूलबॉक्स में झांकने और उनके सुरक्षा मैनुअल को पढ़ने की भी कोशिश की।

यहाँ उनका निष्कर्ष है, जिसे सरल भाषा में समझाया गया है:

1. "कौन कौन है" की सूची (The "Who's Who" List)

शोधकर्ताओं ने वर्तमान में उपयोग किए जा रहे 30 सबसे लोकप्रिय और शक्तिशाली AI एजेंट्स का अध्ययन किया। उन्होंने केवल उन चैटबॉट्स को नहीं देखा जो सवालों के जवाब देते हैं; उन्होंने उन सिस्टमों को देखा जो वास्तव में काम कर सकते हैं, जैसे उड़ान बुक करना, कोड लिखना, व्यावसायिक कार्यप्रवाह (workflows) प्रबंधित करना, या चीजें खरीदने के लिए वेब ब्राउज़ करना।

उन्होंने इन 30 एजेंट्स को तीन मुख्य "पड़ोसों" में विभाजित किया:

  • चैट पड़ोस (12 एजेंट्स): ये मददगार सहायकों की तरह हैं जिनसे आप चैट विंडो में बात करते हैं, लेकिन उनके पास अन्य ऐप्स और टूल्स खोलने की विशेष चाबियाँ होती हैं।
  • ब्राउज़र पड़ोस (5 एजents): ये डिजिटल कर्मचारियों की तरह हैं जो आपके वेब ब्राउज़र के भीतर रहते हैं। वे बटनों पर क्लिक कर सकते हैं, फॉर्म भर सकते हैं और वेबसाइटों पर ठीक वैसे ही नेविगेट कर सकते हैं जैसे एक इंसान करता है, अक्सर आपके हर कदम को देखे बिना।
  • एंटरप्राइज पड़ोस (13 एजेंट्स): ये बड़ी कंपनियों के लिए "फोरमैन बिल्डर्स" हैं। ये ऐसे प्लेटफॉर्म हैं जहाँ एक व्यवसाय मानव संसाधन (HR), बिक्री, या आईटी सहायता जैसे कार्यों को स्वचालित रूप से संभालने के लिए डिजिटल श्रमिकों की एक टीम स्थापित कर सकता है।

2. "ब्लैक बॉक्स" की समस्या (पारदर्शिता)

इस शोध पत्र का सबसे बड़ा आश्चर्य यह है कि कितनी जानकारी गायब है। कल्पना कीजिए कि आपने एक कार खरीदी, लेकिन निर्माता ने आपको यह बताने से मना कर दिया कि:

  • ब्रेक कैसे काम करते हैं।
  • क्या कार का क्रैश-टेस्ट किया गया है।
  • यदि इंजन ओवरहीट हो जाए तो क्या होगा।
  • यदि कार दुर्घटनाग्रस्त हो जाती है तो कौन जिम्मेदार है।

शोधकर्ताओं ने इन AI एजेंट्स के साथ बिल्कुल यही पाया।

  • सुरक्षा के रहस्य: सुरक्षा से जुड़े लगभग 56% सवालों के लिए (जैसे "क्या आपने इसे हैकिंग के लिए टेस्ट किया है?"), जवाब था "हमें नहीं पता" या "हमें कोई सार्वजनिक जानकारी नहीं मिली।"
  • "सेफ्टी-वॉशिंग" का प्रभाव: कुछ कंपनियाँ मार्केटिंग में सुरक्षित होने के बारे में बहुत बातें करती हैं, लेकिन जब शोधकर्ताओं ने वास्तविक परीक्षण परिणामों या सुरक्षा रिपोर्टों की तलाश की, तो अलमारियां खाली थीं। यह एक ऐसे रेस्टोरेंट की तरह है जो दावा तो करता है कि वह "शहर में सबसे स्वास्थ्यवर्धक है" लेकिन अपने स्वच्छता निरीक्षण स्कोर दिखाने से इनकार कर देता है।
  • पहचान का संकट: अधिकांश एजेंट्स लोगों को यह नहीं बताते कि वे रोबोट हैं। यदि कोई ब्राउज़र एजेंट किसी वेबसाइट को ब्राउज़ कर रहा है, तो वेबसाइट अक्सर सोचती है कि वह एक मानव उपयोगकर्ता है। बहुत कम एजेंट्स के पास ऐसा "डिजिटल आईडी कार्ड" है जो कहता है, "नमस्ते, मैं एक AI हूँ।"

3. "तीन सिर वाला राक्षस" (नियंत्रण किसका है?)

यह पत्र समझाता है कि ये एजेंट्स परतों में बनाए गए हैं, जैसे एक सैंडविच, और यह समझना कठिन बनाता है कि प्रभारी कौन है।

  • ब्रेड (फाउंडेशन मॉडल): यह मस्तिष्क है (जैसे GPT, Claude, या Gemini)। केवल कुछ बड़ी कंपनियाँ ही इन्हें बनाती हैं।
  • फिलिंग (एजेंट बिल्डर): यह मध्य परत है (जैसे Microsoft Copilot Studio या Zapier) जो मस्तिष्क को बताता है कि क्या करना है।
  • टॉप बन (उपयोगकर्ता/कंपनी): यह वह व्यक्ति या व्यवसाय है जो वास्तव में एजेंट का उपयोग कर रहा है।

शोधकर्ताओं ने पाया कि क्योंकि ये परतें अलग-अलग कंपनियों द्वारा बनाई गई हैं, इसलिए किसी के पास भी पूरी तस्वीर नहीं है। मस्तिष्क बनाने वाले को नहीं पता कि बिल्डर क्या कर रहा है, और बिल्डर को ठीक से नहीं पता कि उपयोगकर्ता इसे कैसे तैनात कर रहा है। यदि कुछ गलत हो जाता है, तो यह एक "दोषारोपण के खेल" (blame game) की स्थिति पैदा करता है।

4. वेब पर "वाइल्ड वेस्ट" (कानूनहीनता)

यह पत्र एक प्रमुख तनाव को उजागर करता है: ब्राउज़र एजेंट्स इंटरनेट के नियमों को तोड़ रहे हैं।
द दशकों से, वेबसाइटों के पास robots.txt नामक एक "प्रवेश निषेध" का बोर्ड होता है जो कंप्यूटर प्रोग्रामों (क्रॉलर्स) को बताता है कि वे कहाँ जा सकते हैं और कहाँ नहीं।

  • पुराना तरीका: वेबसाइटें कहती हैं "यहाँ क्रॉलिंग न करें," और विनम्र रोबोट रुक जाते हैं।
  • एजेंट का तरीका: कई नए एजेंट्स को इस तरह डिज़ाइन किया गया है कि वे इंसानों की तरह व्यवहार करें। वे अक्सर "प्रवेश निषेध" के संकेतों को अनदेखा करते हैं, सुरक्षा जांच को दरकिनार करते हैं, और काम करने के लिए लोगों का ढोंग करते हैं।
  • परिणाम: इससे कानूनी लड़ाइयाँ शुरू हो गई हैं। अमेज़न और पर्प्लेक्सिटी जैसी कंपनियाँ इस बात पर एक-दूसरे पर मुकदमा कर रही हैं कि क्या एक AI एजेंट को बिना अनुमति के किसी साइट पर खरीदारी करने या ब्राउज़ करने का अधिकार है।

5. "बिग थ्री" पर निर्भरता

लगभग सभी 30 एजेंट्स केवल तीन परिवारों के मस्तिष्क पर निर्भर हैं: OpenAI का GPT, Anthropic का Claude, और Google का Gemini।

  • उपमा: कल्पना कीजिए कि 30 अलग-अलग कार ब्रांड हैं, लेकिन उन सभी में तीन निर्माताओं के बिल्कुल एक ही इंजन का उपयोग किया जाता है। यदि उन तीन में से एक निर्माता को कोई समस्या आती है, उत्पादन बंद कर देता है, या कीमत बदल देता है, तो सभी 30 कार ब्रांड मुसीबत में पड़ जाएंगे। यह अत्यधिक एकाग्रता (concentration) का एक बड़ा जोखिम पैदा करता है।

निचोड़ (The Bottom Line)

"2025 AI एजेंट इंडेक्स" एक तेजी से बढ़ती तकनीक का एक स्नैपशॉट है जो वर्तमान में अंधेरे में काम कर रही है

शोधकर्ता यह नहीं कह रहे हैं कि ये एजेंट्स "बुरे" हैं, लेकिन वे यह कह रहे हैं कि हम बिना देखे उड़ रहे हैं। हमारे पास शक्तिशाली उपकरण हैं जो हमारी ओर से कार्य कर सकते हैं, लेकिन हमारे पास उनके लिए स्पष्ट नियम, सुरक्षा रिपोर्ट या पहचान जांच नहीं है। यह पत्र सुझाव देता है कि यदि हम चाहते हैं कि ये एजents सुरक्षित और विश्वसनीय हों, तो "फोरमैन" को अपना काम दिखाना शुरू करना होगा, और "निर्माण स्थल" को बेहतर संकेत लगाने की आवश्यकता है।

संक्षेप में: हमने स्वायत्त रोबोटों का एक बेड़ा बनाया है, लेकिन उनमें से अधिकांश बिना लाइसेंस प्लेट के, बिना सुरक्षा निरीक्षण के, और बिना किसी को यह बताए कि वे रोबोट हैं, गाड़ी चला रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →