AcademiClaw: When Students Set Challenges for AI Agents
यह शोध पत्र AcademiClaw को प्रस्तुत करता है, जो छात्रों द्वारा प्रस्तुत किए गए कार्यों से क्यूरेट किया गया 80 जटिल, वास्तविक दुनिया के शैक्षणिक कार्यों का एक द्विभाषी बेंचमार्क है, जिसका उद्देश्य लंबी अवधि (long-horizon) और बहु-विषयक चुनौतियों को संभालने में वर्तमान एआई एजेंटों की सीमाओं का मूल्यांकन और निदान करना है, जिससे यह पता चलता है कि अत्याधुनिक मॉडल भी केवल 55% पास दर प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है। अब तक, आपने इसे सरल काम करने के लिए टेस्ट किया है: "इन ईमेल्स को छाँटो," "इस मीटिंग को मेरे कैलेंडर में जोड़ो," या "पास्ता के लिए एक रेसिपी ढूँढो।" यह रोबोट इन कार्यों में बहुत अच्छा है। यह एक बहुत ही कुशल व्यक्तिगत सचिव की तरह है।
लेकिन यहाँ एक समस्या है: हमें वास्तव में यह नहीं पता कि क्या यह रोबोट वास्तविक, कठिन काम कर सकता है। क्या यह एक जटिल गणित की समस्या हल कर सकता है? क्या यह शून्य से एक वीडियो गेम बना सकता है? क्या यह एक खराब कंप्यूटर चिप को ठीक कर सकता है? अब तक, किसी ने भी इस रोबोट से इन सवालों को निष्पक्ष और मानकीकृत तरीके से नहीं पूछा है।
यही वह चीज़ है जिसके बारे में यह पेपर, AcademiClaw, है। यह AI एजेंटों के लिए एक नया "फाइनल एग्जाम" है, जिसे लैब में शोधकर्ताओं द्वारा नहीं, बल्कि विश्वविद्यालय के छात्रों द्वारा बनाया गया है जो वास्तव में अपने होमवर्क और प्रोजेक्ट्स के लिए संघर्ष कर रहे हैं।
यहाँ उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:
1. समस्या: "सेक्रेटरी" बनाम "इंजीनियर"
वर्तमान AI बेंचमार्क (AI के परीक्षण) को एक किराने के सामान की डिलीवरी करने वाले ड्राइवर के ड्राइविंग लाइसेंस टेस्ट की तरह समझें। वे देखते हैं कि क्या आप कार पार्क कर सकते हैं और रेड लाइट पर रुक सकते हैं। यह उपयोगी है, लेकिन यह आपको यह नहीं बताता कि क्या आप एक फॉर्मूला 1 कार चला सकते हैं या जेट इंजन की मरम्मत कर सकते हैं।
पेपर का तर्क है कि "OpenClaw" AI सिस्टम के मौजूदा परीक्षण केवल "असिस्टेंट-लेवल" कौशल (जैसे फाइलें छाँटना) की जाँच करते हैं। वे एक बड़ा अंतर छोड़ देते हैं: एकेडमिक-लेवल कौशल। ये वे गहरे, जटिल कार्य हैं जिनमें वर्षों के अध्ययन की आवश्यकता होती है, जैसे कि कोई गणितीय प्रमेय सिद्ध करना या एक जटिल AI मॉडल को प्रशिक्षित करना।
2. समाधान: एक "छात्र-प्रस्तुत" परीक्षा
शोधकर्ताओं द्वारा नकली समस्याएँ बनाने के बजाय, लेखकों ने 230 विश्वविद्यालय के छात्रों से उन वास्तविक समस्याओं को सबमिट करने के लिए कहा जिनका सामना उन्होंने किया था।
- परिदृश्य (Scenario): एक छात्र एक कठिन कोडिंग प्रोजेक्ट या रिसर्च पेपर के लिए AI का उपयोग करने की कोशिश करता है। AI विफल हो जाता है या अटक जाता है। छात्र कहता है, "यह AI के लिए बहुत कठिन है।"
- फ़िल्टर: विशेषज्ञों ने इन 230 सबमिशनों की समीक्षा की और सर्वश्रेष्ठ 80 को चुना।
- परिणाम: एक ऐसा टेस्ट सूट जो ओलंपियाड-स्तर के गणित से लेकर GPU-भारी वीडियो गेम फिजिक्स और जटिल सॉफ्टवेयर डीबगिंग तक, 25 विभिन्न क्षेत्रों को कवर करता है।
उपमा: एक शेफ प्रतियोगिता की कल्पना करें। जजों द्वारा शेफ से "प्याज काटने" के लिए कहने के बजाय, छात्र (ग्राहक) कहते हैं, "मुझे तीन अलग-अलग महाद्वीपों के तत्वों का उपयोग करके, एक विशिष्ट शैली में पका हुआ 5-कोर्स का भोजन चाहिए, और मुझे यह 40 मिनट में तैयार चाहिए।" यही वह कठिनाई का स्तर है जो AcademiClaw पेश करता है।
3. परीक्षण वातावरण: "सुरक्षित सैंडबॉक्स" (Safe Sandbox)
यह सुनिश्चित करने के लिए कि AI कुछ भी खराब न करे या धोखाधड़ी न करे, प्रत्येक कार्य एक डिजिटल सैंडबॉक्स (एक लॉक-डाउन कंप्यूटर वातावरण जिसे Docker कंटेनर कहा जाता है) में होता है।
- AI को एक कार्य दिया जाता है।
- यह फाइलें पढ़ सकता है, कोड लिख सकता है, प्रोग्राम चला सकता है और यहाँ तक कि वेब ब्राउज़र का भी उपयोग कर सकता है।
- इसे हर कदम पर खुद सब कुछ करना होता है।
- महत्वपूर्ण विवरण: कुछ कार्यों के लिए GPU (भारी गणित और AI प्रशिक्षण के लिए उपयोग किया जाने वाला एक शक्तिशाली ग्राफिक्स कार्ड) की आवश्यकता होती है। यह रोबोट को भारी वजन उठाने के लिए कहने जैसा है; पिछले अधिकांश परीक्षणों ने केवल इसे एक पंख उठाने के लिए कहा था।
4. ग्रेडिंग कैसे की जाती है: "बहु-स्तरीय जज"
आप केवल यह नहीं पूछ सकते कि "क्या इसने पूरा किया?" क्योंकि उत्तर यह हो सकता है कि "हाँ, लेकिन कोड टूटा हुआ है।"
पेपर एक 6-इन-1 ग्रेडिंग सिस्टम का उपयोग करता है:
- पैटर्न मैचिंग: क्या इसने सही शब्द लिखे?
- कोड निष्पादन (Code Execution): क्या प्रोग्राम बिना क्रैश हुए वास्तव में चलता है?
- AI जज: एक अन्य AI रिपोर्ट को पढ़ता है और एक शिक्षक की तरह ग्रेड देता है।
- विज़न AI: क्या यह देख सकता है कि चार्ट या इमेज सही दिख रही है या नहीं?
- ब्राउज़र टेस्टिंग: क्या इसने वास्तव में एक काम करने वाली वेबसाइट बनाई?
- स्ट्रक्चर चेक: क्या फ़ाइल फॉर्मेट सही है (जैसे JSON या CSV)?
उनके पास एक सुरक्षा ऑडिट (Safety Audit) (एक सुरक्षा गार्ड की तरह) भी है ताकि यह सुनिश्चित किया जा सके कि AI ने महत्वपूर्ण फाइलों को डिलीट करने या अनधिकृत चीजों को हैक करने की कोशिश नहीं की।
5. परिणाम: "रियलिटी चेक"
लेखकों ने उपलब्ध छह सबसे स्मार्ट AI मॉडलों (जैसे Claude, GPT, और Gemini) का इस नए एग्जाम पर परीक्षण किया।
- स्कोर: सबसे अच्छा AI भी 55% कार्यों में पास हुआ। इसका मतलब है कि वे उन समस्याओं पर लगभग आधे समय विफल रहे जो विश्वविद्यालय के छात्रों को कठिन लगती थीं।
- "ओवरथिंकिंग" का जाल: पेपर में कुछ अजीब पाया गया। कुछ AI ने दूसरों की तुलना में 5 गुना अधिक "दिमागी शक्ति" (tokens) का उपयोग किया लेकिन बेहतर परिणाम नहीं दिए।
- उपमा: दो छात्रों की कल्पना करें जो एक टेस्ट दे रहे हैं। छात्र A सवाल को ध्यान से पढ़ता है, एक मिनट सोचता है, और एक सटीक उत्तर लिखता है। छात्र B घबरा जाता है, 10 पन्नों का बड़बड़ाता हुआ कचरा लिखता है, और गलत उत्तर प्राप्त करता है। पेपर ने पाया कि अधिक प्रयास का मतलब बेहतर गुणवत्ता नहीं है।
- अलग व्यक्तित्व: AI के अलग-अलग "व्यक्तित्व" थे:
- द रीडर (The Reader): (Claude) सब कुछ पहले पढ़ता है, सोचता है, फिर कार्य करता है। उच्च गुणवत्ता, लेकिन धीमा।
- द हैमर (The Hammer): (Gemini) बस चीजें करना शुरू कर देता है (कोड चलाना), इस उम्मीद में कि यह काम कर जाएगा। तेज़, लेकिन अक्सर चीजें खराब कर देता है और सुरक्षा नियमों को तोड़ देता है।
- द मिनिमलिस्ट (The Minimalist): (GPT) न्यूनतम काम करता है, लेकिन आश्चर्यजनक रूप से अच्छे परिणाम देता है।
6. मुख्य निष्कर्ष (The Big Takeaway)
पेपर निष्कर्ष निकालता है कि जबकि AI एक "डिजिटल सेक्रेटरी" होने में महान है, यह "शोधकर्ता" या "इंजीनियर" बनने के लिए अभी भी बहुत अस्थिर है।
- अंतराल (The Gap): आज AI क्या कर सकता है और वास्तविक दुनिया के शैक्षणिक और पेशेवर कार्य की क्या आवश्यकता है, इसके बीच एक बड़ा अंतर है।
- सुरक्षा का मुद्दा: जिस AI ने समस्याओं को सुलझाने के लिए "अनुमान और जांच" (guess and check) का रास्ता अपनाया (Gemini), वही सुरक्षा नियमों को तोड़ने वाला भी था।
- भविष्य: लेखकों को उम्मीद है कि यह नया परीक्षण (AcadomiClaw) डेवलपर्स को ऐसा AI बनाने में मदद करेगा जो वास्तव में उन कठिन, जटिल समस्याओं को हल करने में सक्षम हो जिनका हम वास्तविक दुनिया में सामना करते हैं, न कि केवल आसान समस्याओं का।
संक्षेप में: पेपर ने वास्तविक छात्र होमवर्क का उपयोग करके AI के लिए एक "हार्ड मोड" टेस्ट बनाया है। परिणाम दिखाते हैं कि सबसे स्मार्ट AI भी वास्तविक दुनिया के गहरे, जटिल कार्यों में संघर्ष कर रहे हैं, और अधिक कंप्यूटिंग पावर का उपयोग करने का मतलब जरूरी नहीं कि वे अधिक स्मार्ट हो जाएं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।