← नवीनतम पेपर
🤖 AI

AcademiClaw: When Students Set Challenges for AI Agents

यह शोध पत्र AcademiClaw को प्रस्तुत करता है, जो छात्रों द्वारा प्रस्तुत किए गए कार्यों से क्यूरेट किया गया 80 जटिल, वास्तविक दुनिया के शैक्षणिक कार्यों का एक द्विभाषी बेंचमार्क है, जिसका उद्देश्य लंबी अवधि (long-horizon) और बहु-विषयक चुनौतियों को संभालने में वर्तमान एआई एजेंटों की सीमाओं का मूल्यांकन और निदान करना है, जिससे यह पता चलता है कि अत्याधुनिक मॉडल भी केवल 55% पास दर प्राप्त करते हैं।

मूल लेखक: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou
प्रकाशित 2026-05-06
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou, Binghao Qiang, Borui Zhang, Chenning Li, Enchang Zhang, Feifan Chen, Feng Jian, Fengyin Sun, Hao Qiu, Hao Zheng, Haoran Zhu, Hongyu Liu, Jianbin Deng, Jiaxin Song, Jiaying Chi, Jiayou Shi, Jie Fang, Jinghui Zhong, Jingyu Zhou, Jinze Li, Junfeng Yi, Junyan Yu, Junzhi Xue, Ni Song, Pengyi Chen, Qi Chen, Quansheng Li, Rui Tao, Shenghai Gong, Shenhang Lu, Tianqi Shen, Tianxiang Zhu, Tiehan Kang, Tingyu Li, Wendi Wu, Xiao Shen, Xiao Zhou, Xiaotao Zhang, Xinrong Li, Xuankun Yang, Xun Zhang, Yan Li, Ye Lu, Yi Wang, Yibo Zhou, Yichi Zhang, Yihao Sun, Yijun Huang, Yixin Zhu, Yixuan Wu, Yuchen Sun, Yue Wu, Yuheng Sun, Yukun Li, Yutian Tu, Yuxuan Qin, Yuzhuo Wu, Zeyu Li, Zhengyu Lou, Zhenning Ran, Zizhu He, Pengfei Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है। अब तक, आपने इसे सरल काम करने के लिए टेस्ट किया है: "इन ईमेल्स को छाँटो," "इस मीटिंग को मेरे कैलेंडर में जोड़ो," या "पास्ता के लिए एक रेसिपी ढूँढो।" यह रोबोट इन कार्यों में बहुत अच्छा है। यह एक बहुत ही कुशल व्यक्तिगत सचिव की तरह है।

लेकिन यहाँ एक समस्या है: हमें वास्तव में यह नहीं पता कि क्या यह रोबोट वास्तविक, कठिन काम कर सकता है। क्या यह एक जटिल गणित की समस्या हल कर सकता है? क्या यह शून्य से एक वीडियो गेम बना सकता है? क्या यह एक खराब कंप्यूटर चिप को ठीक कर सकता है? अब तक, किसी ने भी इस रोबोट से इन सवालों को निष्पक्ष और मानकीकृत तरीके से नहीं पूछा है।

यही वह चीज़ है जिसके बारे में यह पेपर, AcademiClaw, है। यह AI एजेंटों के लिए एक नया "फाइनल एग्जाम" है, जिसे लैब में शोधकर्ताओं द्वारा नहीं, बल्कि विश्वविद्यालय के छात्रों द्वारा बनाया गया है जो वास्तव में अपने होमवर्क और प्रोजेक्ट्स के लिए संघर्ष कर रहे हैं।

यहाँ उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:

1. समस्या: "सेक्रेटरी" बनाम "इंजीनियर"

वर्तमान AI बेंचमार्क (AI के परीक्षण) को एक किराने के सामान की डिलीवरी करने वाले ड्राइवर के ड्राइविंग लाइसेंस टेस्ट की तरह समझें। वे देखते हैं कि क्या आप कार पार्क कर सकते हैं और रेड लाइट पर रुक सकते हैं। यह उपयोगी है, लेकिन यह आपको यह नहीं बताता कि क्या आप एक फॉर्मूला 1 कार चला सकते हैं या जेट इंजन की मरम्मत कर सकते हैं।

पेपर का तर्क है कि "OpenClaw" AI सिस्टम के मौजूदा परीक्षण केवल "असिस्टेंट-लेवल" कौशल (जैसे फाइलें छाँटना) की जाँच करते हैं। वे एक बड़ा अंतर छोड़ देते हैं: एकेडमिक-लेवल कौशल। ये वे गहरे, जटिल कार्य हैं जिनमें वर्षों के अध्ययन की आवश्यकता होती है, जैसे कि कोई गणितीय प्रमेय सिद्ध करना या एक जटिल AI मॉडल को प्रशिक्षित करना।

2. समाधान: एक "छात्र-प्रस्तुत" परीक्षा

शोधकर्ताओं द्वारा नकली समस्याएँ बनाने के बजाय, लेखकों ने 230 विश्वविद्यालय के छात्रों से उन वास्तविक समस्याओं को सबमिट करने के लिए कहा जिनका सामना उन्होंने किया था।

  • परिदृश्य (Scenario): एक छात्र एक कठिन कोडिंग प्रोजेक्ट या रिसर्च पेपर के लिए AI का उपयोग करने की कोशिश करता है। AI विफल हो जाता है या अटक जाता है। छात्र कहता है, "यह AI के लिए बहुत कठिन है।"
  • फ़िल्टर: विशेषज्ञों ने इन 230 सबमिशनों की समीक्षा की और सर्वश्रेष्ठ 80 को चुना।
  • परिणाम: एक ऐसा टेस्ट सूट जो ओलंपियाड-स्तर के गणित से लेकर GPU-भारी वीडियो गेम फिजिक्स और जटिल सॉफ्टवेयर डीबगिंग तक, 25 विभिन्न क्षेत्रों को कवर करता है।

उपमा: एक शेफ प्रतियोगिता की कल्पना करें। जजों द्वारा शेफ से "प्याज काटने" के लिए कहने के बजाय, छात्र (ग्राहक) कहते हैं, "मुझे तीन अलग-अलग महाद्वीपों के तत्वों का उपयोग करके, एक विशिष्ट शैली में पका हुआ 5-कोर्स का भोजन चाहिए, और मुझे यह 40 मिनट में तैयार चाहिए।" यही वह कठिनाई का स्तर है जो AcademiClaw पेश करता है।

3. परीक्षण वातावरण: "सुरक्षित सैंडबॉक्स" (Safe Sandbox)

यह सुनिश्चित करने के लिए कि AI कुछ भी खराब न करे या धोखाधड़ी न करे, प्रत्येक कार्य एक डिजिटल सैंडबॉक्स (एक लॉक-डाउन कंप्यूटर वातावरण जिसे Docker कंटेनर कहा जाता है) में होता है।

  • AI को एक कार्य दिया जाता है।
  • यह फाइलें पढ़ सकता है, कोड लिख सकता है, प्रोग्राम चला सकता है और यहाँ तक कि वेब ब्राउज़र का भी उपयोग कर सकता है।
  • इसे हर कदम पर खुद सब कुछ करना होता है।
  • महत्वपूर्ण विवरण: कुछ कार्यों के लिए GPU (भारी गणित और AI प्रशिक्षण के लिए उपयोग किया जाने वाला एक शक्तिशाली ग्राफिक्स कार्ड) की आवश्यकता होती है। यह रोबोट को भारी वजन उठाने के लिए कहने जैसा है; पिछले अधिकांश परीक्षणों ने केवल इसे एक पंख उठाने के लिए कहा था।

4. ग्रेडिंग कैसे की जाती है: "बहु-स्तरीय जज"

आप केवल यह नहीं पूछ सकते कि "क्या इसने पूरा किया?" क्योंकि उत्तर यह हो सकता है कि "हाँ, लेकिन कोड टूटा हुआ है।"
पेपर एक 6-इन-1 ग्रेडिंग सिस्टम का उपयोग करता है:

  1. पैटर्न मैचिंग: क्या इसने सही शब्द लिखे?
  2. कोड निष्पादन (Code Execution): क्या प्रोग्राम बिना क्रैश हुए वास्तव में चलता है?
  3. AI जज: एक अन्य AI रिपोर्ट को पढ़ता है और एक शिक्षक की तरह ग्रेड देता है।
  4. विज़न AI: क्या यह देख सकता है कि चार्ट या इमेज सही दिख रही है या नहीं?
  5. ब्राउज़र टेस्टिंग: क्या इसने वास्तव में एक काम करने वाली वेबसाइट बनाई?
  6. स्ट्रक्चर चेक: क्या फ़ाइल फॉर्मेट सही है (जैसे JSON या CSV)?

उनके पास एक सुरक्षा ऑडिट (Safety Audit) (एक सुरक्षा गार्ड की तरह) भी है ताकि यह सुनिश्चित किया जा सके कि AI ने महत्वपूर्ण फाइलों को डिलीट करने या अनधिकृत चीजों को हैक करने की कोशिश नहीं की।

5. परिणाम: "रियलिटी चेक"

लेखकों ने उपलब्ध छह सबसे स्मार्ट AI मॉडलों (जैसे Claude, GPT, और Gemini) का इस नए एग्जाम पर परीक्षण किया।

  • स्कोर: सबसे अच्छा AI भी 55% कार्यों में पास हुआ। इसका मतलब है कि वे उन समस्याओं पर लगभग आधे समय विफल रहे जो विश्वविद्यालय के छात्रों को कठिन लगती थीं।
  • "ओवरथिंकिंग" का जाल: पेपर में कुछ अजीब पाया गया। कुछ AI ने दूसरों की तुलना में 5 गुना अधिक "दिमागी शक्ति" (tokens) का उपयोग किया लेकिन बेहतर परिणाम नहीं दिए।
    • उपमा: दो छात्रों की कल्पना करें जो एक टेस्ट दे रहे हैं। छात्र A सवाल को ध्यान से पढ़ता है, एक मिनट सोचता है, और एक सटीक उत्तर लिखता है। छात्र B घबरा जाता है, 10 पन्नों का बड़बड़ाता हुआ कचरा लिखता है, और गलत उत्तर प्राप्त करता है। पेपर ने पाया कि अधिक प्रयास का मतलब बेहतर गुणवत्ता नहीं है।
  • अलग व्यक्तित्व: AI के अलग-अलग "व्यक्तित्व" थे:
    • द रीडर (The Reader): (Claude) सब कुछ पहले पढ़ता है, सोचता है, फिर कार्य करता है। उच्च गुणवत्ता, लेकिन धीमा।
    • द हैमर (The Hammer): (Gemini) बस चीजें करना शुरू कर देता है (कोड चलाना), इस उम्मीद में कि यह काम कर जाएगा। तेज़, लेकिन अक्सर चीजें खराब कर देता है और सुरक्षा नियमों को तोड़ देता है।
    • द मिनिमलिस्ट (The Minimalist): (GPT) न्यूनतम काम करता है, लेकिन आश्चर्यजनक रूप से अच्छे परिणाम देता है।

6. मुख्य निष्कर्ष (The Big Takeaway)

पेपर निष्कर्ष निकालता है कि जबकि AI एक "डिजिटल सेक्रेटरी" होने में महान है, यह "शोधकर्ता" या "इंजीनियर" बनने के लिए अभी भी बहुत अस्थिर है।

  • अंतराल (The Gap): आज AI क्या कर सकता है और वास्तविक दुनिया के शैक्षणिक और पेशेवर कार्य की क्या आवश्यकता है, इसके बीच एक बड़ा अंतर है।
  • सुरक्षा का मुद्दा: जिस AI ने समस्याओं को सुलझाने के लिए "अनुमान और जांच" (guess and check) का रास्ता अपनाया (Gemini), वही सुरक्षा नियमों को तोड़ने वाला भी था।
  • भविष्य: लेखकों को उम्मीद है कि यह नया परीक्षण (AcadomiClaw) डेवलपर्स को ऐसा AI बनाने में मदद करेगा जो वास्तव में उन कठिन, जटिल समस्याओं को हल करने में सक्षम हो जिनका हम वास्तविक दुनिया में सामना करते हैं, न कि केवल आसान समस्याओं का।

संक्षेप में: पेपर ने वास्तविक छात्र होमवर्क का उपयोग करके AI के लिए एक "हार्ड मोड" टेस्ट बनाया है। परिणाम दिखाते हैं कि सबसे स्मार्ट AI भी वास्तविक दुनिया के गहरे, जटिल कार्यों में संघर्ष कर रहे हैं, और अधिक कंप्यूटिंग पावर का उपयोग करने का मतलब जरूरी नहीं कि वे अधिक स्मार्ट हो जाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →