AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios
यह शोध पत्र AgentIF-OneDay को प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसमें ओपन वर्कफ़्लो निष्पादन, लेटेंट इंस्ट्रक्शन इन्फरेंस और इटरेटिव रिफाइनमेंट केAcross 104 विविध दैनिक कार्य शामिल हैं, जिसे सामान्य एआई एजेंटों की प्राकृतिक भाषा निर्देशों का पालन करने और मूर्त फ़ाइल-आधारित परिणाम उत्पन्न करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान में API-आधारित और RL-उन्नत दोनों एजेंट क्षेत्र का नेतृत्व कर रहे हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक शोध पत्र (paper) का सरल, रोज़मर्रा की भाषा में विवरण दिया गया है, जिसमें अवधारणाओं को स्पष्ट करने के लिए उपमाओं (analogies) का उपयोग किया गया है।
बड़ी तस्वीर: AI सहायकों के लिए "एक-दिन" (One-Day) की परीक्षा
कल्पना कीजिए कि आपने एक नया व्यक्तिगत सहायक (personal assistant) काम पर रखा है। आप केवल यह नहीं देखना चाहते कि क्या वे किसी सामान्य ज्ञान के प्रश्न का उत्तर दे सकते हैं या कविता लिख सकते हैं। आप यह देखना चाहते हैं कि क्या वे आपका पूरा दिन संभाल सकते हैं—आपके काम के शेड्यूल को व्यवस्थित करने से लेकर परिवार की यात्रा की योजना बनाने तक, और वह भी आपके विशिष्ट, कभी-कभी उलझे हुए निर्देशों का पालन करते हुए।
यह शोध पत्र AgentIF-OneDay पेश करता है, जो विशेष रूप से AI एजेंटों के लिए बनाया गया एक नया "फाइनल एग्जाम" है। यह AI को कठिन कोडिंग पहेलियों या गहरे वैज्ञानिक अनुसंधान पर परखने के बजाय यह पूछता है: "क्या यह AI वास्तव में एक आम इंसान को उसका दैनिक जीवन और काम पूरा करने में मदद कर सकता है?"
"दैनिक कार्यों" के तीन प्रकार
शोधकर्ताओं ने AI का परीक्षण करने के लिए 104 अलग-अलग परिदृश्य बनाए। उन्होंने इन कार्यों को तीन श्रेणियों में बांटा है, जो तीन अलग-अलग तरीके हैं जिनसे आप अपने सहायक से मदद मांग सकते हैं:
1. "रेसिपी का पालन करें" परीक्षण (ओपन वर्कफ्लो निष्पादन)
- उपमा: आप अपने सहायक को एक जटिल व्यंजन के लिए एक बहुत ही विशिष्ट, चरण-दर-चरण रेसिपी देते हैं। आप कहते हैं, "पहले, ओवन का तापमान देखें। फिर, टाइमर देखें। फिर, इन तीन सामग्रियों को मिलाएं। चरण 3 को छोड़ना नहीं।"
- यह क्या परीक्षण करता है: क्या AI बिना भ्रमित हुए, कोई चरण भूले बिना या अपनी ओर से कुछ मनगढ़ंत किए बिना, निर्देशों की एक लंबी, विस्तृत सूची का पालन कर सकता है? यह परीक्षण करता है कि क्या AI आपके द्वारा दिए गए प्लान पर टिके रह सकता है, भले ही वह प्लान लंबा और जटिल हो।
2. "लाइनों के बीच पढ़ें" परीक्षण (लेटेंट इंस्ट्रक्शन इन्फरेंस)
- उपमा: आप अपने सहायक को पुराने दस्तावेजों का एक फोल्डर सौंपते हैं और कहते, "एक नई रिपोर्ट बनाएं जो बिल्कुल इन दस्तावेजों जैसी दिखे।" आप नियम नहीं लिखते (जैसे "नीले हेडर का उपयोग करें" या "तारीख नीचे दाएं कोने में रखें")। आप उम्मीद करते हैं कि आपका सहायक पुराने दस्तावेजों को देखेगा, छिपे हुए स्टाइल नियमों को समझेगा, और उन्हें नई रिपोर्ट पर लागू करेगा।
- यह क्या परीक्षण करता है: क्या AI किसी फाइल (जैसे PDF या स्प्रेडशीट) को देखकर अनकहे नियमों को समझ सकता है? यह उन पैटर्न और अंतर्निहित बाधाओं को पहचानने के बारे में है जिन्हें आपने स्पष्ट रूप से नहीं कहा था।
3. "एडिट और सुधारें" परीक्षण (इटरेटिव रिफाइनमेंट)
- उपमा: आपका सहायक एक प्रेजेंटेशन का ड्राफ्ट तैयार करता है। आप उसे देखते हैं और कहते, "फॉन्ट बहुत छोटा है, और दूसरी स्लाइड में चार्ट गायब है। साथ ही, बैकग्राउंड को हल्का कर दें।" आप शुरू से नई प्रेजेंटेशन नहीं मांग रहे हैं; आप चाहते हैं कि वे अच्छे हिस्सों को बरकरार रखते हुए मौजूदा प्रेजेंटेशन में सुधार करें।
- यह क्या परीक्षण करता है: क्या AI याद रख सकता है कि उसने अभी क्या किया, आपके फीडबैक को समझ सकता है, और बाकी काम को खराब किए बिना सटीक बदलाव कर सकता है? यह परीक्षण करता है कि AI प्रोजेक्ट की स्थिति (state) को कितनी अच्छी तरह "याद" रखता है।
उन्होंने AI को कैसे ग्रेड किया
केवल "क्या यह काम कर गया?" पूछने के बजाय, शोधकर्ताओं ने एक बहुत ही सख्त ग्रेडिंग रूब्रिक (जैसे शिक्षक की उत्तर कुंजी) का उपयोग किया।
- "जज" (The Judge): उन्होंने परिणामों को ग्रेड करने के लिए एक अत्यंत बुद्धिमान AI (Gemini-3-Pro) का उपयोग किया, लेकिन उन्होंने यह सुनिश्चित करने के लिए इसकी तुलना मानव जजों से भी की कि यह निष्पक्ष हो। उन्होंने पाया कि AI जज लगभग 80% बार इंसानों से सहमत था।
- फाइलें: परीक्षण केवल टेक्स्ट के बारे में नहीं था। AI को वास्तविक फाइलों को संभालना था—PDF, एक्सेल शीट, इमेज और कोड—ठीक वैसे ही जैसे एक इंसान करता है।
उन्हें क्या मिला: परिणाम
उन्होंने आज के शीर्ष चार उपलब्ध AI एजेंटों का परीक्षण किया। यहाँ मुख्य बातें दी गई हैं:
"API" बनाम "विशेषज्ञ" (Specialized) बहस:
- कुछ कंपनियाँ AI एजेंटों का निर्माण केवल एक शक्तिशाली चैटबॉट को उपकरणों के सेट (जैसे एक जनरललिस्ट) से जोड़कर करती हैं।
- अन्य एजेंटों को कार्यों को करने के लिए विशेष "ब्रेन ट्रेनिंग" (Reinforcement Learning) के साथ बनाया जाता है।
- आश्चर्य: शोध पत्र में पाया गया कि दोनों प्रकार लगभग समान रूप से अच्छा प्रदर्शन कर रहे हैं। "विशेष प्रशिक्षण" अब कोई बड़ा लाभ नहीं दे रहा है। ऐसा लगता है कि कार्यों को संभालने की बुनियादी "बुद्धिमत्ता" अब मुख्य AI मॉडल्स में ही अंतर्निहित है।
विजेता:
- Manus समग्र रूप से शीर्ष पर रहा। यह लंबे, जटिल वर्कफ्लो का पालन करने में विशेष रूप से अच्छा था।
- Genspark निर्देशों का पालन करने और नकारात्मक बाधाओं (जैसे "X न करें") को संभालने में उत्कृष्ट था।
- ChatGPT-Agent कार्य-संबंधी कार्यों के लिए सबसे अच्छा था।
- Minimax-Agent सबसे धीमा था, सोचने में काफी समय लेता था, हालांकि यह तर्क (logic) में अच्छा था।
कमजोरी:
- सभी AI के लिए सबसे कठिन हिस्सा "लेटेंट इंस्ट्रक्शन इन्फरेंस" (लाइनों के बीच पढ़ना) था। सबसे अच्छे एजेंट भी बिना बताए किसी फाइल से छिपे हुए नियमों को पूरी तरह से समझने में संघर्ष करते रहे।
निष्कर्ष (The Bottom Line)
यह शोध पत्र तर्क देता है कि हमें AI को केवल इस आधार पर परखना बंद करना चाहिए कि वह पहेलियाँ सुलझाने में कितना "स्मार्ट" है। इसके बजाय, हमें यह परीक्षण करने की आवश्यकता है कि वह वास्तविक जीवन में कितना उपयोगी है।
अच्छी खबर यह है कि AI एजेंट हमारे दिन के "उबाऊ" लेकिन आवश्यक हिस्सों को संभालने में बहुत अच्छे होते जा रहे हैं—फाइलों को मैनेज करना, जटिल वर्कफ्लो का पालन करना और काम को एडिट करना। बुरी खबर यह है कि वे अभी भी "कमरे की स्थिति को पढ़ने" या बिना किसी मदद के दस्तावेजों में छिपे नियमों को समझने में संघर्ष करते हैं।
AI का भविष्य केवल मॉडल को स्मार्ट बनाने के बारे में नहीं है; यह बेहतर उत्पाद बनाने के बारे में है जो हमें हमारे विशिष्ट, उलझे हुए दैनिक जीवन को नेविगेट करने में मदद करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।