TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
यह शोध पत्र टर्मिनलवर्ल्ड (TerminalWorld) का परिचय देता है, जो एक स्केलेबल डेटा इंजन है जो एआई एजेंटों के बेंचमार्किंग के लिए 80,870 वास्तविक दुनिया की रिकॉर्डिंग से 1,530 उच्च-सटीकता वाले टर्मिनल कार्यों को स्वचालित रूप से रिवर्स-इंजीनियर करता है, जिससे यह पता चलता है कि वर्तमान फ्रंटियर मॉडल प्रामाणिक वर्कफ़्लो के साथ संघर्ष करते हैं और मौजूदा विशेषज्ञ-क्यूरेटेड बेंचमार्क की तुलना में खराब प्रदर्शन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर का "कमांड लाइन" (command line) इस्तेमाल करना सिखाने की कोशिश कर रहे हैं—वह काली स्क्रीन जहाँ प्रोग्रामर आइकनों पर क्लिक करने के बजाय टेक्स्ट कमांड टाइप करते हैं। लंबे समय तक, हम इन रोबोट्स का परीक्षण करने के लिए एक सख्त शिक्षक द्वारा बनाई गई पहेली की तरह काम करते थे। शिक्षक कहता, "यहाँ एक कठिन पहेली है; इसे सुलझाओ!" यदि रोबोट ने पहेली सुलझा ली, तो हमें लगा कि वह बुद्धिमान है।
लेकिन इस शोध पत्र के लेखकों ने, TERMINALWORLD, महसूस किया कि इसमें एक समस्या है: वास्तविक जीवन कोई पहेली नहीं है। वास्तविक जीवन अव्यवस्थित, अप्रत्याशित और उन विशिष्ट उपकरणों से भरा होता है जिनका लोग वास्तव में हर दिन उपयोग करते हैं। एक रोबोट जो एक पहेली को हल कर सकता है, वह तब विफल हो सकता है जब उसे वास्तव में किसी सर्वर को ठीक करने या एक वास्तविक कार्यालय में फाइलों को व्यवस्थित करने के लिए कहा जाए।
उन्होंने इसे कैसे ठीक किया, इसे सरल भाषा में यहाँ समझाया गया है:
1. "दीवार के पास खड़े दर्शक" (Fly on the Wall) वाला दृष्टिकोण
नकली कार्य (tasks) बनाने के बजाय, शोधकर्ताओं ने asciinema नामक एक सार्वजनिक वेबसाइट का रुख किया। यह कंप्यूटर स्क्रीन के लिए एक यूट्यूब चैनल की तरह है। डेवलपर्स स्वेच्छा से अपने वास्तविक कार्य सत्रों (work sessions) की रिकॉर्डिंग अपलोड करते हैं।
- उपमा: कल्पना कीजिए कि आप एक छात्र को खाना बनाना सिखाना चाहते हैं। शून्य से एक रेसिपी बुक लिखने के बजाय (जो बहुत अधिक सटीक या अजीब हो सकती है), आप एक रसोई में जाते हैं, वास्तविक शेफ द्वारा वास्तविक भोजन पकाने के 80,000 घंटों को रिकॉर्ड करते हैं, और फिर पूछते हैं, "ठीक है, उन्होंने अभी क्या किया?"
- परिणाम: उन्होंने डेवलपर्स के काम करने के 80,870 वास्तविक रिकॉर्डिंग एकत्र किए।
2. "रोबोट शेफ" इंजन
कच्ची रिकॉर्डिंग अव्यवस्थित होती है। उनमें स्पेलिंग की गलतियाँ, असफल प्रयास और सिस्टम संदेशों की लंबी सूचियाँ होती हैं जो मायने नहीं रखतीं। शोधकर्ताओं ने इसे साफ करने के लिए एक विशेष "डेटा इंजन" (एक स्मार्ट सॉफ्टवेयर सिस्टम) बनाया।
- चरण 1: लक्ष्य को समझना। इंजन एक अव्यवस्थित रिकॉर्डिंग को देखता है और एक सुपर-स्मार्ट AI से पूछता है, "यह व्यक्ति वास्तव में क्या हासिल करने की कोशिश कर रहा था?" यह एक अव्यवस्थित लॉग को एक स्पष्ट निर्देश में बदल देता है: "इन खराब IP एड्रेसों को ब्लॉक करें और इस फ़ाइल में सूची सहेजें।"
- चरण 2: रसोई बनाना। रिकॉर्डिंग यह नहीं बताती कि शेफ के पास कौन से उपकरण थे। इंजन को अनुमान लगाना होगा कि किन सॉफ़्टवेयर और फ़ाइलों की आवश्यकता थी, उस कंप्यूटर वातावरण की एक आदर्श डिजिटल प्रति (एक "Docker container" का उपयोग करके) बनानी होगी, और यह सुनिश्चित करना होगा कि मूल कमांड वहां वास्तव में काम करें।
- चरण 3: सुरक्षा जाल (Safety Net)। चूंकि काम को ग्रेड देने के लिए कोई शिक्षक नहीं है, इसलिए इंजन अपना स्वयं का "टेस्ट" बनाता है। यह समाधान को चलाता है और जाँचता है: "क्या फ़ाइल दिखाई दी? क्या सूची सही है?" यदि टेस्ट विफल होता है, तो यह टेस्ट को तब तक ठीक करता रहता है जब तक कि वह एकदम सही न हो जाए।
3. नया "वास्तविक दुनिया" का एग्जाम
उन 80,000 रिकॉर्डिंग्स से, उन्होंने TERMINALWORLD नामक एक विशाल नया टेस्ट बैंक बनाया।
- इसमें 1,530 प्रमाणित कार्य (tasks) हैं।
- यह 18 अलग-अलग प्रकार की वास्तविक नौकरियों को कवर करता है, जैसे क्लाउड सर्वर सेटअप करना से लेकर डेटाबेस त्रुटियों को ठीक करना तक।
- यह 1,280 विभिन्न कंप्यूटर कमांड्स का उपयोग करता है, जिनमें से 91% पिछले परीक्षणों में कभी नहीं देखे गए थे।
उन्होंने एक छोटा, सुपर-हार्ड वर्शन भी बनाया जिसे TERMINALWORLD-VERIFIED (200 कार्य) कहा जाता है, जिसे इंसानों ने 100% सटीक होने के लिए दोबारा जांचा है।
4. चौंकाने वाले परिणाम
उन्होंने दुनिया के सबसे स्मार्ट AI मॉडल्स (जैसे क्लॉड, GPT और जेमिनी के नवीनतम संस्करण) और उनके "एजेंट" फ्रेमवर्क्स (सॉफ्टवेयर जो AI को कंप्यूटर का उपयोग करने में मदद करता है) को इस नए टेस्ट के माध्यम से परखा।
यहाँ उन्हें क्या मिला:
- "दक्षता विरोधाभास" (The Efficiency Paradox): AI जितना स्मार्ट होता है, वह कभी-कभी उतना ही संघर्ष करता है। सबसे अच्छा AI केवल 62.5% कार्यों को ही पास कर पाया। जब वे विफल हुए, तो उन्होंने हार नहीं मानी; वे गलत रास्तों को खोजने में भारी मात्रा में समय और पैसा बर्बाद करते रहे। यह एक ऐसे छात्र की तरह है जो मदद मांगने के बजाय बार-बार एक ही भ्रमित करने वाले पैराग्राफ को पढ़ता रहता है।
- "पहेली बनाम वास्तविकता" का अंतर: AI ने पुराने "पहेली" टेस्ट (Terminal-Bench) पर कैसा प्रदर्शन किया और इस नए "वास्तविक जीवन" टेस्ट में कैसा प्रदर्शन किया, इसके बीच लगभग कोई संबंध नहीं था।
- उपमा: एक AI सुडोकू पहेलियों (पुराना टेस्ट) को हल करने में चैंपियन हो सकता है, लेकिन ट्रैफिक में वास्तव में कार चलाने में पूरी तरह विफल हो सकता है (नया टेस्ट)। पुराने टेस्ट बहुत अलग थे।
- एजेंट बनाम इंसान: जब AI ने किसी कार्य को हल किया, तो उसने शायद ही कभी उस तरीके से किया जैसे रिकॉर्डिंग में मौजूद इंसान ने किया था। वे एक ही मंजिल तक पहुँचने के लिए अलग-अलग रास्ते अपनाते हैं। यह वास्तव में अच्छा है! इसका मतलब है कि AI केवल नकल नहीं कर रहा है; वह अपना खुद का तरीका खोज रहा है, भले ही वह तरीका लंबा हो।
निष्कर्ष
यह शोध पत्र तर्क देता है कि हम अब उन परीक्षणों पर भरोसा नहीं कर सकते जो लैब में विशेषज्ञों द्वारा बनाए गए हैं। यह जानने के लिए कि क्या कोई AI वास्तव में वास्तविक दुनिया में काम करने के लिए तैयार है, हमें इसे वास्तविक मानव वर्कफ़्लो पर टेस्ट करना चाहिए, जो अव्यवस्थित, जटिल और लगातार बदलते रहते हैं।
TERMINALWORLD एक ऐसा टूल है जो वास्तविक मानव कार्य को स्वचालित रूप से एक टेस्ट में बदल देता है, यह सुनिश्चित करता है कि जैसे-जैसे डेवलपर्स अपने काम करने के तरीके बदलते हैं, हमारे AI के लिए हमारे टेस्ट भी उनके साथ विकसित होते रहें। यह "क्या आप एक पहेली हल कर सकते हैं?" के परीक्षण से बदलकर "क्या आप नौकरी कर सकते हैं?" के परीक्षण की ओर एक कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।