← नवीनतम पेपर
💻 computer science

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

यह शोध पत्र ClawForge पेश करता है, जो एक जनरेटर-समर्थित बेंचमार्क फ्रेमवर्क है जो निरंतर अवस्था संघर्षों (persistent state conflicts) वाले निष्पादन योग्य वर्कफ्लो पर कमांड-लाइन एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान फ्रंटियर मॉडल मौजूदा अवस्थाओं के निरीक्षण और पूर्व-मौजूद आर्टिफ़ेक्ट्स को संभालने में काफी संघर्ष करते हैं, और अधिकतम 45.3% स्ट्रिक्ट सटीकता प्राप्त करते हैं।

मूल लेखक: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

प्रकाशित 2026-05-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ClawForge पेपर का सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

बड़ी तस्वीर: "बिखरी हुई मेज" की समस्या

कल्पना कीजिए कि आपने अपने जीवन को व्यवस्थित करने के लिए एक बहुत ही बुद्धिमान रोबोट सहायक को काम पर रखा है। अधिकांश परीक्षण जो हम इन रोबनों को देते हैं, वे उन्हें एक नई, खाली मेज देने और यह कहने जैसे होते हैं, "कृपया एक टू-डू लिस्ट (कामों की सूची) लिखें।" रोबोट सूची लिखता है, और हम देखते हैं कि शब्द सही हैं या नहीं।

लेकिन वास्तविक दुनिया में, आपकी मेज कभी खाली नहीं होती। वह आधे-अधूरे प्रोजेक्ट्स, पुराने स्टिकी नोट्स, विरोधाभासी निर्देशों और पुराने हो चुके फाइलों से भरी होती है। एक रोबोट की बुद्धिमत्ता का असली परीक्षण केवल यह नहीं है कि "क्या वह सूची लिख सकता है?" बल्कि यह है कि "क्या वह इस बिखरी हुई मेज को देख सकता है, यह समझ सकता है कि क्या टूटा हुआ है, अच्छी चीजों को हटाए बिना पुराने सामान को ठीक कर सकता है, और काम पूरा कर सकता है?"

यह पेपर ClawForge पेश करता है, जो AI एजेंटों (रोबोटों) को टेस्ट करने का एक नया तरीका है जो पूरी तरह से इस "बिखरी हुई मेज" वाले परिदृश्य पर केंद्रित है।


ClawForge क्या है? ("परिदृश्य फैक्ट्री")

लेखकों ने महसूस किया कि इन "बिखरी हुई मेज" वाले परीक्षणों को हाथ से बनाना बहुत कठिन और धीमा है। यदि आप 100 अलग-अलग बिखरे हुए परिदृश्य टेस्ट करना चाहते हैं, तो आपको मैन्युअल रूप से 100 अलग-अलग बिखराव बनाने होंगे।

ClawForge एक स्वचालित फैक्ट्री है।
इंसानों द्वारा हर टेस्ट लिखने के बजाय, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो खुद टेस्ट बनाता है। यह एक टेम्पलेट लेता है (जैसे "एक टूटे हुए रिलीज़ शेड्यूल को ठीक करें") और स्वचालित रूप से उसमें विवरण भर देता है (अलग-अलग शहर, अलग-अलग तारीखें, अलग-अलग त्रुटियाँ)।

  • आउटपुट: यह एक पूर्ण "एग्जीक्यूटेबल टास्क" (निष्पादन योग्य कार्य) बनाता है। यह केवल एक प्रश्न नहीं है; यह एक मिनी-सिमुलेशन है जिसमें एक शुरुआती स्थिति (बिखरी हुई मेज), नियमों का एक सेट और परिणाम को ग्रेड करने का एक तरीका शामिल है।
  • लक्ष्य: यह देखना है कि क्या AI स्टेट कॉन्फ्लिक्ट (State Conflict) को संभाल सकता है। इसका अर्थ है उन चीजों से निपटना जो पहले से ही वहां मौजूद हैं, जिनमें से कुछ गलत, पुरानी या डुप्लिकेट हो सकती हैं।

यह टेस्ट कैसे काम करता है ("गेम लूप")

इस टेस्ट को एक वीडियो गेम लेवल की तरह समझें जहाँ AI खिलाड़ी है:

  1. सेटअप: गेम एक "सेव फाइल" लोड करता है जिसमें पहले से ही कुछ चीजें बोर्ड पर मौजूद हैं। शायद वहां "सर्वर ठीक करें" नाम का एक कार्य पहले से मौजूद है लेकिन उसे "लो प्रायोरिटी" (कम प्राथमिकता) के रूप में चिह्नित किया गया है (जो कि गलत है)।
  2. निर्देश: AI को एक कमांड मिलता है: "सर्वर फिक्स गलत है। इसे ठीक करें, लेकिन अन्य वैध कार्यों को न हटाएं।"
  3. एक्शन: AI एक-एक करके कमांड टाइप करता है (जैसे कोई इंसान कमांड लाइन का उपयोग करता है)।
  4. ग्रेडिंग: यह सबसे महत्वपूर्ण हिस्सा है। सिस्टम यह चेक नहीं करता कि क्या AI ने ठीक वही शब्द लिखे जो इंसान ने लिखे होते। इसके बजाय, यह मेज की अंतिम स्थिति की जांच करता है।
    • क्या पुराना, गलत कार्य हटा दिया गया?
    • क्या नया, सही कार्य वहां मौजूद है?
    • क्या AI ने अनजाने में उस कार्य की डुप्लिकेट कॉपी बना दी?
    • क्या उसने वैध चीजों को वैसे ही रहने दिया?

यदि अंतिम मेज एकदम सही दिखती है, तो AI पास हो जाता है। यदि मेज बिखरी हुई दिखती है, तो वह फेल हो जाता है।

परिणाम: रोबोट अभी भी सीख रहे हैं

लेखकों ने उपलब्ध सात सबसे स्मार्ट AI मॉडल्स (OpenAI, Anthropic और Kimi जैसी कंपनियों से) का इस नए बेंचमार्क पर परीक्षण किया। परिणाम आश्चर्यजनक और विनम्र करने वाले थे:

  • "परफेक्ट स्कोर" दुर्लभ है: सबसे अच्छा AI मॉडल भी केवल 45% कार्यों को पूरी तरह से सही कर पाया। इसका मतलब है कि यह बेंचमार्क कठिन है और इसे अभी तक "सुलझाया" नहीं जा सका है।
  • "गलत सुधार" की समस्या: एक विशिष्ट प्रकार की विफलता बहुत आम थी। जब किसी गलत चीज़ को बदलने के लिए कहा जाता था, तो मॉडल अक्सर अटक जाते थे। वे गलत चीज़ को हटा तो देते थे लेकिन नई चीज़ जोड़ना भूल जाते थे, या वे नई चीज़ जोड़ देते थे लेकिन पुरानी, टूटी हुई चीज़ को वहीं छोड़ देते थे।
    • उपमा: कल्पना कीजिए कि आपको एक फ्लैट टायर बदलने के लिए कहा गया है। AI फ्लैट टायर को निकाल देता है लेकिन स्पेयर टायर लगाना भूल जाता है। या, वह स्पेयर टायर लगा देता है लेकिन फ्लैट टायर को जमीन पर लुढ़कने के लिए छोड़ देता है।
  • "इसे मत छुओ" की समस्या: एक अन्य सामान्य विफलता तब देखी गई जब मेज पहले से ही काफी हद तक तैयार थी। AI एक ऐसे कार्य को देखता था जो पहले से ही सही था और उसे बस वैसे ही छोड़ने के बजाय, वह उसे फिर से "ठीक" करने की कोशिश करता था, जिससे एक डुप्लिकेट बन जाता था।
    • उपमा: आप रोबोट से कहते हैं, "कॉफी पहले ही बन चुकी है।" रोबोट कहता है, "ठीक है," और फिर तुरंत कॉफी का दूसरा बर्तन बनाने लगता है, जिससे गड़बड़ी हो जाती है।
  • दक्षता (Efficiency) मायने रखती है: कुछ मॉडल्स ने सरल समस्याओं को हल करने में बहुत अधिक स्टेप्स लिए, जबकि कुछ तेज़ थे लेकिन गलतियाँ करते थे। सर्वश्रेष्ठ प्रदर्शन करने वाले वे थे जिन्होंने कार्य करने से पहले मौजूदा स्थिति की जांच की

दो सबसे कठिन चुनौतियाँ

पेपर दो विशिष्ट प्रकार के "बिखरी हुई मेज" वाले परिदृश्यों को उजागर करता है जिन्होंने लगभग सभी मॉडल्स को उलझा दिया:

  1. रॉन्ग-स्टेट रिप्लेसमेंट (Wrong-State Replacement): AI को कुछ ऐसा पहचानना होता है जो गलत है और उसे सही चीज़ से बदलना होता है, जबकि बाकी सब कुछ सुरक्षित रखना होता है। यह सबसे कठिन कार्य था; सबसे अच्छे मॉडल ने इसे केवल 17% बार ही सही किया।
  2. इंटरप्टेड वर्कफ्लो रिज्यूम (Interrupted Workflow Resume): AI को एक ऐसे कमरे में जाना होता है जहाँ किसी और ने एक प्रोजेक्ट शुरू किया था, उसे अधूरे हिस्सों को पूरा करना होता है, और उन हिस्सों को दोबारा नहीं करना होता जो पहले से ही हो चुके हैं। यहाँ सबसे अच्छे और सबसे खराब मॉडल्स के बीच का अंतर बहुत बड़ा था (17% से 90% तक), जो दर्शाता है कि कुछ मॉडल्स कूदने से पहले "कमरे को पढ़ने" (स्थिति समझने) में बहुत बेहतर हैं।

यह क्यों महत्वपूर्ण है

लेखक तर्क देते हैं कि हम अब AI को केवल "साफ-सुथरे" कार्यों पर टेस्ट नहीं कर सकते। वास्तविक काम इतिहास, गलतियों और अधूरे काम के साथ निपटने के बारे में है। ClawForge यह मापने का एक उपकरण है कि क्या एक AI वास्तव में एक वास्तविक ऑफिस में काम करने के लिए तैयार है, जहाँ चीजें शायद ही कभी पूर्ण होती हैं और शून्य से शुरुआत करना शायद ही कभी विकल्प होता है।

संक्षेप में: ClawForge AI एजेंटों के लिए एक जिम है ताकि वे फर्नीचर को तोड़े बिना एक बिखरे हुए कमरे को साफ करना सीख सकें। फिलहाल, सबसे मजबूत AI एजेंट भी इस जिम में अपने ही पैरों से टकराकर लड़खड़ा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →