Rollout Cards: A Reproducibility Standard for Agent Research
यह शोध पत्र "रोलआउट कार्ड्स" को पेश करके एजेंट अनुसंधान में पुनरुत्पादकता (reproducibility) की चुनौतियों को संबोधित करता है, जो एक मानकीकृत प्रकाशन प्रारूप है जो एजेंटिक प्रणालियों के पारदर्शी और सत्यापन योग्य मूल्यांकन को सुनिश्चित करने के लिए कच्चे रोलआउट रिकॉर्ड को सुरक्षित रखता है और रिपोर्टिंग नियमों को स्पष्ट रूप से घोषित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए रेस्टोरेंट की समीक्षा कर रहे एक फूड क्रिटिक हैं। शेफ आपको एक स्कोरकार्ड थमाता है जिस पर लिखा है, "यह भोजन 10 में से 9.5 है।" लेकिन शेफ आपको वास्तविक भोजन, रेसिपी, या इस बात के नोट्स दिखाने से इनकार कर देता है कि उन्होंने इस स्कोर तक पहुँचने का निर्णय कैसे लिया। वे बस कहते हैं, "मुझ पर भरोसा करें, यह 9.5 है।"
अब, एक अन्य क्रिटिक की कल्पना करें जिसने वही सटीक भोजन चखा लेकिन उसे 6.0 दिया। बिना भोजन या रेसिपी देखे, आपके पास यह जानने का कोई तरीका नहीं है कि कौन सही है। क्या पहले क्रिटिक ने एक अलग स्केल का उपयोग किया था? क्या उन्होंने जले हुए टोस्ट को अनदेखा कर दिया? क्या उन्होंने डेज़र्ट (मिठाई) को मुख्य कोर्स के हिस्से के रूप में गिना?
यही वह समस्या है जिसे Rollout Cards AI "एजेंट्स" (स्मार्ट कंप्यूटर प्रोग्राम जो कोड लिखने, वेब ब्राउज़ करने या गणित हल करने जैसे कार्य करते हैं) की दुनिया में हल करने का लक्ष्य है।
यहाँ इस पेपर का सरल विवरण दिया गया है, जिसे रोजमर्रा के उपमाओं (analogies) का उपयोग करके समझाया गया है:
समस्या: "ब्लैक बॉक्स" स्कोर
वर्तमान में, जब शोधकर्ता AI एजेंटों के बारे में परिणाम प्रकाशित करते हैं, तो वे आमतौर पर केवल अंतिम स्कोर (वह "9.5") साझा करते हैं। वे रोलआउट रिकॉर्ड (rollout record) को फेंक देते हैं।
- रोलआउट रिकॉर्ड: इसे AI द्वारा कार्य करने का पूर्ण वीडियो रिकॉर्डिंग समझें। इसमें इसके द्वारा उठाया गया हर कदम, इसके द्वारा उपयोग किया गया हर टूल, इसकी हर गलती, इसने कितना समय लिया, और क्या यह क्रैश हुआ या कहीं फंस गया, यह सब शामिल है।
- समस्या: विभिन्न शोध टीमें उस वीडियो को स्कोर में बदलने के लिए अलग-अलग "नियमों" का उपयोग करती हैं।
- टीम A कह सकती है, "यदि AI क्रैश हो जाता है, तो हम उस प्रयास को अनदेखा कर देते हैं।"
- टीम B कह सकती है, "यदि AI क्रैश हो जाता है, तो उसे शून्य माना जाएगा।"
- टीम C कह सकती है, "हम केवल अंतिम उत्तर को गिनते हैं, यह अनदेखा करते हुए कि वहां तक पहुँचने के लिए 50 कदम लगे।"
पेपर में पाया गया कि उन्होंने चेक किए गए 50 लोकप्रिय AI रिसर्च रिपॉजिटरी में से एक भी ने अपने मुख्य स्कोर के साथ यह रिपोर्ट नहीं किया कि कितने प्रयास विफल हुए या क्रैश हुए। यह एक स्पोर्ट्स टीम के समान है जो कहती है, "हमने 3 गेम जीते!" लेकिन इस तथ्य को छिपाती है कि वे 10 गेम हार गए थे और उन्होंने केवल उन्हीं 3 को गिना जिन्हें उन्होंने जीता था।
प्रमाण: नियम खेल को बदल देते हैं
लेखकों ने 50 अलग-अलग AI टूल्स का ऑडिट किया और पाया कि 37 विशिष्ट मामले ऐसे थे जहाँ "नियम पुस्तिका" (rulebook) को बदलने से स्कोर पूरी तरह से बदल गया, भले ही AI ने बिल्कुल वही काम किया था।
- "MMLU" का उदाहरण: एक ही AI मॉडल (LLaMA-65B) को एक नियम सेट के तहत 63.7 का स्कोर मिला और दूसरे के तहत 48.8 मिला। यह केवल इसलिए एक बड़ा अंतर है क्योंकि स्कोर की गणना कैसे की गई थी, न कि इसलिए कि AI बदला।
- "SWE-bench" का उदाहरण: सॉफ्टवेयर इंजीनियरिंग कार्यों में, चाहे आप "विफल प्रयासों" को कुल में गिनें या उन्हें हटा दें, इससे सफलता दर में 15.6 प्रतिशत अंक का अंतर आया।
- "MLE-Bench" का उदाहरण: इस आधार पर कि आप "पास" को गोल्ड मेडल प्राप्त करने के रूप में परिभाषित करते हैं या केवल एक पासिंग ग्रेड के रूप में, उसी AI सबमिशन की सफलता दर 34.2% से गिरकर 13.3% हो गई।
पेपर का तर्क है कि बिना वीडियो रिकॉर्डिंग (रोलआउट) के, हम यह नहीं बता सकते कि क्या AI वास्तव में बेहतर है, या क्या शोधकर्ता ने बस अधिक उदार नियम पुस्तिका का उपयोग किया है।
समाधान: "रोलआउट कार्ड" (The Rollout Card)
इसे ठीक करने के लिए, लेखक रोलआउट कार्ड नामक एक नया मानक प्रस्तावित करते हैं।
एक रोलआउट कार्ड को एक पारदर्शी, छेड़छाड़-मुक्त रेसिपी बॉक्स की तरह समझें जिसे आपको अपने अंतिम व्यंजन के साथ शामिल करना ही होगा। इसमें शामिल है:
- पूर्ण वीडियो: AI के कार्यों, त्रुटियों और समय का पूरा रिकॉर्ड।
- नियम पुस्तिका: यह स्पष्ट घोषणा कि स्कोर की गणना ठीक कैसे की गई थी (जैसे, "हमने क्रैश को अनदेखा किया," या "हमने प्रत्येक टोकन को गिना")।
- "लापता हिस्सों" की सूची: एक ईमानदार नोट जिसमें लिखा हो, "हम गोपनीयता के कारण पूरा वीडियो साझा नहीं कर सके, इसलिए यहाँ वह सब है जिसे हमने हटाया है।"
यह वैज्ञानिकों को उसी वीडियो को देखने और अलग प्रश्न पूछने की अनुमति देता है। शायद मूल पेपर को केवल इस बात में दिलचस्पी थी कि "क्या इसने कार्य पूरा किया?" लेकिन एक नया शोधकर्ता यह पूछना चाहता है, "क्या इसने बहुत अधिक पैसा खर्च किया?" या "क्या इसने खतरनाक टूल कॉल किए?" रोलआउट कार्ड के साथ, वे उन प्रश्नों का उत्तर दे सकते हैं बिना उस महंगे प्रयोग को दोबारा चलाए।
उन्होंने वास्तव में क्या किया (प्रयोग)
लेखकों ने केवल बातें नहीं कीं; उन्होंने वास्तविक डेटा के साथ इसका परीक्षण किया:
छिपे हुए अंतर्दृखों की पुन: खोज: उन्होंने चार मौजूदा सार्वजनिक डेटासेट (GAP, MAESTRO, COPRA, और Tree-of-Thought जैसे टूल्स से) लिए जो पहले प्रकाशित किए जा चुके थे। रोलआउट कार्ड पद्धति को लागू करके, उन्होंने नए तथ्य खोजे जो मूल पेपर से छूट गए थे।
- उदाहरण: उन्होंने पाया कि 20% AI प्रतिक्रियाएं जो टेक्स्ट में "सुरक्षित" दिख रही थीं, वास्तव में बैकग्राउंड में प्रतिबंधित टूल कॉल कर रही थीं। मूल स्कोर इसे मिस कर गया क्योंकि उन्होंने केवल टेक्स्ट को देखा था।
- उदाहरण: उन्होंने पाया कि मल्टी-एजेंट टीमों में, "विफलताएं" वास्तव में सफलताओं की तुलना में बहुत अधिक समन्वय कार्य (coordination work) से जुड़ी थीं, जो यह सुझाव देता है कि अतिरिक्त काम का मतलब हमेशा बेहतर उत्तर नहीं होता।
एक ही कार्य का पुन: मूल्यांकन: उन्होंने सार्वजनिक AI सबमिशन (जैसे कोड पैच या गणित के उत्तर) को अलग-अलग नियम पुस्तिकाओं का उपयोग करके फिर से स्कोर किया।
- परिणाम: केवल स्कोरिंग नियम को बदलने से रिपोर्ट किए गए स्कोर में 20.9 प्रतिशत अंक तक का बदलाव आया। कुछ मामलों में, इसने रैंकिंग को उलट दिया, जिससे एक "कमजोर" AI को केवल नियम पुस्तिका बदलने के कारण "विजेता" बना दिया गया।
मुख्य निष्कर्ष
पेपर का निष्कर्ष यह है कि केवल स्कोर प्रकाशित करना, टेस्ट पेपर के बिना फाइनल एग्जाम ग्रेड प्रकाशित करने जैसा है। यह उन विवरणों को छिपा देता है जो मायने रखते हैं।
रोलआउट कार्ड्स पेश करके, लेखक AI रिसर्च को प्रतिलिपि योग्य (reproducible) बनाना चाहते हैं। उन्होंने पहले से ही एक मुफ्त, ओपन-सोर्स टूल (जिसे ERGON कहा जाता है) और 21 सार्वजनिक डेटासेट (रोलआउट कार्ड्स) जारी किए हैं जो सॉफ्टवेयर इंजीनियरिंग, वेब ब्राउज़िंग और गणित जैसे कार्यों को कवर करते हैं। यह किसी को भी स्कोर के पीछे की "वीडियो रिकॉर्डिंग" का निरीक्षण करने की अनुमति देता है, यह सुनिश्चित करता है कि जब हम कहते हैं कि एक AI स्मार्ट है, तो हमें वास्तव में पता होता है कि हमने इसे कैसे और क्यों मापा।
यह पेपर क्या दावा नहीं करता है:
- यह दावा नहीं करता कि यह अपने आप में AI को सुरक्षित या अधिक शक्तिशाली बनाएगा।
- यह दावा नहीं करता कि यह सभी गोपनीयता समस्याओं को हल करता है (आपको अभी भी तय करना होगा कि क्या छिपाना है)।
- यह दावा नहीं करता कि यह AI प्रशिक्षण का एक नया तरीका है; यह AI प्रशिक्षण के परिणामों को रिपोर्ट करने और ऑडिट करने का एक नया तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।