Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
हार्नेस-बेंच (Harness-Bench) एक नैदानिक बेंचमार्क है जिसमें 106 यथार्थवादी, सैंडबॉक्स्ड कार्य शामिल हैं जो यह मूल्यांकन करता है कि विभिन्न सिस्टम-लेयर कॉन्फ़िगरेशन (हार्नेस) एलएलएम (LLM) एजेंट के प्रदर्शन को कैसे प्रभावित करते हैं, जिससे यह स्पष्ट होता है कि निष्पादन परिणाम मॉडल-हार्नेस युग्मों के बीच काफी भिन्न होते हैं और यह हाइलाइट करता है कि एजेंट की क्षमताओं को केवल आधार मॉडल के बजाय कॉन्फ़िगरेशन स्तर पर रिपोर्ट करने की आवश्यकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, विश्व स्तरीय शेफ है (AI मॉडल)। यह शेफ सही निर्देश मिलने पर कुछ भी पका सकता है। लेकिन वास्तविक दुनिया में, एक शेफ केवल शून्य में काम नहीं करता; वे विशिष्ट उपकरणों, नियमों के एक सेट, ऑर्डर की जाँच करने वाले एक मैनेजर और गलतियों को संभालने वाली एक प्रणाली के साथ एक रसोई में काम करते हैं।
यह शोध पत्र, Harness-Bench, केवल उस शेफ का नहीं, बल्कि उस रसोई प्रणाली (जिसे "हार्नेस" कहा जाता है) का परीक्षण करने के बारे में है।
समस्या: हम रसोई को अनदेखा कर रहे थे
अब तक, जब लोग AI एजेंटों का परीक्षण करते थे, तो वे मुख्य रूप से पूछते थे: "शेफ कितना अच्छा है?" वे अंतिम व्यंजन को देखते थे (क्या AI ने कार्य पूरा किया?) लेकिन इस बात को अनदेखा कर देते थे कि रसोई कैसे व्यवस्थित थी।
- क्या शेफ के पास सही चाकू (उपकरण) थे?
- क्या शेफ को जला हुआ पैन (रिकवरी) संभालने का तरीका पता था?
- क्या रसोई प्रबंधक (सिस्टम) ने शेफ को गलत सामग्री का उपयोग करने से रोका (अनुमतियाँ)?
लेखकों का तर्क है कि आप केवल मॉडल को देखकर AI की क्षमता का न्याय नहीं कर सकते। आपको मॉडल + रसोई प्रणाली को एक साथ देखना होगा। एक अव्यवस्थित, टूटी हुई रसोई में एक महान शेफ विफल हो जाएगा, जबकि एक अच्छी तरह से व्यवस्थित, उत्तम रसोई में एक अच्छा शेफ सफल हो सकता है।
समाधान: AI के लिए एक "किचन सिम्युलेटर"
शोधकर्ताओं ने Harness-Bench बनाया है, जो 106 विभिन्न कुकिंग चुनौतियों (कार्यों) वाला एक विशाल परीक्षण मैदान है। ये केवल साधारण प्रश्न नहीं हैं; ये जटिल कार्य हैं जैसे कोड ठीक करना, वित्तीय डेटा का विश्लेषण करना, या किसी प्रोजेक्ट का प्रबंधन करना।
उन्होंने इसे इस प्रकार परखा:
- वही सामग्री, अलग-अलग रसोई: उन्होंने उन्हीं 106 कार्यों को लिया और उन्हें विभिन्न AI मॉडलों को दिया।
- चर (Variable): उन्होंने कार्य को बिल्कुल समान रखा लेकिन प्रत्येक रन के लिए "रसोई प्रणाली" (हार्नेस) को बदल दिया। कुछ रसोईएँ हाई-टेक और सख्त थीं; अन्य ढीली और सरल थीं।
- परिणाम: उन्होंने 5,000 से अधिक प्रयोग चलाए।
उन्होंने क्या पाया
परिणाम आश्चर्यजनक और स्पष्ट थे: रसोई उतनी ही महत्वपूर्ण है जितना कि शेफ।
- बड़ा अंतर: जब उन्होंने एक ही AI मॉडल का उपयोग किया लेकिन उसे अलग-अलग "रसोई" में रखा, तो सफलता दर में भारी उतार-चढ़ाव आया। एक रसोई प्रणाली ने 76% सफलता दर प्राप्त की, जबकि उसी मॉडल के साथ दूसरी प्रणाली को केवल 52% मिला।
- "स्मार्ट" रसोई की जीत: सबसे अच्छा प्रदर्शन करने वाले सिस्टम केवल वे नहीं थे जिनमें सबसे स्मार्ट AI मॉडल थे। वे वे थे जहाँ सिस्टम ने AI को ट्रैक पर रहने, गलतियों से उबरने और उपकरणों का सही ढंग से उपयोग करने में मदद की।
- "ड्रिफ्ट" (भटकाव) की समस्या: शोधकर्ताओं ने पाया कि AI अक्सर एक अच्छी योजना के साथ शुरू करता है लेकिन फिर "भटक" जाता है। वह तार्किक रूप से सोच सकता है लेकिन वास्तव में फ़ाइल को सहेजना भूल सकता है, या वह टूल एरर को अनदेखा कर सकता है और बार-बार वही चीज़ करने की कोशिश कर सकता है। सबसे अच्छे "रसोई सिस्टम" इन भटकावों को पकड़ते थे और उन्हें ठीक करते थे।
मुख्य निष्कर्ष
पत्र यह निष्कर्ष निकालता है कि हमें यह कहना बंद कर देना चाहिए कि "यह AI मॉडल 90% अच्छा है।" इसके बजाय, हमें कहना चाहिए, "यह AI मॉडल 90% अच्छा है जब इसे इस विशिष्ट प्रणाली के साथ जोड़ा जाता है।"
यदि आप एक विश्वसनीय AI एजेंट बनाना चाहते हैं, तो आप केवल सबसे स्मार्ट दिमाग नहीं चुन सकते; आपको उसके साथ जाने वाला सबसे अच्छा शरीर और तंत्रिका तंत्र (हार्नेस) भी बनाना होगा। Harness-Bench वह उपकरण है जिसे उन्होंने इंजीनियरों को उस शरीर को मापने और सुधारने में मदद करने के लिए बनाया है।
संक्षेप में
इसे एक रेस कार का परीक्षण करने जैसा समझें। आप केवल इंजन (AI मॉडल) को देखकर यह नहीं कह सकते कि वह तेज़ है। आपको इंजन का परीक्षण विभिन्न ट्रैक, विभिन्न टायर और ड्राइवरों (हार्नेस) के साथ करना होगा। Harness-Bench वह नया ट्रैक है जो साबित करता है कि कार की गति केवल इंजन पर नहीं, बल्कि ट्रैक और टायरों पर भी बहुत अधिक निर्भर करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।