Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation
यह शोध पत्र यह प्रदर्शित करता है कि छोटे भाषा मॉडलों (small language models) की सीमाओं की भरपाई के लिए एजेंट हार्नेस (agent harnesses) को स्वचालित रूप से अनुकूलित करना उन्हें नियमित व्यावसायिक कार्यों पर फ्रंटियर एलएलएम (frontier LLM) के प्रदर्शन के बराबर लाने में सक्षम कर सकता है, जबकि इससे अनुमान लागत (inference costs) में 90% तक की कमी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, महंगी रोबोटिक शेफ (एक "फ्रंटियर LLM") है जो एक कंपनी के लिए पांच-सितारा भोजन बना सकती है। यह अद्भुत है, लेकिन इसे चलाने की लागत बहुत अधिक है—जैसे कि सिर्फ एक प्याज काटने के लिए पूछने पर $0.22। फिर, आपको एक छोटा, बजट-अनुकूल रोबोट (एक "स्मॉल लैंग्वेज मॉडल" या "SLM") मिलता है जिसे चलाना लगभग मुफ्त है। आप उन्हें बदल देते हैं, यह उम्मीद करते हुए कि परिणाम उतने ही स्वादिष्ट होंगे। लेकिन आपदा आ जाती है! छोटा रोबोट भ्रमित हो जाता है, टोस्ट जला देता है, और गलत इनवॉइस भेज देता है। यह केवल 75% बार काम सही करता है, जबकि बड़ा रोबोट 97% बार सटीक था।
यह पेपर पूछता है: क्या हम छोटे रोबोट को बड़े रोबोट जितना अच्छा बना सकते हैं बिना बड़े खर्च के?
इसका उत्तर एक जोरदार हाँ है, लेकिन एक ट्विस्ट के साथ। आप केवल रोबोटों को बदल नहीं सकते; आपको छोटे रोबट के चारों ओर एक बेहतर किचन बनाना होगा। लेखक इसे एक "हार्नेस" (harness) कहते हैं। हार्नेस को एक प्रशिक्षण पहियों (training wheels), एक रेसिपी बुक और एक सुरक्षा जाल (safety net) के रूप में सोचें जो सब कुछ एक साथ मिला हुआ है।
बड़ी खोज: "90% सस्ता" जादू
शोधकर्ताओं ने पाया कि विशेष रूप से छोटे रोबोट के लिए किचन (हार्नेस) को स्वचालित रूप से पुनर्गठित करके, वे इसे बड़े महंगे रोबोट के प्रदर्शन के बराबर बना सकते हैं। उनके सबसे अच्छे प्रयोग में, छोटे रोबोट ने बड़े रोबोट के प्रदर्शन का 89.7% प्राप्त किया, जबकि इसकी लागत केवल 4% थी। यह लगभग समान परिणाम के लिए 90% लागत में कमी है!
उन्होंने किचन को ठीक करने का अनुमान नहीं लगाया। उन्होंने एक "मेटा-एजेंट" बनाया—एक सुपर-स्मार्ट रोबोट सुपरवाइजर जिसने छोटे रोबोट की विफलता को देखा, यह पता लगाया कि वह क्यों विफल हुआ, और फिर स्वचालित रूप से किचन के नियमों को फिर से लिखा।
"किचन फिक्स" कैसे काम करता है
पेपर बताता है कि छोटा रोबोट क्यों विफल होता है और हार्नेस इसे कैसे ठीक करता है, इसके लिए तीन मुख्य उपकरणों का उपयोग करता है:
- रेसिपी बुक (कॉन्टेक्स्ट): कभी-कभी छोटे रोबोट को बस नियम या सामग्री का पता नहीं होता। हार्नेस सीधे उसके दिमाग में विस्तृत निर्देश, उदाहरण और "चीट शीट्स" जोड़ देता है।
- विशेष उपकरण (टूल्स): यदि छोटा रोबोट 40 अलग-अलग चाकुओं वाली दराज से अभिभूत हो जाता है, तो हार्नेस उन चीजों को लॉक कर देता है जिनकी उसे आवश्यकता नहीं है और उसे केवल वही एक सटीक चाकू देता है जिसे वह उपयोग करना जानता है।
- सुरक्षा जाल (हुक्स): यदि छोटा रोबोट गोल-गोल घूमने लगता है (जैसे कि एक ही ईमेल दो बार भेजना), तो हार्नेस में एक "स्टॉप बटन" होता है जो गलती होने से पहले ही उसे पकड़ लेता है।
क्या चीज़ काम करती है? (खेल के नियम)
पेपर सुझाव देता है कि यह जादू का तरीका हर काम के लिए काम नहीं करता है। इसने दो बड़े नियम पाए:
- पुनरावृत्ति (Repetition) महत्वपूर्ण है: हार्नेस उन कामों पर सबसे अच्छा काम करता है जहाँ चरण हर बार एक जैसे होते हैं, जैसे उपस्थिति रिकॉर्ड का ऑडिट करना या बजट अनुरोधों को मंजूरी देना। यदि काम अराजक है और हर बार बदलता है (जैसे कि एक अव्यवस्थ कोडबेस को रिफैक्टर करना), तो हार्नेस सभी आधारों को कवर करने के लिए संघर्ष करता है। पेपर ने पाया कि सबसे दोहराव वाले कार्यों के लिए, छोटे रोबोट की सटीकता सबसे अराजक कार्यों की तुलना में 21.1% अधिक बढ़ गई।
- रोबोट को दिमाग चाहिए: छोटे रोबोट के पास शुरुआत में पर्याप्त बुद्धिमत्ता होनी चाहिए। यदि रोबोट बहुत कमजोर है, तो कितने भी प्रशिक्षण पहिए काम नहीं आएंगे। पेपर सुझाव देता है कि मजबूत बेस क्षमताओं वाले मॉडल सबसे अधिक लाभान्वित होते हैं, जो कमजोर मॉडलों के 15.5% की तुलना में 48.8% का प्रदर्शन उछाल देखते हैं।
पेपर किन बातों को "ना" कहता है
लेखक सावधानीपूर्वक बताते हैं कि क्या काम नहीं करता या क्या उत्तर नहीं है:
- "एक ही आकार सबके लिए" (One-Size-Fits-All) नहीं: आप एक छोटे रोबोट के लिए बनाया गया हार्नेस दूसरे पर नहीं लगा सकते। अलग-अलग छोटे रोबोट अलग-अलग तरीकों से विफल होते हैं (एक JSON से नफरत करता है, दूसरा फ़ाइल एडिटिंग से), इसलिए हार्नेस को प्रत्येक विशिष्ट मॉडल के लिए कस्टम-निर्मित होना चाहिए।
- "जादुई उप-रोबोट" (Magic Sub-Robots) नहीं: शोधकर्ताओं ने यह देखने की कोशिश की कि क्या छोटे रोबों की एक टीम (सब-एजेंट्स) बनाने से मदद मिलेगी, लेकिन स्वचालित ऑप्टिमाइज़र ने इस रणनीति को सफल नहीं पाया। पेपर सुझाव देता है कि ऐसा इसलिए है क्योंकि छोटे रोबोट अभी तक अन्य रोबोटों को प्रबंधित करने में सक्षम नहीं हैं।
- "मुफ्त लंच" (Free Lunch) नहीं: हालांकि चलाने की लागत बहुत कम है, लेकिन हार्नेस बनाने के लिए एक बार की लागत होती है। हालांकि, पेपर नोट करता है कि यह लागत औसतन केवल 13 रन के बाद खुद की भरपाई कर लेती है।
निचोड़
यह पेपर साबित करता है कि हमें व्यावसायिक कार्य करने के लिए सबसे महंगे, शक्तिशाली AI पर निर्भर रहने की आवश्यकता नहीं है। एक सस्ते, छोटे मॉडल के चारों ओर एक कस्टम "हार्नेस" बनाने के लिए एक स्मार्ट, स्वचालित प्रणाली का उपयोग करके, हम 10% कीमत पर 90% प्रदर्शन प्राप्त कर सकते हैं।
यह कोई जादुई छड़ी नहीं है जो तुरंत सब कुछ ठीक कर देती; यह एक व्यवस्थित तरीका है जिससे आप एक बजट-अनुकूल रोबोट को सही उपकरण और निर्देश देकर, उसे नियमित व्यावसायिक कार्यों के लिए एक विश्वसनीय कार्यकर्ता में बदल सकते हैं। पेपर का सुझाव है कि दोहराव वाले कार्यों के लिए, यह दृष्टिकोण AI को किफायती बनाने के लिए एक गेम-चेंजर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।