Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation
1,200 लैंग्वेज मॉडल एजेंट रोलआउट्स का यह नियंत्रित अध्ययन प्रदर्शित करता है कि जहाँ विभिन्न कौशल अनुकूलन रणनीतियाँ लागत-दक्षता या प्रदर्शन में सुधार करने में विफल रहती हैं, वहीं निष्पादक मॉडल (एग्जीक्यूटर मॉडल) को अपग्रेड करना ही एकमात्र कारक है जो कार्य सफलता दर को महत्वपूर्ण रूप से बढ़ाता है, हालांकि इसके लिए काफी अधिक मौद्रिक लागत चुकानी पड़ती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप जटिल सॉफ़्टवेयर समस्याओं को हल करने के लिए डिजिटल सहायकों (AI एजेंटों) की एक टीम को काम पर रख रहे हैं। आपके पास उनके लिए एक "कौशल नियमावली" (skill manual) है—विशिष्ट कार्यों को हल करने के लिए निर्देशों का एक समूह। मुख्य प्रश्न जो शोधकर्ताओं ने पूछा था वह है: सर्वश्रेष्ठ परिणाम और सबसे कम कीमत पाने के लिए हमें इन नियमावलियों को कैसे लिखना और प्रस्तुत करना चाहिए?
कई लोग मानते हैं कि यदि वे नियमावली को छोटा कर देते हैं, उसे फैंसी चार्ट में व्यवस्थित करते हैं, या उसे फिर से लिखने के लिए एक बहुत ही स्मार्ट संपादक का उपयोग करते हैं, तो सहायक तेज़ी से और सस्ते में काम करेगा। यह अध्ययन उस धारणा का परीक्षण करता है।
यहाँ उन्होंने क्या पाया, इसे सरल भाषा में समझाया गया है:
1. प्रयोग: "खाना पकाने" का रूपक (Analogy)
AI एजेंट को एक शेफ (रसोइया) के रूप में सोचें।
- कौशल (The Skill): वह रेसिपी जिसे शेफ फॉलो करता है।
- कंपाइलर (The Compiler): वह व्यक्ति जो रेसिपी को एडिट करता है (शायद उसे छोटा करना या उसे फ्लोचार्ट में बदलना)।
- एक्सेक्यूटर (The Executor): वास्तविक शेफ जो भोजन बना रहा है।
- लागत (The Cost): सामग्री और शेफ के समय की कीमत।
उन्होंने शेफ को रेसिपी देने के 10 अलग-अलग तरीकों का परीक्षण किया। उन्होंने ये प्रयास किए:
- शेफ को मूल, बिना संपादित रेसिपी देना।
- रेसिपी को केवल आवश्यक चीजों तक सीमित कर देना (छोटा करना)।
- रेसिपी को एक संरचित सूची या एक फैंसी टेबल में फिर से लिखना (स्ट्रक्चर्ड रेंडरिंग)।
- शेफ को केवल रेसिपी का वही हिस्सा दिखाना जो वर्तमान व्यंजन के लिए प्रासंगिक है (स्कोपड लोडिंग)।
- खाना पकाने के लिए एक "जूनियर शेफ" (एक सस्ता, छोटा AI मॉडल) बनाम एक "मास्टर शेफ" (एक अधिक महंगा, शक्तिशाली AI मॉडल) का उपयोग करना।
उन्होंने 40 अलग-अलग सॉफ़्टवेयर कार्यों में इस प्रयोग को 1,200 बार चलाया, और दो चीजें मापीं: क्या व्यंजन सही बना? (सफलता दर) और वास्तविक पैसे में इसकी लागत कितनी थी?
2. सबसे बड़ा आश्चर्य: "रेसिपी" से ज्यादा "शेफ" महत्वपूर्ण है
सबसे महत्वपूर्ण निष्कर्ष यह है कि खाना कौन पका रहा है, यह इस बात से कहीं अधिक मायने रखता है कि रेसिपी कैसे लिखी गई है।
- मास्टर शेफ की जीत: जब उन्होंने शक्तिशाली "मास्टर शेफ" (अधिक मजबूत AI मॉडल) का उपयोग किया, तो सफलता दर में 27% की उछाल आई। हालाँकि, इसके लिए प्रत्येक कार्य के लिए लगभग 5 गुना अधिक खर्च हुआ।
- जूनियर शेफ संघर्ष करता है: जब उन्होंने सस्ते "जूनियर शेफ" का उपयोग किया, तो फैंसी रेसिपी के नुस्खे काम नहीं आए। वास्तव में, उन्होंने अक्सर चीजों को और खराब कर दिया।
- रेसिपी को छोटा करना: इससे जूनियर शेफ को बेहतर खाना बनाने में कोई मदद नहीं मिली, और न ही इससे पैसे बचे।
- फैंसी फॉर्मेटिंग (चार्ट/टेबल): इसने जूनियर शेफ को भ्रमित कर दिया, जिससे एक साधारण, प्लेन-टेक्स्ट रेसिपी की तुलना में उसकी सफलता दर कम हो गई।
- रेसिकी के केवल हिस्से दिखाना: इसने भी सफलता दर को कम कर दिया और पैसे भी नहीं बचाए।
रूपक: कल्पना कीजिए कि आपके पास एक छात्र (जूनियर शेफ) है। यदि आप उन्हें एक सरल, बुलेट-पॉइंट वाला स्टडी गाइड देते हैं, तो वे अभी भी परीक्षा में फेल हो सकते हैं यदि उन्हें बुनियादी बातें समझ नहीं आती हैं। लेकिन यदि आप एक जीनियस ट्यूटर (मास्टर शेफ) को नियुक्त करते हैं, तो वे परीक्षा आसानी से पास कर लेंगे, भले ही स्टडी गाइड अव्यवस्थित और लंबी क्यों न हो। काम करने वाले की गुणवत्ता निर्णायक कारक है, न कि निर्देशों का प्रारूप।
3. लागत का जाल: "टोकन काउंट" बनाम "वास्तविक पैसा"
वहाँ एक जाल था कि लोग आमतौर पर AI लागत को कैसे मापते हैं।
- टोकन का भ्रम: लोग लागत का अनुमान लगाने के लिए अक्सर "टोकन" (टेक्स्ट के टुकड़े) गिनते हैं। वे सोचते थे, "ओह, फैंसी स्ट्रक्चर्ड रेसिपी में कम टोकन लगते हैं, इसलिए यह सस्ता है!"
- वास्तविकता: "मास्टर शेफ" कम टोकन का उपयोग करता है क्योंकि वे स्मार्ट होते हैं और उन्हें कम निर्देश की आवश्यकता होती है, लेकिन वे प्रति टोकन बहुत अधिक कीमत वसूलते हैं।
- रूपक: यह एक मास्टर बढ़ई को काम पर रखने जैसा है जो 1 घंटे में काम पूरा करता है लेकिन \500/घंटा चार्ज करता है, बनाम एक नौसिखिया जो 5 घंटे लेता है और \20/घंटा लेता है। भले ही मास्टर कम "समय" (टोकन) का उपयोग करता है, लेकिन कुल बिल बहुत अधिक होता है।
- अध्ययन में पाया गया कि जब आप वास्तविक डॉलर लागत देखते हैं, तो कोई भी "अनुकूलित" (optimized) रेसिपी (छोटा करना, स्ट्रक्चर करना या स्कोप करना) मूल निर्देशों को देने की तुलना में पैसे नहीं बचा पाई।
4. "ब्रेक-ईवन" का मिथक
कुछ लोग सोचते हैं: "यदि मैं अभी थोड़ा अतिरिक्त भुगतान करता हूँ ताकि एक सुपर-स्मार्ट संपादक मेरी रेसिपी को फिर से लिख सके, तो मैं बाद में पैसे बचाऊंगा क्योंकि शेफ तेजी से काम करेगा।"
- फैसला: गणित कहता है: नहीं।
- रूपक: कल्पना कीजिए कि आप अपने निर्देशों को फिर से लिखने के लिए एक पेशेवर संपादक को \10 देते हैं। आप उम्मीद करते हैं कि इससे आप हर बार \1 बचाएंगे। अध्ययन में पाया गया कि अधिकांश कार्यों के लिए, आपको उस पुनर्गठित रेसिपी का उपयोग सैकड़ों बार करना होगा तभी आप ब्रेक-ईवन (बराबर स्थिति) तक पहुँच पाएंगे। चूंकि अधिकांश लोग इन कौशलों का उपयोग कुछ ही बार करते हैं, इसलिए आप निर्देशों को "अनुकूलित" करने की कोशिश में लगभग हमेशा पैसा गंवा रहे होते हैं।
निष्कर्षों का सारांश
- निर्देशों को अत्यधिक जटिल (over-engineer) न बनाएं: निर्देशों को छोटा, संरचित या "स्कोपड" बनाने से AI स्मार्ट या सस्ता नहीं हुआ। वास्तव में, सस्ते AI मॉडल्स के लिए, इसने अक्सर चीजों को और खराब कर दिया।
- कच्चा माल ठीक है: मूल, बिना संपादित "कौशल" निर्देश फैंसी संस्करणों की तुलना में उतने ही अच्छे (या बेहतर) काम करते हैं।
- काम करने वाले को अपग्रेड करें, मैनुअल को नहीं: केवल एक अधिक शक्तिशाली AI मॉडल में स्विच करने से ही परिणामों में विश्वसनीय सुधार हुआ, भले ही इसमें अधिक खर्च आता हो।
- वास्तविक लागत मायने रखती है: "टोकन काउंट" से धोखा न खाएं। हमेशा वास्तविक डॉलर मूल्य देखें। इस अध्ययन में, निर्देशों को फिर से लिखकर टोकन बचाने की कोशिश करने से वास्तव में पैसे नहीं बचे।
मुख्य बात (Bottom Line): यदि आप चाहते हैं कि आपका AI एजेंट सफल हो, तो इस बात की चिंता करना छोड़ दें कि आपके निर्देश कितने सुंदर या छोटे हैं। इसके बजाय, कार्य को अधिक सक्षम AI मॉडल को देने पर ध्यान केंद्रित करें। "काम करने वाले की गुणवत्ता" ही एकमात्र चीज़ है जो वास्तव में बदलाव लाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।