Self-Harness: Harnesses That Improve Themselves
यह शोध पत्र Self-Harness को प्रस्तुत करता है, जो एक नया प्रतिमान (paradigm) है जहाँ LLM-आधारित एजेंट मानवीय हस्तक्षेप के बिना प्रदर्शन में उल्लेखनीय सुधार करने के लिए पुनरावृत्ति के माध्यम से अपने स्वयं के विफलता पैटर्न की पहचान करते हैं और स्वायत्त रूप से मॉडल-विशिष्ट हारनेस संशोधनों को उत्पन्न, मान्य और कार्यान्वित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार नया कर्मचारी (AI मॉडल) है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन उसने पहले कभी आपका विशिष्ट कार्यालय नहीं देखा है। आप उसे एक काम देते हैं, लेकिन वह बार-बार वही मूर्खतापूर्ण गलतियाँ करता रहता है: वह अपना काम सहेजना भूल जाता है, मदद माँगने के अंतहीन चक्रों में फंस जाता है, या आपकी फाइलिंग प्रणाली को गलत समझ लेता है।
आमतौर पर, एक मानव प्रबंधक को बैठकर कर्मचारी को विफल होते हुए देखना होगा और फिर मैन्युअल रूप से कर्मचारी की "नियम पुस्तिका" (हार्नेस/harness) को ठीक करने के लिए उसे फिर से लिखना होगा। इसमें बहुत समय लगता है, और यदि आप कल एक अलग प्रकार का कर्मचारी काम पर रखते हैं, तो आपको उनकी अलग आदतों के कारण नियम पुस्तिका को फिर से लिखना होगा।
Self-Harness एक नया विचार है जहाँ कर्मचारी अपनी खुद की नियम पुस्तिका को ठीक करता है।
यहाँ यह पेपर इसे सरल उपमाओं (analogies) का उपयोग करके समझाता है:
तीन-चरणीय "स्व-सुधार" लूप (The Three-Step "Self-Improvement" Loop)
पेपर एक ऐसी प्रक्रिया का वर्णन करता है जहाँ AI स्वयं अपना प्रबंधक बनता है, और बिना किसी मानवीय सहायता या किसी "श्रेष्ठ" AI बॉस के, खुद को बेहतर बनाने के लिए तीन अलग-अलग चरणों से गुजरता है।
1. कमजोरी खोजना (The Detective - जासूस)
केवल एक गलती को देखने के बजाय, AI कई कार्यों को चलाता है और "अपराध स्थल की रिपोर्ट" (विफल प्रयासों) का एक ढेर इकट्ठा करता है। यह इन विफलताओं को एक साथ समूहित करता है।
- उपमा: कल्पना कीजिए कि AI नोटिस करता है, "अरे, मैं कई अलग-अलग कार्यों में इसलिए विफल हुआ क्योंकि मैं विचलित होने से पहले अपनी फ़ाइल सहेजना भूल गया।" वह केवल यह नहीं कहता कि "मैं विफल हुआ"; वह विफलता के एक विशिष्ट पैटर्न की पहचान करता है।
2. हार्नेस प्रस्ताव (The Architect - वास्तुकार)
उन पैटर्न के आधार पर, AI अपनी स्वयं की नियम पुस्तिका में एक छोटा, विशिष्ट परिवर्तन का सुझाव देता है।
- उपमा: AI कहता है, "ठीक है, मुझे पता है कि मैं बार-बार सहेजना भूल जाता हूँ। आइए मेरी निर्देश पुस्तिका में एक छोटा सा नियम जोड़ें: 'एक नया कार्य शुरू करने से पहले, आपको अपना वर्तमान कार्य सहेजना चाहिए।'"
- महत्वपूर्ण बात यह है कि AI पूरी नियमावली को फिर से नहीं लिखता है। वह उस विशिष्ट समस्या को ठीक करने के लिए आवश्यक सबसे छोटा, सबसे लक्षित परिवर्तन ही करता है। वह यह देखने के लिए कुछ अलग-अलग विचार प्रस्तावित करता है कि कौन सा सबसे अच्छा काम करता है।
3. प्रस्ताव सत्यापन (The Strict Judge - सख्त न्यायाधीश)
यह सबसे महत्वपूर्ण सुरक्षा चरण है। AI अपनी नई नियम पुस्तिका को कार्यों के एक नए सेट पर आज़माता है जिसे उसने पहले नहीं देखा है।
- उपमा: इसे एक "रिग्रेशन टेस्ट" के रूप में सोचें। AI पूछता है, "यदि मैं इस नए नियम का पालन करता हूँ, तो क्या मैं उन कार्यों में बेहतर हो जाऊँगा जिनमें मैं पहले से ही अच्छा था, और क्या मैं नई गलतियों को ठीक कर पाऊँगा?"
- यदि नया नियम AI को किसी भी चीज़ में बदतर बनाता है, तो विचार को खारिज कर दिया जाता है। यदि यह बिना नुकसान पहुँचाए मदद करता है, तो नए नियम को आधिकारिक तौर पर नियम पुस्तिका में जोड़ दिया जाता है।
प्रयोगों में क्या हुआ?
शोधकर्ताओं ने तीन बहुत ही अलग AI मॉडलों (MiniMax, Qwen, और GLM) का परीक्षण किया, जो Terminal-Bench-2.0 नामक एक बेंचमार्क का उपयोग करते हैं—यह एक वीडियो गेम की तरह है जहाँ AI को पहेलियाँ सुलझाने के लिए कंप्यूटर टर्मिनल का उपयोग करना होता है।
- प्रारंभिक बिंदु: उन्होंने इन तीनों AI को एक बहुत ही बुनियादी, "बेयर-बोन्स" (बुनियादी) नियम पुस्तिका दी।
- परिणाम: इस स्व-सुधार लूप को चलाने के बाद, तीनों AI पहेलियों को सुलझाने में काफी बेहतर हो गए।
- एक AI ने लगभग 40% कार्यों को हल करने से बढ़कर 60% से अधिक कर लिया।
- दूसरे ने 23% से 38% तक सुधार किया।
- तीसरे ने 42% से 57% तक सुधार किया।
"अहा!" क्षण: अलग-अलग AI को अलग-अलग सुधारों की आवश्यकता होती है
पेपर ने पाया कि यह बहुत ही दिलचस्प था: "सुधार" सबके लिए एक जैसा नहीं था। क्योंकि AI के पास अलग "व्यक्तित्व" या सोचने के तरीके होते हैं, उन्हें अलग-अलग नियम पुस्तिका परिवर्तनों की आवश्यकता थी।
- MiniMax अन्वेषण (exploring) में अच्छा था लेकिन काम पूरा करने में बुरा था। समाधान? एक नियम कि "शुरुआत में ही अंतिम फ़ाइल बनाएँ" और "यदि आपने मदद के लिए बहुत बार पूछा है तो लूप से बाहर निकल जाएँ।"
- Qwen शुरुआत करने में अच्छा था लेकिन गलती से अपना काम डिलीट कर देता था। समाधान? एक नियम कि "पहले डिपेंडेंसी (dependencies) की जाँच करें" और "जब तक आप सुनिश्चित न हों, तब तक कोई फ़ाइल डिलीट न करें।"
- GLM लंबे शोध चरणों में फंस जाता था और वास्तव में कुछ बना नहीं पाता था। समाधान? एक नियम कि "एक निश्चित समय के बाद अन्वेषण (exploring) से निर्माण (building) की ओर स्विच करें।"
मुख्य निष्कर्ष (The Big Takeaway)
पेपर निष्कर्ष निकालता है कि हमें इन प्रणालियों को ठीक करने के लिए हमेशा किसी मानव विशेषज्ञ या "सुपर-इंटेलिजेंट" AI की आवश्यकता नहीं होती है। यदि हम एक AI को अपनी विफलताओं को देखने के सही उपकरण और केवल उन परिवर्तनों को स्वीकार करने का अनुशासन दें जो सिद्ध रूप से काम करते हैं, तो वह अपने स्वयं के ऑपरेटिंग सिस्टम को विकसित कर सकता है।
यह एक वीडियो गेम चरित्र की तरह है जो, कुछ बार मरने के बाद, स्तर को जीतने के लिए सही रणनीति का पता लगाता है और फिर अगले दौर के लिए अपने स्वयं के "चीट शीट" को अपडेट करता है, और वह भी अपने आप। पेपर दिखाता है कि यह संभव है, भले ही इसकी शुरुआत बहुत सरल हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।