HELIX: Model-Harness Co-evolution for Recursive Self-Improvement
यह शोध पत्र HELIX को प्रस्तुत करता है, जो एक स्रोत-ट्रेस करने योग्य (source-traceable) ढांचा है जो एजेंट हार्नेस और मॉडलों के सह-विकास (co-evolving) के माध्यम से पुनरावर्ती स्व-सुधार (recursive self-improvement) को सक्षम बनाता है, जहाँ अनुकूलित हार्नेस वर्तमान कार्य कवरेज का विस्तार करते हैं और आगामी मॉडल पुनरावृत्तियों को प्रशिक्षित करने के लिए सत्यापित प्रक्षेपवक्र डेटा (verified trajectory data) उत्पन्न करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (apprentice) को एक टूटी हुई घड़ी ठीक करना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, "प्रशिक्षु" एक AI मॉडल है—एक विशाल मस्तिष्क जो बहुत सारे तथ्य जानता है, लेकिन यह नहीं जानता कि वास्तविक दुनिया में व्यवहार कैसे किया जाए। लंबे समय तक, वैज्ञानिकों को लगा कि प्रशिक्षु को बेहतर बनाने का एकमात्र तरीका उसके मस्तिष्क को अधिक स्मार्ट बनाना है। उन्होंने उसे और अधिक पुस्तकें, अधिक डेटा और अधिक जटिल पाठ दिए।
लेकिन एक पेंच है: प्रशिक्षु शून्य में काम नहीं करता है। वे एक कार्यशाला (workshop) में काम करते हैं। यह कार्यशाला "हारनेस" (harness) है। यह नियमों, उपकरणों और निर्देशों का वह समूह है जो प्रशिक्षु को बताता है कि पेचकस कब उठाना है, मदद के लिए कैसे पूछना है, यदि कोई गियर गिर जाए तो क्या करना है, और काम कब रोकना है। यदि कार्यशाला अव्यवस्थित है, तो प्रशिक्षु भ्रमित हो जाएगा। यदि उपकरण कुंद (dull) हैं, तो प्रशिक्षु विफल हो जाएगा, भले ही वह एक जीनियस क्यों न हो। जिस कागज को आप पढ़ने जा रहे हैं, वह सुझाव देता है कि प्रशिक्षु को वास्तव में बेहतर बनाने के लिए, हम केवल उनके मस्तिष्क को अपग्रेड नहीं कर सकते; हमें मस्तिष्क और कार्यशाला दोनों को एक साथ अपग्रेड करना होगा, एक ऐसे लूप में जहाँ प्रत्येक एक दूसरे को बेहतर होने में मदद करे।
हेलिक्स (HELIX): मस्तिष्क और कार्यशाला के बीच एक नृत्य
HELIX से मिलिए, जो हांगकांग विश्वविद्यालय के शोधकर्ताओं द्वारा बनाया गया एक नया सिस्टम है। HELIX को एक मास्टर शिल्पकार के रूप में समझें जिसे यह एहसास हुआ है कि एक आदर्श रोबोट बनाने का रहस्य केवल रोबोट के मस्तिष्क को स्मार्ट बनाना नहीं है। यह इस बात को समझना है कि रोबोट का "मस्तिष्क" (AI मॉडल) और उसकी "कार्यशाला" (हारनेस) सबसे अच्छे दोस्त हैं जिन्हें साथ मिलकर विकसित होना चाहिए।
आमतौर पर, जब हम AI को बेहतर बनाने की कोशिश करते हैं, तो हम मस्तिष्क और कार्यशाला को अलग-अलग चीजों के रूप में देखते हैं। हम एक मस्तिष्क बनाते हैं, फिर उसके चारों ओर एक कार्यशाला बनाते हैं, और उम्मीद करते हैं कि वे आपस में तालमेल बिठा लेंगे। लेकिन HELIX का तर्क है कि यह एक तैराक को केवल उसकी मांसपेशियों को बदलने और पानी के तापमान और पूल के नियमों को बिल्कुल वैसा ही रखने के माध्यम से सिखाने जैसा है। तैराक मजबूत हो सकता है, लेकिन फिर भी वह डूब सकता है यदि पानी बहुत ठंडा है या नियम भ्रमित करने वाले हैं।
बड़ी अवधारणा: सह-विकास (Co-Evolution)
HELIX "मॉडल-हारनेस को-इवोल्यूशन" नामक एक अवधारणा पेश करता है। कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जिसमें आप एक पात्र (character) हैं। वह पात्र मॉडल है, और गेम के नियंत्रण (बटन, भौतिकी, मैप) हारनेस हैं।
- पुराना तरीका: आप अपने पात्र को मजबूत बनाने के लिए घंटों मेहनत करते हैं, लेकिन आप लगातार उसी उबाऊ, टूटे हुए स्तर (level) पर खेलते रहते हैं।
- HELIX का तरीका: आप एक स्तर खेलते हैं। यदि आप जीतते हैं, तो आप सीखते हैं कि आपने कैसे जीत हासिल की। यदि आप हारते हैं, तो आप सीखते हैं कि आप क्यों हारे। फिर, आप अगले स्तर को थोड़ा अलग बनाने के लिए गेम के नियंत्रणों (हारनेस) को ट्यून करते हैं, और जो कुछ भी हुआ उसके आधार पर आप अपने पात्र के प्रशिक्षण (मॉडल) को ट्यून करते हैं। आप इसे बार-बार करते हैं। पात्र गेम में बेहतर होता जाता है, और गेम पात्र को सिखाने में बेहतर होता जाता है।
HELIX कैसे काम करता है: बिल्ड-अपडेट-रीबिल्ड लूप
यह कागज बिल्ड-अपडेट-रीबिल्ड (Build-Update-Rebuild) नामक तीन चरणों वाले नृत्य का वर्णन करता है। HELIX सिस्टम में यह इस प्रकार चलता है:
- बिल्ड (Build): सिस्टम एक निश्चित AI मस्तिष्क लेता है और उसके लिए कई अलग-अलग "कार्यशालाएं" बनाता है। यह एक ही कार्यशाला के 65 अलग-अलग संस्करण बनाने जैसा है, जिनमें से प्रत्येक में थोड़े अलग उपकरण, नियम या सुरक्षा जांच होती है।
- अपडेट (Update): AI मस्तिष्क सभी 65 कार्यशालाओं में एक समस्या (जैसे कोड का एक हिस्सा ठीक करना) को हल करने की कोशिश करता है। कुछ कार्यशालाएं उसे सफल होने में मदद करती हैं; कुछ उसे मजेदार तरीकों से विफल बनाती हैं। HELIX विफलताओं को केवल फेंक नहीं देता। यह उन्हें सहेज लेता है! यह एक "सिबलिंग" रिकॉर्ड बनाता है: "यहाँ बताया गया है कि मस्तिष्क ने कार्यशाला A में इसे कैसे हल किया, और यहाँ बताया गया है कि वह कार्यशाला B में क्यों विफल रहा।" ये रिकॉर्ड मस्तिष्क के लिए एक विशेष प्रशिक्षण नियमावली (manual) बन जाते हैं।
- रीबिल्ड (Rebuild): मस्तिष्क प्रशिक्षण नियमावली से थोड़ा स्मार्ट हो जाता है। लेकिन अब, पुराने कार्यशालाएं नए, स्मार्ट मस्तिष्क के लिए सबसे उपयुक्त नहीं हो सकती हैं। इसलिए, HELIX कार्यशालाओं का पुनर्निर्माण करता है, मस्तिष्क की नई सुपरपावर्स से मेल खाने वाले नए उपकरण और नियम डिजाइन करता है।
उन्होंने क्या पाया: केवल एक बेहतर मस्तिष्क से कहीं अधिक
शोधकर्ताओं ने इस विचार का परीक्षण कोडिंग कार्यों (जैसे कंप्यूटर प्रोग्राम में बग ठीक करना) के 100 सेटों का उपयोग करके किया। उन्होंने एक मानक सेटअप से शुरुआत की जिसे "पाई" (Pi) कहा जाता है और HELIX को कार्यशाला के 64 नए रूपांतर विकसित करने दिया।
परिणाम:
- सर्वश्रेष्ठ एकल कार्यशाला: विभिन्न कार्यशालाओं के हिस्सों को मिलाकर, HELIX ने एक विशिष्ट सेटअप पाया जिसने 100 में से 52 कार्यों को हल किया। मूल सेटअप ने केवल 50 को हल किया था। यह कोई बहुत बड़ी छलांग नहीं थी, लेकिन इसने साबित कर दिया कि कार्यशाला को बदलना मस्तिष्क को बेहतर प्रदर्शन करने में वास्तव में मदद करता है।
- पोर्टफोलियो की शक्ति: यह वास्तव में बहुत शानदार हिस्सा है। यदि आप उन सभी 65 कार्यशालाओं को एक साथ देखते हैं, तो वे 100 में से 79 कार्यों को हल करते हैं। इसका मतलब है कि जबकि कोई भी एक कार्यशाला पूर्ण नहीं थी, कार्यशालाओं के समूह ने बहुत अधिक क्षेत्र को कवर किया। यह 65 अलग-अलग मैकेनिकों की एक टीम होने जैसा है; भले ही कोई एक मैकेनिक हर कार को ठीक न कर सके, लेकिन टीम लगभग कुछ भी ठीक कर सकती है।
- डेटा का खजाना: सबसे महत्वपूर्ण खोज केवल हल किए गए कार्यों की संख्या नहीं थी। यह डेटा था। इन विभिन्न कार्यशालाओं के माध्यम से AI को चलाकर, HELIX ने 438 सत्यापित प्रशिक्षण रिकॉर्ड उत्पन्न किए। ये केवल "जीत" या "हार" के स्कोर नहीं थे। ये विस्तृत कहानियाँ थीं: "यह समाधान काम कर गया लेकिन अव्यवस्थित था," "यह समाधान विफल रहा क्योंकि इसने सुरक्षा नियम तोड़ दिया था," और "यह समाधान एकदम सटीक था।" यह समृद्ध डेटा ही वह है जिसकी AI को अगली बार बेहतर तरीके से सोचने के लिए आवश्यकता है।
यह क्यों मायने रखता है
यह शोध पत्र सुझाव देता है कि हम AI सुधार को गलत दृष्टिकोण से देख रहे थे। हमने सोचा, "यदि हम बस मस्तिष्क को बड़ा बना देंगे, तो यह सब कुछ हल कर देगा।" HELIX दिखाता है कि मस्तिष्क केवल आधी कहानी है। वह वातावरण जिसमें वह रहता है—नियम, उपकरण, सुरक्षा जांच—उतना ही महत्वपूर्ण है।
मस्तिष्क और कार्यशाला को एक ऐसी टीम के रूप में व्यवहार करके जो एक साथ विकसित होती है, HELIX आत्म-सुधार का एक चक्र बनाता है। कार्यशाला मस्तिष्क को सीखने में मदद करती है, और स्मार्ट मस्तिष्क एक बेहतर कार्यशाला डिजाइन करने में मदद करता है। यह एक लूप है जो लगातार अधिक सटीक और कुशल होता जाता है।
शोधकर्ता सावधानी बरतते हुए कहते हैं कि यह कोई जादुई छड़ी नहीं है जिसने सब कुछ हल कर दिया। उन्होंने पाया कि हर नया कार्यशाला बेहतर नहीं था; कुछ बदतर भी थे। उन्होंने यह भी नोट किया कि उन्होंने अभी तक इस डेटा का उपयोग करके एक नया मस्तिष्क वास्तव में प्रशिक्षित नहीं किया है—उन्होंने केवल डेटा एकत्र किया है। लेकिन उन्होंने सिद्ध कर दिया है कि यह पद्धति काम करती है: आप केवल इस बात को विकसित करके उच्च-गुणवत्ता वाली, सत्यापित शिक्षण सामग्री बनाने के लिए एक प्रणाली बना सकते हैं कि AI दुनिया के साथ कैसे इंटरैक्ट करता है।
संक्षेप में, HELIX एक ऐसे भविष्य का ब्लूप्रिंट है जहाँ AI केवल अपने आप स्मार्ट नहीं होता; यह इसलिए स्मार्ट होता है क्योंकि हमने इसके लिए एक बेहतर खेल का मैदान बनाया, और फिर हमने स्मार्ट संस्करण के लिए एक और भी बेहतर खेल का मैदान बनाया, और इसी तरह। यह एक बच्चे को बाथटब में तैरना सिखाने बनाम उसे एक ऐसे पूल में सिखाने के बीच का अंतर है जो उसके बढ़ते कौशल के अनुरूप अपना आकार बदलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।