Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher
यह शोध पत्र हाइब्रिड ओपन-एंडेड ट्राई-इवोल्यूशन (HOTE) फ्रेमवर्क का प्रस्ताव करता है, जो एक प्रपोजर (proposer), सॉल्वर (solver) और जज (judge) को सहयोगात्मक रूप से विकसित करने के लिए हाइब्रिड-मोड सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करता है, जिससे एक 8B मॉडल को कम समय के ओवरहेड के साथ ओपन-एंडेड कार्यों पर बड़े स्टैटिक और अत्याधुनिक डीप रिसर्च मॉडल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ी तस्वीर: एक रोबोट को सुपर-रिसर्चर बनने की शिक्षा देना
कल्पना कीजिए कि आप एक ऐसा AI बनाना चाहते हैं जो दुनिया के बेहतरीन शोधकर्ताओं (researchers) की तरह काम कर सके। उसे इंटरनेट पर जानकारी ढूँढनी होगी, हजारों लेख पढ़ने होंगे और जटिल विषयों पर एक विस्तृत रिपोर्ट लिखनी होगी (जैसे कि "2050 में जलवायु परिवर्तन कॉफी उत्पादन को कैसे प्रभावित करेगा?")।
समस्या यह है कि अधिकांश AI मॉडल उन छात्रों की तरह होते हैं जो केवल एक निश्चित पाठ्यपुस्तक से पढ़ते हैं। एक बार जब वे पाठ्यपुस्तक पूरी कर लेते हैं, तो वे सीखना बंद कर देते हैं। वे अपने आप नई चीजों पर शोध करने में बेहतर नहीं हो सकते।
यह पेपर HOTE (Hybrid Open-Ended Tri-Evolution) नामक एक नई प्रणाली पेश करता है। HOTE को केवल एक छात्र के रूप में नहीं, बल्कि एक स्व-सुधार करने वाली रिसर्च टीम के रूप में देखें जो अपने आप के विरुद्ध एक खेल खेलकर सीखती है।
टीम के तीन पात्र
केवल एक AI द्वारा सब कुछ करने के बजाय, HOTE तीन विशिष्ट भूमिकाओं का उपयोग करता है जो एक साथ विकसित होती हैं:
द सॉल्वर (द रिसर्चर - समाधान करने वाला/शोधकर्ता):
- भूमिका: यह वह AI है जो वास्तव में काम करता है। यह एक प्रश्न लेता है, वेब खोजता है, दस्तावेज़ पढ़ता है और एक लंबी शोध रिपोर्ट लिखता है।
- उपमा: सॉल्वर को एक जासूस के रूप में सोचें जो एक रहस्य को सुलझाने की कोशिश कर रहा है।
द जज (द क्रिटिक - निर्णायक/आलोचक):
- भूमिका: यह AI सॉल्वर द्वारा लिखी गई रिपोर्टों को पढ़ता है। केवल "अच्छा" या "बुरा" कहने के बजाय, यह रिपोर्ट को ग्रेड देने के लिए एक कस्टम चेकलिस्ट (जिसे "रूब्रिक" कहा जाता है) बनाता है। यह विशिष्ट खूबियों और कमजोरियों को देखता है।
- उपमा: जज एक सख्त संपादक या स्पोर्ट्स रेफरी की तरह है। यदि जासूस कोई सुराग छोड़ देता है, तो रेफरी सीटी बजाता है और कहता है, "आपने इस विशिष्ट विवरण को मिस कर दिया।" महत्वपूर्ण बात यह है कि जज नए प्रकार की गलतियों को देखते हुए अपनी स्वयं की नियम पुस्तिका को अपडेट करता है, ताकि वह पुराने नियमों में न फंसा रहे।
द प्रोपोज़र (द क्विज़ मास्टर - प्रस्ताव देने वाला/प्रश्नोत्तरी मास्टर):
- भूमिका: यह AI जज के फीडबैक और जासूस की गलतियों को देखता है और नए, कठिन प्रश्न बनाता है। इसका लक्ष्य जासूस की कमजोरियों को ढूंढना और उन्हें चुनौती देना है।
- उपमा: प्रोपोज़र एक जिम कोच की तरह है जो एथलीट को एक विशिष्ट मूव करने में विफल होते हुए देखता है और फिर उस सटीक कमजोरी को ठीक करने के लिए एक नया, थोड़ा कठिन अभ्यास (drill) तैयार करता है।
वे कैसे प्रशिक्षण लेते हैं: "ट्राइ-इवोल्यूशन" गेम
जादू तब होता है जब ये तीनों एक लूप में मिलकर काम करते हैं, और लगातार बेहतर होते जाते हैं:
- क्विज़ मास्टर एक कठिन शोध प्रश्न बनाता है।
- जासूस उसका उत्तर देने का प्रयास करता है, वेब खोजता है और एक रिपोर्ट लिखता है।
- रेफरी रिपोर्ट को ग्रेड देता है, एक नई चेकलिस्ट बनाता है, और ठीक से बताता है कि जासूस कहाँ विफल रहा।
- जासूस ग्रेड से सीखता है और फिर से प्रयास करता है।
- क्विज़ मास्टर देखता है कि जासूस अभी भी किन चीजों में बुरा है और अगले दौर के लिए एक और कठिन प्रश्न बनाता है।
यह चक्र हजारों बार दोहराया जाता है। पेपर इसे "ट्राइ-इवोल्यूशन" कहता है क्योंकि ये तीनों पात्र एक ही समय में विकसित (सुधार) हो रहे हैं।
"हाइब्रिड" गुप्त नुस्खा (Secret Sauce)
पेपर "डुअल-मोड हाइब्रिड" रणनीति का भी उल्लेख करता है। यह एक एथलीट को दो अलग-अलग तरीकों से प्रशिक्षित करने जैसा है:
- मोड A (टूल-यूज़): जासूस को उत्तर खोजने के लिए इंटरनेट (सर्च टूल्स) का उपयोग करने की अनुमति है। यह वास्तविक है लेकिन इसमें शोर (noise) हो सकता है और यह धीमा हो सकता है।
- मोड B (नो-टूल): जासूस को बिना कुछ भी खोजे, केवल अपनी याददाश्त और तर्क के आधार पर उत्तर देना होता है। यह तेज़ है लेकिन यह इस पर निर्भर करता है कि वे पहले से क्या जानते हैं।
HOTE सिस्टम जासूस को दोनों मोड में एक साथ प्रशिक्षित करता है।
- क्यों? यदि आप केवल इंटरनेट के साथ प्रशिक्षण देते हैं, तो जासूस आलसी हो सकता है और खोज परिणामों पर बहुत अधिक निर्भर हो सकता है। यदि आप केवल बिना टूल के प्रशिक्षण देते हैं, तो वे प्रभावी ढंग से इंटरनेट का उपयोग करना भूल सकते हैं। उन्हें मिलाकर, जासूस यह सीखता है कि कब खोजना है और बिना टूल के कैसे गहराई से सोचना है।
परिणाम: यह क्यों मायने रखता है
शोधकर्ताओं ने इस प्रणाली का परीक्षण तीन कठिन बेंचमार्क (स्वास्थ्य, विज्ञान और सामान्य अनुसंधान) पर किया।
- दावा: HOTE के साथ प्रशिक्षित एक 8-बिलियन पैरामीटर वाला मॉडल (एक मध्यम आकार का AI) बहुत बड़े मॉडलों (32B+) और अन्य अत्याधुनिक शोध AI से अधिक स्मार्ट बन गया।
- दक्षता: इसने अन्य तरीकों की तुलना में कम समय और कम कंप्यूटिंग पावर के साथ ये परिणाम प्राप्त किए।
- स्थिरता: अन्य तरीकों के विपरीत, जो कुछ समय बाद सुधार करना बंद कर देते हैं, HOTE टीम लंबे समय तक बेहतर होती रही क्योंकि "क्विज़ मास्टर" लगातार नई, चुनौतीपूर्ण समस्याएं ढूंढता रहा जिन्हें "जासूस" ने अभी तक हल नहीं किया था।
एक वाक्य में सारांश
HOTE एक स्व-सुधार करने वाला AI सिस्टम है जहाँ एक रिसर्चर, एक क्रिटिक, और एक क्विज़ मास्टर एक-दूसरे के साथ निरंतर "शतरंज" का खेल खेलते हैं, जिसमें इंटरनेट सर्चिंग और शुद्ध सोच का मिश्रण उपयोग किया जाता है ताकि एक मध्यम आकार के AI को किसी भी अन्य तरीके की तुलना में तेज़ और बेहतर तरीके से विश्व-स्तरीय डीप रिसर्चर बनाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।