Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses
हार्नेस-1 (Harness-1) एक 20B सुदृढीकरण लर्निंग-आधारित (reinforcement learning-based) खोज एजेंट है जो मौजूदा ओपन और फ्रंटियर मॉडलों की तुलना में बेहतर रिट्रीवल प्रदर्शन और विविध बेंचमार्क में मजबूत सामान्यीकरण प्राप्त करने के लिए, अर्थपूर्ण निर्णय लेने की क्षमता को बरकरार रखते हुए नियमित स्टेट मैनेजमेंट को एक बाहरी स्टेटफुल हार्नेस पर ऑफलोड करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बड़ी, जटिल गुत्थी सुलझाने की कोशिश कर रहे हैं। आपके पास एक प्रतिभाशाली जासूस है (AI मॉडल), लेकिन उसकी एक बहुत बुरी आदत है: वह जो कुछ भी पढ़ता है उसे भूल जाता है, बहुत अधिक कागजी कार्रवाई से भ्रमित हो जाता है, और अक्सर बार-बार एक ही सुराग को पढ़ने में समय बर्बाद करता है।
एक शोध पत्र Harness-1 नामक एक नई प्रणाली पेश करता है जो इस समस्या को हल करती है, यह जासूस को एक अति-व्यवस्थित सहायक (the "Harness") देकर।
यह कैसे काम करता है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करते हुए यहाँ दिया गया है:
1. समस्या: "प्रतिभाशाली लेकिन भुलक्कड़" जासूस
आमतौर पर, जब कोई AI उत्तर खोजने की कोशिश करता है, तो वह एक ऐसे जासूस की तरह कार्य करता है जिसे सब कुछ अपने दिमाग में याद रखना पड़ता है। उसे याद रखना होता है:
- उन्होंने कौन से दस्तावेज़ पहले ही पढ़ लिए हैं।
- कौन से उपयोगी थे और कौन से बेकार।
- उन्हें अभी और कौन से तथ्य खोजने बाकी हैं।
- उनके पास कितना समय बचा है।
शोध पत्र का तर्क है कि AI को यह सारा "बहीखाता" (दस्तावेजों को व्यवस्थित करना) करने के लिए मजबूर करना उसकी मानसिक शक्ति की बर्बादी है। यह एक प्रतिभाशाली गणितज्ञ से भी फाइल क्लर्क के रूप में कार्य करने के लिए कहने जैसा है। वे थक जाते हैं, गलतियाँ करते हैं, और प्रभावी ढंग से खोजना बंद कर देते हैं।
2. समाधान: "स्टेटफुल हार्नेस" (द सुपर असिस्टेंट)
Harness-1 दो अलग-अलग भूमिकाओं में काम को विभाजित करता है:
- द पॉलिसी (जासूस): यह AI मॉडल (एक 20-बिलियन पैरामीटर वाला मॉडल) है। इसका एकमात्र काम स्मार्ट निर्णय लेना है: "मुझे आगे क्या खोजना चाहिए?" "क्या यह दस्तावेज़ महत्वपूर्ण है?" "क्या मेरे पास पर्याप्त सबूत हैं कि मैं रुक जाऊं?"
- द हार्नेस (सहायक): यह एक विशेष सॉफ्टवेयर प्रोग्राम है जो AI के चारों ओर चलता है। यह सारा उबाऊ, यांत्रिक काम करता है। यह पाए गए प्रत्येक दस्तावेज़ की एक सटीक सूची रखता है, उन्हें महत्व के स्तरों (जैसे कि "बहुत उच्च" या "निम्न") के साथ टैग करता है, विभिन्न दस्तावेजों के बीच संबंध जोड़ता है, और यह याद रखता है कि क्या सत्यापित किया जा चुका है।
उपमा: AI को एक शेफ (रसोइया) और हार्नेस को एक सू-शेफ (सहायक रसोइया) के रूप में सोचें।
- शेफ (AI) निर्णय लेता है: "मुझे प्याज काटने और सॉस चेक करने की जरूरत है।"
- सू-शेफ (Harness) वास्तव में करता है: "यहाँ कटे हुए प्याज का कटोरा है, मैंने पहले ही अच्छे टमाटरों को खराब टमाटरों से अलग कर दिया है, और मैंने लिख दिया है कि हमारे पास नमक खत्म हो गया है।"
- शेफ को इस बात की चिंता करने की ज़रूरत नहीं है कि प्याज कहाँ हैं या बिन में कितने टमाटर हैं; उन्हें बस खाना पकाने पर ध्यान केंद्रित करना है।
3. वे मिलकर कैसे सीखते हैं (रीइन्फोर्समेंट लर्निंग)
टीम ने इस सिस्टम को रीइन्फोर्समेंट लर्निंग नामक पद्धति का उपयोग करके प्रशिक्षित किया।
- प्रशिक्षण: उन्होंने AI को हजारों बार "जासूस" का खेल खेलने दिया। हर बार जब AI ने एक अच्छा कदम उठाया (सही सुराग ढूँढा, फाइलों को अच्छी तरह व्यवस्थित किया), तो उसे एक इनाम मिला।
- ट्विस्ट: क्योंकि हार्नेस ने जटिल विवरणों को संभाल लिया था, इसलिए AI ने बहुत तेज़ी से सीखा। उसे यह याद रखने में ऊर्जा बर्बाद नहीं करनी पड़ी कि उसने एक फाइल कहाँ रखी थी; उसे बस यह सीखना था कि कौन सी फाइलें महत्वपूर्ण थीं।
- परिणाम: AI एक मास्टर रणनीतिकार बनने के लिए सीख गया। इसने व्यापक रूप से खोजना, फिर संकुचित करना, तथ्यों को सत्यापित करना और उत्तर मिलने पर ठीक समय पर रुकना सीख लिया।
4. सहायक की "जादुई" विशेषताएं
हार्नेस केवल एक नोटबुक नहीं है; इसके पास ऐसे उपकरण हैं जो जासूस को स्मार्ट बनाते हैं:
- "एविडेंस ग्राफ" (साक्ष्य ग्राफ): कल्पना कीजिए कि सुरागों को जोड़ने वाली लाल डोरी वाला एक जासूस का कॉर्कबोर्ड। हार्नेस स्वचालित रूप से ये डोरियाँ खींचता है। यदि दस्तावेज़ A "ब्रसेल्स" का उल्लेख करता है और दस्तावेज़ B "ब्रसेल्स" का उल्लेख करता है, तो हार्नेस उन्हें जोड़ देता है। इससे AI को हर एक शब्द को दोबारा पढ़े बिना बड़ी तस्वीर देखने में मदद मिलती है।
- ऑटो-सीडिंग: जब खोज शुरू होती है, तो हार्नेस जासूस को खाली मेज के सामने अकेला नहीं छोड़ता है। यह तुरंत सबसे संभावित 8 दस्तावेज़ों को एक "शुरुआती बिंदु" के रूप में मेज पर रख देता है। यह AI को शुरुआत में फंसने से रोकता है।
- कंप्रेशन (संक्षेपण): यदि कोई खोज 50 पन्नों की रिपोर्ट देती है, तो हार्नेस उसे AI को दिखाने से पहले 4 सबसे महत्वपूर्ण वाक्यों में संक्षिप्त कर देता है। यह AI की "वर्किंग मेमोरी" को जाम होने से बचाता है।
5. परिणाम: छोटा मॉडल, बड़ी जीत
शोध पत्र ने आठ अलग-अलग कठिन खोज चुनौतियों (जैसे वित्तीय डेटा, पेटेंट जानकारी और बहु-चरणीय सामान्य ज्ञान खोजना) पर Harness-1 का परीक्षण किया।
- आश्चर्य: एक अपेक्षाकृत छोटा AI मॉडल (20 बिलियन पैरामीटर) जो इस हार्नेस का उपयोग करता है, उसने बहुत बड़े, महंगे "फ्रंटियर" मॉडलों (कुछ 120+ बिलियन पैरामीटर वाले) से बेहतर प्रदर्शन किया, जिनके पास यह विशेष सहायक नहीं था।
- सामान्यीकरण (Generalization): भले ही AI का परीक्षण उन विषयों पर किया गया जिन्हें उसने प्रशिक्षण के दौरान कभी नहीं देखा था (जैसे वित्त के सवालों से इतिहास के सवालों पर जाना), फिर भी इसने अविश्वसनीय रूप से अच्छा प्रदर्शन किया। यह साबित करता है कि AI ने खोज करने का कौशल सीखा, न कि केवल उत्तर रटे।
सारांश
Harness-1 AI सर्च एजेंट बनाने का एक नया तरीका है। AI से सब कुछ करने (सोचने, खोजने और व्यवस्थित करने) के लिए कहने के बजाय, यह उसे संगठन संभालने के लिए एक शक्तिशाली, स्टेटफुल सहायक देता है। यह एक छोटे, सस्ते AI को बड़ी, महंगी मशीनों से बेहतर प्रदर्शन करने की अनुमति देता है, जिससे वह गलत विवरणों को याद रखने के बजाय सही निर्णय लेने पर अपना मस्तिष्क केंद्रित कर पाता है।
शोध पत्र का दावा है: वातावरण (Harness) को "बहीखाता" संभालने की जिम्मेदारी देकर, AI अधिक प्रभावी ढंग से खोजना सीखता है, नए विषयों पर बेहतर तरीके से काम करता है, और वर्तमान अत्याधुनिक तरीकों की तुलना में उच्च सटीकता प्राप्त करता है, वह भी एक छोटे मॉडल का उपयोग करते हुए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।