Bootstrapping Cognitive Agents with a Large Language Model
यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करता है जो बड़े भाषा मॉडलों (LLMs) के शोरयुक्त सामान्य ज्ञान का उपयोग करके व्याख्यात्मक संज्ञानात्मक आर्किटेक्चर को बूटस्ट्रैप करता है, और यह प्रदर्शित करता है कि एम्बोडीड किचन कार्यों के माध्यम से यह हाइब्रिड दृष्टिकोण केवल LLMs पर निर्भर रहने की तुलना में अधिक दक्षता प्राप्त करता है और साथ ही डोमेन-विशिष्ट ज्ञान सत्यापन और अपडेट को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को रसोई में खाना बनाना सिखाने की कोशिश कर रहे हैं। आपके पास उसे मदद करने के लिए दो बहुत अलग उपकरण हैं:
"सुपर-रीडर" (लार्ज लैंग्वेज मॉडल): यह एक ऐसे रोबोट की तरह है जिसने इंटरनेट पर मौजूद हर किताब, वेबसाइट और रेसिपी पढ़ ली है। वह जानता है कि "टमाटर आमतौर पर फ्रिज में रहते हैं" और "सेब काटने के लिए आपको चाकू की आवश्यकता होती है।" हालांकि, यह थोड़ा बिखरा हुआ है। यह कभी-कभी चीजें मनगढ़ंत बना लेता है (हैलुसिनेशन), विशिष्ट विवरणों में भ्रमित हो जाता है, और हर बार अपना हाथ हिलाने के लिए सलाह मांगना बहुत महंगा पड़ता है।
"सख्त लाइब्रेरियन" (कॉग्निटिव आर्किटेक्चर): यह एक बहुत ही व्यवस्थित, चरण-दर-चरण नियम पुस्तिका वाले रोबोट की तरह है। यह अविश्वसनीय रूप से विश्वसनीय और समझने में आसान है। यदि आप इसे कहते हैं "नियम 1: यदि फ्रिज खुला है, तो अंदर देखें," तो यह बिल्कुल वही करेगा। लेकिन, इसकी शुरुआत एक खाली किताब से होती है। आपको हर स्थिति के लिए हर एक नियम खुद लिखना होगा, जिसमें बहुत अधिक मानवीय प्रयास लगता है।
पेपर का बड़ा विचार:
लेखकों, फियू (गैविन) झू और रीड सिमंस (कार्नेगी मेलन यूनिवर्सिटी) ने इन दोनों को मिलाने का निर्णय लिया। उन्होंने एक ऐसा सिस्टम बनाया जहाँ सुपर-रीडर सख्त लाइब्रेरियन के लिए शुरुआती नियम लिखता है, और फिर लाइब्रेरियन कमान संभाल लेता है।
इसे इस तरह सोचें:
- बूटस्ट्रैपिंग चरण: आप सुपर-रीडर से पूछते हैं, "मैं अंडा कैसे ढूँढूँ?" सुपर-रीडर कहता है, "खैर, अंडे आमतौर पर फ्रिज या कैबिनेट में होते हैं।" फिर रोबोट इसे रसोई में आजमाता है। यदि यह काम करता है, तो रोबट इसे अपनी स्थायी, सख्त नियम पुस्तिका में लिख देता है: "यदि मुझे अंडे की आवश्यकता है, तो पहले फ्रिज देखें।"
- सीखने का चरण: रोबोट यह करता रहता है। वह टमाटर काटने की कोशिश करता है। यदि वह फंस जाता है, तो वह संकेत के लिए सुपर-रीडर से मदद मांगता है। सुपर-रीडर एक रणनीति सुझाता है, और रोबोट उस रणनीति को एक स्थायी नियम में बदल देता है।
- परिणाम: अंततः, रोबोट के पास अपनी एक पूरी नियम पुस्तिका होती है। उसे अब मदद के लिए महंगे सुपर-रीडर को बुलाने की आवश्यकता नहीं है। वह बस अपने स्वयं के नियमों का पालन करता है।
यह केवल सुपर-रीडर का उपयोग करने से बेहतर क्यों है?
पेपर का परीक्षण एक सिम्युलेटेड किचन में किया गया जिसमें "टमाटर ढूंढना," "सेब काटना," और "काउंटर साफ करना" जैसे कार्य शामिल थे।
- लागत और गति: हर एक हरकत के लिए (जैसे "बाएं मुड़ें," "चाकू पकड़ें," "काटें") सुपर-रीडर से पूछना एक घर बनाने के हर कदम के लिए सलाहकार को बुलाने जैसा है। यह धीमा है और इसमें बहुत पैसा (कंप्यूटिंग पावर) खर्च होता है। नया सिस्टम नियमों को सीखने के लिए केवल कुछ ही बार सलाहकार को बुलाता है, और फिर खुद घर बनाता है। पेपर ने पाया कि इस पद्धति ने केवल AI से हर क्रिया पूछने की तुलना में काफी कम "टोकन" (AI कंप्यूटिंग की मुद्रा) का उपयोग किया।
- विश्वसनीयता: सुपर-रीडर कभी-कभी अजीब व्यवहार कर सकता है। वह सोच सकता है कि मग एक कप है और मग को ढूंढना बंद कर सकता है। हालांकि, सख्त लाइब्रेरियन अपने सत्यापित नियमों का पालन करता है। यदि नियम कहता है "सिंक देखें," तो वह सिंक देखता है, भले ही सुपर-रीडर ने कभी गलत अनुमान लगाया हो।
- सामान्यीकरण (Generalization): एक बार जब रोबोट यह नियम सीख जाता है कि "यदि मुझे कुछ ढूंढना है, तो देखें कि वह आमतौर पर कहाँ रखा जाता है," तो वह बिना दोबारा सिखाए किसी भी वस्तु (अंडे, चाकू, कप) के लिए इसे लागू कर सकता है।
यह गलतियों को कैसे संभालता है:
इसमें एक "क्रिटिक" (आलोचक) बना हुआ है। यदि रोबोट एक नियम आजमाता है और एक लूप में फंस जाता है (जैसे किसी वस्तु को उठाने और उसे उसी जगह वापस रखने में फंस जाना), तो उसे एहसास होता है कि कुछ गलत है। वह नियम को ठीक करने के लिए सुपर-रीडर से पूछता है, जिससे नियम अधिक विशिष्ट हो जाता है (जैसे, "वस्तु को तभी उठाएं जब वह पहले से लक्षित स्थान पर न हो")।
मुख्य बात:
यह पेपर दिखाता है कि आपको एक स्मार्ट-लेकिन-शोर करने वाले AI और एक डंब-लेकिन-विश्वसनीय रोबोट के बीच चयन करने की आवश्यकता नहीं है। एक विश्वसनीय रोबोट के लिए शुरुआती निर्देश पुस्तिका लिखने के लिए स्मार्ट AI का उपयोग करके, आपको एक ऐसा सिस्टम मिलता है जो स्मार्ट, सस्ता और समझने में आसान है। रोबोट AI के "शोर वाले" ज्ञान से सीखता है लेकिन अपने तार्किक मस्तिष्क के माध्यम से इसे एक साफ, कुशल निर्देशों के सेट में फिल्टर करता है ताकि रसोई के कार्यों को कुशलतापूर्वक किया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।