HiFo-Prompt: Prompting with Hindsight and Foresight for LLM-based Automatic Heuristic Design
HiFo-Prompt, LLM-आधारित स्वचालित ह्यूरिस्टिक डिज़ाइन के लिए एक नवीन ढांचा है जो खोज गतिकी (search dynamics) को अनुकूल रूप से प्रबंधित करने के लिए "Foresight" प्रॉम्प्ट्स और सफल पिछले अनुभवों को पुन: प्रयोज्य डिज़ाइन सिद्धांतों में निकालने के लिए "Hindsight" प्रॉम्प्ट्स का उपयोग करके विकासवादी गणना (evolutionary computation) को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को शतरंज या कोई जटिल बोर्ड गेम जैसा कोई जटिल रणनीति वाला खेल खेलना सिखाने की कोशिश कर रहे हैं।
वर्तमान में, अधिकांश लोग इसे दो तरीकों में से एक से करने की कोशिश करते हैं: या तो वे रोबोट के लिए एक विशाल, कठोर नियम पुस्तिका (rulebook) लिखते हैं (जिसे पूरी तरह से करना कठिन है), या वे रोबोट को लाखों बार खेलने देते हैं और गणित का उपयोग करके उसके मस्तिष्क को "फाइन-ट्यून" करने की कोशिश करते हैं (जिसमें बहुत अधिक बिजली और समय लगता है)।
यह पेपर रोबोट को सिखाने का एक नया तरीका पेश करता है जिसे HiFo-Prompt कहा जाता है। केवल उसे नियम देने या गणित के साथ ज़बरदस्ती करने के बजाय, वे रोबोट को एक "याददाश्त और दिशा-सूचक यंत्र (Compass) वाला मस्तिष्क" देते हैं।
यह कैसे काम करता है, इसके लिए यहाँ दो सरल रूपक (metaphors) दिए गए हैं:
1. हिंडसाइट मॉड्यूल (Hindsight Module): "ज्ञान की डायरी"
कल्पना कीजिए कि रोबोट एक खेल खेल रहा है और बीच में ही उसे एक शानदार चाल मिल जाती है—जैसे कि कोई "गुप्त ट्रिक" जो उसे तेज़ी से जीतने में मदद करती है। अधिकांश प्रणालियों में, एक बार खेल समाप्त होने के बाद, रोबोट उस विशिष्ट ट्रिक को भूल जाता है; वह केवल यह याद रखता है कि वह जीता या हारा।
HiFo-Prompt अलग है। इसमें एक ज्ञान की डायरी (Insight Pool) है। हर बार जब रोबोट को कोई सफल रणनीति मिलती है, तो सिस्टम रुकता है और पूछता है, "उस जीत के पीछे का वास्तविक तर्क क्या था?" फिर यह एक उच्च-स्तरीय सिद्धांत लिख देता है, जैसे: "जब बोर्ड भरा हुआ हो, तो अपने मोहरों को किनारों की ओर ले जाने को प्राथमिकता दें।"
अगली बार जब रोबrobot एक नया खेल शुरू करता है, तो वह शून्य से शुरुआत नहीं करता। वह अपनी डायरी पढ़ता है और कहता है, "आहा! मुझे किनारों के बारे में एक अच्छी टिप याद है," और उस ज्ञान का उपयोग अपनी अगली चाल को निर्देशित करने के लिए करता है। यह केवल व्यक्तिगत चालें नहीं, बल्कि अवधारणाओं (concepts) को सीखता है।
2. फोरसाइट मॉड्यूल (Foresight Module): "रणनीतिक नेविगेटर"
कल्पना कीजिए कि रोबोट एक खेल खेल रहा है और अचानक एक लूप में फंस जाता है, बार-बार वही औसत दर्जे की चालें चल रहा है। वह जीत नहीं रहा है, लेकिन हार भी नहीं रहा है—वह बस "स्थिर" (stagnant) है।
HiFo-Prompt के पास एक नेविगेटर (Foresight मॉड्यूल) है जो "बड़ी तस्वीर" को देखता है। यह केवल वर्तमान स्कोर को नहीं देखता; यह खेल के "वाइब" (vibe) को देखता है।
- यदि रोबोट निरंतर प्रगति कर रहा है: नेविगेटर कहता है, "अपने रास्ते पर बने रहो! जो तुम कर रहे हो उसे और बेहतर बनाते रहो।" (यह Exploitation है)।
- यदि रोबोट एक ही ढर्रे में फंस गया है या खुद को दोहरा रहा है: नेविगेटर चिल्लाता है, "रुको! तुम बहुत अनुमानित (predictable) होते जा रहे हो! कुछ बिल्कुल अलग और जंगली आज़माकर देखो!" (यह Exploration है)।
यह एक कोच की तरह साइडलाइन पर खड़ा रहता है, जो खिलाड़ी को बताता है कि कब सुरक्षित खेलना है और कब किसी रुकावट को तोड़ने के लिए बड़ा जोखिम उठाना है।
यह क्यों मायने रखता है? (इसका महत्व क्या है?)
शोधकर्ताओं ने इसका परीक्षण प्रसिद्ध, अविश्वसनीय रूप से कठिन गणितीय समस्याओं (जैसे "ट्रैवलिंग सेल्समैन प्रॉब्लम", जहाँ आपको कई शहरों के बीच सबसे छोटा रास्ता खोजना होता है) पर किया।
परिणाम ऐसे थे जैसे एक छात्र जो उत्तर रटता है और उस छात्र की तुलना करना जो वास्तव में विषय को समझता है:
- यह स्मार्ट है: इसने पिछले AI तरीकों की तुलना में बेहतर "मार्ग" और "शेड्यूल" खोजे।
- यह तेज़ है: इसे स्मार्ट होने के लिए लाखों गेम खेलने की आवश्यकता नहीं थी; यह बहुत तेज़ी से सीख गया क्योंकि यह अपनी "ज्ञान की डायरी" और "नेविगेटर" का उपयोग कर रहा था।
- यह कुशल है: विशेषज्ञता के उच्च स्तर तक पहुँचने के लिए यह बहुत कम "मस्तिष्क शक्ति" (कंप्यूटिंग लागत) का उपयोग करता है।
संक्षेप में: HiFo-Prompt एक AI को एक mindless खिलाड़ी से बदलकर एक विचारशील रणनीतिकार बना देता है जो अपने अतीत से सीखता है और अपने भविष्य की योजना बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।