IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs
यह शोध पत्र IDEAFix प्रस्तुत करता है, जो एक नियंत्रित मूल्यांकन ढांचा है जिसका उपयोग यह विश्लेषण करने के लिए किया जाता है कि कार्य प्रविष्टि (task formulation) और डिफ़िक्सेशन प्रॉम्प्टिंग (defixation prompting) रणनीतियाँ LLMs की अपसारी सोच (divergent thinking) को कैसे प्रभावित करती हैं, जो यह प्रकट करता है कि जहाँ संरचित मार्गदर्शन समाधानों की मौलिकता को बढ़ा सकता है, वहीं अंतर्निहित आउटपुट समरूपीकरण (output homogenization) एक निरंतर सीमा बनी हुई है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास बहुत बुद्धिमान, बहुत विद्वान रोबोटों (लार्ज लैंग्वेज मॉडल्स, या LLMs) की एक टीम है और आप उनसे किसी प्रोजेक्ट के लिए नए विचार सोचने को कहते हैं। आप उम्मीद कर सकते हैं कि वे प्रतिभाशाली आविष्कारकों के एक कमरे की तरह होंगे, जिनमें से प्रत्येक अजीब और अनूठे विचार चिल्ला रहा हो। लेकिन अक्सर, ये रोबोट बिल्कुल एक जैसे सुनाई देते हैं, वही सुरक्षित, उबाऊ उत्तर दोहराते हैं। इसे "फिक्सेशन" (fixation) कहा जाता है—वे एक ढर्रे में फंस जाते हैं।
IDEAFix पेपर एक नए, सुपर-संगठित विज्ञान प्रयोगशाला की तरह है जिसे ठीक यह परीक्षण करने के लिए डिज़ाइन किया गया है कि ये रोबole कितनी अच्छी तरह 'आउट ऑफ द बॉक्स' (लीक से हटकर) सोच सकते हैं, और हम उन्हें उनके ढर्रे से कैसे बाहर निकाल सकते हैं।
यहाँ इसका एक सरल विवरण दिया गया है कि उन्होंने क्या किया और उन्हें क्या मिला:
1. समस्या: "हाइव माइंड" (Hive Mind) प्रभाव
इन AI मॉडलों को उन छात्रों के रूप में सोचें जिन्होंने लाइब्रेरी की हर किताब पढ़ी है। जब आप उनसे कोई सवाल पूछते हैं, तो वे कुछ नया "आविष्कृत" नहीं करते; वे जो कुछ भी उन्होंने पहले पढ़ा है, उसे ही फिर से व्यवस्थित (remix) करते हैं।
- समस्या: यदि आप 10 अलग-अलग AI मॉडलों से "एक नई कुर्सी डिजाइन करने" के लिए कहते हैं, तो वे सभी एक ही लकड़ी की कुर्सी के थोड़े अलग संस्करण ही सामने ला सकते हैं। वे एक "हाइव माइंड" में फंसे हुए हैं, जो समरूप (एक जैसे) आउटपुट दे रहे हैं।
- लक्ष्य: शोधकर्ता यह देखना चाहते थे कि क्या वे इन रोबोटों को इस पैटर्न को तोड़ने और वास्तव में मौलिक विचार देने के लिए मजबूर कर सकते हैं।
2. समाधान: IDEAFix लैब
लेखकों ने IDEAFix नामक एक परीक्षण ढांचा बनाया। इसे एक विशाल "आइडिया ऑब्स्टेकल कोर्स" (विचारों की बाधा दौड़) के रूप में समझें जिसमें तीन मुख्य स्टेशन हैं:
- स्टेशन 1: परिदृश्य (The Scenarios/Briefs)
उन्होंने 81 अलग-अलग डिजाइन चुनौतियां बनाईं। कुछ सामान्य थीं (जैसे "एक नया जूता डिजाइन करें"), और कुछ अजीब या पेचीदा थीं (जैसे "एक कैटरपिलर को प्रशिक्षित करने का तरीका डिजाइन करें")। यह देखने के लिए था कि क्या कार्य का प्रकार रोबोट के व्यवहार को बदलता है। - स्टेशन 2: "मसाला" (Attributes/विशेषताएं)
उन्होंने निर्देशों में "फ्लेवर" जोड़ा। ठीक वैसे ही जैसे किसी व्यंजन में हॉट सॉस या चीनी डाली जाती है, उन्होंने विशेषणों को बदल दिया।- पारंपरिक: "एक सुरक्षित जूता डिजाइन करें।"
- आश्चर्यजनक: "एक खतरनाक जूटा डिजाइन करें।"
- नकारात्मक: "एक बहुत बुरा जूता डिजाइन करें।"
वे यह देखना चाहते थे कि क्या कार्य को अजीब या नकारात्मक बनाने से रोबोट को अलग तरह से सोचने के लिए मजबूर किया जा सकता है।
- स्टेशन 3: संकेत (The Hints/प्रॉम्प्ट्स)
यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने मानव रचनात्मकता विधियों पर आधारित अलग-अलग "चीट शीट्स" दीं।- कुछ संकेत जटिल थे, जैसे डिज़ाइन थिंकिंग (Design Thinking) या TRIZ (जो इंजीनियरों द्वारा उपयोग की जाने वाली विधियाँ हैं)।
- कुछ संकेत सरल थे, जैसे "जंगली बनो" (Be wild), "अजीब बनो" (Be absurd), या "रोबोट की तरह मत सोचो।"
उन्होंने "AI-विशिष्ट" संकेत भी आजमाए जो रोबोट को सक्रिय रूप से अपने सामान्य श्रेणियों से बचने के लिए कहते थे।
3. प्रयोग
उन्होंने पांच अलग-अलग प्रसिद्ध AI मॉडलों (जैसे GPT-4, Llama, और Grok) पर यह प्रयोग चलाया। उन्होंने प्रत्येक मॉडल को प्रत्येक Scenario + Spice + Hint के संयोजन के लिए समाधानों की सूचियाँ बनाने के लिए कहा। कुल मिलाकर, उन्होंने 14,000 से अधिक प्रॉम्प्ट्स उत्पन्न किए।
फिर उन्होंने गणित का उपयोग करके मापा:
- Fluency (प्रवाह): उन्होंने कितने विचार दिए?
- Diversity (विविधता): विचार एक-दूसरे से कितने अलग थे?
- Novelty (नवीनता): विचार कितने नए और आश्चर्यजनक थे, जो रोबोट के सामान्य जवाबों की तुलना में?
4. परिणाम: क्या काम आया और क्या नहीं?
अच्छी खबर:
- सरल संकेत जीतते हैं: आश्चर्यजनक रूप से, जटिल, फैंसी मानव विधियाँ (जैसे विस्तृत डिज़ाइन थिंकिंग चरण) बहुत अच्छी तरह से काम नहीं करतीं। रोबोट जटिल निर्देशों को समझने में सक्षम नहीं लग रहे थे।
- "वाइल्ड" बटन काम करता है: वे प्रॉम्प्ट्स जिनमें केवल रोबोट को "लीक से हटकर सोचने," "जंगली होने," या "गैर-पारंपरिक होने" के लिए कहा गया था, सबसे अच्छा काम करते थे। यह एक कुत्ते को "दौड़ना कैसे है" पर जटिल भौतिकी का लेक्चर देने के बजाय बस "कुत्ता बनो" कहने जैसा है।
- नकारात्मकता अच्छी है: रोबोट को कुछ "बुरा" या "नकारात्मक" डिजाइन करने के लिए कहने से वास्तव में वे अधिक अनूठे विचार देने लगे। ऐसा लगता है कि "विनम्र" नियमों को तोड़ने से रोबोट को नए स्थानों पर देखने के लिए मजबूर किया जाता है।
बुरी खबर:
- हाइव माइंड बना रहता है: बेहतरीन संकेतों के बावजूद, रोबोट पूरी तरह से मुक्त होने में संघर्ष करते रहे। यदि आप पांच अलग-अलग रोबोटों को एक ही समस्या को हल करने के लिए कहते हैं, तो वे अभी भी बहुत समान समाधान देने की प्रवृत्ति रखते हैं। वे एक साझा "सिमेंटिक स्पेस" (मानसिक पड़ोस) में फंसे हुए हैं जिससे बाहर निकलना कठिन है।
- कार्य मायने रखता है: कार्य के प्रकार ने परिणामों को बदल दिया। "उत्पाद" (Product) के लिए पूछने पर रोबोट अधिक रचनात्मक थे लेकिन कम संख्या में विचार दिए। एक "प्रक्रिया" (Procedure) के लिए पूछने पर उन्होंने अधिक विचार उत्पन्न किए, लेकिन वे सभी एक-दूसरे के बहुत समान थे।
5. मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हालांकि हम सही "मसाले" (नकारात्मक शब्द) और सरल "हैक" (जंगली होने के लिए कहना) का उपयोग करके इन AI रोबोटों को थोड़ा रचनात्मक होने के लिए प्रेरित कर सकते हैं, लेकिन वे मौलिक रूप से सीमित हैं। वे जो कुछ भी पहले से जानते हैं उसे रीमिक्स करने में उत्कृष्ट हैं, लेकिन वे वास्तव में परिवर्तनकारी विचार बनाने के लिए संघर्ष करते हैं जो उनके प्रशिक्षण डेटा से परे हों।
IDEAFix केवल एक परीक्षण नहीं है; यह एक टूलकिट है। यह शोधकर्ताओं को इन रोबोटों का परीक्षण करने के लिए एक नियंत्रित तरीका देता है, जिससे यह सुनिश्चित होता है कि हम समझते हैं कि उनकी रचनात्मकता कहाँ समाप्त होती है और उनका "फिक्सेशन" कहाँ शुरू होता है। यह एक याद दिलाता है कि जबकि AI विचारों को उत्पन्न करने के लिए एक शक्तिशाली उपकरण है, इसे वास्तव में लीक से हटकर सोचने के लिए मानवीय मार्गदर्शन की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।