QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models
यह शोध पत्र QSTN को प्रस्तुत करता है, जो एक नो-कोड इंटरफेस के साथ एक ओपन-सोर्स पायथन फ्रेमवर्क है जिसे बड़े पैमाने पर LLM-आधारित प्रश्नावली प्रतिक्रियाओं को व्यवस्थित रूप से उत्पन्न करने और मजबूती से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि प्रॉम्प्ट संरचना और पीढ़ी विधियाँ मानव उत्तरों के साथ संरेखण को महत्वपूर्ण रूप से प्रभावित करती हैं जबकि कंप्यूट लागत को कम करती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शोधकर्ता हैं जो यह समझने की कोशिश कर रहे हैं कि लोग राजनीति के बारे में कैसा महसूस करते हैं, या शायद आपको कंप्यूटर विज़न प्रोजेक्ट के लिए हजारों छवियों (images) को लेबल करने की आवश्यकता है। पारंपरिक रूप से, आपको सर्वेक्षण भरने या लेबलिंग करने के लिए वास्तविक मनुष्यों को काम पर रखना पड़ता। यह महंगा, धीमा और प्रबंधित करने में कठिन है।
यहाँ लार्ज लैंग्वेज मॉडल्स (LLMs) आते हैं—वे सुपर-स्मार्ट AI चैटबॉट्स। शोधकर्ताओं ने इन सर्वेक्षणों को तुरंत भरने के लिए उन्हें "नकली मनुष्यों" के रूप में उपयोग करना शुरू कर दिया। लेकिन एक समस्या है: AI अविश्वसनीय रूप से नाजुक है।
यदि आप AI से वही प्रश्न पूछते हैं लेकिन उत्तरों का क्रम "A, B, C" से बदलकर "C, B, A" कर देते हैं, तो वह पूरी तरह से अलग उत्तर दे सकता है। यदि आप इसे एक साथ पूछते हैं बनाम एक-एक करके, तो यह अलग तरह से व्यवहार करता है। यह एक कमरे का तापमान मापने के लिए थर्मामीटर का उपयोग करने जैसा है जो हर बार अपना मन बदल लेता है जब आप उसे तीन इंच बाईं ओर खिसकाते हैं।
यहीं QSTN (उच्चारण: "क्वेश्चन") काम आता है। QSTN को एक "AI सर्वेक्षणों के लिए स्विस आर्मी नाइफ (बहुउद्देशीय उपकरण)" के रूप में समझें।
QSTN क्या है?
QSTN एक मुफ्त, ओपन-सोर्स टूलकिट (कंप्यूटर टूल्स का एक सेट) है जो शोधकर्ताओं को AI का उपयोग करके सर्वेक्षणों का उत्तर देने में मदद करता है, ताकि वे मजबूत, विश्वसनीय और सस्ते हों।
यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं (analogies) का उपयोग किया गया है:
1. सर्वेक्षण डिजाइन का "मैड लिब्स" (प्रॉम्प्ट पर्टरबेशन/Prompt Perturbation)
कल्पना कीजिए कि आप एक नया नुस्खा (recipe) टेस्ट कर रहे हैं। यदि आप इसे केवल एक बार चखते हैं, तो आप भाग्यशाली हो सकते हैं। लेकिन यदि आप इसे नमक पहले डालने के बाद, फिर नमक अंत में डालने के बाद, और फिर नमक दोगुना करने के बाद चखते हैं, तो आपको एक वास्तविक तस्वीर मिलती है कि वह नुस्खा कैसे काम करता है।
QSTN, AI के लिए यही करता है। यह स्वचालित रूप से एक ही सर्वेक्षण प्रश्न के हजारों "संस्करण" बनाता है:
- ताश के पत्तों को फेंटना (Shuffling the deck): यह प्रश्नों का क्रम बेतरतीब ढंग से बदल देता है ताकि AI केवल पिछले प्रश्न के आधार पर अनुमान न लगाए।
- लेबल बदलना: यह "A, B, C" को "1, 2, 3" या यहाँ तक कि "लाल, हरा, नीला" में बदल देता है ताकि यह देखा जा सके कि क्या AI "A" अक्षर के प्रति पक्षपाती है।
- टाइपिंग की गलतियाँ जोड़ना: यह जानबूझकर छोटी वर्तनी की गलतियाँ (spelling mistakes) डालता है ताकि यह देखा जा सके कि क्या AI भ्रमित हो जाता है या स्मार्ट बना रहता है।
इन सभी "मोड़ों और घुमावों" के माध्यम से सर्वेक्षण चलाकर, QSTN आपको बताता है: "क्या यह AI वास्तव में स्मार्ट है, या यह केवल इसलिए अनुमान लगा रहा है क्योंकि आपने प्रश्न पूछने का तरीका बदल दिया है?"
2. "ग्रुप चैट" बनाम "वन-ऑन-वन" (क्वेश्चनेयर प्रेजेंटेशन/Questionnaire Presentation)
आप AI से प्रश्न कैसे पूछते हैं?
- "वन-ऑन-वन" (सिंगल-आइटम): आप प्रश्न 1 पूछते हैं, उत्तर प्राप्त करते हैं, एक बिल्कुल नई बातचीत शुरू करते हैं, और प्रश्न 2 पूछते हैं। AI को पहले प्रश्न की कोई याद नहीं रहती।
- "ग्रुप चैट" (बैटरी): आप एक ही बड़े संदेश में सभी 10 प्रश्न पूछते हैं, और AI एक साथ उन सभी के उत्तर देता है, जिससे उसे पिछले संदर्भ की याद रहती है।
QSTN ने 4 करोड़ (40 मिलियन) से अधिक नकली सर्वेक्षण प्रतिक्रियाओं पर इसका परीक्षण किया। उन्होंने एक आश्चर्यजनक परिणाम पाया: सभी प्रश्न एक साथ पूछना ( "ग्रुप चैट") अक्सर AI को वास्तविक मानव की तरह व्यवहार करने में मदद करता है और कंप्यूटर समय व पैसे की भारी बचत करता है। यह अपने दोस्त को एक बार में 10 किराने के सामानों की सूची लिखने के लिए कहने जैसा है, बजाय इसके कि आप उन्हें एक-एक वस्तु के लिए 10 अलग-अलग बार कॉल करें।
3. "मैजिक डिकोडर रिंग" (रिस्पॉन्स जनरेशन/Response Generation)
कभी-कभी आप बस चाहते हैं कि AI "हाँ" या "नहीं" कहे। लेकिन AI बहुत अधिक बोलने लगता है। QSTN आपको अलग-अलग "मोड" देता है ताकि AI को सटीक होने के लिए मजबूर किया जा सके:
- "सख्त बॉस" मोड (The Strict Boss Mode): यह AI को केवल अनुमत विकल्पों में से चुनने के लिए मजबूर करता है (जैसे कि मल्टीपल-चॉइस बबल शीट)।
- "कॉन्फिडेंस मीटर" मोड (The Confidence Meter Mode): केवल एक उत्तर चुनने के बजाय, AI प्रत्येक उत्तर की संभावना (probability) बताता है (जैसे, "मुझे 80% यकीन है कि यह A है, 10% B, 10% C")। यह अविश्वसनीय रूप से सटीक साबित होता है और वास्तविक मानव डेटा के साथ बेहतर तालमेल बिठाता है।
आपको इसकी परवाह क्यों करनी चाहिए?
Q-STN से पहले, AI का उपयोग सर्वेक्षणों के लिए करना बिना स्टीयरिंग व्हील वाली कार चलाने जैसा था—आप तेज़ तो जा सकते थे, लेकिन आप नियंत्रण नहीं कर सकते थे कि आप कहाँ जा रहे हैं।
- शोधकर्ताओं के लिए: यह उनके काम को पुनरुत्पादनीय (reproducible) बनाता है। यदि वे कहते हैं, "हमारा AI सोचता है कि लोग X पसंद करते हैं," तो QSTN यह सिद्ध करता है कि उन्होंने यह जांचा है कि क्या AI केवल प्रश्न के प्रारूप के कारण पक्षपाती था।
- बाकी सभी के लिए: इसका अर्थ है कि AI सिमुलेशन से हमें जो डेटा मिलता है वह अधिक भरोसेमंद है। चाहे वह चुनाव परिणामों की भविष्यवाणी करना हो या मानव मनोविज्ञान को समझना, Q-STN यह सुनिश्चित करने में मदद करता है कि AI केवल जवाबों के बारे में कल्पना (hallucinate) न कर रहा हो।
सबसे अच्छी बात?
आपको इसे उपयोग करने के लिए कोडिंग का जादूगर होने की आवश्यकता नहीं है। इसके निर्माता ने एक विजुअल इंटरफेस (जैसे कि एक वेबसाइट फॉर्म) बनाया है जहाँ आप अपना सर्वेक्षण अपलोड कर सकते हैं, कुछ बटन दबाकर चीजों को "हिलाना-डुलाना" (perturbations जोड़ना) कर सकते हैं, और "Run" दबा सकते हैं। यह आपके ब्राउज़र में एक पेशेवर सर्वेक्षण लैब रखने जैसा है, बिना एक भी लाइन कोड लिखे।
संक्षेप में: QSTN उस टूल के रूप में काम करता है जो AI को एक ऐसे "डिवा" (diva) बनने से रोकता है जो इस आधार पर अपना मन बदल लेता है कि आपने उससे कैसे पूछा, और इसे एक विश्वसनीय, सुसंगत अनुसंधान सहायक में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।