← नवीनतम पेपर
💬 NLP

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

यह अध्ययन प्रदर्शित करता है कि रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम रिट्रीव किए गए स्रोतों से वैचारिक पूर्वाग्रहों को LLM आउटपुट में प्रसारित और प्रवर्धित कर सकते हैं, जिसमें इस स्थानांतरण की शक्ति सैंपलिंग टेम्परेचर द्वारा महत्वपूर्ण रूप से नियंत्रित होती है, जो मध्यम स्तरों पर चरम पर होती है जहाँ स्टोकेस्टिसिटी और ग्राउंडिंग के बीच संतुलन बना रहता है।

मूल लेखक: Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास "LLM" नाम का एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है जो लगभग सब कुछ जानता है लेकिन कठिन विषयों पर पूछे जाने पर कभी-कभी अजीबोगरीब कहानियाँ बना देता है। इसे झूठ बोलने से रोकने के लिए, हमने लाइब्रेरियन को असली किताबों और लेखों से भरा एक विशेष "RAG" बैकपैक दिया। विचार सरल था: "केवल बैकपैक में मौजूद चीज़ों का ही उत्तर दें!" लेकिन यहाँ एक मोड़ है: क्या होगा अगर बैकपैक खुद उन किताबों से भरा हो जो एक ही विषय पर बहुत अलग, पक्षपाती तरीकों से बहस करती हैं?

इस अध्ययन ने एक मजेदार लेकिन गंभीर सवाल पूछा: यदि हम लाइब्रेरियन को पक्षपाती किताबों से भरा एक बैकपैक देते हैं, तो उस पक्षपात का कितना हिस्सा रोबोट के उत्तरों में लीक होता है, और क्या रोबोट का "मूड" (जिसे टेम्परेचर कहा जाता है) इस बात को बदलता है कि वह उस पक्षपात की कितनी नकल करता है?

प्रयोग: दो दुनियाओं का एक पुस्तकालय

शोधकर्ताओं ने 2020 से 2022 के बीच COVID-19 उपचारों के बारे में 1,117 लेखों का उपयोग करके एक विशेष बैकपैक बनाया। उन्होंने इन्हें दो समूहों में विभाजित किया:

  1. "एंडोर्स्ड" (समर्थित) समूह: 991 लेख जिन्होंने आधिकारिक स्वास्थ्य नियमों और विज्ञान मानकों का पालन किया।
  2. "कॉन्ट्रोवर्शियल" (विवादास्पद) समूह: 116 लेख जो उन उपचारों को बढ़ावा दे रहे थे जिन्हें आधिकारिक एजेंसियों ने मंजूरी नहीं दी थी (जैसे हाइड्रोक्सीक्लोरोक्वीन)।

लेक्सिकल मल्टीडायमेंशनल एनालिसिस (LMDA) नामक एक फैंसी गणितीय उपकरण का उपयोग करके, उन्होंने पता लगाया कि इन दोनों समूहों के शब्द एक-दूसरे से कितने भिन्न थे। उन्होंने पाया कि तीन अलग-अलग "वैचारिक विमर्श" (ideological discourses) थे (मूल रूप से, एक ही बिंदु पर बहस करने के तीन अलग तरीके)।

"टेम्परेचर" डायल

अब, कल्पना कीजिए कि रोबोट लाइब्रेरियन के पास टेम्परेचर नामक एक डायल है।

  • लो टेम्परेचर (0.1): रोबोट बहुत गंभीर, रोबोटिक है और सबसे स्पष्ट, सुरक्षित शब्द चुनता है। यह एक स्क्रिप्ट पढ़ने वाले रोबोट की तरह है।
  • हाई टेम्परेचर (0.9): रोबोट जंगली, रचनात्मक है और शब्दों को बेतरतीब ढंग से चुनता है। यह एक जैज़ सोलो बजाने वाले रोबोट की तरह है।

शोधकर्ताओं ने रोबोट को इन उपचारों के बारे में विभिन्न तापमानों और विभिन्न प्रकार के निर्देशों (प्रॉम्प्ट्स) का उपयोग करके उत्तर देने के लिए कहा।

बड़ी खोज: "गोल्डिलॉक्स" ज़ोन

यहाँ उन्हें क्या पता चला, और यह थोड़ा आश्चर्यजनक है:

1. बैकपैक की जीत:
जब रोबोट ने बैकपैक (RAG) का उपयोग किया, तो उसने अपने स्वयं के दिमाग का उपयोग करने की तुलना में किताबों से पक्षपात को कहीं अधिक कॉपी किया। यदि किताबें पक्षपाती थीं, तो रोबोट के उत्तर भी पक्षपाती थे। बैकपैक ही मुख्य चालक था।

2. टेम्परेचर का मोड़:
आप सोच सकते हैं, "यदि रोबोट बहुत गंभीर (लो टेम्परेचर) है, तो वह गलतियाँ नहीं करेगा, इसलिए वह पक्षपात की नकल नहीं करेगा।" गलत! अध्ययन इसके विपरीत सुझाव देता है।

  • लो टेम्परेचर (0.1) पर: रोबोट बहुत अधिक कठोर था। उसने पक्षपात के हस्तांतरण को दबा दिया। वह इतना सटीक होने पर केंद्रित था कि उसने पक्षपाती किताबों के "वाइब" (vibe) को पूरी तरह से आत्मसात नहीं किया।
  • मॉडरेट टेम्परेचर (0.5) पर: यह स्वीट स्पॉट था। रोबोट संतुलित था—किताबों को पढ़ने के लिए पर्याप्त गंभीर, लेकिन उनके वैचारिक "फ्लेवर" को सोखने के लिए पर्याप्त लचीला। रोबोट के उत्तर और पक्षपाती किताबों के बीच का तालमेल यहाँ सबसे अधिक था।
  • हाई टेम्परेचर (0.9) पर: रोबोट बहुत अराजक हो गया। हालांकि वह अभी भी किताबों का उपयोग कर रहा था, लेकिन बेतरतीब यादृच्छिकता (randomness) ने उत्तरों को विशिष्ट पक्षपात के साथ कम सटीक बना दिया, हालांकि RAG सिस्टम ने उसे बिना बैकपैक वाले रोबोट की तुलना में बेहतर तरीके से जमीन से जोड़े रखा।

3. "एन्हांस्ड" (उन्नत) प्रॉम्प्ट:
जब शोधकर्ताओं ने रोबोट को अतिरिक्त नोट्स दिए कि, "हे, इन किताबों का एक विशिष्ट दृष्टिकोण है, इसे मिलाने की कोशिश करें," तो पक्षपात का हस्तांतरण और भी मजबूत हो गया। लेकिन इन नोट्स के साथ भी, मॉडरेट टेम्परेचर ही वह जगह थी जहाँ रोबोट पक्षपात को सबसे अच्छी तरह से मैच करता था।

रोबोट मॉडल

उन्होंने चार अलग-अलग रोबोट दिमागों का परीक्षण किया: GPT-4o-mini, GPT-3.5-turbo, Gemini-2.0, और Qwen

  • Qwen पक्षपाती किताबों से सबसे आसानी से प्रभावित हुआ, जिसने 0.85 से ऊपर के स्कोर (जहाँ 1 एक परफेक्ट मैच है) के साथ पक्षपात को मैच किया।
  • GPT-4o-mini सबसे जिद्दी था। इसका स्कोर सबसे कम था, जो बताता है कि बड़े, स्मार्ट मॉडल पक्षपाती बैकपैक के बावजूद उसके पक्षपात को अनदेखा करने में बेहतर हो सकते हैं।

"नो बायस" (कोई पक्षपात नहीं) के बारे में क्या?

उन्होंने एक "नेगेटिव प्रॉम्प्ट" भी आज़माया, जिसमें रोबोट को बताया गया: "यहाँ पक्षपाती किताबें हैं, लेकिन उनकी शैली की नकल न करें!"

  • यह काम कर गया! रोबोट के उत्तर बहुत कम पक्षपाती हो गए।
  • दिलचस्प बात यह है कि "नो बायस" निर्देश उच्चतम तापमान (0.9) पर सबसे अच्छा काम करता था, जबकि "कॉपी द बायस" निर्देश मॉडरेट टेम्परेचर (0.5) पर सबसे अच्छा काम करता था।

मुख्य निष्कर्ष

पेपर सुझाव देता है कि टेम्परेचर केवल रचनात्मकता के बारे में नहीं है; यह बदल देता है कि एक रोबोट अपने स्रोत सामग्री के पक्षपात को कितनी मात्रा में कॉपी करता है।

  • यदि आप चाहते हैं कि एक रोबोट पक्षपाती स्रोत के विशिष्ट दृष्टिकोण को आत्मसात (absorb) करे, तो मॉडरेट टेम्परेचर (लगभग 0.5) सबसे प्रभावी लगता है।
  • यदि आप चाहते कि एक रोबोट पक्षपात को कॉपी करना बंद (stop) कर दे, तो एक सख्त "ऐसा न करें" निर्देश के साथ हाई टेम्परेचर (0.9) आपका सबसे अच्छा विकल्प हो सकता है।

लेखक सावधानी बरतते हुए कहते हैं कि यह COVID-19 ग्रंथों के साथ किए गए सिमुलेशन पर आधारित है, इसलिए हम 100% निश्चित नहीं हो सकते कि यह हर विषय या हर रोबोट के लिए काम करता है। लेकिन डेटा एक स्पष्ट पैटर्न दिखाता है: रोबोट का "मूड" (टेम्परेचर) और "बैकपैक" (रिट्रीव्ड जानकारी) मिलकर यह तय करते हैं कि अंतिम उत्तर में कितना पक्षपात समाप्त होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →