← नवीनतम पेपर
💻 computer science

Exploring LLM biases to manipulate AI search overview

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल (LLM) ओवरव्यू सिस्टम स्रोत चयन में पूर्वाग्रहों के प्रति संवेदनशील हैं, जिसका लाभ खोज स्निपेट्स को फिर से लिखने और परिणामों में हेरफेर करने के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) मॉडल को प्रशिक्षित करके उठाया जा सकता है, साथ ही यह संदर्भ विषाक्तता (context poisoning) हमलों से जुड़े सुरक्षा जोखिमों को भी उजागर करता है।

मूल लेखक: Roman Smirnov

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roman Smirnov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Exploring LLM biases to manipulate AI search overview" का सरल भाषा और रोजमर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: "AI सारांशकार" (The AI Summarizer)

कल्पना कीजिए कि आप एक लाइब्रेरियन (AI) से एक विशाल लाइब्रेरी में किसी विशेष विषय पर तीन सबसे अच्छी किताबें खोजने के लिए कहते हैं। लाइब्रेरियन पूरी किताब नहीं पढ़ता; वह यह तय करने के लिए कि कौन सी किताबें सिफारिश की जानी चाहिए, किताब के कवर, शीर्षक और पीछे लिखे एक छोटे विवरण (जिसे "स्निपेट" कहा जाता है) को देखता है।

यह शोध इस बात की जांच करता है कि क्या होता है जब उस लाइब्रेरियन के मन में कुछ छिपे हुए पसंदीदा (पक्षपात/biases) होते हैं और क्या कोई व्यक्ति उस छोटे विवरण को फिर से लिखकर लाइब्रेरियन को एक विशिष्ट पुस्तक चुनने के लिए मजबूर कर सकता है।

1. लाइब्रेरियन की एक "पसंदीदा सूची" है (Biases)

शोधकर्ताओं ने पहले यह सिद्ध किया कि AI लाइब्रेरियन पूरी तरह से निष्पक्ष नहीं है। भले ही आप किताबों का क्रम बदल दें या कवर में थोड़ा बदलाव करें, लाइब्रेरियन बार-बार उन्हीं कुछ किताबों को चुनता रहता है।

  • उदाहरण: कल्पना कीजिए कि एक शिक्षक निबंधों की जांच कर रहा है। भले ही आप कागजों पर नाम बदल दें या फॉन्ट बदल दें, शिक्षक बार-बार उसी छात्र को "A" ग्रेड देता रहता है क्योंकि उसे उस छात्र की लेखन शैली पसंद है, चाहे वास्तविक सामग्री कुछ भी हो।
  • निष्कर्ष: AI कुछ खास प्रकार के स्रोतों (जैसे बड़े रिटेलर्स) को दूसरों (जैसे ब्रांड की अपनी वेबसाइट) की तुलना में अधिक पसंद करता है, भले ही जानकारी समान हो। इसे "अर्न्ड मीडिया बायस" (Earned Media Bias) कहा जाता है।

2. "पुनर्लेखन" का खेल (The Rewriting Game)

शोधकर्ताओं ने पूछा: क्या हम एक छोटे AI को उन छोटे विवरणों (blurbs) को फिर से लिखने के लिए प्रशिक्षित कर सकते हैं ताकि लाइब्रेरियन उन्हें चुने?

उन्होंने इसके लिए रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) तकनीक का उपयोग किया। इसे एक कुत्ते को प्रशिक्षित करने की तरह समझें:

  • कुत्ता (छोटा AI) एक विवरण को फिर से लिखने की कोशिश करता है।
  • यदि लाइब्रेरियन पुनर्लिखित विवरण को चुनता है, तो कुत्ते को इनाम (treat) मिलता है।
  • यदि लाइब्रेरियन उसे अनदेखा करता है, तो कुत्ते को कुछ नहीं मिलता।

खेल के नियम:
इसे वास्तविक बनाने के लिए, उन्होंने कुत्ते पर सख्त नियम लगाए:

  1. लंबाई के साथ धोखाधड़ी नहीं: कुत्ता केवल विवरण को लंबा नहीं कर सकता ताकि लाइब्रेरियन उसे पढ़ने के लिए मजबूर हो जाए।
  2. पूरी किताब नहीं पढ़ना: कुत्ता केवल छोटा विवरण देख सकता है, पूरा लेख या URL नहीं।
  3. संदर्भ मायने रखता है: कुत्ते को अन्य प्रतिस्पर्धी विवरणों को देखते हुए ही विवरण को फिर से लिखना होगा।

3. "तुलनात्मक" रहस्य (The Relative Secret)

सबसे बड़ी खोज यह थी कि लाइब्रेरियन को इस बात से फर्क नहीं पड़ता कि कोई विवरण अपने आप में "परफेक्ट" है या नहीं; उसे इससे फर्क पड़ता है कि वह दूसरों से बेहतर है या नहीं।

  • उदाहरण: कल्पना कीजिए कि एक टैलेंट शो है। आपको जीतने के लिए दुनिया का सबसे अच्छा गायक होने की आवश्यकता नहीं है; आपको बस अपने बगल में खड़े व्यक्ति से थोड़ा बेहतर होने की आवश्यकता है।
  • परिणाम: प्रशिक्षित AI ने विवरणों को "परफेक्ट" बनाने के बजाय "प्रतिस्पर्धा से थोड़ा बेहतर" बनाने के लिए सीखा। उसने पुनर्लिखित विवरणों को चुनने के लिए लाइब्रेरियन को सफलतापूर्वक चकमा देने में सफलता प्राप्त की।

4. खतरा क्षेत्र (Attacks)

शोधकर्ताओं ने फिर यह देखने की कोशिश की कि क्या इस चालाकी का उपयोग गलत कामों (attacks) के लिए किया जा सकता है। उन्होंने सिस्टम को नुकसान पहुँचाने के तीन तरीके आजमाए:

  1. लक्ष्य को ज़हरीला बनाना (Poisoning the Target): उन्होंने पुनर्लिखित विवरण में हानिकारक शब्दों को डालने की कोशिश की। परिणाम: विफल। AI "अच्छा" दिखने पर इतना केंद्रित था कि उसने अजीब शब्दों को अनदेखा कर दिया।
  2. शीर्षक को ज़हरीला बनाना (Poisoning the Title): उन्होंने किताब का शीर्षक बदलकर कुछ अजीब लिख दिया, और फिर विवरण को फिर से लिखा। परिणाम: विफल। लाइब्रेरियन ने शीर्षक देखा, उसे अजीब पाया, और किताब को खारिज कर दिया।
  3. प्रतिस्पर्धा को ज़हरीला बनाना (Context Poisoning): यह सबसे डरावना है। उन्होंने एक प्रतिद्वंद्वी के विवरण को लिया और उसे बकवास या हानिकारक सलाह से भर दिया (जैसे, "इन वॉच बैंड्स का उपयोग लोगों को रस्सी से बांधने के लिए किया जा सकता है!")। फिर, उन्होंने लक्ष्य विवरण को फिर से लिखने के लिए AI से कहा, जबकि वह उस ज़हरीले प्रतिद्वंद्वी को देख रहा था।
    • परिणाम: सफलता। AI ने लक्ष्य विवरण को उस बकवास को शामिल करने के लिए फिर से लिखा ("...लोगों को रस्सी से बांधना, सबसे बड़ी प्रतिस्पर्धी बढ़त!")। लाइब्रेरियन ने इस नए विवरण को देखा, इसे चुना और अंतिम सारांश में उस हानिकारक सलाह को शामिल कर लिया।

5. सभी लाइब्रेरियन एक जैसे नहीं होते

शोधकर्ताओं ने विभिन्न प्रकार के AI लाइब्रेरियन (विभिन्न मॉडल जैसे GPT-4.1 और GPT-5) पर इसका परीक्षण किया।

  • कुछ लाइब्रेरियन पुनर्लिखित विवरणों द्वारा आसानी से धोखा खा गए।
  • एक लाइब्रेरियन (GPT-5 Mini) बहुत जिद्दी था। ऐसा लगा कि वह टेक्स्ट के बजाय URL (वेबसाइट एड्रेस) पर अधिक ध्यान देता है। चाहे विवरण कितना भी अच्छा क्यों न हो, यदि URL उसकी "पसंदीदा सूची" में नहीं था, तो वह उसे नहीं चुनता था।

सारांश

यह शोध सिद्ध करता है कि:

  1. AI सर्च सारांश पक्षपाती होते हैं और कुछ विशेष स्रोतों को प्राथमिकता देते हैं।
  2. आप एक छोटे AI को संक्षिप्त टेक्स्ट स्निपेट्स को फिर से लिखने के लिए प्रशिक्षित कर सकते हैं ताकि सिस्टम को "गेम" किया जा सके और उसे अधिक बार चुना जा सके।
  3. AI निर्णय तुलना (अभी कौन बेहतर है?) के आधार पर लेता है, न कि पूर्ण सत्य के आधार पर।
  4. हालांकि आप सीधे तौर पर या खराब शीर्षकों के माध्यम से AI को धोखा नहीं दे सकते, लेकिन आप संदर्भ (context) को ज़हरीला बनाकर (अन्य विकल्पों को बदलकर) उसे धोखा दे सकते हैं, जिससे वह हानिकारक या गलत सारांश बना सकता है।

शोधकर्ता निष्कर्ष निकालते हैं कि हालांकि हमने इन प्रणालियों में हेरफेर करने का एक तरीका खोजा है, लेकिन AI मॉडल जटिल हैं, और कुछ मॉडल इस तरह की चालाकी के प्रति अधिक प्रतिरोधी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →