← नवीनतम पेपर
💻 computer science

TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling

यह शोध पत्र TAG (टैन्जेंशियल एम्प्लीफाइंग गाइडेंस) प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त और आर्किटेक्चर-अज्ञेय इन्फरेंस-टाइम विधि है जो महत्वपूर्ण कम्प्यूटेशनल ओवरहेड जोड़े बिना डेटा मैनिफोल्ड के उच्च-संभाव्यता वाले क्षेत्रों की ओर सैंपलिंग प्रक्षेपवक्रों को निर्देशित करने के लिए स्पर्शरेखीय स्कोर घटकों (tangential score components) को प्रवर्धित करके डिफ्यूजन मॉडल में मतिभ्रम (hallucinations) को कम करती है।

मूल लेखक: Hyunmin Cho, Donghoon Ahn, Susung Hong, Jee Eun Kim, Seungryong Kim, Kyong Hwan Jin

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunmin Cho, Donghoon Ahn, Susung Hong, Jee Eun Kim, Seungryong Kim, Kyong Hwan Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: जब AI भीड़ में "खो" जाता है

कल्पना कीजिए कि आप अपने दोस्तों के एक विशिष्ट समूह (एक "सही छवि") को खोजने के लिए एक विशाल, भीड़भाड़ वाले उत्सव (एक "डेटा वितरण") के माध्यम से चलने की कोशिश कर रहे हैं। यह उत्सव अलग-अलग क्षेत्रों में व्यवस्थित है: एक संगीत मंच, एक फूड कोर्ट और एक गेम एरिया। ये वे "मोड्स" (modes) हैं जहाँ वास्तविक, सार्थक छवियाँ रहती हैं।

हालाँकि, कभी-कभी AI भ्रमित हो जाता है। संगीत मंच की ओर सीधे जाने के बजाय, यह क्षेत्रों के बीच के खाली स्थान में भटक जाता है। इस "नो-मैन्स-लैंड" (no-man's-land) में, AI एक गिटार को टैको के साथ मिलाने या किसी व्यक्ति को छह उंगलियाँ देने की कोशिश करता है। पेपर में, इसे हैलुसिनेशन (hallucination) या मोड इंटरपोलेशन (mode interpolation) कहा गया है। AI तकनीकी रूप से चल तो रहा है, लेकिन वह उस रास्ते से भटक रहा है जहाँ "अच्छी चीजें" मौजूद हैं, जिससे अजीब और असंगत छवियाँ बन रही हैं।

पुराना तरीका: ज़ोर से चिल्लाना

इसे ठीक करने के लिए, शोधकर्ताओं ने पहले क्लासिफायर-फ्री गाइडेंस (Classifier-Free Guidance - CFG) जैसी विधियों का उपयोग किया। इसे ऐसे समझें जैसे AI चिल्ला रहा हो, "मैं असली चीज़ के और अधिक करीब होना चाहता हूँ!" और बस अपने निर्देशों की आवाज़ (volume) बढ़ा रहा है।

समस्या यह है कि केवल आवाज़ बढ़ाने से आप धुंधले कमरे में चिल्लाने जैसा ही करते हैं। आप तेज़ तो चिल्ला सकते हैं, लेकिन आपको यह पता नहीं चलता कि किस दिशा में चलना है। आप केवल इतना ज़ोर से चिल्ला सकते हैं कि आप अपनी ही आवाज़ को विकृत (distort) कर दें (जिससे धुंधली या अत्यधिक संतृप्त छवियाँ बनती हैं) बिना वास्तव में अपने दोस्तों को खोजे। यह एक "ज्यामिति-अज्ञेय" (geometry-agnostic) दृष्टिकोण है—इसे उत्सव के मैदान के आकार की समझ नहीं है।

नया समाधान: TAG (टेंजेंशियल एम्प्लीफाइंग गाइडेंस)

लेखकों ने एक नई विधि प्रस्तावित की है जिसे TAG कहा जाता है। केवल ज़ोर से चिल्लाने के बजाय, TAG एक स्मार्ट कंपास की तरह काम करता है जो उत्सव के आकार को समझता है।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "गोला" (Sphere) सादृश्य

कल्पना कीजिए कि AI की वर्तमान छवि एक विशाल, अदृश्य गोले में तैरती हुई एक गेंद है।

  • त्रिज्या (Radius - सामान्य दिशा): गोले के केंद्र या किनारे की ओर बढ़ना। यह "शोर के स्तर" (noise level) या समग्र चमक/धुंधलेपन को बदलने जैसा है। AI पहले से ही यह जानता है कि यह कैसे करना है; वह बस निर्धारित शेड्यूल का पालन कर रहा है।
  • सतह (Surface - टेंजेंशियल दिशा): गोले की सतह के साथ चलना। यहीं पर वास्तविक विवरण रहते—जैसे बिल्ली के कान को बाईं से दाईं ओर खिसकाना, या बहुत अधिक उंगलियों वाले हाथ को ठीक करना। यह छवि का "सिमेंटिक" (semantic) हिस्सा है।

2. "डांस स्टेप" (Dance Step)

जब AI छवि बनाने के लिए एक कदम उठाता है, तो वह आमतौर पर एक बड़ा, अनाड़ी कदम उठाता है जो "त्रिज्या" (धुंधलापन) और "सतह" (विवरण) को मिला देता है।

TAG उस कदम को देखता है और उसे दो भागों में विभाजित करता है:

  • यह "त्रिज्या" वाले हिस्से को बिल्कुल वैसा ही रखता है (क्योंकि वह हिस्सा ठीक काम कर रहा है)।
  • यह "सतह" वाले हिस्से (विवरणों) को लेता है और उसे एम्प्लीफाई (बढ़ाता) करता है।

इसे एक डांसर की तरह समझें। यदि डांसर स्पिन करते समय थोड़ा डगमगा रहा है, तो TAG कहता है, "स्पिन की गति को समान रखें, लेकिन उस फुटवर्क पर ज़ोर दें जो आपको संतुलित रखता है।" यह उस गति को बढ़ाता है जो डेटा मैनिफोल्ड (उत्सव के मैदान) के पथ पर रहती है और उस गति को अनदेखा करता है जो पथ से भटक जाती है।

3. यह क्यों काम करता है ("मैप" सिद्धांत)

पेपर यह सिद्ध करने के लिए एक गणितीय अवधारणा जिसे ट्वीडी की पहचान (Tweedie's identity) कहा जाता है, का उपयोग करता है कि "सतह" वाली गति में वह समृद्ध, संरचनात्मक जानकारी होती है जो तस्वीर को वास्तविक दिखाने के लिए आवश्यक है। इस विशिष्ट गति को बढ़ाकर, AI को उन "उच्च-संभावना" वाले रास्तों पर रहने के लिए मजबूर किया जाता है जहाँ वास्तविक छवियाँ रहती हैं।

यह AI को एक मानचित्र देने जैसा है जो कहता है, "सिर्फ तेज़ मत चलो; पक्के रास्ते के साथ बगल में चलो।" यह AI को उन घास के मैदानों में भटकने से रोकता है जहाँ हैलुसिनेशन (अतिरिक्त उंगलियां, तैरती हुई वस्तुएं) होते हैं।

परिणाम: बेहतर तस्वीरें, कोई अतिरिक्त लागत नहीं

पेपर का दावा है कि TAG एक "प्लग-एंड-प्ले" टूल है। इसका मतलब है:

  • कोई रीट्रेनिंग नहीं: आपको AI को कुछ भी नया सिखाने की ज़रूरत नहीं है। आप बस अंतिम चरणों के दौरान उसके चलने के तरीके को ट्यून करते हैं।
  • कोई अतिरिक्त हार्डवेयर नहीं: इसे छवियां उत्पन्न करने के लिए किसी बड़े कंप्यूटर या अधिक समय की आवश्यकता नहीं होती है। यह लगभग शून्य "कंप्यूटेशनल ओवरहेड" जोड़ता है।
  • हैलुसिनेशन को ठीक करता है: परीक्षणों में, TAG ने AI को अजीब गलतियाँ करने (जैसे तीन पैरों वाला कुत्ता या तैरता हुआ पतंग) से सफलतापूर्वक रोका और छवियों को अधिक स्पष्ट और सुसंगत बनाया।

सारांश सादृश्य

कल्पना कीजिए कि आप एक कुत्ते की पेंटिंग बना रहे हैं।

  • बिना मदद के AI एक ऐसे चित्रकार की तरह है जो बार-बार आगे-पीछे कदम रखता है, गलती से पेंट को फैला देता है और कभी-कभी कुत्ते को बिल्ली की पूंछ के साथ चित्रित कर देता है क्योंकि वह अपना स्थान खो देता है।
  • पुराना तरीका (CFG) उस चित्रकार की तरह है जो चिल्ला रहा है, "इसे और अधिक कुत्ते जैसा बनाओ!" और पेंट को और भी ज़ोर से फैला रहा है।
  • TAG एक मददगार सहायक की तरह है जो धीरे से चित्रकार के हाथ को थपथपाता है और कहता है, "आप कुत्ते के आकार के लिए सही दिशा में ब्रश चला रहे हैं, लेकिन आप डगमगा रहे हैं। आइए आपके हाथ को उस विशिष्ट दिशा में लॉक करें और वहां थोड़ा और ज़ोर दें।"

परिणाम? चित्रकार कैनवास पर टिका रहता है, कुत्ता एक कुत्ते जैसा दिखता है, और पेंटिंग उतनी ही तेज़ी से पूरी होती है जितनी पहले थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →