← नवीनतम पेपर
🤖 AI

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

चेन-ऑफ-ज़ूम (CoZ) एक मॉडल-अज्ञेय (model-agnostic) ढांचा है जो VLM-जनित टेक्स्ट प्रॉम्प्ट्स द्वारा निर्देशित मध्यवर्ती स्केल-स्टेट्स की एक ऑटोरेग्रेसिव श्रृंखला में कार्य को विभाजित करके चरम सिंगल-इमेज सुपर-रिज़ॉल्यूशन प्राप्त करता है, जिसे मॉडल के मूल प्रशिक्षण शासन से कहीं अधिक आवर्धन पर उच्च बोधगम्य गुणवत्ता बनाए रखने के लिए प्रेफरेंस अलाइनमेंट के माध्यम से और अधिक अनुकूलित किया जाता है।

मूल लेखक: Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "चेन-ऑफ-ज़ूम" (CoZ) पेपर का स्पष्टीकरण दिया गया है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) में अनुवादित किया गया है।

बड़ी समस्या: "धुंधला ज़ूम" का जाल (The "Blurry Zoom" Trap)

कल्पना कीजिए कि आपके फोन पर बिल्ली की एक बहुत छोटी, धुंधली फोटो है। आप उसकी मूंछों को करीब से देखने के लिए ज़ूम करना चाहते हैं।

  • पुराना तरीका ("स्ट्रेच" विधि): यदि आप केवल इमेज को खींचते (stretch) हैं, तो वह एक विशाल, पिक्सेलेटेड कचरा बन जाती है।
  • आधुनिक AI तरीका ("जादुई" विधि): वर्तमान AI सुपर-रेज़ोल्यूशन मॉडल जादूगर कलाकारों की तरह हैं। यदि आप उनसे थोड़ा ज़ूम करने के लिए कहते हैं (जैसे 4x), तो वे अद्भुत काम करते हैं। वे मूंछों और फर की बनावट का सटीक अनुमान लगा सकते हैं।
  • खामी (The Glitch): लेकिन यदि आप उसी कलाकार से 256 गुना ज़ूम करने के लिए कहते हैं (एक छोटे बिंदु से एक विशाल पोस्टर तक), तो वे घबरा जाते हैं। वे कल्पना (hallucinate) करने लगते हैं। वे शायद तीन सिर वाली बिल्ली बना दें, या बिल्ली के फर को ईंट की दीवार में बदल दें। उन्हें केवल छोटे ज़ूम के लिए प्रशिक्षित किया गया था, इसलिए वे अत्यधिक दूरी को संभालने के तरीके नहीं जानते।

समाधान: चेन-ऑफ-ज़ूम (Chain-of-Zoom - CoZ)

इस पेपर के लेखकों ने चेन-ऑफ-ज़ूम नामक एक चतुर तकनीक विकसित की है। एक ही बड़ी छलांग में "छोटे" से "विशाल" तक जाने के बजाय, वे इस यात्रा को छोटे, प्रबंधनीय चरणों में तोड़ देते हैं।

इसे पहाड़ चढ़ने की तरह समझें।

  • पुराना तरीका: बेस कैंप से शिखर तक एक ही छलांग में पहुँचने की कोशिश करना। आप गिर सकते हैं।
  • CoZ तरीका: आप छोटे कदम उठाते हैं। आप पहले पायदान (ledge) तक चढ़ते हैं, आराम करते हैं, अपना नक्शा देखते हैं, फिर अगले पायदान तक चढ़ते हैं। आप शीर्ष तक पहुँचने के लिए यही प्रक्रिया दोहराते रहते हैं।

तकनीकी शब्दों में, AI तुरंत 1x से 256x पर जाने की कोशिश नहीं करता है। यह इस प्रकार जाता है:

  1. 1x \to 4x
  2. 4x \to 16x
  3. 16x \to 64x
  4. 64x \to 256x

हर चरण में, AI उसी "कलाकार" मॉडल का उपयोग करता है जिसे वह पहले से जानता है और जिस पर उसे भरोसा है। क्योंकि हर बार छलांग छोटी होती है, इसलिए कलाकार शांत और सटीक रहता है।

गुप्त सामग्री: "गाइड" (VLM)

यहाँ पेचीदा हिस्सा है। जैसे-जैसे आप और अधिक ज़ूम करते जाते हैं, मूल धुंधली फोटो लगभग अदृश्य हो जाती है। AI के पास काम करने के लिए बहुत कम विज़ुअल जानकारी बचती है। यह एक अंधेरे कमरे में विस्तृत लैंडस्केप पेंट करने की कोशिश करने जैसा है।

यदि AI तीसरे चरण में गलती करता है, तो वह गलती चौथे चरण में बढ़ जाएगी, और 10वें चरण तक आते-आते इमेज पूरी तरह खराब हो जाएगी।

इसे ठीक करने के लिए, लेखकों ने एक गाइड जोड़ा है।

  • कलाकार (The Artist): सुपर-रेज़ोल्यूशन मॉडल (वह जो तस्वीर पेंट कर रहा है)।
  • गाइड (The Guide): एक विज़न-लैंग्वेज मॉडल (VLM)। यह एक ऐसा AI है जो इमेज को "देख" भी सकता है और उसे "पढ़" भी सकता है।

गाइड कैसे काम करता है:
इससे पहले कि कलाकार अगला ज़ूम किया हुआ वर्शन पेंट करे, गाइड वर्तमान इमेज और पिछली इमेज को देखता है। वह कलाकार के लिए एक छोटा, वर्णनात्मक नोट (प्रॉम्ट) लिखता है।

  • उदाहरण: "ठीक है, हम दीवार पर ज़ूम कर रहे हैं। पिछले चरण में एक खुरदरी बनावट दिखाई दी थी। इस चरण में विशिष्ट ईंट के पैटर्न और काई (moss) दिखनी चाहिए, न कि चिकना पेंट।"

यह नोट कलाकार को सही रास्ते पर रखता है, यह सुनिश्चित करता है कि विवरण सार्थक हों, भले ही विज़ुअल संकेत धुंधले क्यों न हों।

"कोच" (GRPO ट्रेनिंग)

एक समस्या थी: गाइड हमेशा सटीक नहीं होता था। कभी-कभी वह गलत निर्देश देता था, जैसे कि जब वास्तव में एक बिल्ली हो, तो "यहाँ एक ड्रैगन बनाओ" कहना। या वह बार-बार एक ही बात दोहराता रहता था।

इसे ठीक करने के लिए, लेखकों ने गाइड को GRPO (Generalized Reward Policy Optimization) पद्धति का उपयोग करके प्रशिक्षित किया।

इसे कोच और आलोचक के रूप में समझें:

  1. छात्र (गाइड): कलाकार के लिए एक विवरण लिखता है।
  2. आलोचक (एक अन्य AI): विवरण और इमेज को देखता है। वह एक स्कोर देता है: "अच्छा काम किया, यह सटीक है!" या "बुरा काम किया, तुमने ड्रैगन की कल्पना कर ली!"
  3. कोच (GRPO): उन स्कोर्स का उपयोग छात्र को सिखाने के लिए करता है। यदि छात्र को उच्च स्कोर मिलता है, तो वह वैसा ही करता रहता है। यदि उसे कम स्कोर मिलता है, तो वह उन गलतियों को करना बंद करना सीख जाता है।

समय के साथ, गाइड कलाकार के लिए एकदम सही निर्देश लिखने में विशेषज्ञ बन जाता है, जिससे यह सुनिश्चित होता है कि अंतिम इमेज वास्तविक और मानवीय पसंद के अनुरूप दिखे।

परिणाम: एक्सट्रीम सुपर-रेज़ोल्यूशन

इन तीनों चीजों को मिलाकर:

  1. छोटे कदम: एक समय में एक पायदान चढ़ना।
  2. गाइड: कलाकार को केंद्रित रखने के लिए नोट्स लिखना।
  3. कोच: गाइड को परफेक्ट बनाने के लिए प्रशिक्षित करना।

टीम ने कुछ अविश्वसनीय हासिल किया: उन्होंने एक मानक AI मॉडल (जो केवल 4x ज़ूम के लिए प्रशिक्षित था) का उपयोग करके 256x ज़ूम अविश्वसनीय विवरण के साथ बनाया। आप पेड़ पर व्यक्तिगत पत्तियाँ, झंडे की सिलवटें, या दीवार की बनावट देख सकते हैं, और वह भी पूरे सिस्टम को फिर से प्रशिक्षित किए बिना।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप दूर के एक साइन बोर्ड पर लिखे बहुत छोटे अक्षरों को पढ़ने की कोशिश कर रहे हैं।

  • पुराना AI: एक ही बार में पूरे शब्द का अनुमान लगाने की कोशिश करता है। वह "PARK" का अनुमान लगाता है जबकि वास्तव में वह "PARKING" है।
  • चेन-ऑफ-ज़ूम: आप टेलीस्कोप का उपयोग करते हैं।
    1. आप थोड़ा ज़ूम करते हैं। गाइड (एक बुद्धिमान मित्र) कहता है, "यह एक 'P' जैसा लग रहा है।"
    2. आप और ज़ूम करते हैं। गाइड कहता है, "अब मुझे एक 'A' और एक 'R' दिख रहा है।"
    3. आप फिर से ज़ूम करते हैं। गाइड कहता है, "निश्चित रूप से 'K', 'I', 'N', 'G' है।"
    4. कोच ने गाइड को सिखाया कि जब अक्षर स्पष्ट रूप से "PARKING" लिख रहे हों, तो "PARK" का अनुमान न लगाए।

परिणाम? आप मील दूर से भी साइन को पूरी तरह पढ़ सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →