← नवीनतम पेपर
💻 computer science

HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization

यह शोध पत्र HYDRA को प्रस्तुत करता है, जो एक अत्याधुनिक एकीकृत मल्टीमॉडल फ्रेमवर्क है जो HYDRA-TOK का उपयोग करके दृश्य समझ और सृजन के बीच के अंतर को पाटता है, जो एक नवीन रिप्रजेंटेशन-हारमोनाइज्ड ViT आर्किटेक्चर है जो एक जनरेशन-सिमेंटिक बॉटलनेक के माध्यम से जनरेशन-केंद्रित प्रिमिटिव्स से सिमेंटिक एनकोडिंग की ओर प्रगतिशील रूप से संक्रमण करता है।

मूल लेखक: Xuerui Qiu, Yutao Cui, Guozhen Zhang, Junzhe Li, JiaKui Hu, Xiao Zhang, Yang Li, Songtao Liu, Miles Yang, Yu Shi, Zhao Zhong, Liefeng Bo

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuerui Qiu, Yutao Cui, Guozhen Zhang, Junzhe Li, JiaKui Hu, Xiao Zhang, Yang Li, Songtao Liu, Miles Yang, Yu Shi, Zhao Zhong, Liefeng Bo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसा रोबोट बनाने की कोशिश कर रहे हैं जो एक महारत हासिल पेंटर (Master Painter) और एक प्रतिभाशाली कला समीक्षक (Brilliant Art Critic) दोनों हो।

  • पेंटर (Painter) को यह जानना होगा कि नीले रंग के विशिष्ट शेड्स कैसे मिलाए जाते हैं, कुत्ते का एक अकेला बाल कैसे पेंट किया जाता है, और ईंट की दीवार की बनावट (texture) को कैसे उभारा जाता है। इसे बारीक, उलझी हुई बारीकियों की परवाह होती है।
  • समीक्षक (Critic) को पेंटिंग की कहानी को समझना होगा। इसे यह समझना होगा कि चित्र "बारिश में भीगते हुए एक उदास कुत्ते" को दर्शाता है, न कि केवल "गीले पिक्सल वाला एक भूरा धब्बा"। इसे बड़े विचारों और अर्थ की परवाह होती है।

समस्या:
लंबे समय तक, AI शोधकर्ताओं ने इन दोनों रोबोटों को अलग-अलग बनाने और फिर उन्हें आपस में जोड़ने की कोशिश की।

  • पेंटर एक ऐसे टूल का उपयोग करता था जो विवरणों में तो बहुत अच्छा था लेकिन कहानियों को समझने में बहुत खराब था।
  • समीक्षक एक ऐसे टूल का उपयोग करता था जो कहानियों में तो बहुत अच्छा था लेकिन विवरणों में बहुत खराब था।

जब आपने उन्हें एक टीम के रूप में काम करने के लिए मजबूर किया, तो वे आपस में लड़ने लगे। पेंटर कहता, "मुझे हर पिक्सेल देखना है!" जबकि समीक्षक कहता, "मुझे बस मुख्य विचार चाहिए!" वे एक-दूसरे से "बात करने" के तरीके पर सहमत नहीं हो पा रहे थे, जिससे एक ऐसा रोबोट बना या तो जो धुंधला और बेमतलब पेंट करता था या जो कहानी तो समझ लेता था पर उसे चित्रित नहीं कर पाता था।

समाधान: HYDRA
यह पेपर एक नया मॉडल पेश करता है जिसे HYDRA कहा जाता है (इसका नाम कई सिरों वाले राक्षस के नाम पर रखा गया है, लेकिन अच्छे अर्थ में!)। यह इसे हल करता है क्योंकि यह एक ही एकीकृत मस्तिष्क (unified brain) बनाता है जो इन दोनों कामों को पूरी तरह से कर सकता है।

यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:

1. "स्मार्ट ट्रांसलेटर" (HYDRA-TOK)

कल्पना कीजिए कि रोबोट के पास एक विशेष अनुवादक (translator) है जो छवियों को उस भाषा में बदल देता है जिसे वह समझता है।

  • पुराना तरीका: अनुवादक एक फैक्स मशीन की तरह था। यह स्थान बचाने के लिए छवि को सिकोड़ देता था (विवरण खो देता था) और फिर अर्थ का अनुमान लगाने की कोशिश करता था। यह एक गड़बड़ी थी।
  • HYDRA का तरीका: अनुवादक एक प्रोग्रेसिव लर्नर (Progressive Learner) है। इसके दो चरण हैं:
    • चरण 1 (द स्केच आर्टिस्ट): पहले, यह छवि को देखता है और उसकी संरचना (structure) को पकड़ता है। यह रूपरेखा, आकार और बनावट बनाता है। यह सभी सूक्ष्म विवरणों को सुरक्षित रखता है।
    • "बॉटलनेक" (द फिल्टर): फिर, यह इस स्केच को एक विशेष फिल्टर के माध्यम से भेजता है। यह फिल्टर एक छलनी की तरह काम करता है। यह "शोर" (अव्यवस्थित, भ्रमित करने वाले हिस्से) को हटा देता है लेकिन आकारों की आवश्यक "शब्दावली" को बनाए रखता है।
    • चरण 2 (द स्टोरीटेलर): अंत में, यह उस साफ, फिल्टर किए गए स्केच को लेता है और उसे एक गहरे अर्थ में बदल देता है। अब यह जानता है कि "यह एक उदास कुत्ता है," बिना इस तथ्य को खोए कि कुत्ते के बाल गीले हैं।

यह "बॉटलनेक" ही असली सफलता का मंत्र (secret sauce) है। यह AI को छवि के सार (essence) को सीखने के लिए मजबूर करता है, जो इसे पेंटिंग और समझने दोनों में माहिर बनाता है।

2. "दो सिरों वाला मस्तिष्क" (HYDRA)

एक बार जब छवि को इस पूर्ण "सार की भाषा" में अनुवादित कर दिया जाता है, तो रोबोट के पास दो सिर होते हैं:

  • सिर A (लेखक): यदि आप छवि के बारे में कोई प्रश्न पूछते हैं, तो यह सिर उत्तर लिखता है।
  • सिर B (पेंटर): यदि आप एक नई छवि मांगते हैं, तो यह सिर उसी "सार की भाषा" का उपयोग करके शुरू से पेंट करता है।

चूंकि दोनों सिर एक ही भाषा बोलते हैं, इसलिए वे लड़ते नहीं हैं। वे एक-दूसरे की मदद करते हैं!

  • जब रोबोट एक "लाल सेब" को पेंट करना सीखता है, तो वह एक "लाल सेब" कैसा दिखता है, इसे समझने में बेहतर हो जाता है।
  • जब रोबोट "उदास कुत्ते" का वर्णन करना सीखता है, तो वह सही भावना के साथ एक उदास कुत्ता पेंट करने में बेहतर हो जाता है।

यह एक बड़ी बात क्यों है?
इसे एक ऐसे संगीतकार के रूप में सोचें जो वायलिन बजाने में तो माहिर है (विवरण) और साथ ही एक सिम्फनी (symphony) भी रच सकता है (अर्थ)। HYDRA से पहले, अधिकांश AI मॉडल या तो केवल वायलिन बजाने में अच्छे थे या केवल रचना करने में, लेकिन शायद ही कभी दोनों एक साथ।

परिणाम:
पेपर दिखाता है कि HYDRA नया चैंपियन है:

  • बेहतर समझ: यह छवियों के बारे में प्रश्नों के उत्तर देने में लगभग किसी भी अन्य मॉडल से बेहतर है (प्रतियोगिता को बड़े अंतर से पछाड़ते हुए)।
  • बेहतर पेंटिंग: यह ऐसी छवियां बनाता है जो अविश्वसनीय रूप से वास्तविक दिखती हैं और निर्देशों का पूरी तरह से पालन करती हैं (जैसे कि "दाहिनी ओर पीला फल रखें")।
  • कोई समझौता नहीं: इसे एक कौशल पाने के लिए दूसरे का त्याग नहीं करना पड़ता। यह एक ही समय में, एक ही मस्तिष्क में दोनों काम करता है।

संक्षेप में: HYDRA पहला AI है जिसने एक पेंटर और एक कवि दोनों की भाषा बोलना सीखा है, जिससे यह अभूतपूर्व सामंजस्य के साथ दृश्य दुनिया को बनाने और समझने में सक्षम हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →