← नवीनतम पेपर
🤖 AI

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

यह शोध पत्र UniT को पेश करता है, जो एक ऐसा ढांचा है जो एकीकृत मल्टीमॉडल मॉडलों को बहु-चरणीय तर्क (multi-round reasoning), सत्यापन और परिशोधन के माध्यम से पुनरावृत्ति परीक्षण-समय स्केलिंग (iterative test-time scaling) करने में सक्षम बनाता है, यह प्रदर्शित करते हुए कि लघु तर्क प्रक्षेप पथों (short reasoning trajectories) पर प्रशिक्षण प्रभावी रूप से लंबे अनुमान श्रृंखलाओं (longer inference chains) तक सामान्यीकृत होता है और जटिल दृश्य समझ एवं निर्माण कार्यों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन अधीम कलाकार को एक जटिल दृश्य चित्रित करना सिखाने की कोशिश कर रहे हैं।

समस्या: "वन-शॉट" कलाकार
वर्तमान के अधिकांश AI आर्ट मॉडल उसी अधीम कलाकार की तरह हैं। आप उन्हें एक प्रॉम्प्ट देते हैं (जैसे, "एक शाखा पर एक पक्षी बनाओ जिसके बैकग्राउंड में एक बंदरगाह हो"), और वे तुरंत एक तस्वीर थमा देते हैं। यदि पक्षी अजीब दिखता है या बैकग्राउंड गलत है, तो वे उसे ठीक नहीं करते। वे बस परिणाम आपको सौंप देते हैं और कहते, "हो गया।" यह सरल कार्यों के लिए काम करता है, लेकिन कई चरणों या विशिष्ट विवरणों वाले जटिल अनुरोधों के लिए, परिणाम अक्सर अस्त-व्यस्त होता है।

समाधान: UniT (द "सोचने वाला" कलाकार)
यह पेपर UniT को पेश करता है, जो एक नया फ्रेमवर्क है जो एक एकीकृत AI मॉडल को काम शुरू करने से पहले रुकने, सोचने और अपने काम को परिष्कृत (refine) करने के लिए सिखाता है। केवल एक बार पेंट करने के बजाय, UniT एक ऐसे चित्रकार की तरह कार्य करता है जो:

  1. एक प्रारंभिक विचार का स्केच बनाता है।
  2. इसे आलोचनात्मक रूप से देखने के लिए पीछे हटता है ("रुको, पक्षी बहुत छोटा है")।
  3. समस्या को टुकड़ों में तोड़ता है ("पहले, मुझे पक्षी को ठीक करना होगा, फिर मैं बैकग्राउंड को ठीक करूँगा")।
  4. याद रखता है कि उसने पिछले चरण में क्या किया था ताकि वह अनजाने में अपने ही काम को मिटा न दे।
  5. इस चक्र को तब तक दोहराता है जब तक कि पेंटिंग एकदम सही न हो जाए।

यह पेपर इसे मल्टीमॉडल चेन-ऑफ-थॉट (Multimodal Chain-of-Thought) कहता है। यह एक "सोचने की प्रक्रिया" देने जैसा है जहाँ AI एक इमेज को देखते हुए टेक्स्ट के माध्यम से खुद से बात करता है, सुधारों की योजना बनाता है, और फिर उन्हें लागू करता है।

हमने इसे कैसे सिखाया (द "रोबोट टीचर" फैक्ट्री)
आप केवल एक AI को "ज़्यादा गहराई से सोचने" के लिए नहीं कह सकते। आपको उसे दिखाना होगा कि कैसे सोचा जाता है। शोधकर्ताओं ने प्रशिक्षण डेटा बनाने के लिए एक स्वचालित फैक्ट्री (एक एजेंटिक पाइपलाइन) बनाई:

  • उन्होंने एक शक्तिशाली AI का उपयोग करके एक प्रॉम्प्ट के आधार पर एक अव्यवst (messy) इमेज बनाई।
  • उन्होंने एक "विज़न-लैंग्वेज मॉडल" (एक स्मार्ट आलोचक) का उपयोग किया जो इमेज को देखता, एक विस्तृत आलोचना लिखता, और विशिष्ट सुधारों की योजना बनाता।
  • उन्होंने उन सुधारों को वास्तव में करने के लिए एक एडिटिंग टूल का उपयोग किया।
  • उन्होंने इस लूप को तब तक दोहराया जब तक कि इमेज एकदम सही नहीं हो गई।

इस प्रक्रिया ने "अच्छे सोचने" के हजारों उदाहरण बनाए, जो AI को यह दिखाते हैं कि अपने काम को कैसे सत्यापित (verify) किया जाए, बड़े कार्यों को छोटे चरणों में कैसे विभाजित किया जाए (सबगोल डिकंपोजिशन/subgoal decomposition), और पूरे प्रोजेक्ट के संदर्भ को कैसे याद रखा जाए (कंटेंट मेमोरी/content memory)। इसके बाद उन्होंने अपने मुख्य मॉडल, Bagel, को इन उदाहरणों पर प्रशिक्षित किया।

परिणाम: क्यों "सोचना" "अनुमान लगाने" से बेहतर है
यह पेपर बेहतर परिणाम प्राप्त करने के दो तरीकों की तुलना करता है:

  1. पैरेलल स्केलिंग (द "लॉटरी" अप्रोच): आप AI को एक ही समय में 10 अलग-अलग तस्वीरें जेनरेट करने के लिए कहते हैं और सबसे अच्छी वाली चुन लेते हैं। यह 10 लॉटरी टिकट खरीदने जैसा है; आप उम्मीद करते हैं कि एक जीत जाएगा, लेकिन आप वास्तव में स्मार्ट नहीं हो रहे हैं।
  2. सीक्वेंशियल स्केलिंग (द "UniT" अप्रोच): आप AI को एक तस्वीर जेनरेट करने, उसके बारे में सोचने, उसे ठीक करने और एक बेहतर संस्करण जेनरेट करने के लिए कहते हैं। यह एक कौशल का अभ्यास करने जैसा है।

पेपर का दावा है कि UniT बड़ी जीत हासिल करता है:

  • बेहतर गुणवत्ता: जटिल इमेज एडिटिंग और रीजनिंग के परीक्षणों पर, UniT ने मानक "वन-शॉट" मॉडल्स और यहाँ तक कि "लॉटरी" अप्रोच को भी काफी पीछे छोड़ दिया।
  • दक्षता (Efficiency): UniT ने "लॉटरी" पद्धति की तुलना में 2.5 गुना कम कंप्यूटिंग पावर का उपयोग करके बेहतर परिणाम प्राप्त किए। 10 रैंडम अनुमान लगाने के बजाय एक अच्छे विचार को परिष्कृत करना अधिक कुशल है।
  • सामान्यीकरण (Generalization): भले ही इसे मुख्य रूप से छोटे थिंकिंग लूप्स (लग लगभग 3-4 स्टेप्स) पर प्रशिक्षित किया गया था, फिर भी यह बिना किसी अतिरिक्त प्रशिक्षण के लंबे, अधिक जटिल कार्यों (4-5+ स्टेप्स) के लिए अपने सोचने के तरीके को स्वाभाविक रूप से विस्तारित कर सकता है। इसने सीखा कि कैसे सोचना है, न कि केवल क्या सोचना है।

"कॉग्निटिव बिहेवियर्स" (द सीक्रेट सॉस)
पेपर तीन विशिष्ट आदतों पर प्रकाश डालता है जो AI ने सीखी हैं, जो मानव संज्ञानात्मक कौशलों की तरह हैं:

  • वेरिफिकेशन (Verification): निर्देशों के विरुद्ध काम की जाँच करना ("क्या मैंने वास्तव में किताबें हटा दी हैं?")।
  • सबगोल डिकंपोजिशन (Subgoal Decomposition): एक विशाल कार्य को छोटे, प्रबंधनीय चरणों में तोड़ना ("पहले ज़ूम इन करें, फिर बैकग्राउंड बदलें, फिर रोशनी को उज्ज्वल करें")।
  • कंटेंट मेमोरी (Content Memory): कई संपादनों के दौरान पूरी कहानी का ट्रैक रखना ताकि अंतिम इमेज एक सुसंगत रचना हो, न कि केवल रैंडम बदलावों का संग्रह।

सारांश में
UniT एक ऐसा फ्रेमवर्क है जो एक एकल AI मॉडल को एक स्व-सुधार करने वाले, पुनरावृत्ति करने वाले (iterative) कलाकार में बदल देता है। इसे सत्यापित करने, योजना बनाने और याद रखने के माध्यम से "चेन ऑफ थॉट" के जरिए सिखाकर, यह जटिल, बहु-चरणीय विजुअल कार्यों को मानक मॉडल्स की तुलना में बहुत बेहतर तरीके से संभाल सकता है जो केवल अनुमान लगाते हैं और उम्मीद करते हैं। यह साबित करता है कि AI को "सोचने" के लिए अधिक समय देना (टेस्ट-टाइम स्केलिंग) इसे स्मार्ट बनाने का एक शक्तिशाली तरीका है, चाहे वह इमेज बनाने में हो या उन्हें समझने में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →