← नवीनतम पेपर
💻 computer science

Self-Rewarding Vision-Language Model via Reasoning Decomposition

यह शोधपत्र विजन एसआर1 (Vision SR1) का परिचय देता है, जो एक तीन-चरणीय स्व-पुरस्कार सुदृढीकरण लर्निंग (self-rewarding reinforcement learning) ढांचा है जो बिना किसी बाहरी दृश्य पर्यवेक्षण या अतिरिक्त जीपीयू ओवरहेड के, विजन-लैंग्वेज मॉडल्स में विजुअल हैलुसिनेशन (visual hallucinations) को कम करने और भाषाई शॉर्टकट पर निर्भरता घटाने के लिए तर्क को दृश्य और भाषाई घटकों में विभाजित करता है।

मूल लेखक: Zongxia Li, Wenhao Yu, Chengsong Huang, Zhenwen Liang, Rui Liu, Fuxiao Liu, Jingxi Che, Dian Yu, Jordan Boyd-Graber, Haitao Mi, Dong Yu

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zongxia Li, Wenhao Yu, Chengsong Huang, Zhenwen Liang, Rui Liu, Fuxiao Liu, Jingxi Che, Dian Yu, Jordan Boyd-Graber, Haitao Mi, Dong Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Vision-SR1 पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) के माध्यम से समझाया गया है।

समस्या: "दिन में सपने देखने वाला" कलाकार (The "Daydreaming" Artist)

कल्पना कीजिए कि आपने एक चित्र का वर्णन करने और उस पर प्रश्नों के उत्तर देने के लिए एक प्रतिभाशाली कलाकार को काम पर रखा है। हालाँकि, इस कलाकार की एक बुरी आदत है: जब उससे पेंटिंग के बारे में पूछा जाता है, तो वह अक्सर अपनी आँखें बंद कर लेता है और पेंटिंग को वास्तव में देखने के बजाय इस आधार पर अनुमान लगाता है कि पेंटिंग आमतौर पर कैसी दिखती होगी।

AI की दुनिया में, इसे "विजुअल हैलुसिनेशन" (Visual Hallucination) (मनगढ़ंत बातें बनाना) और "लैंग्वेज शॉर्टकट्स" (Language Shortcuts) (छवि को अनदेखा करना और टेक्स्ट पैटर्न पर निर्भर रहना) कहा जाता है।

वर्तमान AI प्रशिक्षण विधियाँ एक ऐसे शिक्षक की तरह हैं जो केवल अंतिम उत्तर को ग्रेड देता है। यदि छात्र सही उत्तर देता है, तो उसे एक 'गोल्ड स्टार' मिलता है, भले ही उसने आँखें बंद करके अनुमान लगाकर नकल की हो। शिक्षक कभी यह जाँच नहीं करता कि छात्र ने चित्र को कैसे देखा। इसके परिणामस्वरूप, AI देखने के बजाय अनुमान लगाने को प्राथमिकता देना सीख जाता है।

समाधान: Vision-SR1 (एक "स्व-जाँचने वाली" प्रणाली)

लेखक Vision-SR1 पेश करते हैं, जो एक नई प्रशिक्षण विधि है जो AI को "अपना काम दिखाने" (show its work) और बिना किसी मानव शिक्षक या सुपर-कंप्यूटर की मदद के अपनी दृष्टि को सत्यापित करने के लिए मजबूर करती है।

Vision-SR1 को AI कलाकार के लिए तीन-चरणीय प्रशिक्षण शिविर के रूप में समझें:

चरण 1: "आँखों पर पट्टी वाला टेस्ट" (Decomposition)

केवल AI से यह पूछने के बजाय कि "छवि को देखें और उत्तर दें," यह विधि AI को अपने मस्तिष्क को दो अलग-अलग कार्यों में विभाजित करने के लिए मजबूर करती है:

  1. वर्णनकर्ता (The Describer): पहले, AI को छवि का एक विस्तृत विवरण लिखना होगा। महत्वपूर्ण बात यह है कि यह विवरण इतना पूर्ण होना चाहिए कि यदि आप छवि को हटा दें और केवल AI को वह टेक्स्ट विवरण दें, तो भी वह प्रश्न का सही उत्तर दे सके।
  2. तर्ककर्ता (The Reasoner): फिर, AI उस टेक्स्ट विवरण का उपयोग करके उत्तर तक पहुँचता है।

उपमा: कल्पना कीजिए कि एक जासूस को केस सुलझाने की अनुमति मिलने से पहले अपराध स्थल की पूरी रिपोर्ट लिखनी होगी। यदि वे केवल अपनी लिखित रिपोर्ट का उपयोग करके (बिना अपराध स्थल की तस्वीरों को देखे) केस को हल नहीं कर सकते, तो उनकी रिपोर्ट अधूरी थी।

चरण 2: स्व-जाँच (Self-Check/Self-Rewarding)

यह एक जादू जैसा है। AI को अपने विवरण को ग्रेड देने के लिए किसी मानव की आवश्यकता नहीं है।

  • AI विवरण तैयार करता है।
  • फिर, AI से पूछा जाता है: "यह रहा वह विवरण जो आपने अभी लिखा है। अब, केवल इस टेक्स्ट का उपयोग करके प्रश्न का उत्तर दें।"
  • यदि AI अपने ही विवरण का उपयोग करके सही उत्तर देता है, तो वह एक अच्छे पर्यवेक्षक के रूप में खुद को "गोल्ड स्टार" (पुरस्कार) देता है।
  • यदि वह विफल रहता है, तो उसे पता चल जाता है कि उसका विवरण कमजोर था, और उसे "रेड फ्लैग" (चेतावनी) मिलता है।

उपमा: यह एक ऐसे शेफ की तरह है जो एक रेसिपी लिखता है, और फिर केवल उसी रेसिपी का उपयोग करके व्यंजन बनाने की कोशिश करता है। यदि व्यंजन का स्वाद सही है, तो रेसिपी अच्छी थी। यदि स्वाद बहुत खराब है, तो शेफ जानता है कि वह निर्देशों में कोई सामग्री छोड़ गया है। शेफ बिना किसी फूड क्रिटिक के अपनी ही रेसिपी को ग्रेड दे रहा है।

चरण 3: संतुलित स्कोरकार्ड (Multi-Reward Optimization)

अतीत में, यदि AI अंतिम उत्तर सही देता था, तो उसे पुरस्कार मिलता था, भले ही उसका विवरण निरर्थक हो। Vision-SR1 स्कोरकार्ड को बदल देता है।

  • यह इस बात के लिए अलग स्कोर देता है कि AI ने छवि का वर्णन कितनी अच्छी तरह किया
  • यह इस बात के लिए अलग स्कोर देता है कि AI ने समस्या को कितनी अच्छी तरह हल किया

उपमा: कल्पना कीजिए कि एक स्पोर्ट्स कोच जो पहले केवल टीम के जीतने की परवाह करता था। अब, कोच के पास दो स्कोरबोर्ड हैं: एक "डिफेंस" (छवि को देखना) के लिए और एक "ऑफेंस" (प्रश्न का उत्तर देना) के लिए। AI को दोनों स्कोरबोर्डों पर एक साथ सुधार करने के लिए प्रशिक्षित किया जाता है। यदि वह डिफेंस में धोखाधड़ी करता है (देखना छोड़ देता है), तो वह अंक खो देता है, भले ही वह ऑफेंस में स्कोर करे।

यह क्यों महत्वपूर्ण है?

  1. अतिरिक्त शिक्षकों की आवश्यकता नहीं: अधिकांश विधियों के लिए यह जाँचने के लिए महंगे "AI जजों" (अन्य बड़े मॉडल) या मनुष्यों को नियुक्त करने की आवश्यकता होती है कि क्या AI चित्र को देख रहा है। Vision-SR1 स्वयं AI का उपयोग जाँच करने के लिए करता है, जिससे पैसा और समय बचता है।
  2. "दिन में सपने देखना" बंद करना: AI को यह साबित करने के लिए मजबूर करके कि वह केवल अपने विवरण का उपयोग करके प्रश्न का उत्तर दे सकता है, AI यह सीख जाता है कि वह केवल अनुमान नहीं लगा सकता। उसे एक उपयोगी विवरण बनाने के लिए वास्तव में छवि को "देखना" होगा।
  3. दक्षता (Efficiency): पेपर का दावा है कि इस विधि के लिए मानक प्रशिक्षण की तुलना में अतिरिक्त कंप्यूटर पावर (GPUs) की आवश्यकता नहीं होती है, जो इसे मौजूदा प्रणालियों के लिए एक व्यावहारिक अपग्रेड बनाता है।

परिणाम

विभिन्न कार्यों (जैसे आरेख के साथ गणित की समस्याएं, चार्ट पढ़ना और सामान्य छवि प्रश्न) पर परीक्षण करने पर, Vision-SR1:

  • हैलुसिनेशन को कम करता है: AI ने कम मनगढ़ंत बातें बनाईं।
  • धोखाधड़ी रोकता है: AI ने टेक्स्ट शॉर्टकट के बजाय वास्तव में छवि को देखने पर अधिक भरोसा किया।
  • सटीकता में सुधार: इसने पिछली विधियों की तुलना में सभी क्षेत्रों में अधिक प्रश्नों के सही उत्तर दिए।

संक्षेप में, Vision-SR1 AI को अनुमान लगाना बंद करने और देखना शुरू करने के लिए सिखाता है, क्योंकि यह AI को खुद को यह साबित करने के लिए मजबूर करता है कि उसने वास्तव में वही देखा जो उसने दावा किया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →