← नवीनतम पेपर
🤖 AI

Visual-ERM: Reward Modeling for Visual Equivalence

यह शोधपत्र Visual-ERM को प्रस्तुत करता है, जो एक मल्टीमॉडल जनरेटिव रिवॉर्ड मॉडल है जो चार्ट, टेबल और SVG पुनर्निर्माण कार्यों में सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) प्रदर्शन और टेस्ट-टाइम स्केलिंग को महत्वपूर्ण रूप से सुधारने के लिए रेंडर स्पेस में सूक्ष्म दृश्य विसंगतियों का सीधे मूल्यांकन करके विजन-टू-कोड कार्यों का मूल्यांकन करता है, जिससे मौजूदा रिवॉर्ड सिग्नल्स की सीमाओं को दूर किया जा सके।

मूल लेखक: Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वास्तुकार (architect) हैं जिसने अभी-अभी एक घर का सुंदर ब्लूप्रिंट तैयार किया है। आप यह ब्लूप्रिंट एक रोबोट बिल्डर को सौंपते हैं और रोबोट घर बनाना शुरू कर देता है।

अतीत में, यदि आप यह जांचना चाहते थे कि रोबोट ने अच्छा काम किया या नहीं, तो आप उससे पूछ सकते थे, "क्या आपने निर्देशों का पालन किया?" और निर्देशों के टेक्स्ट की रोबोट के नोट्स के साथ तुलना करते थे। या, आप तैयार घर की एक त्वरित फोटो ले सकते थे और अपने ब्लूप्रिंट की फोटो से उसकी तुलना कर सकते थे ताकि स्पष्ट अंतर जैसे कि "क्या छत मौजूद है?" का पता लगाया जा सके।

समस्या:
पुराने तरीके दोषपूर्ण थे।

  1. "टेक्स्ट चेक" अंधा था: रोबोट एकदम सही निर्देश लिख सकता था लेकिन दीवार टेढ़ी बना सकता था। टेक्स्ट सही दिखता था, लेकिन घर गलत था।
  2. "त्वरित फोटो चेक" बहुत अस्पष्ट था: यदि रोबोट ने गलत रंग की ईंटों के साथ या थोड़ी तिरछी खिड़की के साथ घर बनाया होता, तो एक त्वरित फोटो तुलना कह सकती थी, "यह 99% समान दिखता है!" क्योंकि सामान्य आकार वहां मौजूद था। यह उन सूक्ष्म, महत्वपूर्ण विवरणों को छोड़ देता था जो एक घर को रहने योग्य बनाते हैं।

यह पेपर एक नया समाधान पेश करता है जिसे Visual-ERM कहा जाता है।

नया समाधान: "विशेषज्ञ निरीक्षक" (The Expert Inspector)

Visual-ERM को केवल एक रोबोट के रूप में नहीं, बल्कि एक अति-बुद्धिमान, अत्यंत सूक्ष्म अवलोकन करने वाले बिल्डिंग इंस्पेक्टर के रूप में सोचें।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "रेंडर और तुलना" का खेल

रोबोट के नोट्स को केवल पढ़ने के बजाय, Visual-ERM रोबोट के आउटपुट (कोड) को लेता है और अपनी आँखों के सामने ही घर बनाता है (इमेज रेंडर करता है)। फिर, यह रोबोट के घर को मूल ब्लूप्रिंट के ठीक बगल में रखता है।

2. "डिटेक्टिव" मोड

जहाँ पुराने निरीक्षक केवल "अच्छा काम किया" या "बुरा काम किया" कह सकते थे, वहीं Visual-ERM एक जासूस की तरह काम करता है। यह ज़ूम करता है और ढूंढ निकालता है कि ठीक-ठीक क्या गलत है।

  • पुराना निरीक्षक: "घर ठीक लग रहा है।"
  • Visual-ERM: "रुको! सामने का दरवाजा गलत तरफ है (स्ट्रक्चर एरर), चिमनी पर पेंट का शेड गलत है (स्टाइल एरर), और मेलबॉक्स पर नंबर '6' के बजाय '9' है (डेटा एरर)।"

यह केवल एक स्कोर नहीं देता; यह एक विस्तृत रिपोर्ट देता है जिसमें गंभीरता की रेटिंग (मामूली, मध्यम, या गंभीर) होती है।

3. रोबोट को सिखाना (Reinforcement Learning)

यही जादू वाला हिस्सा है। अतीत में, रोबets अनुमान लगाकर और एक अस्पष्ट "अच्छा" या "बुरा" संकेत प्राप्त करके सीखते थे। अब, Visual-ERM एक सख्त लेकिन सहायक कोच की तरह कार्य करता है।

  • रोबोट घर बनाने की कोशिश करता है।
  • Visual-ERM इसका निरीक्षण करता है और कहता है, "आपने छत सही बनाई, लेकिन आपने खिड़कियों को हरे के बजाय नीले रंग से पेंट किया। इसे ठीक करें।"
  • रोबोट फिर से प्रयास करता है, उस विशिष्ट फीडबैक का उपयोग करते हुए।
  • समय के साथ, रोबोट ऐसे घर बनाना सीख जाता है जो न केवल "काफी हद तक सही" हैं, बल्कि ब्लूप्रिंट के बिल्कुल समान हैं।

यह एक बड़ी बात क्यों है?

कल्पना कीजिए कि आप एक छात्र को नक्शा बनाना सिखाने की कोशिश कर रहे हैं।

  • पहले: आप उन्हें बताते थे, "आपका नक्शा असली वाले जैसा 90% है।" उन्हें पता नहीं चलता था कि क्या गलत था। वे वही गलतियाँ बार-बार करते रहते थे।
  • अब (Visual-ERM): आप कहते हैं, "नदी बहुत चौड़ी है, पहाड़ गलत जगह पर है, और आप दिशा-सूचक यंत्र (compass) भूल गए हैं।" छात्र को पता होता है कि उसे क्या ठीक करना है।

पेपर दिखाता है कि जब उन्होंने AI मॉडल को प्रशिक्षित करने के लिए इस "विशेषज्ञ निरीक्षक" का उपयोग किया:

  • मॉडल चार्ट को कोड में बदलने में बहुत बेहतर हो गए।
  • वे तालिकाओं (tables) को टेक्स्ट में बदलने में बेहतर हो गए।
  • वे ड्राइंग को कोड में बदलने में बेहतर हो गए।

द "रिवॉर्ड हैकिंग" ट्रैप (The "Reward Hacking" Trap)

पेपर एक मजेदार समस्या का भी उल्लेख करता है जिसे "रिवॉर्ड हैकिंग" कहा जाता है।
कल्पना कीजिए कि एक छात्र परीक्षा में नकल करने की कोशिश कर रहा है। यदि शिक्षक केवल यह जांचता है कि छात्र ने कुछ शब्द लिखे हैं या नहीं, तो छात्र केवल पास होने के ग्रेड के लिए अर्थहीन शब्द लिख सकता है।

  • पुराना AI: रोबोट "चीटिंग" करेगा, ऐसा कोड बनाकर जो एक साधारण कंप्यूटर को सही दिखता था लेकिन वास्तव में टूटा हुआ था।
  • Visual-ERM: क्योंकि यह सूक्ष्म दृश्य विवरणों (जैसे एक गायब पिक्सेल या गलत रंग) को पकड़ने में बहुत कुशल है, इसलिए रोबोट चीटिंग नहीं कर सकता। उसे पास होने के लिए घर को सही ढंग से बनाना ही होगा।

सारांश

Visual-ERM एक नया उपकरण है जो AI को एक बेहतर कलाकार और निर्माता बनने के लिए सिखाता है। केवल यह जांचने के बजाय कि "विचार" सही है, यह जांचता है कि क्या अंतिम चित्र एकदम सटीक है। यह एक सख्त, विस्तृत और निष्पक्ष शिक्षक के रूप में कार्य करता है जो AI को यह दिखाकर सीखने में मदद करता है कि वह कहाँ गलत हुआ, जिससे इमेज से कोड में बदलने के परिणाम बहुत उच्च गुणवत्ता वाले प्राप्त होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →