← नवीनतम पेपर
💬 NLP

ETCHR: Editing To Clarify and Harness Reasoning

यह शोध पत्र ETCHR को प्रस्तुत करता है, जो एक विच्छेदित (decoupled), तर्क-सचेत (reasoning-aware) इमेज एडिटिंग फ्रेमवर्क है जो दो-चरणीय प्रशिक्षण रेसिपी के माध्यम से अमूर्त प्रश्नों और दृश्य रूपांतरणों के बीच के अंतर को पाटता है, जिससे कई कार्य परिवारों में विविध मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की दृश्य तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली सुलझाने की कोशिश कर रहे हैं, जैसे कि कोई भूलभुलैया या कोई जटिल चार्ट, लेकिन आप केवल एक स्मार्ट असिस्टेंट से ही बात कर सकते हैं जो पढ़ने में तो बहुत माहिर है लेकिन विवरणों को "देखने" में बहुत खराब है। यदि आप पूछते हैं, "निकास (exit) कहाँ है?" तो असिस्टेंट गलत अनुमान लगा सकता है क्योंकि वह रास्ते को विज़ुअलाइज़ (visualize) नहीं कर पाता।

वर्तमान AI सिस्टम इसे ठीक करने की कोशिश करते हैं, लेकिन उनके पास दो तरीके हैं:

  1. असिस्टेंट को एक रूलर और पेन देना: वे AI को एक बॉक्स बनाने या ज़ूम करने के लिए सख्त, पहले से लिखे गए कमांड देते हैं। (यह एक बच्चे को कलरिंग बुक देने जैसा है जिसमें केवल तीन रंग हैं; वे वह नहीं बना सकते जिसकी उन्हें वास्तव में आवश्यकता है)।
  2. असिस्टेंट को एक साथ लिखने और सोचने के लिए कहना: वे एक ही दिमाग से दोनों काम करवाने की कोशिश करते हैं। (यह एक शेफ से एक शानदार भोजन बनाने के साथ-साथ एक उपन्यास लिखने को कहने जैसा है; खाना अक्सर जल जाता है, और कहानी भी गड़बड़ हो जाती है)।

ETCHR (Clarify और Harness Reasoning के लिए Editing) एक तीसरा तरीका है। यह एक विशेष "विजुअल डिटेक्टिव" (दृश्य जासूस) असिस्टेंट की तरह काम करता है जो मुख्य AI के साथ मिलकर काम करता है।

यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. समस्या: "भाषा" और "ड्राइंग" के बीच का अंतर

शोधकर्ताओं ने पाया कि सामान्य इमेज-एडिटिंग टूल्स निष्क्रिय चित्रकारों (passive painters) की तरह होते हैं। यदि आप उनसे कहते हैं, "कूड़ेदान के चारों ओर एक लाल बॉक्स बनाओ," तो वे इसे पूरी तरह से करते हैं। लेकिन यदि आप उनसे एक कठिन प्रश्न पूछते हैं जैसे, "क्या कूड़ेदान कुर्सी के बाईं ओर है या दाईं ओर?" तो चित्रकार भ्रमित हो जाता है। उसे नहीं पता कि सवाल का जवाब देने के लिए उसे क्या बनाना चाहिए।

साथ ही, भले ही उसे पता हो कि क्या बनाना है, लेकिन यदि कार्य जटिल है (जैसे कि एक भूलभुलैया के माध्यम से एक लंबे, घुमावदार रास्ते को ट्रेस करना), तो वह विवरणों में गलती कर सकता है।

2. समाधान: दो-चरणीय प्रशिक्षण शिविर (Two-Stage Training Camp)

एक निष्क्रिय चित्रकार को सक्रिय "विजुअल डिटेक्टिव" में बदलने के लिए, टीम ने ETCHR मॉडल को दो चरणों में प्रशिक्षित किया:

  • चरण 1: "इमिटेशन" (अनुकरण) पाठ (SFT)
    कल्पना कीजिए कि आप चित्रकार को हजारों ऐसे उदाहरण दिखा रहे हैं जहाँ एक प्रश्न को उस परफेक्ट ड्राइंग के साथ जोड़ा गया है जो उसे हल करती है।

    • उदाहरण: प्रश्न: "रास्ता कहाँ है?" \rightarrow ड्राइंग: सही मार्ग को ट्रेस करती हुई एक लाल रेखा।
    • मॉडल यह सीखता है कि एक प्रश्न को देखना है और कहना है, "आह, इसका उत्तर देने के लिए, मुझे यहाँ एक लाल रेखा खींचनी होगी।" यह अमूर्त (abstract) प्रश्नों को विशिष्ट दृश्य संकेतों में बदलना सीख जाता है।
  • चरण 2: "रिवॉर्ड" (पुरस्कार) गेम (RL)
    अब, मॉडल अपने आप ड्राइंग बनाने की कोशिश करता है। लेकिन हमें कैसे पता चलेगा कि ड्राइंग वास्तव में मददगार है या नहीं?

    • रिवॉर्ड A (जज): एक अलग AI ड्राइंग को देखता है और पूछता है, "क्या इस चित्र में वास्तव में वह सुराग मौजूद है जो सवाल का जवाब देने के लिए आवश्यक है?"
    • रिवॉर्ड B (सॉल्वर): मुख्य AI उस ड्राइंग का उपयोग करके पहेली को हल करने की कोशिश करता है। क्या उसने सही उत्तर दिया?
    • मॉडल को अंक तभी मिलते हैं जब ड्राइंग दोनों रूप से सटीक हो और वास्तव में समस्या को हल करने में मदद करे। यह उसे "सुंदर लेकिन बेकार" ड्राइंग बनाने से रोकता है।

3. सुरक्षा जाल: "एडिट, वेरीफाई, रीज़न" (Edit, Verify, Reason)

यहाँ तक कि एक प्रशिक्षित जासूस भी गलती कर सकता है। यदि विजुअल डिटेक्टिव एक गलत रास्ता बनाता है, तो वह मुख्य AI को गलत उत्तर की ओर ले जा सकता है।

इसलिए, ETCHR एक सुरक्षा जांच (safety check) जोड़ता है:

  1. एडिट (Edit): डिटेक्टिव एक सुराग (clue) बनाता है।
  2. वेरीफाई (Verify): मुख्य AI रुकता है और जांचता है: "क्या यह ड्राइंग वास्तव में मददगार और सही है?"
  3. रीज़न (Reason):
    • यदि हाँ: AI पहेली को हल करने के लिए ड्राइंग का उपयोग करता है।
    • यदि नहीं: AI ड्राइंग को अनदेखा कर देता है और मूल छवि के साथ समस्या को हल करने की कोशिश करता है।

यह बेहतर क्यों है?

  • यह प्लग-एंड-प्ले है: आपको मुख्य AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस इस "विजुअल डिटेक्टिव" को जोड़ सकते हैं, और यह विभिन्न AI दिमागों (जैसे Qwen, Gemini, या Kimi) के साथ काम करता है।
  • यह लचीला है: उन टूल्स के विपरीत जो केवल बॉक्स बना सकते हैं या ज़ूम कर सकते हैं, ETCHR एक पूरे 3D दृश्य को फिर से बना सकता है, एक जिग्सॉ पहेली को पुनर्व्यवस्थित कर सकता है, या एक जटिल पथ को ट्रेस कर सकता है।
  • यह सटीक है: "ड्राइंग" के काम को "सोचने" के काम से अलग करके, ड्राइंग उच्च गुणवत्ता वाली रहती है, और सोच स्पष्ट रहती है।

परिणाम

पेपर ने इसे पांच प्रकार के कठिन कार्यों पर परखा:

  1. बड़ी तस्वीरों में सूक्ष्म विवरण ढूंढना।
  2. जटिल चार्ट पढ़ना।
  3. तर्क संबंधी पहेलियाँ (जैसे भूलभुलैया) हल करना।
  4. बिखरी हुई जिग्सॉ पहेलियों को वापस जोड़ना।
  5. 3D स्थानों को समझना।

इन सभी परीक्षणों में, ETCH जोड़ने से AI को काफी अधिक प्रश्न सही करने में मदद मिली। उदाहरण के लिए, एक विशिष्ट AI मॉडल के साथ, सफलता दर लगभग 56% से बढ़कर 61% हो गई, और दूसरे के साथ, यह 76% से बढ़कर 81% हो गई।

संक्षेप में: ETCHR एक AI को "छवियों के साथ सोचने" के लिए सिखाता है, उसे एक समर्पित साथी देकर जो जानता है कि किसी समस्या को हल करने में मदद करने के लिए क्या बनाना है, अपने काम की जांच करता है, और ड्राइंग को तभी साझा करता है जब वह वास्तव में उपयोगी हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →