← नवीनतम पेपर
💬 NLP

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

यह शोधपत्र VisTIRA को प्रस्तुत करता है, जो एक टूल-एकीकृत तर्क फ्रेमवर्क (tool-integrated reasoning framework) है जो विज़न-लैंग्वेज मॉडल्स में टेक्स्ट और इमेज-आधारित गणितीय तर्क के बीच प्रदर्शन के अंतर को संबोधित करने के लिए दृश्य समस्याओं को प्राकृतिक भाषा के तर्कों (natural language rationales) और निष्पादन योग्य पायथन चरणों (executable Python steps) में विभाजित करता है, जिसे एक नए सिंथेटिक डेटासेट और प्रशिक्षण पाइपलाइन द्वारा समर्थित किया गया है।

मूल लेखक: Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र हैं जो गणित की समस्याओं को हल करने में माहिर हैं जब वे कंप्यूटर स्क्रीन पर सादे टेक्स्ट के रूप में लिखी होती हैं। आप संख्याओं को पढ़ सकते हैं, शब्दों को समझ सकते हैं और समीकरणों को पूरी तरह से हल कर सकते हैं।

लेकिन अब, कल्पना कीजिए कि किसी ने आपको हाथ से लिखे गए गणित के होमवर्क का एक फोटो थमा दिया है। अचानक, आप गलतियाँ करने लगते हैं। आप एक टेढ़े-मेढ़े "3" को "8" समझ लेते हैं, एक प्लस साइन को गुणा के निशान के रूप में भ्रमित कर देते हैं, या आप पेज के बिखरे हुए लेआउट में खो जाते हैं। भले ही गणित वही है, लेकिन इसे प्रस्तुत करने का तरीका (फोटो) आपको उलझा देता है।

यह वह समस्या है जिसे पेपर VisTIRA हल करने की कोशिश कर रहा है। यह इस बारे में है कि कैसे AI द्वारा टेक्स्ट को संभालने और गणित की छवियों (images) को संभालने के बीच के अंतर को कम किया जाए।

यहाँ उनके समाधान का विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "फोटो बनाम टेक्स्ट" का अंतर

वर्तमान AI मॉडल (विज़न-लैंग्वेज मॉडल्स) उन छात्रों की तरह हैं जो पाठ्यपुस्तक पढ़ने में तो बहुत अच्छे हैं लेकिन एक बिखरे हुए व्हाइटबोर्ड को पढ़ने में बहुत खराब हैं।

  • टेक्स्ट मोड: AI पढ़ता है "x squared plus 5 equals 10"। यह आसान है।
  • इमेज मोड: AI हाथ से लिखे "x² + 5 = 10" की एक फोटो देखता है। यह सोच सकता है कि "2" वास्तव में "z" है, या यह मिस कर सकता है कि खराब स्कैन की वजह से "5" वास्तव में "S" है।
  • परिणाम: AI गलत उत्तर देता है, इसलिए नहीं कि वह गणित नहीं कर सकता, बल्कि इसलिए क्योंकि वह चित्र को स्पष्ट रूप से पढ़ नहीं पाता है।

2. समाधान: VisTIRA (एक "कैलकुलेटर-चेकिंग" छात्र)

लेखकों ने VisTIRA नामक एक नया फ्रेमवर्क बनाया है। VisTIRA को एक ऐसे छात्र के रूप में न सोचें जो उत्तर रटने की कोशिश कर रहा है, बल्कि एक ऐसे छात्र के रूप में सोचें जिसका एक सख्त नियम है: "मैं भारी काम के लिए अपने खुद के दिमाग पर कभी भरोसा नहीं करूँगा; मैं कैलकुलेटर का उपयोग करूँगा।"

VisTIRA इस प्रकार काम करता है, चरण-दर-चरण:

  1. देखना और सोचना: AI गणित की समस्या की छवि को देखता है। वह कहता है, "ठीक है, मुझे लगता है कि यह त्रिभुज से जुड़ी एक ज्यामिति (geometry) की समस्या है।"
  2. नुस्खा लिखना: इसे अपने दिमाग में हल करने के बजाय, यह इसे हल करने के लिए निर्देशों का एक सेट (पायथन कोड) लिखता है। "पहले, आधार (base) का क्षेत्रफल निकालें। फिर, ऊंचाई से गुणा करें।"
  3. कैलकुलेटर चलाना: यह उन निर्देशों को एक बाहरी कंप्यूटर प्रोग्राम (कैलकुलेटर) को भेजता है ताकि वास्तव में गणित किया जा सके।
  4. परिणाम की जाँच करना: कंप्यूटर उत्तर वापस देता है। AI जाँचता है कि क्या वह उत्तर तर्कसंगत है।
  5. दोहराना: यदि उत्तर अजीब लगता है, तो वह चरण 2 पर वापस जाता है, अपने निर्देशों को ठीक करता है, और फिर से प्रयास करता है।

उपमा: कल्पना कीजिए कि आप एक शहर में नेविगेट करने की कोशिश कर रहे हैं।

  • पुराना AI: मैप को याद करने और बिना GPS के गाड़ी चलाने की कोशिश करता है। यदि मैप धुंधला है (इमेज), तो वह रास्ता भटक जाता है।
  • VisTIRA: धुंधले मैप को देखता है, मोड़-दर-मोड़ के निर्देश लिखता है, और फिर गाड़ी चलाने के लिए GPS (कोड) का उपयोग करता है। भले ही मैप बिखरा हुआ हो, GPS यह सुनिश्चित करता है कि कार सही मंजिल पर पहुँचे।

3. प्रशिक्षण: AI को "होमवर्क करना" सिखाना

VisTIRA को यह सिखाने के लिए कि यह कैसे किया जाए, शोधकर्ताओं ने इसे केवल उत्तर नहीं दिखाए। उन्होंने "होमवर्क सॉल्यूशंस" (जिसे SnapAsk कहा जाता है) की एक विशाल लाइब्रेरी बनाई।

  • उन्होंने गणित के होमवर्क की वास्तविक तस्वीरें लीं।
  • उन्होंने एक सुपर-स्मार्ट AI (एक "शिक्षक") का उपयोग करके उन्हें हल किया, जिसमें विचार प्रक्रिया (thought process) और उसे हल करने के लिए कोड दोनों को विस्तार से लिखा गया।
  • उन्होंने उन सभी समाधानों को हटा दिया जहाँ "विचार प्रक्रिया" का "कोड परिणाम" से मेल नहीं खा रहा था।
  • उन्होंने इस उच्च-गुणवत्ता वाले डेटा का उपयोग छोटे AI मॉडल्स को प्रशिक्षित करने के लिए किया, जिससे उन्हें हमेशा कोड के साथ अपने काम को दोबारा जाँचने के लिए सिखाया गया।

4. "जादुई चश्मा" (OCR)

पेपर ने OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) नामक एक ट्रिक का भी परीक्षण किया।

  • विचार: AI द्वारा इमेज को हल करने से पहले, यह चित्र में मौजूद टेक्स्ट को "पढ़ने" और उसे पहले सादे टेक्स्ट में बदलने के लिए एक विशेष टूल का उपयोग करता है।
  • परिणाम: यह AI को एक विशेष चश्मे की तरह काम करता है जो धुंधले हस्तलेखन को एकदम स्पष्ट बना देता है।
  • सावधानी: यह छोटे, कम शक्तिशाली AI मॉडल्स के लिए चमत्कार करता है (उन्हें इन चश्मों की आवश्यकता होती है)। लेकिन विशाल, सुपर-स्मार्ट AI मॉडल्स के लिए, ये चश्मे कभी-कभी अतिरिक्त शोर या भ्रम पैदा करते हैं, क्योंकि वे दिग्गज पहले से ही धुंधले टेक्स्ट को अपने आप पढ़ने में काफी अच्छे होते हैं।

5. बड़ी खोज

शोधकर्ताओं ने दो मुख्य बातें पाईं:

  1. अंतर वास्तविक है: जब गणित एक इमेज के रूप में होता है, तो AI टेक्स्ट की तुलना में गणित करने में काफी खराब प्रदर्शन करता है।
  2. समाधान: सबसे अच्छा तरीका केवल AI को "स्मार्टर" बनाना नहीं है। यह AI को धीरे होने, अपनी योजना लिखने और गणित को सत्यापित करने के लिए एक उपकरण (कोड) का उपयोग करने के लिए प्रशिक्षित करना है।

सारांश

VisTIRA एक छात्र को अनुमान लगाना छोड़ने और कैलकुलेटर का उपयोग करना शुरू करने के लिए सिखाने जैसा है। AI को एक बिखरी हुई इमेज समस्या को स्पष्ट चरणों में तोड़ने और फिर संख्याओं को हल करने के लिए कोड का उपयोग करने के लिए मजबूर करके, यह मूर्खतापूर्ण पढ़ने की गलतियों को रोकता है और सही उत्तर प्राप्त करना शुरू करता है, भले ही गणित कागज के टुकड़े पर एक बिखरे हुए फोटो की तरह क्यों न दिखे।

उन्होंने गणित की समस्याओं को इमेज में परिवर्तित करने वाला एक विशाल नया डेटासेट भी जारी किया है ताकि अन्य शोधकर्ता अपने स्वयं के "जादुई चश्मे" और "कैलकुलेटर-चेकिंग" सिस्टम का परीक्षण कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →