← नवीनतम पेपर
🤖 AI

Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code

यह शोध पत्र GeoCode प्रस्तुत करता है, जो एक सिंथेटिक रूप से जनरेट किया गया मल्टीमॉडल ज्योमेट्री डेटासेट है जो कोड-आधारित आरेख रेंडरिंग के माध्यम से निरंतरता सुनिश्चित करता है और विजन-लैंग्वेज मॉडल्स की ज्यामितीय तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए प्लॉटिंग कोड को एक स्पष्ट एलाइनमेंट ऑब्जेक्टिव के रूप में उपयोग करता है।

मूल लेखक: Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जटिल ज्यामिति (geometry) की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। आप उसे एक त्रिभुज (triangle) की तस्वीर दिखाते हैं जिसमें कुछ रेखाएं और कोण हैं, और आप उससे पूछते हैं, "इस तरफ की लंबाई क्या है?"

वर्तमान रोबोट (AI मॉडल) प्रश्न के टेक्स्ट को पढ़ने में अच्छे हैं, लेकिन वे तस्वीर को "देखने" में बहुत खराब हैं। वे अक्सर उन शब्दों के आधार पर उत्तर का अनुमान लगा लेते हैं जो उन्होंने पहले देखे होते हैं, न कि चित्र के वास्तविक आकार को समझकर। यह एक ऐसे छात्र की तरह है जिसने गणित करने के बजाय केवल गणित के टेस्ट के उत्तर रट लिए हों।

यह शोध पत्र, "GeoCode," इन रोबोटों को सिखाने का एक शानदार नया तरीका पेश करता है, जिसमें वे शून्य से एक विशाल, सटीक अभ्यास पुस्तकालय (practice library) बनाते हैं और उन्हें केवल शब्दों को नहीं, बल्कि चित्र के "ब्लूप्रिंट" (खाके) को सीखने के लिए मजबूर करते हैं।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "अंधा वास्तुकार" (The Blind Architect)

अभी के AI मॉडल अंधे वास्तुकारों की तरह हैं। यदि आप उन्हें एक ब्लूप्रिंट (गणितीय तर्क) और एक इमारत की फोटो (डायग्राम) देते हैं, तो वे अक्सर टेक्स्ट विवरण को पढ़कर इमारत की ऊंचाई का अनुमान लगा सकते हैं। लेकिन यदि आप टेक्स्ट को ढक दें और उन्हें केवल फोटो दिखाएं, तो वे खो जाते हैं। वे दृश्य रेखाओं और कोणों को उन तार्किक नियमों में अनुवाद नहीं कर पाते जिनकी समस्या को हल करने के लिए आवश्यकता होती है।

2. समाधान: एक "परफेक्ट फैक्ट्री" बनाना

रोबोटों को इंटरनेट से मिलने वाली यादृच्छिक (random) तस्वीरें दिखाकर सुधारने के बजाय, लेखकों ने एक फैक्ट्री बनाई जो शून्य से ज्यामिति की समस्याएं बनाती है।

इस फैक्ट्री को तीन चरणों वाली असेंबली लाइन के रूप में सोचें:

  • चरण 1: लॉजिक स्केलेटन (बीज/Seed)
    सबसे पहले, वे एक सुपर-स्मार्ट लॉजिक इंजन (एक डिजिटल गणितज्ञ की तरह) का उपयोग करके ज्यामिति की समस्या के नियम बनाते हैं। वे तय करते हैं, "ठीक है, हमें एक ऐसा त्रिभुज चाहिए जहाँ दो रेखाएं लंबवत (perpendicular) हों, और एक वृत्त (circle) एक तरफ को छू रहा हो।" उन्होंने अभी तक इसे बनाया नहीं है; उनके पास केवल तार्किक नियम हैं। यह सुनिश्चित करता है कि समस्या गणितीय रूप से संभव हो।
  • चरण 2: बिल्डर (कोडर)
    इसके बाद, वे एक AI "बिल्डर" का उपयोग करके उन अमूर्त नियमों को एक कंप्यूटर प्रोग्राम (विशेष रूप से, प्लॉटिंग कोड) में बदलते हैं। यह कोड सटीक निर्देशों का एक सेट है: " (0,0) पर एक बिंदु बनाएं, (5,5) तक एक रेखा खींचें, त्रिज्या 3 के साथ एक वृत्त बनाएं।"
    चूंकि यह कोड चित्र बनाता है, इसलिए चित्र नियमों के साथ पूरी तरह से मेल खाता है। इसमें कोई त्रुटि, कोई "असंभव" आकार या कोई विरोधाभास नहीं होता है।
  • चरण 3: एडिटर (डिबायसर/Debiaser)
    अंत में, वे एक सख्त संपादक की भूमिका निभाते हैं। वे समस्या के टेक्स्ट विवरण को लेते हैं और उसमें से किसी भी ऐसे संकेत को हटा देते हैं जो चित्र में पहले से ही स्पष्ट है।
    • खराब उदाहरण: "चित्र में, आप A पर एक समकोण (right angle) देख सकते हैं। साथ ही, टेक्स्ट कहता है कि कोण A 90 डिग्री है।" (रोबोट बस टेक्स्ट पढ़ लेता है और चित्र को अनदेखा कर देता है)।
    • अच्छा उदाहरण: "चित्र में, आप A पर एक समकोण देखते हैं। साइड B की लंबाई ज्ञात करें।" (रोबोट को यह जानने के लिए कि वह एक समकोण है, चित्र को देखना ही होगा)।

3. सीक्रेट सॉस: "ब्लूप्रिंट सिखाना"

यह इस पेपर का सबसे रचनात्मक हिस्सा है। आमतौर पर, जब हम एक रोबोट को सिखाते हैं, तो हम उसे एक चित्र दिखाते हैं और उत्तर पूछते हैं।

लेखक कहते हैं: "नहीं, पहले, हमें ब्लूप्रिंट बताओ।"

वे रोबोट को ज्यामिति डायग्राम को देखने और उस प्लॉटिंग कोड को लिखने के लिए प्रशिक्षित करते हैं जो उस चित्र को फिर से बना सके।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को बने-बनाए लेगो (Lego) महल को दिखाते हैं। इसके बजाय कि उनसे पूछें, "टावर में कितने ईंटें हैं?" आप उनसे पूछते हैं, "इस महल को शून्य से बनाने के निर्देश लिखें।"
  • यह क्यों काम करता है: निर्देश (कोड) लिखने के लिए, रोबोट को यह समझना ही होगा कि हर बिंदु कहाँ है, कौन सी रेखाएँ किससे जुड़ती हैं, और कोण क्या हैं। यह रोबोट को चित्र की संरचना को गहराई से "देखने" के लिए मजबूर करता है, न कि केवल अनुमान लगाने के लिए।

4. परिणाम: "अनुमान लगाने वालों" से "सोचने वालों" तक

उन्होंने मौजूदा ज्यामिति बेंचमार्क (AI के लिए मानक परीक्षण) पर इस नई पद्धति का परीक्षण किया।

  • पहले: रोबोट जटिल, बहु-चरणीय समस्याओं के साथ संघर्ष करते थे।
  • बाद में: इस "GeoCode" डेटासेट पर प्रशिक्षित रोबोटों ने काफी बेहतर प्रदर्शन किया। उन्होंने केवल उत्तर याद नहीं किए; उन्होंने डायग्राम को देखना, छिपी हुई संरचना को समझना और समस्या को तार्किक रूप से हल करना सीखा।

सारांश

लेखकों ने केवल AI को अधिक होमवर्क नहीं दिया; उन्होंने एक परफेक्ट, स्वयं-जांच करने वाली पाठ्यपुस्तक बनाई जहाँ प्रत्येक चित्र गणित से पूरी तरह मेल खाता है। फिर, उन्होंने टेस्ट बदल दिया: केवल उत्तर पूछने के बजाय, उन्होंने AI को चित्र बनाने के लिए कोड लिखने के लिए कहा।

इसने AI को अनुमान लगाने के बजाय वास्तव में "देखने" के लिए मजबूर किया, जिससे एक अंधे वास्तुकार एक कुशल इंजीनियर में बदल गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →