GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language
यह शोधपत्र GeoBuildBench प्रस्तुत करता है, जो 489 चीनी ज्यामिति समस्याओं वाला एक नया बेंचमार्क है जो प्राकृतिक भाषा से ज्यामितीय आरेख बनाने के लिए निष्पादन योग्य डोमेन-विशिष्ट भाषा प्रोग्राम उत्पन्न करने की मल्टीमॉडल एजेंटों की क्षमता का मूल्यांकन करता है, जो उचित प्रारंभिक प्रदर्शन के बावजूद संरचनात्मक सटीकता और बाधा संतुष्टि में महत्वपूर्ण चुनौतियों को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को केवल बोले गए विवरण के आधार पर एक सटीक ज्यामितीय आकृति (geometric shape) बनाना सिखा रहे हैं, जैसे कि "एक ऐसा त्रिभुज बनाइए जहाँ एक भुजा दूसरी भुजा से दोगुनी लंबी हो, और ऊपर का कोण 90 डिग्री हो।"
वर्तमान में अधिकांश AI मॉडल उन छात्रों की तरह हैं जो बहुविकल्पीय (multiple-choice) परीक्षा में उत्तर का अनुमान लगाने में या किसी चित्र का वर्णन करने में बहुत अच्छे होते हैं। लेकिन यह शोध पत्र एक नई चुनौती पेश करता है जिसे GeoBuildBench कहा जाता है, जो यह परीक्षण करता है कि क्या एक AI वास्तव में चरण-दर-चरण ड्राइंग कर सकता है, सख्त नियमों का पालन कर सकता है, और अपनी गलतियों को सुधार सकता है जब ड्राइंग गलत दिखती है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:
1. समस्या: "जादुई ट्रिक" बनाम "ब्लूप्रिंट"
पहले, शोधकर्ता AI मॉडलों से एक ज्यामिति (geometry) की समस्या और एक चित्र देखते हुए पूछते थे, और फिर बस कहते थे, "उत्तर 45 डिग्री है।" AI पैटर्न को पहचानकर या टेक्स्ट या इमेज को देखकर सही नंबर का अनुमान लगा सकता था, भले ही उसे वास्तव में यह समझ न आया हो कि वह आकृति कैसे बनाई गई थी।
GeoBuildBench खेल बदल देता है। केवल उत्तर पूछने के बजाय, यह AI को एक वास्तुकार (architect) की तरह कार्य करने के लिए कहता है।
- कार्य: AI को शून्य से आकृति बनाने के लिए एक कंप्यूटर प्रोग्राम (निर्देशों का एक सेट) लिखना होगा।
- चुनौती: AI केवल यह नहीं कह सकता कि आकृति मौजूद है। उसे एक विशेष, सीमित शब्दावली (एक "डोमेन-स्पेसिफिक लैंग्वेज" या DSL) का उपयोग करके इसे भौतिक रूप से निर्मित करना होगा।
- उपमा: कल्पना कीजिए कि आप "लेगो" (Lego) का खेल खेल रहे हैं जहाँ आप केवल यह नहीं कह सकते, "एक टावर बनाओ।" आपको विशिष्ट कमांड देने होंगे: "यहाँ एक लाल ईंट रखें, फिर उसके ऊपर एक नीली ईंट रखें।" यदि आप हवा में ईंट रखने की कोशिश करते हैं, तो गेम इंजन कहता है, "त्रुटि! वह ईंट अभी अस्तित्व में नहीं है।"
2. वातावरण: "सख्त शिक्षक"
शोधकर्ताओं ने एक डिजिटल प्लेग्राउंड बनाया है जहाँ AI इन आकृतियों को बनाने की कोशिश करता है।
- लूप (The Loop): AI निर्देशों का एक सेट लिखता है -> कंप्यूटर इसे बनाने की कोशिश करता है -> कंप्यूटर जाँचता है कि क्या आकृति वैध है।
- फीडबैक: यदि AI एक ऐसी रेखा खींचने की कोशिश करता है जो किसी चीज़ से नहीं जुड़ती, या यदि वह उस वृत्त (circle) को बनाना भूल जाता है जो आवश्यक था, तो कंप्यूटर तुरंत कहता है, "आप एक वृत्त बनाना भूल गए!" या "आपने दो ऐसी समानांतर रेखाओं को जोड़ने की कोशिश की जो कभी नहीं मिलेंगी!"
- लक्ष्य: AI को तब तक प्रयास करते रहना होगा, फीडबैक को पढ़ना होगा और अपने निर्देशों को फिर से लिखना होगा जब तक कि आकृति एकदम सटीक न हो जाए।
3. डेटासेट: 489 "पाठ्यपुस्तक" पहेलियाँ
टीम ने चीनी गणित की पाठ्यपुस्तकों से ली गई 489 ज्यामिति समस्याओं के साथ एक बेंचमार्क बनाया।
- फ़िल्टर: उन्होंने बहुत सावधानी से उन समस्याओं को हटा दिया जो समझने के लिए चित्र पर निर्भर थीं (जैसे, "चित्र 1 में दिखाए अनुसार, कोण A है...")। वे केवल उन्हीं समस्याओं को रखे जहाँ केवल टेक्स्ट ही आकृति बनाने के लिए पर्याप्त जानकारी प्रदान करता था।
- विविधता: समस्याएँ "बहुत आसान" (स्तर 1) से लेकर "कठिन" (स्तर 4) तक हैं, जिनमें त्रिभुज, वृत्त और जटिल कोण शामिल हैं।
4. परिणाम: AI के "भ्रम" (Hallucinations)
शोधकर्ताओं ने इस वातावरण में कई शीर्ष-स्तरीय AI मॉडलों (जैसे GPT-5.1, Gemini और अन्य) का परीक्षण किया। यहाँ उन्हें क्या मिला:
- अच्छी खबर: सबसे स्मार्ट मॉडल (GPT-5.1 और Gemini) लगभग 75-79% समस्याओं को सही कर पाए। वे अक्सर सही आकृति बना सकते थे।
- बुरी खबर: सबसे अच्छे मॉडल भी संरचनात्मक भ्रम (structural hallucinations) के साथ संघर्ष करते हैं।
- यहाँ भ्रम का क्या अर्थ है? यह तब होता है जब AI एक निर्देश लिखता है जैसे "बिंदु X और बिंदु Y को जोड़ने वाली एक रेखा खींचें," लेकिन उसने निर्देशों में पहले कभी बिंदु X या बिंदु Y को वास्तव में बनाया ही नहीं। यह एक शेफ की तरह है जो कहता है, "सीक्रेट सॉस डालें," बिना यह बताए कि उसने सॉस बनाया भी है या नहीं।
- "अनपरिभाषित संदर्भ" (Undefined Reference) की समस्या: सबसे आम त्रुटि उन वस्तुओं का संदर्भ देना था जो अभी तक अस्तित्व में नहीं थे। AI यह ट्रैक करना भूल गया कि वह पहले क्या बना चुका है।
- सुधार की समस्या: जब कंप्यूटर ने AI को बताया, "आपने एक गलती की है," तो स्मार्ट मॉडल इसे जल्दी ठीक कर सकते थे (आमतौर पर 1 या 2 प्रयासों में)। कमजोर मॉडल बार-बार वही गलती करते रहे, फीडबैक से सीखने में असमर्थ रहे।
5. "विज़न" का आश्चर्य
शोधकर्ताओं ने परीक्षण किया कि क्या होता है यदि वे AI को उस आकृति की एक तस्वीर देते हैं जिसे वह वर्तमान में बना रहा है (विजुअल फीडबैक)।
- परिणाम: यह मिला-जुला रहा। कुछ मॉडलों के लिए, तस्वीर देखने से उन्हें बेहतर विचार बनाने में मदद मिली, लेकिन इसने उन्हें इस बात को लेकर भी भ्रमित किया कि उनके पास पहले से कौन से विशिष्ट बिंदु मौजूद थे। यह एक चित्रकार को दर्पण देने जैसा है: वे अपनी गलती देख सकते हैं, लेकिन वे विचलित भी हो सकते हैं और यह भूल सकते हैं कि वे कौन सा ब्रश पकड़े हुए हैं।
6. निष्कर्ष: "तर्कसंगत" होना "सही" होने के बराबर नहीं है
मुख्य निष्कर्ष यह है कि सही दिखना, सही होने के समान नहीं है।
- एक AI ऐसी तस्वीर बना सकता है जो मानवीय दृष्टि के लिए एक त्रिभुज की तरह दिखती है, लेकिन यदि कंप्यूटर गणित की जाँच करता है, तो रेखाएँ वास्तव में नहीं मिल सकतीं, या कोण गलत हो सकते हैं।
- GeoBuildBench सिद्ध करता है कि हालांकि AI ज्यामिति के बारे में बात करने में अच्छा हो रहा है, लेकिन वह अभी भी ज्यामिति को कठोर, चरण-दर-चरण, त्रुटि-मुक्त तरीके से करने के लिए संघर्ष कर रहा है। यह "उत्तर का अनुमान लगाने" और "सत्य के निर्माण" के बीच के अंतर को उजागर करता है।
संक्षेप में: इस शोध पत्र ने AI की ज्यामिति कौशल के लिए एक कठोर "ड्राइविंग टेस्ट" बनाया। इसने पाया कि हालांकि कुछ AI ड्राइवर गंतव्य तक पहुँच सकते हैं, लेकिन कई अभी भी गलत मोड़ ले रहे हैं, अपने शीशों को देखना भूल रहे हैं, और कभी-कभी दीवारों में टकरा रहे हैं, भले ही वे ऐसे दिखते हों जैसे उन्हें पता है कि वे कहाँ जा रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।