← नवीनतम पेपर
🤖 machine learning

Internalizing Geometric Law: Learning from Solver Residuals for Precision-Critical Generation

यह शोध पत्र PyGeoX, एक प्रोग्रामेबल ज्यामितीय DSL और बेंचमार्क पेश करता है, और ज्यामितीय संश्लेषण में "आउटलियर ग्रेडिएंट मास्किंग" विफलता मोड को दूर करने के लिए सैचुरेटिंग एडिटिव रिवार्ड्स (SAR) का प्रस्ताव करता है, जो एक 8B मॉडल को MSE-आधारित बेसलाइन से काफी बेहतर प्रदर्शन करने और परिशुद्धता-महत्वपूर्ण बाधा संतुप्ति कार्यों पर बड़े फ्रंटियर सिस्टम के साथ प्रतिस्पर्धा करने में सक्षम बनाता है।

मूल लेखक: Rafael Cabral, Pang Zixi, Ziyi Shou, Shen Xin

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rafael Cabral, Pang Zixi, Ziyi Shou, Shen Xin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेहद प्रतिभाशाली लेकिन थोड़े अनाड़ी कलाकार को पुल के ब्लूप्रिंट बनाना सिखा रहे हैं। वह कलाकार शब्दों में पुल का सुंदर वर्णन कर सकता है और उसे बनाने के लिए कोड भी लिख सकता है। हालाँकि, यदि कलाकार एक छोटी सी गलती कर देता है—जैसे कि एक सपोर्ट बीम को 1 मिलीमीटर छोटा बना देना—तो वास्तविक दुनिया में पूरा पुल ढह सकता है।

यह शोध पत्र एक आर्टिफिशियल इंटेलिजेंस (AI) को लिखित निर्देशों के आधार पर वृत्त (circles), रेखाओं (lines) और बहुभुजों (polygons) जैसे ज्यामितीय आकार बनाने में होने वाली उन छोटी, महत्वपूर्ण गलतियों को रोकने के लिए सिखाने के बारे में है।

इस खोज की कहानी यहाँ सरल रूप में दी गई है:

समस्या: "सब-या-कुछ-नहीं" का जाल (The "All-or-Nothing" Trap)

शोधकर्ताओं ने AI को एक मानक तरीके से सिखाने की कोशिश की: वे ड्राइंग की जाँच करते, और यदि सब कुछ एकदम सही होता, तो वे AI को एक 'गोल्ड स्टार' (पुरस्कार) देते। यदि एक भी छोटा हिस्सा गलत होता, तो वे उसे शून्य देते।

उन्होंने इस दृष्टिकोण में एक बड़ी खामी खोजी, जिसे वे "आउटलियर ग्रेडिएंट मास्किंग" (Outlier Gradient Masking) कहते हैं।

उपमा: कल्पना कीजिए कि आप 10 प्रश्नों की एक परीक्षा दे रहे हैं।

  • पुराना तरीका (ग्लोबल नॉर्म): यदि आप 9 प्रश्न सही करते हैं लेकिन 10वाँ प्रश्न गलत कर देते हैं, तो शिक्षक आपको 0 अंक देता है। क्योंकि स्कोर शून्य है, इसलिए शिक्षक आपको यह नहीं बताता कि आपने कौन से 9 प्रश्न सही किए थे। आप कुछ भी नहीं सीख पाते, और आपको पता ही नहीं चलता कि सुधार कैसे किया जाए।
  • वास्तविकता: जटिल ज्यामिति (geometry) में, सब कुछ तुरंत एकदम सटीक करना बहुत कठिन होता है। AI इसलिए फंस गया था क्योंकि वह 90% सही होने के बावजूद लगातार "शून्य" प्राप्त कर रहा था, जिससे वह अपनी आंशिक सफलताओं से कुछ भी नहीं सीख पा रहा था।

समाधान: "सैचुरेटिंग एडिटिव रिवॉर्ड" (SAR)

इसे ठीक करने के लिए, शोधकर्ताओं ने इनाम देने का एक नया तरीका विकसित किया, जिसे वे SAR कहते हैं।

उपमा: पूरे टेस्ट के लिए एक एकल स्कोर देने के बजाय, अब शिक्षक हर उस प्रश्न के लिए एक छोटा "धन्यवाद" देता है जो AI ने सही किया है, भले ही अन्य प्रश्न गलत हों।

  • यदि AI 10 में से 9 रेखाएं सही बनाता है, तो उसे 9 छोटे पुरस्कार मिलते हैं।
  • यह AI को प्रेरित रखता है और उसे स्पष्ट रूप से दिखाता है कि ड्राइंग के कौन से हिस्से सही काम कर रहे हैं और किन हिस्सों को सुधारने की आवश्यकता है।
  • उन्होंने पूरी ड्राइंग को एकदम सटीक बनाने के लिए एक "बोनस" भी जोड़ा, ताकि AI अभी भी गोल्ड स्टार पाने का लक्ष्य रखे, लेकिन छोटे कदमों के दौरान हतोत्साहित न हो।

नया टूल: PyGeoX

इसे संभव बनाने के लिए, टीम ने PyGeoX नामक एक नया "प्लेग्राउंड" बनाया।

  • PyGeoX को एक अत्यंत सख्त ज्यामिति शिक्षक के रूप में समझें जो एक विशेष कंप्यूटर भाषा बोलता है।
  • AI एक आकृति (जैसे वृत्त के अंदर एक पंचकोणीय/pentagon) बनाने के लिए एक प्रोग्राम लिखता है।
  • PyGeoX तुरंत उस ड्राइंग की जाँच करता है। वह केवल "अच्छा" या "बुरा" नहीं कहता। वह सटीक रूप से मापता है कि रेखाएं कितनी दूर या गलत हैं (जिन्हें "रेसिडुअल्स" कहा जाता है) और वह सटीक फीडबैक वापस AI को भेजता है।
  • महत्वपूर्ण बात यह है कि AI को गणित के लिए PyGeoX का उपयोग करने की अनुमति नहीं है। AI को खुद निर्देशांक (coordinates) खोजने होते हैं, जो उसे केवल एक फॉर्मूला कॉपी करने के बजाय वास्तव में ज्यामिति के नियमों को सीखने के लिए मजबूर करता है।

परिणाम

टीम ने इस नए तरीके का परीक्षण 8-बिलियन पैरामीटर वाले AI मॉडल (एक बहुत स्मार्ट मॉडल, लेकिन उपलब्ध सबसे बड़े मॉडल में से एक नहीं) पर किया।

  • पहले: AI कठिन ज्यामिति समस्याओं के साथ संघर्ष कर रहा था, अक्सर इसलिए विफल हो जाता था क्योंकि वह अपनी 'निकट-सफलता' (near-misses) से सीख नहीं पा रहा था।
  • बाद में: इस नए "SAR" ग्रेडिंग सिस्टम के साथ, AI कठिन समस्याओं को हल करने में 2.3 गुना बेहतर हो गया।
  • आश्चर्य: इस अपेक्षाकृत छोटे AI ने, जिसे इस नए तरीके से प्रशिक्षित किया गया था, उन बहुत बड़े और महंगे AI सिस्टम के बराबर या उनसे बेहतर प्रदर्शन किया जो बिना इस विशिष्ट प्रशिक्षण के केवल अनुमान लगा रहे थे।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र दिखाता है कि इंजीनियरिंग या डिज़ाइन में AI को सटीक होने के लिए सिखाने हेतु, आप केवल यह नहीं कह सकते कि "आप विफल रहे" जब वह 99% सही हो। आपको कहना होगा, "आपने इन 5 भागों को एकदम सही बनाया, और इन 2 भागों पर काम करने की आवश्यकता है।" फीडबैक को छोटे, प्रबंधनीय टुकड़ों में तोड़कर, AI ज्यामिति के नियमों को आत्मसात करना सीख जाता है और शून्य से सटीक, कार्यशील डिज़ाइन बना सकता है।

शोधकर्ताओं ने अपने टूल्स, टेस्ट समस्याएं और डेटा जारी कर दिया है ताकि अन्य लोग तकनीकी कार्यों के लिए बेहतर AI बनाने के लिए इस पद्धति का उपयोग कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →