← नवीनतम पेपर
⚡ electrical engineering

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

यह शोधपत्र \textsc{ReasonSTL} का परिचय देता है, जो एक टूल-ऑगमेंटेड फ्रेमवर्क है जो प्राकृतिक भाषा की आवश्यकताओं को सिग्नल टेम्पोरल लॉजिक (STL) सूत्रों में सटीक और निजी रूप से अनुवादित करने के लिए प्रोसेस-रिवॉर्डेड लर्निंग के माध्यम से स्थानीय ओपन-सोर्स लैंग्वेज मॉडल्स को अनुकूलित करता है, जो मैनुअल स्पेसिफिकेशन और कमर्शियल एपीआई के लिए एक लागत प्रभावी विकल्प प्रदान करता है।

मूल लेखक: Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार या एक रोबोटिक आर्म को डिजाइन करने वाले इंजीनियर हैं। आपके पास इस बात का एक शानदार विचार है कि इसे कैसा व्यवहार करना चाहिए, लेकिन आप इसे केवल साधारण अंग्रेजी में ही वर्णित कर सकते हैं, जैसे: "यदि कार दीवार के बहुत करीब आती है, तो इसे दो सेकंड के भीतर रुक जाना चाहिए।"

समस्या यह है कि कंप्यूटर का "दिमाग" अंग्रेजी नहीं बोलता। यह एक सख्त, गणितीय भाषा बोलता है जिसे सिग्नल टेम्पोरल लॉजिक (Signal Temporal Logic - STL) कहा जाता है। यह भाषा एक बहुत ही सटीक रेसिपी की तरह है जो मशीन को ठीक से बताती है कि उसे क्या करना है, मिलीसेकंड और मिलीमीटर तक।

समस्या:
अब तक, आपकी अंग्रेजी वाक्य को इस सख्त गणितीय रेसिपी में बदलना एक बुरा सपना था।

  1. मैनुअल अनुवाद: आपको एक मानव विशेषज्ञ की आवश्यकता होती थी जो इसका अनुवाद करे। यह धीमा, महंगा और स्केल करने में कठिन था।
  2. AI से पूछना (एक "ब्लैक बॉक्स"): आप एक शक्तिशाली, व्यावसायिक AI (जैसे कि एक विशाल क्लाउड-आधारित चैटबॉट) से पूछ सकते थे। लेकिन यह जोखिम भरा है। आप अनजाने में अपनी कंपनी के गुप्त सुरक्षा नियमों को तीसरे पक्ष के सर्वर पर भेज सकते हैं। इसके अलावा, हर बार सवाल पूछने पर इसमें बहुत पैसा खर्च होता है।
  3. पुराने AI प्रयास: पिछले स्थानीय AI मॉडल ऐसे छात्रों की तरह थे जिन्होंने वर्णमाला तो याद कर ली लेकिन गणित नहीं सीखा। वे रेसिपी का अनुमान लगाते थे, लेकिन यदि वे एक संख्या भी गलत कर देते (जैसे "2 सेकंड" के बजाय "2.5 सेकंड" कहना), तो पूरी चीज़ विफल हो जाती।

समाधान: REASONSTL
लेखकों ने REASONSTL नामक एक नया सिस्टम बनाया है। इस प्रशिक्षु (apprentice) को एक स्थानीय, गोपनीयता-केंद्रित प्रशिक्षु के रूप में सोचें जिसके पास एक बहुत ही विशिष्ट कार्यप्रवाह (workflow) है। केवल उत्तर का अनुमान लगाने के बजाय, यह प्रशिक्षु एक सख्त तीन-चरणीय प्रक्रिया का पालन करता है:

  1. अनुवादक (Reasoning): प्रशिक्षु आपके अंग्रेजी वाक्य को पढ़ता है और उसे तोड़ता है। "ठीक है, 'बहुत करीब' का अर्थ है दूरी। 'दो सेकंड' को मिलीसेकंड में बदलने की आवश्यकता है।"
  2. कैलकुलेटर (Tool Use): गणित का अनुमान लगाने के बजाय, प्रशिक्षु एक कैलकुलेटर (एक "टूल") निकालता है। इसके पास इकाइयों को बदलने (फुट से मीटर), समय की गणना करने और गणित करने के लिए विशिष्ट उपकरण हैं। सही नंबर पाने के लिए इसे इन उपकरणों का उपयोग करना ही होगा
  3. वास्तुकार (Construction): एक बार नंबरों को सत्यापित कर लेने के बाद, प्रशिक्षु एक सख्त ब्लूप्रिंट (एक JSON ट्री स्ट्रक्चर) का उपयोग करके अंतिम गणितीय रेसिपी (STL फॉर्मूला) बनाता है ताकि कोई ब्रैकेट या भ्रमित करने वाले प्रतीक छूट न जाएं।

हमने प्रशिक्षु को कैसे सिखाया
उन्होंने प्रशिक्षु को केवल यह नहीं बताया कि "अच्छा काम किया" या "बुरा काम किया"। उन्होंने प्रोसेस-रिवॉर्डेड लर्निंग (Process-Rewarded Learning) नामक एक विशेष प्रशिक्षण पद्धति का उपयोग किया।

  • कल्पना कीजिए कि एक शिक्षक प्रशिक्षु के काम को देख रहा है। यदि प्रशिक्षु कैलकुलेटर का सही उपयोग करता है लेकिन फिर घर उल्टा बनाता है, तो शिक्षक कहता है, "गणित अच्छा है, निर्माण खराब है।"
  • यदि प्रशिक्षु कैलकुलेटर का उपयोग किए बिना गणित का अनुमान लगाने की कोशिश करता है, तो शिक्षक उसे तुरंत रोक देता है।
  • यह सुनिश्चित करता है कि प्रशिक्षु केवल उत्तरों को याद करने के बजाय, चरण-दर-चरण सोचने और सही उपकरणों का उपयोग करने के लिए सीखे।

नया परीक्षण: STL-BENCH
यह देखने के लिए कि क्या यह प्रशिक्षु वास्तव में अच्छा था, टीम ने STL-BENCH नामक एक नया, कठिन परीक्षण बनाया।

  • यह एक फाइनल एग्जाम की तरह है जिसमें वास्तविक दुनिया के परिदृश्य (जैसे एयरोस्पेस या रोबोटिक्स) शामिल हैं, न कि केवल मनगढ़ंत वाक्य।
  • यह द्विभाषी (अंग्रेजी और चीनी) है।
  • यह विशेष रूप से यह परीक्षण करता है कि क्या प्रशिक्षु "उबाऊ लेकिन महत्वपूर्ण" चीजों को संभाल सकता है: इकाइयों को बदलना, गणित करना और जटिल समय सीमाओं को समझना।

परिणाम
टीम ने अपने 4-बिलियन-पैरामीटर वाले मॉडल (एक "छोटा" लेकिन स्मार्ट स्थानीय मॉडल) का परीक्षण विशाल वाणिज्यिक AI मॉडल और अन्य तरीकों के विरुद्ध किया।

  • गोपनीयता और लागत: क्योंकि यह उनके अपने कंप्यूटरों पर स्थानीय रूप से चलता है, इसलिए इसे बार-बार चलाना मुफ्त है और यह सभी डेटा को निजी रखता है।
  • प्रदर्शन: आश्चर्यजनक रूप से, इस स्थानीय प्रशिक्षु ने सटीकता में विशाल वाणिज्यिक "ब्लैक बॉक्स" AI मॉडल को भी पीछे छोड़ दिया। यह गणित को सही करने और सही संरचना बनाने में बेहतर था।
  • मानवीय जांच: जब मनुष्यों ने परिणामों को देखा, तो स्थानीय मॉडल महंगे वाणिज्यिक मॉडलों जितना ही अच्छा था।

संक्षेप में
REASONSTL स्थानीय AI मॉडलों को मानव सुरक्षा नियमों को सख्त कंप्यूटर कोड में अनुवाद करने के लिए सिखाने का एक नया तरीका है। कैलकुलेटर और टूल्स का उपयोग करके अपना "काम दिखाने" के लिए AI को मजबूर करके, और इसे हर चरण में सावधान रहने के लिए प्रशिक्षित करके, उन्होंने एक ऐसा सिस्टम बनाया है जो निजी, सस्ता और आश्चर्यजनक रूप से सटीक है, जो बड़े क्लाउड कंपनियों को संवेदनशील डेटा भेजने के सुरक्षित विकल्प के रूप में काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →