← नवीनतम पेपर
🤖 AI

Strategy-Aware Optimization Modeling with Reasoning LLMs

यह शोध पत्र SAGE को प्रस्तुत करता है, जो एक स्ट्रैटेजी-अवेयर फ्रेमवर्क है जो डेटा निर्माण और सुपरवाइज्ड फाइन-ट्यूनिंग एवं सेगमेंट-वेटेड GRPO के माध्यम से पोस्ट-ट्रेनिंग में मॉडलिंग रणनीतियों को स्पष्ट रूप से शामिल करता है, जिससे आठ बेंचमार्क में ऑटोमेटेड ऑप्टिमाइज़ेशन मॉडलिंग के दौरान लार्ज लैंग्वेज मॉडल्स की सटीकता, विविधता और सॉल्वर दक्षता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Ruiqing Zhao, Fengzhi Li, Yuan Zuo, Rui Liu, Yansong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiqing Zhao, Fengzhi Li, Yuan Zuo, Rui Liu, Yansong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Strategy-Aware Optimization Modeling with Reasoning LLMs" (SAGE) शोध पत्र की व्याख्या है, जिसे रोजमर्रा की भाषा में उपमाओं (analogies) का उपयोग करके अनुवादित किया गया है।

बड़ी समस्या: "अंधा वास्तुकार" (The Blind Architect)

कल्पना कीजिए कि आप एक नया सबवे सिस्टम बनाने की कोशिश कर रहे एक शहर के योजनाकार (city planner) हैं। आपके पास आवश्यकताओं की एक सूची है: "स्टेशन A को स्टेशन B से जोड़ें," "1 बिलियन डॉलर से अधिक खर्च न करें," और "सुनिश्चित करें कि ट्रेनें आपस में न टकराएं।"

आप एक बहुत ही बुद्धिमान, विद्वान AI वास्तुकार (एक Large Language Model) को ब्लूप्रिंट तैयार करने के लिए काम पर रखते हैं। AI भाषा में बहुत अच्छा है; वह आपके अनुरोध को पूरी तरह समझता है। हालाँकि, जब वह ड्राइंग बनाना शुरू करता है, तो वह एक गंभीर गलती करता है: वह पहले कोई "रणनीति" (strategy) नहीं चुनता है।

यह तय करने के बजाय कि, "ठीक है, मैं एक 'फ्लो-बेस्ड' (Flow-Based) रणनीति का उपयोग करूँगा जहाँ ट्रेनें केवल मौजूदा पटरियों पर चलेंगी," AI बस हर संभावित स्टेशन के जोड़े के बीच रेखाएं खींचना शुरू कर देता है, जिसमें वे भी शामिल हैं जो अस्तित्व में ही नहीं हैं (जैसे स्टेशन A से स्टेशन A तक एक सुरंग)।

जब निर्माण दल (Solver) इसे बनाने की कोशिश करता है, तो वे एक दीवार से टकरा जाते है। ब्लूप्रिंट व्याकरण के मामले में "वैध" है, लेकिन भौतिक रूप से इसे बनाना असंभव है। AI ने शब्दों को सही पकड़ा, लेकिन तर्क (logic) गलत कर दिया क्योंकि उसने किसी उच्च-स्तरीय योजना के प्रति प्रतिबद्धता नहीं जताई।

समाधान: SAGE (The "Strategic Architect")

इस शोध पत्र के लेखकों ने SAGE (Strategy-Aware Guided rEasoning) नामक एक नई प्रणाली बनाई है। SAGE को केवल एक लेखक के रूप में नहीं, बल्कि एक ऐसे वास्तुकार के रूप में सोचें जिसे ड्राइंग शुरू करने से पहले सोचने के लिए मजबूर किया जाता है।

SAGE दो मुख्य तरीकों से AI को ये मॉडल बनाना सिखाता है:

1. "रणनीति मेनू" (डेटा निर्माण - Data Construction)

अतीत में, AI मॉडल को उन उदाहरणों पर प्रशिक्षित किया जाता था जो केवल अंतिम ब्लूप्रिंट दिखाते थे। उन्होंने कभी वास्तुकार की विचार प्रक्रिया को नहीं देखा।

  • SAGE क्या करता है: यह एक विशेष प्रशिक्षण डेटासेट बनाता है जहाँ, प्रत्येक समस्या के लिए, AI को उसे हल करने के कई अलग-अलग तरीके दिखाए जाते हैं।
  • उपमा: कल्पना कीजिए कि आप एक छात्र को केक बनाना सिखा रहे हैं। केवल एक तैयार केक दिखाने के बजाय, आप उन्हें तीन अलग-अलग तरीके दिखाते हैं: "स्पंज विधि," "मफिन विधि," और "लेयर केक विधि।" फिर आप उन्हें दिखाते हैं कि विशिष्ट सामग्रियों के लिए कौन सी विधि वास्तव में सबसे अच्छी रही।
  • परिणाम: AI सीख जाता है कि कोड की एक भी लाइन लिखने से पहले, उसे एक "पैराडाइम" (जैसे फ्लो-बेस्ड या असाइनमेंट-बेस्ड) चुनना होगा। यह बिना सोचे-समझे गैर-मौजूद स्टेशनों के बीच रेखाएं खींचने से रोकता है।

2. "कठोर कोच" (सॉल्वर फीडबैक के साथ प्रशिक्षण - Training with Solver Feedback)

एक बार जब AI सीखना शुरू कर देता है, तो उसे एक ऐसे कोच की आवश्यकता होती है जो केवल "अच्छा काम किया" या "बुरा काम किया" न कहे। उसे एक ऐसे कोच की आवश्यकता है जो समझ सके कि काम अच्छा या बुरा क्यों था।

  • पुराना तरीका: कोच केवल अंतिम उत्तर को देखता था। यदि केक का स्वाद अच्छा था, तो कोच खुश था, भले ही बेकर ने एक खतरनाक या अक्षम तरीका अपनाया हो।
  • SAGE का तरीका: कोच (द सॉल्वर) वास्तव में केक को "पकाने" की कोशिश करता है।
    • क्या यह काम कर गया? (Correctness/शुद्धता)
    • क्या इसने रेसिपी फॉर्मेट का पालन किया? (Format/प्रारूप)
    • इसे पकाने में कितनी तेजी लगी? (Efficiency/दक्षता)
  • "सेगमेंट-वेटेड" (Segment-Weighted) ट्रिक: यही असली जादू है। एक लंबी रेसिपी में, पहला कदम (विधि चुनना) आखिरी कदम (नमक का एक चुटकी डालना) की तुलना में बहुत अधिक महत्वपूर्ण है। SAGE एक विशेष स्कोरिंग सिस्टम का उपयोग करता है जो AI को तब अतिरिक्त अंक देता है जब वह रणनीति को सही करता है, और केवल छोटी बारीकियों को सही करने के लिए कम अंक देता है। यह AI को सिखाता है कि टाइपिंग से ज्यादा महत्वपूर्ण योजना बनाना है।

उन्होंने क्या पाया?

शोधकर्ताओं ने आठ अलग-अलग "परीक्षा बोर्डों" (बेंचमार्क) पर SAGE का परीक्षण किया, जो सरल गणित समस्याओं से लेकर जटिल वास्तविक दुनिया के लॉजिस्टिक्स (जैसे सामान भेजना या उड़ानों का शेड्यूलिंग) तक विस्तृत हैं।

  • बेहतर सटीकता: SAGE ने पहली कोशिश में लगभग 80% बार समस्याओं को सही ढंग से हल किया, जो पिछले सर्वश्रेष्ठ ओपन-सोर्स मॉडल्स (जो लगभग 72% थे) को पीछे छोड़ देता है।
  • अधिक रचनात्मक समाधान: जब इसे कई बार प्रयास करने की अनुमति दी गई (जैसे एक छात्र द्वारा टेस्ट देने के कई मौके), तो SAGE ने बार-बार एक ही उत्तर नहीं दिया। इसने एक ही समस्या को सही ढंग से हल करने के अधिक विभिन्न तरीके खोजे। यह एक ऐसे शेफ की तरह था जो स्टोव, माइक्रोवेव या ग्रिल का उपयोग करके एक स्वादिष्ट भोजन बना सकता है, न कि केवल एक ही तरीके से।
  • तेज़ निष्पादन (Faster Execution): यह एक बड़ी बात है। SAGE द्वारा बनाए गए मॉडल केवल काम ही नहीं करते थे; वे तेजी से भी काम करते थे। इसके द्वारा बनाए गए "ब्लूप्रिंट" में अनावश्यक रेखाएं और बाधाएं कम थीं।
    • उपमा: यदि एक मानक AI 100 सुरंगों के साथ सबवे मैप बनाता है (जिनमें से कई बेकार हैं), तो SAGE एक ऐसा मैप बनाता है जिसमें 86 सुरंगें हैं जो उतना ही अच्छा काम करती हैं लेकिन उन्हें बनाना बहुत सस्ता और तेज़ है।

निचोड़ (The Bottom Line)

यह शोध पत्र तर्क देता है कि जटिल योजना (जैसे लॉजिस्टिक्स, वित्त या विनिर्माण) के लिए AI को वास्तव में उपयोगी होने के लिए, इसे केवल एक "शब्द भविष्यवक्ता" (word predictor) नहीं होना चाहिए। इसे एक रणनीतिक विचारक होना चाहिए।

AI को स्पष्ट रूप से अपनी रणनीति बताने के लिए मजबूर करके ("मैं एक फ्लो-बेस्ड दृष्टिकोण का उपयोग करने जा रहा हूँ") और इसे उन रणनीतियों के लिए पुरस्कृत करके जो न केवल सही हैं बल्कि कुशल भी हैं, SAGE ऐसे मॉडल बनाता है जो स्मार्ट, तेज़ और वास्तविक दुनिया की समस्याओं को हल करते समय कंप्यूटर को क्रैश करने की कम संभावना वाले होते हैं।

संक्षेप में: SAGE AI को गाड़ी चलाने से पहले रास्ता प्लान करना सिखाता है, यह सुनिश्चित करता है कि वह केवल इसलिए खाई में न गिर जाए क्योंकि वह सड़क के संकेतों की भाषा जानता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →