HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
यह शोध पत्र HeuriGym को प्रस्तुत करता है, जो एक ओपन-सोर्स एजेंटिक बेंचमार्क है जो कॉम्बिनेटरियल ऑप्टिमाइज़ेशन समस्याओं के लिए पुनरावृत्ति रूप से ह्यूरिस्टिक एल्गोरिदम उत्पन्न करने और उन्हें परिष्कृत करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जो एक नवीन क्वालिटी-यील्ड इंडेक्स मीट्रिक के माध्यम से वर्तमान मॉडल्स के टूल उपयोग और अनुकूली तर्क (एडैप्टिव रीजनिंग) में महत्वपूर्ण सीमाओं को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास अविश्वसनीय रूप से बुद्धिमान, सुशिक्षित रोबोटों (लार्ज लैंग्वेज मॉडल्स, या LLMs) की एक टीम है जो निबंध लिखने, सामान्य ज्ञान के उत्तर देने और यहाँ तक कि बुनियादी कंप्यूटर कोड लिखने में माहिर हैं। आप यह जानना चाहते हैं कि क्या वे वास्तव में अपने दम पर कठिन, वास्तविक दुनिया की पहेलियों को हल कर सकते हैं, न कि केवल उन उत्तरों को दोहरा सकते हैं जो उन्होंने अपनी पाठ्यपुस्तकों से रटे हुए हैं।
यह पेपर एक नया "जिम" पेश करता है जिसे HeuriGym कहा जाता है ताकि उन्हें टेस्ट किया जा सके। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:
1. समस्या: "क्विज़ शो" बनाम "असली नौकरी"
वर्तमान AI परीक्षण एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) की तरह हैं।
- समस्या: यदि आप AI से गणित का वह सवाल पूछते हैं जो उसने अपने ट्रेनिंग डेटा में देखा है, तो वह A+ प्राप्त कर लेता है। लेकिन यदि आप उससे एक नए प्रकार का सवाल पूछते हैं, तो वह अक्सर ठप हो जाता है। यह उस छात्र की तरह है जिसने उत्तर कुंजी (answer key) तो रट ली है लेकिन उसे गणित समझ नहीं आता।
- पुराना तरीका: कुछ परीक्षण AI को ऐसा कोड लिखने के लिए कहते हैं जो एक विशिष्ट जांच (check) को पास कर सके। लेकिन ये अक्सर बहुत सरल होते हैं या इनमें केवल एक ही "सही" उत्तर होता है।
- नया तरीका (HeuriGym): एक क्विज़ के बजाय, HeuriGym एक जटिल निर्माण परियोजना (complex construction project) देने जैसा है जिसका कोई निर्देश मैनुअल नहीं है। लक्ष्य केवल एक टेस्ट पास करना नहीं है; बल्कि एक ऐसी मशीन बनाना है जो कुशलता से काम करे।
2. चुनौती: "कॉम्बिनेटोरियल ऑप्टिमाइज़ेशन" की पहेली
यह पेपर एक विशिष्ट प्रकार की कठिन समस्या पर ध्यान केंद्रित करता है जिसे कॉम्बिनेटोरियल ऑप्टिमाइज़ेशन (Combinatorial Optimization) कहा जाता है।
- उपमा: कल्पना कीजिए कि आप एक लॉजिस्टिक्स मैनेजर हैं जो 1,000 डिलीवरी ट्रकों का शेड्यूल बनाने की कोशिश कर रहे हैं। आपको हर ट्रक के लिए सही रूट तय करना है ताकि वे कम से कम ईंधन का उपयोग करें और समय पर पहुँचें।
- पेच: संभावित रूट इतने अधिक हैं कि वे ब्रह्मांड में मौजूद परमाणुओं की संख्या से भी अधिक हैं। आप उन सभी की जाँच नहीं कर सकते। आपको एक "ह्यूरिस्टिक" (heuristic) जीनियस होना होगा—जिसका अर्थ है कि आपको एक चतुर शॉर्टकट या "नियम का सूत्र" (rule of thumb) आविष्कार करना होगा ताकि एक अच्छा समाधान जल्दी से मिल सके, भले ही वह गणितीय रूप से पूर्ण न हो।
3. सेटअप: "एजेंटिक लूप" (The Agentic Loop)
HeuriGym केवल AI को एक बार कोड लिखने और उसे ग्रेड करने के लिए नहीं कहता। यह एक फीडबैक लूप सेट करता है, जो एक वीडियो गेम की तरह है जिसमें "रीस्पॉन" (respawn) की सुविधा होती है।
- प्रॉम्प्ट (The Prompt): AI को एक समस्या का विवरण मिलता है (जैसे, "इन इलेक्ट्रॉनिक सर्किटों को इस तरह शेड्यूल करें कि वे यथासंभव तेज़ चल सकें")।
- प्रयास (The Attempt): AI एक प्रोग्राम (एक ह्यूरिस्टिक) लिखता है ताकि समस्या को हल किया जा सके।
- वास्तविकता की जाँच (The Reality Check): सिस्टम उस कोड को चलाता है।
- क्या यह क्रैश हो गया? (सिंटैक्स एरर)
- क्या इसने नियमों का उल्लंघन किया? (कन्स्ट्रेंट वायलेशन)
- क्या यह बहुत धीमा रहा? (टाइमआउट)
- फीडबैक (The Feedback): सिस्टम AI को बताता है, "आपने एक ऐसी लाइब्रेरी का उपयोग करने की कोशिश की जो मौजूद नहीं है," या "आपका समाधान समय सीमा का उल्लंघन करता है।"
- पुनः प्रयास (The Retry): AI उस त्रुटि को पढ़ता है, उससे सीखता है, और गलती को ठीक करने के लिए कोड को फिर से लिखने का प्रयास करता है।
यह चक्र दोहराता रहता है, जिससे AI को त्रुटियों और सुधारों के माध्यम से यह "सीखने" की अनुमति मिलती है कि समस्या को कैसे हल किया जाए, ठीक वैसे ही जैसे एक मानव इंजीनियर करता है।
4. स्कोरकार्ड: "क्वालिटी-यील्ड इंडेक्स" (QYI)
आप उस रोबोट को कैसे ग्रेड करेंगे जो एक पहेली को हल करने का नया तरीका खोजने की कोशिश कर रहा है? लेखकों ने एक नया स्कोर बनाया है जिसे QYI कहा जाता है।
- यील्ड (Yield): क्या रोबोट वास्तव में बिना क्रैश हुए काम पूरा कर पाया? (क्या उसे एक काम करने वाला समाधान मिला?)
- क्वालिटी (Quality): एक मानव विशेषज्ञ की तुलना में समाधान कितना अच्छा था?
- स्कोर: 1.0 का स्कोर का मतलब है कि रोबोट ने बिल्कुल एक मानव विशेषज्ञ के समान प्रदर्शन किया। 0 का स्कोर मतलब है कि वह पूरी तरह विफल रहा।
5. परिणाम: "वास्तविकता की जाँच"
लेखकों ने उपलब्ध नौ सबसे स्मार्ट AI मॉडल्स (जैसे GPT-o4-mini और Gemini-2.5-Pro) का परीक्षण किया।
- फैसला: यहाँ तक कि सबसे "स्मार्ट" मॉडल्स का स्कोर लगभग 0.6 ही रहा।
- इसका क्या अर्थ है: सर्वश्रेष्ठ AI मॉडल इन कार्यों में मानव विशेषज्ञ की तुलना में केवल लगभग 60% प्रभावी हैं। वे अक्सर ऐसा कोड लिख सकते हैं जो चलता है, लेकिन उन्हें ऐसा कोड लिखने में संघर्ष करना पड़ता है जो कुशल हो या जो मानव-निर्मित समाधानों को मात देने के लिए पर्याप्त रचनात्मक हो।
- संघर्ष: मॉडल अक्सर लूप में फंस जाते थे, भ्रमित (hallucinate) होकर फर्जी कंप्यूटर लाइब्रेरी बना लेते थे, या जटिल बाधाओं (constraints) को समझने में विफल रहते थे। वे निर्देशों का पालन करने में अच्छे थे लेकिन एक नई रणनीति बनाने के लिए "आउट ऑफ द बॉक्स" सोचने में कमजोर थे।
6. यह क्यों महत्वपूर्ण है
पेपर का तर्क है कि हमें AI को सरल क्विज़ पर टेस्ट करना बंद करना चाहिए और उन्हें वास्तविक इंजीनियरिंग चुनौतियों पर टेस्ट करना शुरू करना चाहिए।
- लक्ष्य: AI विकास को ऐसे मॉडल्स की ओर धकेलना है जो वास्तव में तर्क कर सकें, अनुकूलित हो सकें और विज्ञान एवं इंजीनियरिंग के लिए नए समाधानों का आविष्कार कर सकें, न कि केवल पैटर्न को याद रख सकें।
- निष्कर्ष: हमने इस प्रगति को मापने के लिए एक शक्तिशाली उपकरण (HeuriGym) बनाया है। वर्तमान में, AI एक आशाजनक प्रशिक्षु (apprentice) है, लेकिन जटिल, वास्तविक दुनिया की अनुकूलन समस्याओं को हल करने के मामले में वह अभी तक एक कुशल शिल्पकार (master craftsman) नहीं बना है।
संक्षेप में: HeuriGym एक ऐसा जिम है जहाँ AI रोबोट असंभव पहेलियों को हल करने के लिए अपने स्वयं के उपकरण बनाने की कोशिश करते हैं। वे बेहतर हो रहे हैं, लेकिन वे अभी भी बहुत सारी गलतियाँ कर रहे हैं और अभी तक मानव विशेषज्ञ के स्तर तक नहीं पहुँचे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।