← नवीनतम पेपर
🤖 machine learning

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench एक नवीन ढांचा है जो एक संरचित वर्गीकरण और बाधा-संचालित संश्लेषण का उपयोग करके योजना निर्माण डेटा के सृजन को स्थिर संग्रहों से एक नियंत्रणीय, स्केलेबल उत्पादन प्रक्रिया में बदल देता है, जिससे वर्तमान LLM की सीमाओं के कठोर मूल्यांकन और सामान्यीकरण योग्य योजना क्षमताओं को बढ़ाने के लिए प्रभावी सुदृढीकरण शिक्षण (reinforcement learning) प्रशिक्षण दोनों को सक्षम बनाया जा सके।

मूल लेखक: Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अनुभवहीन प्रशिक्षु (apprentice) को एक मास्टर शेफ बनने के लिए सिखाने की कोशिश कर रहे हैं। आप उन्हें एक एकल, निश्चित रेसिपी बुक दे सकते हैं (AI के परीक्षण का पुराना तरीका), लेकिन यह केवल आपको यह बताएगा कि क्या वे उस विशिष्ट पुस्तक का पालन कर सकते हैं। यह आपको यह नहीं बताएगा कि क्या वे सामग्री की अचानक कमी, टूवे ओवन, या किसी ऐसे ग्राहक को संभाल सकते हैं जो बीच में ही अपना ऑर्डर बदल देता है।

PlanningBench एक नया "किचन सिम्युलेटर" है जिसे लार्ज लैंग्वेज मॉडल्स (LLMs) को प्लानिंग (योजना बनाने) की जटिल कला पर टेस्ट करने और प्रशिक्षित करने के लिए डिज़ाइन किया गया है। केवल AI को समस्याओं की एक स्थिर सूची देने के बजाय, शोधकर्ताओं ने एक ऐसी मशीन बनाई है जो चलते-फिरते अनंत, अद्वितीय और सत्यापन योग्य (verifiable) प्लानिंग चुनौतियाँ उत्पन्न कर सकती है।

यहाँ पेपर का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "फिक्स्ड मेनू" की सीमा

इस पेपर से पहले, AI प्लानिंग का परीक्षण एक छात्र को 50 गणित की समस्याओं के एक निश्चित मेनू को देने जैसा था। यदि वे उन्हें सही हल कर लेते, तो वे पास हो जाते। लेकिन:

  • सीमित विविधता: मेनू में केवल 50 समस्याएँ थीं। एक बार जब छात्र ने उन्हें याद कर लिया, तो परीक्षण बेकार हो गया।
  • नकली कठिनाई: "कठिन" समस्याएँ केवल लंबी या अधिक संख्याओं वाली थीं, न कि अनिवार्य रूप से अधिक तार्किक रूप से जटिल।
  • कोई फीडबैक लूप नहीं: यदि छात्र गलत होता, तो परीक्षण आपको यह नहीं बताता कि वह क्यों गलत हुआ या अगली बार सीखने में उसकी मदद कैसे की जाए।

2. समाधान: "अनंत रेसिपी जनरेटर" (PlanningBench)

लेखकों ने PlanningBench नामक एक फ्रेमवर्क बनाया। इसे एक मास्टर शेफ (शोधकर्ताओं) के रूप में सोचें जिसने व्यंजनों की सूची के बजाय एक "कुकबुक ऑफ कंस्ट्रेंट्स" (प्रतिबंधों की पाक-पुस्तिका) लिखी है।

  • टैक्सोनॉमी (द कुकबुक): उन्होंने वास्तविक दुनिया के प्लानिंग कार्यों (जैसे मीटिंग शेड्यूल करना, शादी की योजना बनाना, या पावर ग्रिड का प्रबंधन करना) को 6 मुख्य श्रेणियों और 30 से अधिक विशिष्ट प्रकारों में व्यवस्थित किया।
  • कंस्ट्रेंट्स (सामग्री/Ingredients): उन्होंने नियमों को परिभाषित किया जैसे "टाइम विंडोज" (आप शाम 5 बजे से पहले डिनर नहीं बना सकते), "कैपेसिटी लिमिट्स" (ओवन में केवल 4 पिज्जा आ सकते हैं), और "डिपेंडेंसीज़" (आप भोजन खाने से पहले केक परोस नहीं सकते)।
  • जेनरेटर (द मशीन): यह मशीन एक "रेसिपी टाइप" (जैसे, "मीटिंग प्लानिंग") लेती है और उसमें अलग-अलग बाधाएं (जैसे, "रूम A खराब है," "CEO केवल मंगलवार को फ्री हैं") रैंडमली मिला देती है। यह हर बार एक अद्वितीय, स्व-निहित (self-contained) समस्या बनाता है।

3. "क्लोज्ड-लूप" किचन

यह सिस्टम केवल समस्याएँ नहीं फेंकता; यह गुणवत्ता सुनिश्चित करने के लिए तीन-सदस्यीय टीम चलाता है:

  1. जेनरेटर: एक नई, पेचीदा प्लानिंग समस्या बनाता है।
  2. रिस्पोंडर (द अप्रेंटिस): AI इसे हल करने की कोशिश करता है।
  3. क्रिटिक (द इंस्पेक्टर): एक विशेष AI एक सख्त "चेकलिस्ट" के विरुद्ध उत्तर की जाँच करता है।
    • क्या उन्होंने सही कमरा इस्तेमाल किया?
    • क्या उनका बजट खत्म हो गया?
    • क्या वे शाकाहारी विकल्प को भूल गए?

यदि रिस्पोंडर इसे बहुत आसानी से हल कर लेता है, तो क्रिटिक जेनरेटर को अगला और कठिन सवाल बनाने का संकेत देता है (जैसे, "एक फायर ड्रिल परिदृश्य जोड़ें")। यदि रिस्पोंडर विफल रहता है, तो सिस्टम समस्या को रखता है लेकिन नोट करता है कि AI कहाँ गलत हुआ। यह AI के कौशल स्तर के अनुसार अनुकूलित होने वाला एक डिफिकल्टी कर्व बनाता है।

4. "गोल्ड स्टैंडर्ड" नियम

इस पेपर में एक महत्वपूर्ण खोज डिटरमिनेट सॉल्यूशंस (निश्चित समाधानों) के बारे में है।

  • उपमा: कल्पना करें कि आप AI से "एक अच्छी कहानी लिखें" कह रहे हैं। इसे करने के लाखों तरीके हैं, और यह कहना कठिन है कि कौन सा "सर्वश्रेष्ठ" है।
  • समाधान: PlanningBench AI को एक स्पष्ट, इष्टतम (optimal) उत्तर वाली समस्याओं को हल करने के लिए मजबूर करता है (जैसे एक गणित की समस्या या एक विशिष्ट शेड्यूल)।
  • महत्व: पेपर ने पाया कि जब AI उन समस्याओं पर प्रशिक्षित होता है जिनमें एक ही "सही" उत्तर होता है, तो वह बेहतर सीखता है। यह एक धावक को एक ट्रैक पर प्रशिक्षित करने जैसा है जहाँ एक स्पष्ट फिनिश लाइन है, बजाय इसके कि उनसे "कहीं अच्छी जगह पर दौड़ने" के लिए कहा जाए। यह स्पष्टता AI को यह संकेत देती है कि उसे कैसे सुधार करना है।

5. परिणाम: परीक्षण और प्रशिक्षण

शोधकर्ताओं ने इस सिस्टम का दो तरह से उपयोग किया:

A. परीक्षा (इवैल्यूएशन)
उन्होंने इन उत्पन्न समस्याओं पर शीर्ष AI मॉडल्स (जैसे GPT-5.4 और अन्य) का परीक्षण किया।

  • परिणाम: यहाँ तक कि सबसे स्मार्ट मॉडल भी संघर्ष करते हैं। सबसे अच्छा मॉडल लगभग 63% समस्याओं को पूरी तरह से हल कर पाया।
  • अंतर्दृष्टि: AI स्थानीय नियमों (जैसे, "मैंने मीटिंग शेड्यूल की") को संतुष्ट करने में अच्छा है, लेकिन वैश्विक निरंतरता (जैसे, "लेकिन वह मीटिंग CEO की फ्लाइट के साथ ओवरलैप हो रही है") में बुरा है। सबसे बड़ी विफलता फॉर्मेटिंग नहीं थी; यह गणना संबंधी त्रुटियाँ (calculation errors) और प्रतिबंधों को भूल जाना (जैसे समय या पैसा खत्म होना) था।

B. ट्रेनिंग कैंप (रीइन्फोर्समेंट लर्निंग)
उन्होंने एक मॉडल लिया और उसे PlanningBench से सत्यापित डेटा का उपयोग करके प्रशिक्षित किया।

  • परिणाम: मॉडल ने न केवल उन विशिष्ट समस्याओं में सुधार किया जिन्हें उसने देखा था, बल्कि वह अनदेखे (unseen) प्लानिंग कार्यों (जैसे यात्रा की योजना बनाना) और यहाँ तक कि सामान्य निर्देश पालन कार्यों में भी बेहतर हो गया।
  • सबक: इन "सख्त, सत्यापन योग्य" प्लानिंग समस्याओं पर प्रशिक्षण ने AI को एक साथ कई नियमों को संभालने का तरीका सिखाया, एक ऐसा कौशल जो अन्य क्षेत्रों में भी काम आया।

सारांश

PlanningBench एक ऐसा उपकरण है जो प्लानिंग को "अंदाजे के खेल" से बदलकर एक "मापने योग्य विज्ञान" में बदल देता है।

  • यह फिक्स्ड टेस्ट बैंक से हटकर अनंत, जनरेटेड परिदृश्यों की ओर बढ़ता है।
  • यह एक क्लोज्ड-लूप सिस्टम (जेनरेटर -> सॉल्वर -> क्रिटिक) का उपयोग करता है ताकि समस्याएँ हल करने योग्य लेकिन चुनौतीपूर्ण हों।
  • यह सिद्ध करता है कि स्पष्ट, एकल-उत्तर लक्ष्य AI को योजना बनाने के लिए प्रशिक्षित करने का सबसे अच्छा तरीका हैं।
  • यह प्रकट करता है कि वर्तमान AI मॉडल अभी भी बाधाएं सख्त होने पर सभी चीजों को एक साथ संभालने में काफी खराब हैं, लेकिन वे सही प्रकार के प्रशिक्षण डेटा के साथ बेहतर होना सीख सकते हैं।

पेपर निष्कर्ष निकालता है कि AI को प्लानिंग में वास्तव में "स्मार्ट" बनाने के लिए, हमें ऐसे डेटा की आवश्यकता है जो स्केलेबल (अनंत रूप से बढ़ सके), विविध (कई वास्तविक दुनिया की स्थितियों को कवर करे), और सत्यापन योग्य (हम गणितीय रूप से सिद्ध कर सकें कि उत्तर सही है) हो। PlanningBench बिल्कुल यही प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →