← नवीनतम पेपर
🤖 AI

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

यह शोध पत्र OPT-BENCH प्रस्तुत करता है, जो एक व्यापक ढांचा है जो एनपी-हार्ड (NP-hard) अनुकूलन समस्याओं पर लार्ज लैंग्वेज मॉडल्स को प्रशिक्षित करने के लिए गुणवत्ता-जागरूक 'रिनफोर्समेंट लर्निंग विद वरीफिएबल रिवॉर्ड्स' (RLVR) का उपयोग करता है, जो मौजूदा मॉडलों और बाइनरी रिवॉर्ड दृष्टिकोणों की तुलना में समाधान की गुणवत्ता और विविध तर्क कार्यों में सामान्यीकरण में महत्वपूर्ण सुधार प्रदर्शित करता है।

मूल लेखक: Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो "क्या यह गणित की समस्या सही ढंग से हल की गई है?" या "क्या मैंने इस शब्द की वर्तनी सही लिखी है?" जैसे सवालों के जवाब देने में माहिर है। लंबे समय से, हमने इन रोबोटों को इस तरह प्रशिक्षित किया है कि यदि उत्तर सही है तो "अच्छा काम किया!" और यदि गलत है तो "फिर से प्रयास करें।" यह एक बहुविकल्पीय परीक्षा (multiple-choice test) को ग्रेड करने जैसा है जहाँ केवल एक ही सही उत्तर होता है।

लेकिन क्या होगा अगर कार्य केवल उत्तर को सही पाने के बारे में नहीं, बल्कि उत्तर को सर्वश्रेष्ठ बनाने के बारे में हो?

यही वह समस्या है जिसे FORGE पेपर हल करता है। यह ऐसा है जैसे रोबोट को केवल किराने की दुकान तक पहुँचने का एक रास्ता खोजने के लिए नहीं, बल्कि सबसे छोटा और सबसे तेज़ रास्ता खोजने के लिए कहना, भले ही लाखों अन्य वैध मार्ग हों जो अधिक समय लेते हों।

यहाँ इसका एक सरल विवरण दिया गया है कि उन्होंने इसे कैसे किया:

1. समस्या: "ठीक-ठाक" बनाम "सर्वश्रेष्ठ"

कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं।

  • पुराना तरीका (बाइनरी रिवॉर्ड्स): आप रोबोट को पैक करने के लिए कहते हैं। यदि वह सब कुछ बैग में फिट कर देता है, तो आप कहते हैं "सफलता!" यदि सामान बाहर गिरता है, तो आप कहते हैं "विफलता।" रोबलेट केवल चीजों को फिट करना सीख जाता है, भले ही वह आधा सूटकेस खाली छोड़ दे या नाजुक चीजों के ऊपर भारी चीजें रख दे।
  • FORGE का तरीका (क्वालिटी-अवेयर रिवॉर्ड्स): आप रोबोट को बताते हैं, "सफलता अच्छी है, लेकिन यदि आप उसी स्थान में अधिक सामान फिट कर सकते हैं, या इसे इस तरह व्यवस्थित कर सकते हैं कि यह हल्का रहे, तो आपको बड़ा इनाम मिलेगा।" रोबोट तब तक बेहतर करने की कोशिश करना सीखता है जब तक कि वह एकदम सटीक न हो जाए।

यह पेपर तर्क देता है कि वर्तमान AI मॉडल "वैध" समाधान (जैसे एक मार्ग जो काम करता है) खोजने में अच्छे हैं, लेकिन "इष्टतम" (optimal) समाधान (जैसे सबसे अच्छा मार्ग) खोजने में खराब हैं। यह वास्तविक दुनिया की समस्याओं जैसे लॉजिस्टिक्स, शेड्यूलिंग और नेटवर्क डिज़ाइन के लिए एक बड़ी बात है, जिन्हें NP-hard समस्याएं कहा जाता है (ऐसे गणितीय प्रश्न जिन्हें पूरी तरह से हल करना अविश्वसनीय रूप से कठिन है)।

2. समाधान: "फोर्ज" फैक्ट्री

लेखकों ने इन रोबोटों को बेहतर ऑप्टिमाइज़र बनने के लिए प्रशिक्षित करने हेतु एक फैक्ट्री बनाई जिसे FORGE-ENGINE कहा जाता है। इसे AI के मस्तिष्क के लिए एक जिम की तरह समझें, लेकिन यहाँ वजन उठाने के बजाय, यह जटिल पहेलियाँ सुलझा रहा है।

इस फैक्ट्री में तीन मुख्य मशीनें हैं:

  • जेनरेटर (Generator): यह मशीन लाखों अभ्यास पहेलियाँ बनाती है। यह उन्हें आसान (जैसे 5-टुकड़ों वाली पहेली), मध्यम, या कठिन (जैसे 1,000-टुकड़ों वाली पहेली) बना सकती है।
  • वैलिडेटर (Validator): यह एक सख्त रेफरी है। यह जाँचता है कि क्या रोबोट का समाधान वास्तव में नियमों का पालन करता है (जैसे, "क्या आपने हर शहर की ठीक एक बार यात्रा की?")।
  • ह्यूरिस्टिक सॉल्वर (Heuristic Solver - असली जादू): यह सबसे महत्वपूर्ण हिस्सा है। यह एक बहुत तेज़, पारंपरिक कंप्यूटर प्रोग्राम है जो पहेली को लगभग पूरी तरह से हल करता है। यह एक "गोल्ड स्टैंडर्ड" या कोच के रूप में कार्य करता है।
    • उपमा: कल्पना कीजिए कि रोबोट एक परीक्षा देने वाला छात्र है। वैलिडेटर यह जाँचता है कि क्या उत्तर सही ढंग से लिखा गया है। ह्यूरिस्टिक सॉल्वर वह शिक्षक है जिसके पास उत्तर कुंजी (answer key) है। यदि रोबोट को 80% अंक मिलते हैं, तो शिक्षक केवल "गलत" नहीं कहता। शिक्षक कहता है, "आपको 80% मिले हैं। 90% तक पहुँचने का प्रयास करें।" यह रोबोट को एक साधारण "पास/फेल" के बजाय एक निरंतर स्कोर (continuous score) देता है।

3. प्रशिक्षण पद्धति: "पहाड़ पर चढ़ना"

आप एक रोबोट को सीधे 1,000-टुकड़ों वाली पहेली में नहीं डाल सकते; वह भ्रमित हो जाएगा और हार मान लेगा। इसलिए, यह पेपर एक कैरिकुलम लर्निंग (Curriculum Learning) रणनीति का उपयोग करता है:

  • आसान चरण: रोबोट नियमों को सीखने के लिए छोटी, सरल पहेलियाँ हल करता है।
  • मध्यम चरण: पहेलियाँ बड़ी होती जाती हैं। रोबोट आगे की योजना बनाना सीखता है।
  • कठिन चरण: रोबोट विशाल, जटिल पहेलियों का सामना करता है।
  • रिप्ले ट्रिक (The Replay Trick): लेखकों ने देखा कि यदि आप केवल आगे बढ़ते हैं (आसान → कठिन), तो रोबोट आसान चीजों को करना भूल जाता है। इसलिए, उन्होंने रोबोट को समय-समय पर आसान और मध्यम स्तरों को दोबारा (replay) करने के लिए बनाया। यह कठिन चीजों को सीखते समय उसके कौशल को भी तेज रखता है।

4. परिणाम: एक स्मार्ट मस्तिष्क

उन्होंने अपने नए रोबोट (जिसे FORGE नाम दिया गया है) का परीक्षण 10 अलग-अलग प्रकार की कठिन पहेलियों (जैसे डिलीवरी ट्रक के लिए सबसे छोटा रास्ता तय करना या बिना किसी टकराव के मीटिंग शेड्यूल करना) पर किया।

  • स्कोर: रोबोट ने केवल एक समाधान नहीं निकाला; उसने बेहतरीन समाधान निकाले। इसने प्रसिद्ध GPT-4o मॉडल को बड़े अंतर से पीछे छोड़ दिया। जहाँ GPT-4o लगभग 62% समय वैध समाधान ढूंढ पाता था, वहीं FORGE 93% समय उन्हें ढूंढ लेता था। इससे भी महत्वपूर्ण बात यह है कि FORGE के समाधान "परफेक्ट" उत्तर के बहुत करीब थे।
  • बोनस प्रभाव: यहाँ सबसे दिलचस्प बात है। जब उन्होंने इस रोबोट को इन कठिन ऑप्टिमाइज़ेशन पहेलियों पर प्रशिक्षित किया, तो वह केवल इन पहेलियों में ही बेहतर नहीं हुआ। वह बाकी सब चीज़ों में भी बेहतर हो गया।
    • वह गणित में बेहतर हो गया।
    • वह तर्क (logic) में बेहतर हो गया।
    • वह निर्देशों का पालन करने में बेहतर हो गया।
    • उपमा: यह एक शतरंज खिलाड़ी को ग्रैंडमास्टर बनाने के लिए प्रशिक्षित करने जैसा है। इस प्रक्रिया में, वे न केवल शतरंज में बेहतर होते हैं; वे अपने दैनिक जीवन में रणनीति, धैर्य और योजना बनाने में भी बेहतर हो जाते हैं। यह पेपर सुझाव देता है कि "ऑप्टिमाइज़" (सर्वश्रेष्ठ समाधान खोजना) सीखना AI को गहराई से सोचने और अपने उत्तरों को परिष्कृत करने का एक सामान्य कौशल सिखाता है, जो इसे सभी कार्यों में मदद करता है।

सारांश

यह पेपर FORGE नामक एक नए तरीके को पेश करता है जिससे AI को प्रशिक्षित किया जाता है। केवल AI को "सही" उत्तर प्राप्त करने के लिए सिखाने के बजाय, वे इसे यह सिखाते हैं कि अपने समाधान की गुणवत्ता पर निरंतर स्कोर देकर सर्वश्रेष्ठ संभव उत्तर कैसे खोजा जाए। यह AI को एक मास्टर ऑप्टिमाइज़र में बदल देता है जो न केवल कठिन गणितीय पहेलियों को वर्तमान शीर्ष मॉडलों से बेहतर हल करता है, बल्कि सामान्य तर्क, लॉजिक और निर्देशों का पालन करने में भी अधिक स्मार्ट बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →