← नवीनतम पेपर
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

यह शोध पत्र Deco-G को प्रस्तुत करता है, जो एक ऐसा डिकोडिंग फ्रेमवर्क है जो एक समर्पित फॉर्मेट एस्टीमेशन मॉड्यूल के माध्यम से समस्या-समाधान को कठोर फॉर्मेटिंग आवश्यकताओं से अलग करके जटिल कार्यों पर लार्ज लैंग्वेज मॉडल के प्रदर्शन में सुधार करता है, जो तर्क करने में बाधा डाले बिना अनुपालन सुनिश्चित करता है।

मूल लेखक: Haikang Deng, Po-Nien Kung, Nanyun Peng

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haikang Deng, Po-Nien Kung, Nanyun Peng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट से एक कठिन गणितीय समस्या हल करने के लिए कह रहे हैं, लेकिन आप यह भी मांग करते हैं कि वह अपना उत्तर एक बहुत ही विशिष्ट, कठोर प्रारूप (format) में लिखे, जैसे कि "अंतिम उत्तर 42 है।" आमतौर पर, जब आप "कड़ी मेहनत करने" वाले हिस्से को "परफेक्ट लिखने" वाले हिस्से के साथ एक बड़े निर्देश में मिला देते हैं, तो रोबोट भ्रमित हो जाता है। यह कुछ ऐसा है जैसे रस्सी पर चलते हुए करतब दिखाना (juggling); अक्सर वह गेंद गिरा देता है (गणित) या रस्सी से लड़खड़ा जाता है (प्रारूप)।

हाइकैंग डेंग और सहयोगियों का एक शोध पत्र एक नया सिस्टम पेश करता है जिसे DECO-G कहा जाता है ताकि इसे ठीक किया जा सके। DECO-G को दो विशेषज्ञों की एक शानदार टीम-अप के रूप में समझें: एक समस्या समाधानकर्ता (Problem Solver) और एक फॉर्मेट पुलिस अधिकारी (Format Police Officer)

समस्या: "उलझा हुआ" (Entangled) मवाद

पुराने तरीके में, आप रोबोट को एक विशाल प्रॉम्प्ट देते थे: "यह गणित की समस्या हल करें और सुनिश्चित करें कि आप उत्तर एक JSON बॉक्स में लिखें।" शोध पत्र तर्क देता है कि यह "एंटैंगलमेंट" (उलझन) रोबोट के दिमाग को नुकसान पहुँचाती है। यह सुझाव देता है कि जब रोबोट एक साथ दोनों काम करने की कोशिश करता है, तो वह प्रारूप के नियमों को पूरा करने के चक्कर में गणित में गलतियाँ करने लगता है।

लेखक स्पष्ट रूप से इस विचार के खिलाफ तर्क देते हैं कि केवल रोबोट को "सावधान रहने" के लिए कहना या कठोर, पूर्व-निर्मित टेम्पलेट (जैसे कि उसे चरण-दर-चरण एक सख्त JSON स्कीमा का पालन करने के लिए मजबूर करना) का उपयोग करना सबसे अच्छा समाधान है। उन्होंने पाया कि ये कठोर तरीके अक्सर रोबोट को उसके विचारों के बीच में ही रोक देते हैं, जिससे उत्तर असंगत हो जाते हैं या गणित गलत हो जाता है, भले ही प्रारूप एकदम सही दिखे।

समाधान: दो-टीम रणनीति

DECO-G काम को विभाजित करता है।

  1. समस्या समाधानकर्ता (The LLM): यह मुख्य रोबोट है। इसे केवल गणित की समस्या मिलती है। इसे प्रारूप की कोई चिंता नहीं है। यह बस स्वतंत्र रूप से सोचता है, तर्क करता है और समस्या को हल करता है।
  2. फॉर्मेट पुलिस (The FEM): यह एक अलग, छोटा सहायक मॉड्यूल है। यह गणित हल नहीं करता है। इसका एकमात्र काम रोबोट के आउटपुट को देखना और फुसफुसाना है, "हे, तुम अंत के करीब पहुँच रहे हो, लेकिन तुम्हें नंबर देने से पहले 'अंतिम उत्तर है' कहना होगा।"

जादू इस बात में है कि वे कैसे बात करते हैं। फॉर्मेट पुलिस एक विशेष "प्रोबेबिलिस्टिक लुकअहेड" (भविष्य में झाँकने का एक फैंसी तरीका) का उपयोग करती है यह अनुमान लगाने के लिए: "यदि रोबोट अभी 'The' कहता है, तो वाक्य को सही ढंग से पूरा करने की कितनी संभावना है?" यदि संभावना कम है, तो पुलिस रोबलेट को बिना उसकी सोच को रोके, उसे वापस पटरी पर लाने के लिए उसके अगले शब्द के चुनाव को धीरे से दिशा देती है।

गुप्त हथियार

इस टीम-अप को तेज़ बनाने और कंप्यूटर को धीमा किए बिना काम करने के लिए, लेखकों ने तीन शानदार तरकीबें पेश की हैं:

  • इंस्ट्रक्शन-अवेयर डिस्टिलेशन (Instruction-Aware Distillation): फॉर्मेट पुलिस को रैंडम, उबाऊ चैट पर प्रशिक्षित करने के बजाय, उन्होंने इसे विशेष रूप से इस बात पर प्रशिक्षित किया कि रोबोट वास्तव में समस्याओं को हल करते समय कैसा व्यवहार करता है। इससे पुलिस यह जानने में बहुत स्मार्ट हो जाती है कि रोबोट अगला कदम क्या उठाने वाला है।
  • फ्लेक्सिबल ट्राइ बिल्डिंग (Flexible Trie Building): कल्पना कीजिए कि उत्तर कैसे भी दिख सकता है, उसके सभी संभावित रास्तों का एक नक्शा है। आमतौर पर, यदि उत्तर की लंबाई अलग-अलग हो सकती है, तो ये नक्शे बहुत बड़े और अस्त-व्यस्त हो जाते हैं। लेखकों ने एक "लचीला" नक्शा बनाया जो रास्तों को आपस में जोड़ता है, ताकि कंप्यूटर हर एक संभावना की जाँच करने में अभिभूत न हो जाए।
  • HMM स्टेट प्रूनिंग (HMM State Pruning): फॉर्मेट पुलिस के पास हजारों छिपे हुए स्टेट्स (states) वाला एक विशाल दिमाग है। लेखकों ने महसूस किया कि अधिकांश समय, रोबोट को वास्तव में उन चुनिंदा स्टेट्स की ही आवश्यकता होती है। इसलिए, उन्होंने पुलिस को बाकी हिस्सों को अनदेखा करने के लिए कहा, जिससे कंप्यूटिंग कार्य लगभग 13 गुना कम हो गया (लगभग 1.08 GFLOPs से घटकर 0.08 GFLOPs प्रति स्टेप) जबकि सटीकता लगभग समान रही।

आंकड़े क्या कहते हैं

टीम ने तीन अलग-अलग चुनौतियों पर इसका परीक्षण किया:

  1. गणित की समस्याएं (GSM8k): स्कूली गणित हल करते समय, DECO-G अन्य तरीकों को लगातार पछाड़ देता है। उदाहरण के लिए, Llama-3.1-8B मॉडल पर, इसने 85.2% उत्तर सही दिए जबकि 100% फॉर्मेट अनुपालन बनाए रखा। इसके विपरीत, "Outlines" नामक एक कठोर विधि केवल 81.3% सही उत्तर दे पाई, और एक मानक "प्रॉम्प्ट-ओनली" दृष्टिकोण ने 82.3% सही उत्तर दिए लेकिन प्रारूप में बार-बार विफल रहा।
  2. इवेंट एक्सट्रैक्शन (Event Extraction): जब समाचार कहानियों से विशिष्ट विवरण निकालने के लिए कहा गया, तो DECO-G ने यह पहचानने के स्कोर में सुधार किया कि किसने क्या किया (Llama के लिए "Argument Id" मेट्रिक बढ़कर 39.4 हो गया)।
  3. LLM-as-a-Judge: जब रोबोट को सारांशों (summaries) को ग्रेड करने के लिए कहा गया, तो DECO-G ने मानव न्यायाधीशों के साथ बेहतर तालमेल बिठाया, उच्चतम औसत सहसंबंध स्कोर (जैसे Coherence के लिए Llama के लिए 0.418) प्राप्त किया।

निष्कर्ष

शोध पत्र सुझाव देता है कि "सोचने" को "फॉर्मेटिंग" से अलग करके, हम दोनों दुनिया का सर्वश्रेष्ठ प्राप्त कर सकते हैं: उत्तर जो गणितीय रूप से सही और पूरी तरह से सही प्रारूप में हैं। लेखकों ने वास्तविक डेटासेट पर इसे मापा और पाया कि DECO-G लगातार एक साथ सब कुछ करने या कठोर बाधाओं का उपयोग करने से बेहतर प्रदर्शन करता है।

हालाँकि, वे कुछ चेतावनियाँ भी देते हैं। यह सिस्टम कोई जादुई छड़ी नहीं है जो किसी भी रोबोट पर तुरंत काम करती है; आपको प्रत्येक विशिष्ट रोबोट मॉडल के लिए एक नया "फॉर्मेट पुलिस" प्रशिक्षित करना होगा। साथ मिलकर, Qwen सीरीज़ जैसे कुछ मॉडल्स के लिए, रोबोट का दिमाग इतना केंद्रित होता है कि आपको फॉर्मेट पुलिस को अधिक जोर से धकेलना पड़ता है (एक कंट्रोल फैक्टर γ=2 का उपयोग करके) ताकि वह सुनने के लिए तैयार हो।

संक्षेप में, DECO-G सुझाव देता है कि यदि आप चाहते हैं कि एक रोबोट गणित में जीनियस हो और फॉर्मेटिंग में परफेक्शनिस्ट हो, तो आपको उसे एक ही समय में दोनों काम करने के लिए नहीं कहना चाहिए। उसे नियमों को संभालने के लिए एक साथी दें, और उसे चमकते हुए देखें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →