← नवीनतम पेपर
💬 NLP

Pause or Fabricate? Training Language Models for Grounded Reasoning

यह शोध पत्र ग्राउंडेड रीजनिंग वाया इंटरैक्टिव रीइन्फोर्समेंट लर्निंग (GRIL) को प्रस्तुत करता है, जो एक मल्टी-टर्न फ्रेमवर्क है जो भाषा मॉडलों को सूचना अंतराल पहचानने और काल्पनिक आधार बनाने के बजाय स्पष्टीकरण के लिए रुकने के लिए प्रशिक्षित करता है, जिससे अधूरी जानकारी वाले कार्यों पर तर्क की सटीकता और दक्षता में उल्लेखनीय सुधार होता है।

मूल लेखक: Yiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan, Yao Hu, Daoxin Zhang, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan, Yao Hu, Daoxin Zhang, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Pause or Fabricate? Training Language Models for Grounded Reasoning" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य समस्या: "आत्मविश्वासी झूठा" (The Confident Liar)

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान और आत्मविश्वासी मित्र से किसी पार्टी का रास्ता पूछ रहे हैं। आप उन्हें बताते हैं, "यह मेन स्ट्रीट पर स्थित उस बड़े लाल घर में है," लेकिन आप यह बताना भूल जाते कि मेन स्ट्रीट किस शहर में है।

एक सामान्य व्यक्ति कहेगा, "रुको, यह कौन सा शहर है?"
लेकिन यह शोध पत्र तर्क देता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स (LLMs) एक "आत्मविश्वासी झूठे" की तरह व्यवहार करते हैं। वे रुककर सवाल नहीं पूछते। इसके बजाय, वे तुरंत अनुमान लगाते हैं, "ओह, यह निश्चित रूप से स्प्रिंगफील्ड में होगा!" और फिर आपको उस घर तक पहुँचने के लिए एक विस्तृत, चरण-दर-चरण पैदल यात्रा का विवरण देते हैं जो वास्तव में अस्तित्व में ही नहीं है। वे इतने यकीन के साथ बोलते हैं कि आप उन पर विश्वास कर सकते हैं, भले ही उनका पूरा उत्तर एक मनगढ़ंत तथ्य पर आधारित हो।

लेखक इसे "अग्राउंडेड रीजनिंग" (Ungrounded Reasoning) कहते हैं। मॉडल गणित या तर्क में बुरा नहीं है; वह बस यह जानने में बुरा है कि जब उसके पास शुरू करने के लिए पर्याप्त जानकारी नहीं होती, तो उसे क्या करना चाहिए। यह एक ऐसे शेफ की तरह है जो यह जांचे बिना कि क्या उनके पास अंडे हैं, एक जटिल व्यंजन बनाना शुरू कर देता है, और फिर "काल्पनिक अंडों" का उपयोग करके एक रेसिपी बना लेता है।

समाधान: GRIL ( "रुकें और पूछें" प्रशिक्षण)

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया प्रशिक्षण तरीका बनाया जिसे GRIL (Grounded Reasoning via Interactive Reinforcement Learning) कहा जाता है।

GRIL को एक सख्त कुकिंग इंस्ट्रक्टर (शिक्षक) के रूप में सोचें जो खेल के नियम बदल देता है। केवल उत्तर देने के लिए मॉडल को पुरस्कृत करने के बजाय, इंस्ट्रक्टर मॉडल को यह जानने के लिए पुरस्कृत करता है कि कब रुकना है।

प्रशिक्षण दो अलग-अलग चरणों में होता है, जैसे दो स्तरों वाला एक खेल:

स्तर 1: "डिटेक्टिव" चरण (स्पष्टीकरण और विराम)

  • परिदृश्य: मॉडल को अधूरी जानकारी वाला एक प्रश्न दिया जाता है (जैसे "मेन स्ट्रीट" वाला उदाहरण)।
  • पुराना तरीका: मॉडल तुरंत इसे हल करने की कोशिश करता है, गायब शहर का अनुमान लगाता है, और गलत हो जाता है।
  • GRIL का तरीका: मॉडल को एक जासूस (detective) की तरह काम करने के लिए प्रशिक्षित किया जाता है। यदि उसे कोई कमी दिखती है, तो उसे रुकना (pause) होगा और कहना होगा, "मैं इसे अभी हल नहीं कर सकता; मुझे शहर जानने की आवश्यकता है।"
  • पुरस्कार: इंस्ट्रक्टर जल्दी रुकने के लिए एक बोनस पॉइंट देता है। यदि मॉडल पूछने से पहले 10 मिनट तक अनुमान लगाता है, तो उसे बहुत कम पुरस्कार मिलता है। यदि वह तुरंत पूछता है, तो उसे बहुत बड़ा पुरस्कार मिलता है। यह मॉडल को सिखाता है कि "रुककर पूछना" एक जीत है, विफलता नहीं।

स्तर 2: "शेफ" चरण (ग्राउंडेड रीजनिंग)

  • परिदृश्य: उपयोगकर्ता (या वातावरण) अंततः गायब जानकारी प्रदान करता है ("यह स्प्रिंगफील्ड में है!")।
  • क्रिया: अब जब "सामग्री" पूरी हो गई है, तो मॉडल "शेफ मोड" में स्विच हो जाता है। यह समस्या को सही ढंग से हल करने के लिए नई जानकारी का उपयोग करता है।
  • पुरस्कार: इसे गणितीय समस्या को सही ढंग से हल करने के लिए अंक मिलते हैं।

यह एक बड़ी बात क्यों है

यह शोध पत्र दिखाता है कि इस सरल बदलाव से कितना बड़ा अंतर आता है:

  1. कम मतिभ्रम (Less Hallucination): मॉडल्स ने तथ्य बनाना बंद कर दिया। उन्होंने सीख लिया कि यदि वे कुछ नहीं जानते हैं, तो उन्हें इसे स्वीकार करना चाहिए।
  2. बेहतर सटीकता (Better Accuracy): क्योंकि उन्होंने अनुमान लगाना बंद कर दिया, इसलिए वे वास्तव में बहुत अधिक बार सही उत्तर दे पाए (सफलता दर में 30% तक की वृद्धि)।
  3. दक्षता (Efficiency): वे तेज़ हो गए। गायब जानकारी को छिपाने के लिए एक लंबी, नकली कहानी लिखने के बजाय, वे बस सवाल पूछते थे और उत्तर प्राप्त करते थे। इससे उनका "कंप्यूटिंग समय" (टोकन) बच गया।
  4. सामान्य बुद्धिमत्ता (General Smarts): यह कौशल केवल गणित के लिए नहीं था। मॉडल्स ने इस "रुकें और जाँचें" वाले तर्क को अन्य प्रकार के प्रश्नों, जैसे कि रीडिंग कॉम्प्रिहेन्शन या कॉमन सेंस, पर लागू करना सीखा, यहाँ तक कि उन पर भी जिन्हें उन्होंने पहले नहीं देखा था।

निष्कर्ष (The Takeaway)

इस शोध पत्र से पहले, AI मॉडल्स "उतावले इंटर्न" की तरह थे जो आधे डेटा के गायब होने पर भी प्रोजेक्ट पूरा करने की कोशिश करते थे, और अक्सर खाली जगहों को भरने के लिए चीजें बना लेते थे।

GRIL प्रशिक्षण के बाद, वे "बुद्धिमान सलाहकार" बन जाते हैं। वे जानते हैं कि एक अच्छा उत्तर एक अच्छे प्रश्न से शुरू होता है। उन्होंने तर्क करने का सबसे महत्वपूर्ण नियम सीख लिया है: गलत होने और आत्मविश्वास के साथ अनुमान लगाने से बेहतर है कि रुकें और स्पष्टता के लिए पूछें।

संक्षेप में: केवल उत्तर न दें। यह जानें कि कब रुकना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →