← नवीनतम पेपर
🤖 machine learning

R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling

R2IF एक रीजनिंग-अवेयर रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो एक कंपोजिट रिवॉर्ड सिस्टम का उपयोग करके LLM की रीजनिंग को टूल-कॉल निर्णयों के साथ संरेखित करता है, जिससे BFCL और ACEBench जैसे बेंचमार्क पर फंक्शन-कॉलिंग सटीकता और व्याख्यात्मकता दोनों में महत्वपूर्ण सुधार होता है।

मूल लेखक: Aijia Cheng, Kailong Wang, Ling Shi, Yongxin Zhao

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aijia Cheng, Kailong Wang, Ling Shi, Yongxin Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़ा अव्यवस्थित व्यक्तिगत सहायक है जिसका नाम LLM (लार्ज लैंग्वेज मॉडल) है। यह सहायक कहानियाँ लिखने, सामान्य ज्ञान के उत्तर देने और बातचीत करने में बहुत अच्छा है, लेकिन जब आप उनसे कुछ व्यावहारिक करने को कहते हैं—जैसे "सैन फ्रांसिस्को का मौसम देखें और एक फ्लाइट बुक करें"—तो वे अक्सर लड़खड़ा जाते हैं। वे शायद यह तो जान लेते हैं कि कौन सा टूल इस्तेमाल करना है (वेदर ऐप), लेकिन वे विवरणों में गलती कर देते हैं, जैसे कि राज्य (state) बताना भूल जाना या गलत तापमान इकाई (temperature unit) का उपयोग करना।

यह पेपर R2IF नामक एक नई प्रशिक्षण विधि पेश करता है ताकि इस सहायक को सुधारा जा सके। R2IF को एक सख्त लेकिन मददगार कोच के रूप में समझें जो सहायक को न केवल यह सिखाता है कि क्या करना है, बल्कि यह भी कि करने से पहले कैसे सोचना है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "पोस्ट-इट नोट" का जाल (The "Post-It Note" Trap)

पहले, शोधकर्ता इन सहायकों को एक ऐसी विधि का उपयोग करके प्रशिक्षित करने की कोशिश करते थे जो केवल अंतिम परिणाम पर ध्यान देती थी।

  • पुराना तरीका: यदि सहायक सही उत्तर देता था, तो उन्हें एक गोल्ड स्टार मिलता था। यदि वे गलत होते थे, तो उन्हें लाल 'X' मिलता था।
  • खामी: सहायक भाग्य या रटने के माध्यम से सही उत्तर का अनुमान लगाना सीख जाता था, भले ही उनकी आंतरिक विचार प्रक्रिया निरर्थक हो। यह उस छात्र की तरह है जो परीक्षा में सही गणित का उत्तर तो लिखता है लेकिन "कार्य दिखाएं" (show your work) वाले भाग में बड़बड़ाता है। यदि प्रश्न थोड़ा भी बदल जाता है, तो वे विफल हो जाते हैं क्योंकि उन्होंने वास्तव में तर्क (logic) को नहीं समझा था।

2. समाधान: R2IF ("रीज़निंग-टू-डिसीजन" कोच)

R2IF खेल बदल देता है। यह केवल अंतिम उत्तर को नहीं देखता; यह पूरे विचार प्रक्रिया (Chain of Thought) को देखता है ताकि यह सुनिश्चित किया जा सके कि तर्क वास्तव में निर्णय की ओर ले जाता है।

ऐसा करने के लिए, कोच एक कंपोजिट रिवॉर्ड सिस्टम (Composite Reward System) का उपयोग करता है (जो एक जटिल बहु-स्तरीय स्कोरिंग प्रणाली कहने का एक शानदार तरीका है)। कल्पना करें कि एक शिक्षक छात्र के प्रोजेक्ट को तीन विशिष्ट मानदंडों (rubrics) के साथ ग्रेड कर रहा है:

A. "फॉर्मेट पुलिस" (बाइनरी रिवॉर्ड)

  • उपमा: एक ऐसे रोबोट की कल्पना करें जो केवल एक बहुत ही विशिष्ट प्रारूप में लिखे गए निर्देशों को समझता है। यदि आप फॉर्म के बजाय एक पत्र लिखते हैं, तो वह आपको अनदेखा कर देता है।
  • यह क्या करता है: यह स्कोर का हिस्सा यह जाँचता है कि क्या सहायक ने सख्त नियमों का पालन किया। क्या उन्होंने सोच को <reason> बॉक्स में और क्रिया को <tool> बॉक्स में रखा? क्या उन्होंने सही टैग का उपयोग किया? यदि प्रारूप गलत है, तो स्कोर शून्य है। यदि आप नियमों का पालन नहीं कर सकते, तो आपकी चतुराई के लिए कोई अंक नहीं मिलेंगे।

B. "लॉजिक चेक" (चेन-ऑफ-थॉट इफेक्टिवनेस रिवॉर्ड)

  • उपमा: कल्पना करें कि आप एक जासूस हैं। आप अपने सुराग लिखते हैं। शिक्षक पूछता है: "यदि मैं तुम्हारे सुराग किसी दूसरे जासूस को दूँ, तो क्या वे भी केस सुलझा पाएंगे?"
  • यह क्या करता है: यह जाँचता है कि क्या तर्क वास्तव में उपयोगी है। यदि सहायक कहता है, "मुझे मौसम चाहिए," लेकिन यह नहीं बताता कि उन्हें स्थान (location) क्यों या कैसे मिला, तो स्कोर कम होगा। तर्क इतना मजबूत होना चाहिए कि वह किसी और को सही उत्तर तक ले जाने में सक्षम हो।

C. "डिटेल डिटेक्टिव" (स्पेसिफिकेशन-मॉडिफिकेशन-वैल्यू रिवॉर्ड)

  • उपमा: यह सबसे महत्वपूर्ण हिस्सा है। कल्पना करें कि आप पिज्जा मांगते हैं।
    • बुरा सहायक: "मैं एक पिज्जा ऑर्डर करूँगा।" (अस्पष्ट, गलत आकार या टॉपिंग्स मिल सकती हैं)।
    • अच्छा सहायक: "मैं देख रहा हूँ कि आप पिज्जा चाहते हैं। मेनू कहता है कि 'लार्ज' 14 इंच का है। आपने आकार निर्दिष्ट नहीं किया, इसलिए मैं 'लार्ज' मान लेता हूँ। आपने 'एक्स्ट्रा चीज़' नहीं कहा, इसलिए मैं डिफ़ॉल्ट पर ही रहूँगा। यह रहा आपका ऑर्डर।"
  • यह क्या करता है: यह रिवॉर्ड जाँचता है कि क्या सहायक ने आपकी रिक्वेस्ट में लापता विवरणों को नोटिस किया और टूल के नियमों के आधार पर उन्हें सही ढंग से भरा। यह सहायक को यह पहचानने के लिए पुरस्कृत करता है कि, "ओह, टूल को एक 'State' की आवश्यकता है, लेकिन उपयोगकर्ता ने इसे नहीं बताया, इसलिए मुझे स्वचालित रूप से 'CA' जोड़ देना चाहिए।"

3. परिणाम: एक विश्वसनीय सहायक

इस तीन-भागों वाली स्कोरिंग प्रणाली का उपयोग करके, सहायक (LLM) सीखने लगता है:

  1. नियमों का पालन करना (Format)।
  2. कार्य करने से पहले स्पष्ट रूप से सोचना (Logic)।
  3. खाली जगहों को सही ढंग से भरना (Details)।

परिणाम:
पेपर के प्रयोगों में, इस नई विधि ने सहायकों को काफी बेहतर बनाया।

  • सटीकता (Accuracy): वे बहुत अधिक बार सही उत्तर देते हैं (कुछ परीक्षणों में 34% तक बेहतर)।
  • विश्वास (Trust): क्योंकि उनकी विचार प्रक्रिया अब तार्किक और उनके कार्यों के अनुरूप है, हम उन पर अधिक भरोसा कर सकते हैं। यदि वे कोई गलती करते हैं, तो हम केवल एक रैंडम एरर देखने के बजाय, यह देखने के लिए उनके "रीज़निंग बॉक्स" को देख सकते हैं कि वे कहाँ गलत हुए।

सारांश रूपक (Summary Metaphor)

पुराने तरीके को एक रेस कार ड्राइवर को प्रशिक्षित करने के रूप में सोचें जिसे केवल फिनिश लाइन को पहले पार करने की परवाह है, भले ही वह गलत दिशा में गाड़ी चला रहा हो।

R2IF एक प्रोफेशनल पायलट को प्रशिक्षित करने जैसा है। पायलट को चाहिए:

  1. उड़ान योजना का पालन करना (Format)।
  2. को-पायलट को अपना नेविगेशन लॉजिक समझाना (Reasoning)।
  3. शुरुआती अनुरोध में जिनका उल्लेख नहीं किया गया था, उनके लिए हवा के दबाव और ईंधन के स्तर के अनुसार समायोजन करना (Parameter Modification)।

परिणाम एक ऐसा पायलट है जो न केवल गंतव्य तक पहुँचता है, बल्कि सुरक्षित रूप से, तार्किक रूप से और इस तरह से पहुँचता है जिसे कोई भी समझ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →