← नवीनतम पेपर
💬 NLP

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

यह शोध पत्र LARFT का प्रस्ताव करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो लंबाई-उन्मुख सुदृढीकरण शिक्षण (reinforcement learning) को पश्चदृष्टि-आधारित आत्म-जागरूकता (hindsight self-awareness) के साथ एकीकृत करके लंबाई संबंधी निर्देशों के पालन में संज्ञानात्मक-क्रिया अंतराल (cognition-action gap) को पाटता है, जिससे मॉडल की आंतरिक लंबाई समझ को उसकी पीढ़ी नीति (generation policy) के साथ संरेखित करने में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं और सामान्य क्षमताओं पर न्यूनतम प्रभाव पड़ता है।

मूल लेखक: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

प्रकाशित 2026-03-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली, रचनात्मक लेखक (AI) को अपने लिए एक कहानी लिखने के लिए काम पर रख रहे हैं। आप उसे एक बहुत ही विशिष्ट निर्देश देते हैं: "एक ऐसी कहानी लिखें जो ठीक 500 शब्दों की हो।"

अतीत में, यहाँ तक कि सबसे स्मार्ट AI लेखक भी इस काम में कठिनाई महसूस करते थे। वे या तो बहुत छोटा 50-शब्दों का लेख लिख देते थे या 5,000 शब्दों तक लंबा लेख लिख देते थे। वे कंटेंट (कहानी खुद) में तो बहुत अच्छे थे लेकिन गिनती करने में बहुत खराब थे।

प्रस्तुत शोध पत्र एक नई प्रशिक्षण विधि पेश करता है जिसे LARFT (लेंथ-अवेयर रीइन्फोर्समेंट फाइन-ट्यूनिंग) कहा जाता है। LARFT को एक विशेष कोचिंग प्रोग्राम के रूप में समझें जो AI को न केवल यह सिखाता है कि क्या लिखना है, बल्कि यह भी सिखाता है कि लिखते समय कैसे गिनना है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "कॉग्निशन-एक्शन गैप" (संज्ञान-क्रिया अंतराल)

एक ऐसे शेफ की कल्पना करें जो स्वादिष्ट खाना बनाने में जीनियस है लेकिन उसे "समय" का कोई अंदाजा नहीं है। आप उसे कहते हैं, "इस स्टेक को ठीक 10 मिनट तक पकाएं।"

  • पुराना तरीका: शेफ बस अनुमान लगाता है। कभी वह इसे ज्यादा पका देता है, तो कभी कम। वह एक टाइमर (एक बाहरी उपकरण) पर निर्भर रहता है या बस उम्मीद करता है कि सब ठीक रहेगा।
  • AI की समस्या: AI उसी शेफ की तरह है। उसके पास शब्दों की गिनती के लिए कोई आंतरिक "घड़ी" या "पैमाना" नहीं है। वह कहानी के विचार को जानता है, लेकिन वह कहानी लिखते समय उसकी लंबाई को "महसूस" नहीं कर पाता। जानने और करने के बीच का यह अंतर कॉग्निशन-एक्शन गैप कहलाता है।

2. समाधान: LARFT (दो-चरणीय कोचिंग)

LARFT इसे दो विशिष्ट प्रशिक्षण तकनीकों को एक साथ उपयोग करके ठीक करता है।

चरण A: "हाइंडसाइट" का सबक (गलतियों से सीखना)

कल्पना करें कि शेफ ने 10 मिनट तक पकाने की कोशिश की लेकिन गलती से 15 मिनट तक पका दिया।

  • पुरानी विधि: कोच बस कहता है, "बुरा काम किया, फिर से कोशिश करो," और आगे बढ़ जाता है।
  • LARFT विधि: कोच कहता है, "रुको! जो तुमने अभी पकाया है उसे देखो। इसमें 15 मिनट लगे। अब, मैं चाहता हूँ कि तुम उस 15 मिनट वाले स्टेक को देखो और मुझे बताओ कि इसमें वास्तव में कितना समय लगा।"

इसे हाइंडसाइट लेंथ अवेयरनेस (दृष्टिगत लंबाई जागरूकता) कहा जाता है।

  • AI एक कहानी बनाता है (भले ही वह गलत लंबाई की हो)।
  • केवल इसे फेंक देने के बजाय, AI को रुकने और अपने आउटपुट के शब्दों को गिनने के लिए मजबूर किया जाता है।
  • वह सीखता है: "ओह! जब मैंने इतना टेक्स्ट लिखा, तो इसका मतलब 500 शब्द हुआ।"
  • यह AI के मस्तिष्क के भीतर एक आंतरिक "पैमाना" बनाता है। वह अनुमान लगाना बंद कर देता है और जानने लगता है कि एक विशिष्ट लंबाई कैसी महसूस होती है।

चरण B: "रीइन्फोर्समेंट" गेम (अभ्यास से पूर्णता)

एक बार जब AI ने गिनना सीख लिया, तो वह लक्ष्य तक पहुँचने के लिए एक खेल खेलता है।

  • कोच AI को एक लक्ष्य देता है: "500 शब्द लिखें।"
  • AI कोशिश करता है।
  • यदि वह 490 या 510 लिखता है, तो उसे एक उच्च स्कोर (एक "रिवॉर्ड") मिलता है।
  • यदि वह 100 या 1,000 लिखता है, तो उसे कम स्कोर मिलता है।
  • AI अपने लेखन के तरीके को एडजस्ट करना सीख जाता है ताकि वह "स्वीट स्पॉट" में बना रहे।

3. सीक्रेट सॉस: दोनों को एक साथ करना

LARFT का जादू यह है कि यह केवल चरण A फिर चरण B नहीं करता। यह एक स्मार्ट तरीके से दोनों को एक साथ करता है।

  • प्रशिक्षण के शुरुआती दौर में: यह "हाइंडसाइट" सबक (गिनना सीखने) पर अधिक ध्यान केंद्रित करता है। यह एक छात्र की तरह है जो जटिल गणित समस्याओं को हल करने से पहले पहाड़े सीख रहा है।
  • प्रशिक्षण के बाद के दौर में: यह "रीइन्फोर्समेंट" गेम (लक्ष्य तक पहुँचने) पर ध्यान केंद्रित करता है।
  • इन दोनों को संतुलित करके, AI लिखना शुरू करने से पहले अपनी लंबाई की योजना बनाना और लिखते समय अपनी लंबाई की निगरानी करना सीख जाता है।

4. परिणाम: एक मास्टर शेफ

इस पेपर ने चार अलग-अलग AI मॉडल्स पर इसका परीक्षण किया। परिणाम प्रभावशाली थे:

  • सटीकता: AI सटीक शब्द गणना (जैसे निशाने पर निशाना लगाना) हासिल करने में अविश्वसनीय रूप से अच्छा हो गया।
  • कोई दुष्प्रभाव नहीं: आमतौर पर, जब आप किसी AI को एक विशिष्ट कार्य (जैसे गिनती) के लिए प्रशिक्षित करते हैं, तो वह अन्य चीजों (जैसे गणित के सवाल या कविता लिखना) में कमजोर हो जाता है। लेकिन LARFT इतना कुशल था कि AI अपनी सामान्य बुद्धिमत्ता खोए बिना लंबाई में बेहतर हो गया। यह ऐसा है जैसे शेफ स्वादिष्ट खाना बनाना भूले बिना समय का प्रबंधन करना सीख गया हो।

सारांश उपमा

AI को एक शराबी ड्राइवर के रूप में सोचें जो एक ही लेन में रहने की कोशिश कर रहा है।

  • पहले: ड्राइवर लेन के अंदर रहने की उम्मीद में इधर-उधर डगमगाता है, लेकिन वह लाइनों को स्पष्ट रूप से नहीं देख पाता।
  • LARFT: हम ड्राइवर को एक रियर-व्यू मिरर (हाइंडसाइट अवेयरनेस) देते हैं ताकि वह देख सके कि वह कहाँ है, और हम उसे एक लेन-कीपिंग असिस्ट (रीइन्फोर्समेंट) देते हैं जो उसे भटकने पर धीरे से वापस सही दिशा में मोड़ देता है।
  • परिणाम: ड्राइवर हर बार बिना किसी दूसरी कार से टकराए (अपनी सामान्य क्षमता खोए बिना) पूरी तरह से लेन में रहता है।

संक्षेप में: LARFT AI को उसके शब्दों की लंबाई को "महसूस" करना सिखाता है, जिससे यह एक अनुमान लगाने वाले खेल से बदलकर एक सटीक कौशल बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →