← नवीनतम पेपर
💬 NLP

Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms

यह शोध पत्र डायरेक्ट अलाइनमेंट एल्गोरिदम (DAAs) में "रिवॉर्ड-जेनरेशन गैप" को प्रशिक्षण उद्देश्यों और ऑटोरेग्रेसिव डिकोडिंग डायनेमिक्स के बीच एक बेमेल के रूप में पहचानता है, और एक सरल प्रीफिक्स-ओरिएंटेड इक्वल-लेंथ ट्रेनिंग (POET) पद्धति का प्रस्ताव करता है जो प्रतिक्रियाओं को समान लंबाई में छोटा (ट्रंकेट) करती है ताकि AlpacaEval 2 जैसे बेंचमार्क पर प्रदर्शन में उल्लेखनीय सुधार किया जा सके।

मूल लेखक: Zeguan Xiao, Yun Chen, Guanhua Chen, Ke Tang

प्रकाशित 2026-04-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zeguan Xiao, Yun Chen, Guanhua Chen, Ke Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को मानव फीडबैक के आधार पर एक आदर्श भोजन बनाना सिखा रहे हैं। आप रोबोट को दो व्यंजन दिखाते हैं: एक स्वादिष्ट (पसंदीदा) और एक जला हुआ (अनापसंद)।

वर्तमान में, रोबोट को सिखाने का सबसे लोकप्रिय तरीका (जिसे डायरेक्ट अलाइनमेंट एल्गोरिदम या DAA कहा जाता है) इस प्रकार काम करता है: रोबोट पूरे तैयार व्यंजन को देखता है, अच्छे वाले की तुलना बुरे वाले से करता है, और अच्छे वाले जैसे अधिक व्यंजन बनाना सीखता है।

समस्या: "पहली बाइट" का अंधापन
यह शोध पत्र तर्क देता है कि इस तरीके में एक घातक दोष है। यह व्यंजन के हर एक घटक (इग्रीडिएंट) को समान रूप से महत्वपूर्ण मानता है। लेकिन वास्तव में, शुरुआती कुछ निवाले (वाक्य की शुरुआत) सबसे महत्वपूर्ण होते हैं।

यदि रोबोट व्यंजन की शुरुआत एक सड़े हुए टमाटर से करता है, तो बाद में सब्जियों को कितनी भी सटीकता से काट ले, पूरा भोजन बर्बाद हो जाता है। इसे "रिवॉर्ड-जनरेशन गैप" कहा जाता है। रोबोट को पूरे भोजन के अंतिम स्कोर पर ग्रेड दिया जा रहा है, लेकिन वास्तव में वह इसलिए विफल हो रहा है क्योंकि उसने पहले ही चरण में गलती कर दी थी। प्रशिक्षण की विधि इस तथ्य को अनदेखा करती है कि शुरुआती गलतियाँ आगे की हर चीज़ को खराब कर देती हैं।

समाधान: POET (प्रिफिक्स-ओरिएंटेड इक्वल-लेंथ ट्रेनिंग)

कल्पना कीजिए कि आप फिर से दो रेसिपी की तुलना कर रहे हैं। एक रेसिपी 10 पन्नों की है, और दूसरी केवल 5 पन्नों की है।

  • पुराना तरीका: आप पहली रेसिपी के सभी 10 पन्ने पढ़ते हैं और दूसरी रेसिपी के सभी 5 पन्ने पढ़ते हैं, और फिर तय करते हैं कि कौन सी बेहतर है।
  • POET वाला तरीका: आप महसूस करते हैं कि लंबी रेसिपी के अतिरिक्त 5 पन्ने शायद केवल फालतू बातें या दोहराव हो सकते हैं। इसलिए, आप लंबी रेसिपी को छोटी वाली के बराबर काटने के लिए छोटा कर देते हैं। अब, आप दोनों रेसिपी के पहले 5 पन्नों की आमने-सामने तुलना कर रहे हैं।

रोबोट को केवल दोनों प्रतिक्रियाओं के मैचिंग शुरुआती हिस्सों (matching beginnings) की तुलना करने के लिए मजबूर करके, आप उसे उन महत्वपूर्ण शुरुआती चरणों को सही करने पर ध्यान केंद्रित करने के लिए मजबूर करते हैं। यदि रोबोट "अच्छे" रेसिपी की शुरुआत सही ढंग से करना सीख जाता है, तो बाकी का भोजन स्वाभाविक रूप से अच्छा बनता है।

यह एक बड़ी बात क्यों है?

  1. यह सरल है: आपको उस जटिल गणित को बदलने की आवश्यकता नहीं है जिसका उपयोग रोबोट सीखने के लिए करता है। आपको बस डेटा को रोबोट को खिलाने से पहले काट देना है।
  2. यह मुफ्त है: इसके लिए किसी अतिरिक्त कंप्यूटिंग पावर या नए सेटिंग्स (हाइपरपैरामीटर्स) की आवश्यकता नहीं है।
  3. यह काम करता है: जब उन्होंने प्रसिद्ध AI मॉडल (जैसे Llama और Mistral) पर इसका परीक्षण किया, तो रोबोट निर्देशों का पालन करने में बहुत बेहतर हो गए। एक परीक्षण में, उनका प्रदर्शन 11.8 अंक बढ़ गया, जो AI की दुनिया में एक विशाल सुधार है।

निबंध का उदाहरण
एक AI द्वारा निबंध लिखने के बारे में सोचें।

  • POET के बिना: शिक्षक पूरा निबंध पढ़ता है। यदि छात्र एक शानदार प्रस्तावना (इंट्रोडक्शन) लिखता है लेकिन फिर 10 पन्नों तक बड़बड़ाता रहता है, तो शिक्षक अभी भी उसे उच्च स्कोर दे सकता है यदि बड़बड़ाने वाला हिस्सा इतना लंबा है कि वह खराब हिस्सों को "औसत" (average out) कर सके।
  • POET के साथ: शिक्षक कहता है, "मैं दोनों निबंधों का केवल पहला पैराग्राफ पढूँगा। यदि आपका पहला पैराग्राफ कमजोर है, तो आप तुरंत फेल हो जाएंगे।" यह छात्र को पूरी तरह से एक मजबूत शुरुआत लिखने पर ध्यान केंद्रित करने के लिए मजबूर करता है, जो आमतौर पर एक बेहतर निबंध की ओर ले जाता है।

सारांश
यह शोध पत्र खोज निकालता है कि AI मॉडल इसलिए विफल हो रहे हैं क्योंकि उन्हें पूरी कहानी के बजाय कहानी की शुरुआत पर ग्रेड दिया जा रहा है। समाधान, POET, यह है कि कहानियों को काटकर समान लंबाई का बना दिया जाए, जिससे AI यह सीखने के लिए मजबूर हो जाए कि शुरुआत ही सब कुछ है। यह AI को डेटा खिलाने के तरीके में एक छोटा सा बदलाव है, लेकिन यह अधिक स्मार्ट, अधिक मददगार रोबोट का परिणाम देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →