← नवीनतम पेपर
💬 NLP

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

यह शोध पत्र टोकन-स्तरीय ब्रेगमन प्रेफरेंस ऑप्टिमाइज़ेशन (TBPO) प्रस्तुत करता है, जो एक नवीन विधि है जो संरेखण गुणवत्ता (alignment quality), प्रशिक्षण स्थिरता और आउटपुट विविधता में सुधार करने के लिए मानक अनुक्रम-स्तरीय तुलनाओं से एक टोकन-स्तरीय ब्रैडली-टेरी प्रेफरेंस मॉडल व्युत्पन्न करती है, जबकि डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) की सरलता को बनाए रखती है।

मूल लेखक: Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना सिखा रहे हैं। आप उसे एक ही कहानी के दो संस्करण दिखाते हैं: एक "विजेता" (अच्छा, सहायक, सुरक्षित) और एक "हारने वाला" (बुरा, अनुपयोगी, या खतरनाक)। आपका लक्ष्य रोबोट को इस तरह से सुधारना है कि वह "विजेता" संस्करण लिखना सीख जाए।

लंबे समय तक, इसे करने का मानक तरीका (जिसे DPO कहा जाता है) यह था कि पूरी कहानी को एक साथ ग्रेड किया जाए: "यह पूरी कहानी बहुत अच्छी है, वह पूरी कहानी बुरी है।" फिर रोबोट पूरी कहानी को बेहतर बनाने के लिए अपने मस्तिष्क को समायोजित करने की कोशिश करता है।

समस्या:
यह पेपर तर्क देता है कि यह एक मैराथन धावक को केवल उसके फिनिशिंग टाइम (समाप्ति समय) से आंकने जैसा है, बिना उसकी चाल (stride) को देखे। भाषा मॉडल एक बार में पूरी कहानी नहीं लिखते; वे एक बार में एक शब्द लिखते हैं। उनका हर एक शब्द पिछले शब्दों के आधार पर लिया गया एक छोटा सा निर्णय होता है। यदि रोबक पहले ही शब्द पर एक छोटी सी गलती कर देता है, तो पूरी कहानी पटरी से उतर सकती है, भले ही अंत में "पूरी कहानी" का ग्रेड सुधर गया हो।

मौजूदा "टोकन-लेवल" (token-level) विधियों ने इसे ठीक करने की कोशिश की, लेकिन वे अभी भी मूल रूप से पूरी कहानी के ग्रेड को शब्दों पर फैला रहे थे, न कि रोबोट को हर एक कदम पर सही चुनाव करना सिखा रहे थे।

समाधान: TokenRatio (TBPO)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे Token-level Bregman Preference Optimization (TBPO) कहा जाता है। वे इसे सरल उपमाओं का उपयोग करके इस प्रकार समझाते हैं:

1. "GPS टर्न-बाय-टर्न" की उपमा

कल्पना कीजिए कि आप न्यूयॉर्क से लॉस एंजिल्स जा रहे हैं।

  • पुराना तरीका (सीक्वेंस-लेवल): आप अंतिम गंतव्य देखते हैं। यदि आप एलए पहुँचते हैं, तो आपको एक गोल्ड स्टार मिलता है। यदि आप कनाडा पहुँच जाते हैं, तो आपको रेड लाइट मिलती है। आप उस गोल्ड स्टार को पाने के लिए अपनी ड्राइविंग को एडजस्ट करने की कोशिश करते हैं, लेकिन आपको यह नहीं पता होता कि वास्तव में कौन सा मोड़ गलत था।
  • TBPO तरीका (टोकन-लेवल): यह एक ऐसे GPS की तरह काम करता है जो आपको मोड़-दर-मोड़ स्कोर देता है। हर एक चौराहे पर (हर शब्द पर), यह पूछता है: "क्या आपने उस सड़क को चुना जो अच्छी कहानी की ओर ले जाती है, या बुरी कहानी की ओर?" यह रोबोट को केवल यह उम्मीद करने के बजाय कि अंतिम परिणाम अच्छा होगा, हर एक कदम पर सही चुनाव करना सिखाता है।

2. "दो अलग रास्तों" की समस्या

यहाँ वह पेचीदा हिस्सा है जिसे यह पेपर हल करता है। जब एक "विजेता" कहानी और एक "हारने वाली" कहानी की तुलना की जाती है, तो वे अक्सर बहुत जल्दी अलग दिखने लगती हैं।

  • परिदृश्य: कल्पना कीजिए कि विजेता कहानी शुरू होती है "The cat sat..." (बिल्ली बैठी...) से और हारने वाली कहानी शुरू होती है "The dog ran..." (कुत्ता दौड़ा...) से।
  • समस्या: यदि आप केवल अगले शब्द की तुलना करते हैं, तो आप केवल शब्द की तुलना नहीं कर रहे हैं; आप दो पूरी तरह से अलग शुरुआती बिंदुओं की तुलना कर रहे हैं। यह एक ऐसे धावक की तुलना करने जैसा है जिसने पहाड़ी के ऊपर से दौड़ना शुरू किया बनाम एक जिसने पहाड़ी के नीचे से शुरू किया। ऊपर वाले के पास अनुचित लाभ है।
  • सुधार: पेपर एक "करेक्शन फैक्टर" (जिसे बेसलाइन कहा जाता है) पेश करता है।
    • TBPO-Q: यह संस्करण एक छोटा, हल्का "कैलकुलेटर" बनाता है जो यह अनुमान लगाता है कि शुरुआती बिंदु (प्रिफिक्स/prefix) कितना "अच्छा" था। यह उस लाभ को घटा देता है ताकि आप केवल अगले शब्द को परख सकें, न कि पूरे इतिहास को।
    • TBPO-A: यह संस्करण वही गणित करता है लेकिन एक अलग ट्रिक (जिसे "एडवांटेज नॉर्मलाइजेशन" कहा जाता है) का उपयोग करता है ताकि बिना किसी अलग कैलकुलेटर के शुरुआती बिंदु के अंतर को खत्म किया जा सके।

3. "डेंसिटी रेश्यो" (Density Ratio) का जादू

पेपर एक फैंसी गणितीय अवधारणा Density Ratio Matching (विशेष रूप से जिसे Bregman Divergence कहा जाता है) का उपयोग करता है।

  • सरल उपमा: कल्पना कीजिए कि आपके पास लाल मार्बल्स (अच्छे शब्द) और नीले मार्बल्स (बुरे शब्द) का एक बैग है। आप रोबोट को लाल मार्बल्स चुनना सिखाना चाहते हैं।
  • केवल उन्हें गिनने के बजाय, पेपर का तरीका "अच्छी" कहानियों बनाम "बुरी" कहानियों में लाल और नीले मार्बल्स के अनुपात (ratio) को देखता है। यह रोबोट के आंतरिक अनुपात को "अच्छे" अनुपात के बिल्कुल समान बनाने की कोशिश करता है।
  • ऐसा करके, रोबोट एक ऐसी "पॉलिसी" (नियमों का समूह) सीखता है जो केवल अंतिम परिणाम के लिए नहीं, बल्कि हर एक क्षण के लिए इष्टतम (optimal) होती है।

उन्होंने क्या पाया?

लेखकों ने दो लोकप्रिय AI मॉडलों (Mistral और Llama 3) पर कई विभिन्न कार्यों में इस नए तरीके का परीक्षण किया:

  • बेहतर तर्क क्षमता (Reasoning): मॉडल गणित और तर्क पहेलियों (जैसे GSM8K और MMLU) में बेहतर हो गए।
  • बेहतर एलाइनमेंट (Alignment): वे अधिक सहायक बन गए और हानिकारक बातें कहने की संभावना कम हो गई।
  • अधिक विविधता (Variety): AI प्रशिक्षण की एक आम समस्या यह है कि मॉडल उबाऊ और दोहराव वाले हो जाते हैं (जैसे एक टूटा हुआ रिकॉर्ड)। TBPO ने मॉडलों को विविध और रचनात्मक बनाए रखा, जबकि अन्य तरीकों ने उन्हें अधिक रोबोटिक बना दिया।
  • दक्षता (Efficiency): उन्होंने जटिल, महंगे सुदृढीकरण लर्निंग (reinforcement learning) लूप की आवश्यकता के बिना ये परिणाम प्राप्त किए। यह मानक विधियों पर एक "प्लग-एंड-प्ले" सुधार था।

संक्षेप में:
पेपर कहता है, "एक साथ पूरा निबंध ग्रेड करना बंद करें। AI को हर एक शब्द के लिए सही चुनाव करना सिखाएं, जबकि इस तथ्य को भी ठीक करें कि कुछ कहानियों को शुरुआत में ही बढ़त मिल जाती है।" परिणाम एक ऐसा AI है जो अधिक स्मार्ट, अधिक सहायक और कम दोहराव वाला है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →