Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
यह शोध पत्र GraphDPO प्रस्तुत करता है, जो डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन का एक सिद्धांतपूर्ण सामान्यीकरण है जो ट्रांसिटिविटी (transitivity) को लागू करने और पर्यवेक्षण (supervision) को एकत्रित करने के लिए कई रोलआउट्स द्वारा प्रेरित पूर्ण प्रेफरेंस ग्राफों का लाभ उठाता है, जिससे पेयरवाइज़ (pairwise) विधियों की सीमाओं को दूर किया जा सकता है और रीजनिंग तथा प्रोग्राम सिंथेसिस कार्यों में बेहतर प्रदर्शन प्राप्त किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट शेफ को एक आदर्श भोजन बनाना सिखा रहे हैं।
पुराना तरीका: "दो-स्वाद" परीक्षण (The "Two-Taste" Test)
परंपरागत रूप से, रोबोट को सिखाने के लिए, आप उसे दो व्यंजन देंगे: एक जो उसने बनाया है (मान लीजिए "स्वाद A") और एक जो आपने बनाया है (या एक बेहतर संस्करण, "स्वाद B")। आप कहेंगे, "स्वाद B, स्वाद A से बेहतर है।" रोबोट इस एकल तुलना से सीखता है। यह वर्तमान मानक विधि की तरह है जिसे DPO (डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन) कहा जाता है।
समस्या यह है कि वास्तविक दुनिया में, आपको केवल दो व्यंजन नहीं मिलते। आप रोबोट से एक ही भोजन को पाँच बार बनाने के लिए कह सकते हैं। आपको पाँच अलग-अलग संस्करण मिलते हैं:
- जला हुआ टोस्ट।
- थोड़ा कच्चा।
- पूरी तरह से सुनहरा (Perfectly golden)।
- पूरी तरह से सुनहरा (लेकिन थोड़े अलग आकार का)।
- एक पूरी तरह से अलग, अजीब व्यंजन।
यदि आप पुराने "दो-स्वाद" तरीके का उपयोग करते हैं, तो आपको इन पाँच व्यंजनों को जोड़ों (pairs) में तोड़ना होगा (1 बनाम 2, 1 बनाम 3, 2 बनाम 3, आदि)। यह एक अव्यवस्था पैदा करता है। आप एक बड़ी तस्वीर खो देते हैं। आप रोबोट को बता सकते हैं कि "सुनहरा" व्यंजन "कच्चे" से बेहतर है, और "कच्चा" व्यंजन "जले हुए" से बेहतर है, लेकिन रोबोट भ्रमित हो सकता है क्योंकि आपने उसे स्पष्ट रूप से यह नहीं बताया कि "सुनहरा" व्यंजन "जले हुए" से बेहतर है, और वह भी एक ही बार में, एक स्पष्ट श्रृंखला के रूप में। यह ऐसा है जैसे आप केवल चचेरे भाइयों के जोड़ों को देखकर एक पारिवारिक वंशावली (family tree) को समझने की कोशिश कर रहे हों, जबकि माता-पिता और दादा-दादी को अनदेखा कर रहे हों।
नया तरीका: स्वाद का "पारिवारिक वृक्ष" (GraphDPO)
लेखक इस नए तरीके का प्रस्ताव करते हैं जिसे GraphDPO कहा जाता है। जोड़ों को देखने के बजाय, वे रोबोट के प्रयासों के पूरे "पारिवारिक वृक्ष" को देखते हैं।
ग्राफ (वृक्ष): वे उन पाँचों व्यंजनों को एक पदानुक्रम (hierarchy) में व्यवस्थित करते हैं।
- "जला हुआ" और "अजीब" व्यंजन सबसे नीचे जाते हैं।
- "कच्चा" व्यंजन बीच में आता है।
- दोनों "सुनहरे" व्यंजन सबसे ऊपर जाते हैं।
- महत्वपूर्ण बात यह है कि वे दोनों "सुनहरे" व्यंजन बराबरी पर हैं। वे एक ही "क्लब" में हैं। रोबोट को इस बात के लिए दंडित करने की आवश्यकता नहीं है कि वह यह नहीं जान पाया कि दोनों में से कौन सा थोड़ा बेहतर है; उसे बस यह जानने की आवश्यकता है कि दोनों ही खराब व्यंजनों से बेहतर हैं।
नियम (Transitivity/संक्रामकता): यह प्रणाली तर्क के एक नियम को लागू करती: यदि A, B से बेहतर है, और B, C से बेहतर है, तो A का C से बेहतर होना अनिवार्य है। पुराना तरीका अक्सर इसे भूल जाता था जब वह चीजों को जोड़ों में तोड़ देता था। GraphDPO इस नियम को सीधे सीखने की प्रक्रिया में शामिल करता है, जिससे यह सुनिश्चित होता है कि रोबोट की समझ ऊपर से नीचे तक सुसंगत रहे।
"ओरेकल" एंकर (The "Oracle" Anchor): कभी-कभी, आपके पास वास्तविक रेसिपी (ground truth) होती है। GraphDPO आपको इस पूर्ण रेसिपी को पेड़ के बिल्कुल शीर्ष पर रखने की अनुमति देता है। प्रशिक्षण की शुरुआत में, रोबोट को बताया जाता है, "यह स्वर्ण मानक है, इसे ही लक्ष्य बनाएं!" जैसे-जैसे रोबोट स्मार्ट होता जाता है, सिस्टम धीरे-धीरे अपनी पकड़ ढीली कर देता है, जिससे रोबोट बिना अत्यधिक सूक्ष्म प्रबंधन के अपने तरीके से शीर्ष तक पहुँचने के लिए अन्वेषण (explore) कर सके।
यह बेहतर क्यों है?
- कोई भ्रम नहीं: यह रोबोट को विरोधाभासी निर्देशों से भ्रमित होने से रोकता है जो तब उत्पन्न होते हैं जब आप उन चीजों पर सख्त रैंकिंग थोपते हैं जो वास्तव में समान स्तर पर हैं।
- दक्षता (Efficiency): भले ही यह पूरे पेड़ को देखता है, फिर भी यह आश्चर्यजनक रूप से तेज़ है। इसे हर एक व्यंजन की तुलना दूसरे से करने की आवश्यकता नहीं है; यह केवल समूहों को देखता है।
- बेहतर परिणाम: शोधकर्ताओं ने गणितीय समस्याओं और कोडिंग कार्यों पर इसका परीक्षण किया। इन क्षेत्रों में, जहाँ अक्सर "सही" और "गलत" उत्तर होते हैं (जैसे जले हुए बनाम एकदम सही व्यंजन), GraphDPO ने रोबोट को पुराने जोड़े-दर-जोड़े वाले तरीकों की तुलना में तेज़ी से सीखने और बेहतर स्कोर प्राप्त करने में मदद की।
संक्षेप में
यह शोध पत्र तर्क देता है कि AI को केवल दो विकल्पों को एक समय में दिखाने के बजाय, हमें उसे विकल्पों का एक पूरा बैच दिखाना चाहिए, उन्हें एक स्पष्ट पदानुक्रम (ग्राफ) में व्यवस्थित करना चाहिए, और उसे उन सभी के बीच के संबंधों को एक साथ सीखने देना चाहिए। यह AI के लिए एक अधिक स्थिर, तार्किक और प्रभावी शिक्षक बनाता है, विशेष रूप से उन मामलों में जहाँ उत्तर या तो स्पष्ट रूप से सही हैं या गलत।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।