InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion
InfiGFusion एक नवीन संरचना-जागरूक मॉडल फ्यूजन फ्रेमवर्क पेश करता है जो शब्दावली चैनलों (vocabulary channels) के बीच अर्थ संबंधी निर्भरताओं को पकड़ने के लिए एक कुशल, क्लोज्ड-फॉर्म ग्रोमोव-वासरस्टीन सन्निकटन (Gromov-Wasserstein approximation) के साथ ग्राफ-ऑन-लॉगिट्स डिस्टिलेशन का उपयोग करता है, जिससे यह जटिल तर्क कार्यों में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास तीन अलग-अलग विशेषज्ञ शेफ हैं। एक इतालवी पास्ता का उस्ताद है, दूसरा तीखे भारतीय करी का जादूगर है, और तीसरा फ्रांसीसी पेस्ट्री बनाने का जीनियस है। आप एक एकल "सुपर शेफ" बनाना चाहते हैं जो बिना तीन अलग लोगों को काम पर रखे, इन तीनों व्यंजनों को पूरी तरह से बना सके।
यह आर्टिफिशियल इंटेलिजेंस में मॉडल फ्यूजन (Model Fusion) की चुनौती है। यह पेपर इस समस्या को हल करने के लिए InfiGFusion नामक एक नई विधि पेश करता है, जो विशेष रूप से लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए है जो चैटबॉट्स को संचालित करते हैं।
यहाँ यह पेपर उनके समाधान को सरल उपमाओं (analogies) का उपयोग करके समझाता है:
1. समस्या: "सोलो" दृष्टिकोण बनाम "टीम" दृष्टिकोण
मॉडल को मिलाने के वर्तमान तरीके अधिकांशतः ऐसे हैं जैसे सुपर शेफ को पास्ता डिश के लिए सामग्री देखने के बाद, फिर करी के लिए सामग्री देखने के लिए कहना, और फिर एक समय में एक सामग्री पर निर्णय लेना।
- दोष: यह इस बात की अनदेखी करता है कि सामग्रियां आपस में कैसे जुड़ती हैं। एक वास्तविक रेसिपी में, लहसुन और नींबू मिलकर एक विशिष्ट स्वाद बनाते हैं। यदि आप उन्हें अलग-अलग वस्तुओं के रूप में देखते हैं, तो आप "फ्लेवर प्रोफाइल" या सिमेंटिक डिपेंडेंसी (semantic dependency) को खो देते हैं।
- पेपर का दृष्टिकोण: मौजूदा तरीके AI के "विचारों" (जिन्हें logits कहा जाता है) को शब्द-दर-शब्द देखते हैं। वे कहते हैं, "AI सोचता है कि 'बिल्ली' की संभावना अधिक है, और 'कुत्ता' की संभावना अधिक है," लेकिन वे यह नहीं समझते कि AI "बिल्ली" और "कुत्ता" के बीच के संबंध को "जानवर" के रूप में देखता है। वे सोचने की संरचना (structure) को मिस कर देते हैं।
2. समाधान: विचारों का मानचित्र बनाना (Graph-on-Logits)
InfiGFusion खेल को बदल देता है क्योंकि यह शब्दों को व्यक्तिगत रूप से देखने के बजाय, इस बात पर ध्यान केंद्रित करता है कि वे कैसे जुड़ते हैं।
- उपमा: कल्पना कीजिए कि AI के विचार केवल शब्दों की एक सूची नहीं हैं, बल्कि एक सोशल नेटवर्क हैं।
- नोड्स (लोग): AI जो भी शब्द बोल सकता है, वह एक व्यक्ति है।
- एजेस (दोस्ती): यदि AI अक्सर "आग" और "धुआं" के बारे में एक साथ सोचता है, तो उनके बीच एक मजबूत दोस्ती की रेखा है।
- नवाचार: केवल उन शब्दों की सूची की तुलना करने के बजाय जो AI भविष्यवाणी करता है, InfiGFusion मित्रता के पूरे मानचित्र की तुलना करता है। यह पूछता है: "क्या सुपर शेफ का 'आग' का 'ध煙' से संबंध रखने वाला मानचित्र, इतालवी शेफ और भारतीय शेफ के मानचित्र जैसा ही है?"
3. सीक्रेट सॉस: "ग्रोमोव-वासरस्टीन" दूरी (The Shape Matcher)
इन जटिल मानचित्रों की तुलना करने के लिए, लेखक एक गणितीय उपकरण जिसे ग्रोमोव-वासरस्टीन (Gromov-Wasserstein - GW) दूरी कहा जाता है, का उपयोग करते हैं।
- उपमा: कल्पना कीजिए कि आपके पास मिट्टी से बनी दो अलग-अलग आकृतियाँ हैं। एक घन (cube) है, एक गोला (sphere) है। आप जानना चाहते हैं कि वे कितने समान हैं।
- पुराना तरीका: आप हर एक बिंदु की ऊंचाई, चौड़ाई और गहराई को मापते हैं। यह धीमा और अव्यवस्थित है।
- GW तरीका: आप वस्तु के आकार (shape) को देखते हैं। क्या घन के कोने हैं? क्या गोले में वक्र (curves) हैं? आप बिंदुओं के बजाय बिंदुओं के बीच के संबंधों की तुलना करते हैं।
- GW के साथ समस्या: आमतौर पर, यह "शेप मैचिंग" अविश्वसनीय रूप से धीमा और गणनात्मक रूप से महंगा (computational expense) होता है (जैसे अरबों टुकड़ों वाले पहेली को हल करने की कोशिश करना)। इसे प्रशिक्षित करने में बहुत समय लगेगा।
4. बड़ी सफलता: "सॉर्टिंग" का शॉर्टकट
पेपर की सबसे बड़ी तकनीकी उपलब्धि इस शेप मैचिंग को तेजी से करने का एक नया तरीका है।
- उपमा: सोशल नेटवर्क में हर एक व्यक्ति को एक-एक करके मिलाने की कोशिश करने के बजाय, उन्होंने महसूस किया कि वे बस हर किसी को उनकी लोकप्रियता (कितने कनेक्शन हैं) के आधार पर रैंक (rank) कर सकते हैं।
- यदि "सुपर शेफ" के पास एक "आग" वाला व्यक्ति है जो 5वां सबसे लोकप्रिय है, और "सोर्स शेफ" के पास भी 5वां सबसे लोकप्रिय "आग" वाला व्यक्ति है, तो वे उन्हें मिला देते हैं!
- परिणाम: यह "सॉर्टिंग" ट्रिक एक कार्य को जो पहले बहुत समय लेता था (O(n⁴)), उसे लगभग तत्काल (O(n log n)) कार्य में बदल देती है। यह 10 घंटे की पैदल यात्रा को 10 मिनट की साइकिल यात्रा में बदलने जैसा है।
5. परिणाम: "सोचने" में बेहतर
लेखकों ने गणित, कोडिंग और तर्क पहेलियों सहित 11 विभिन्न चुनौतियों पर इस नए "सुपर शेफ" का परीक्षण किया।
- निष्कर्ष: InfiGFusion पिछले तरीकों की तुलना में जटिल तर्क (complex reasoning) में काफी बेहतर था।
- उदाहरण: एक "मल्टी-स्टेप अरिथमेटिक" टेस्ट (गणित की समस्या को हल करना जिसमें कई चरणों की आवश्यकता होती है) पर, इसमें 35.6 अंक का सुधार हुआ।
- उदाहरण: "कॉज़ल जजमेंट" (यह पता लगाना कि क्या A ने B को जन्म दिया) पर, इसमें 37 अंक का सुधार हुआ।
- क्यों? क्योंकि इसने विचारों के बीच के संबंधों को सुरक्षित रखा। इसने केवल उत्तर को याद नहीं किया; इसने उस तर्क (logic) को सीखा कि स्रोत मॉडल ने कैसे तर्क किया।
सारांश
InfiGFusion एआई मॉडल्स को संयोजित करने का एक नया तरीका है। केवल शब्द-दर-शब्द उत्तरों की नकल करने के बजाय, यह सोचने की संरचना की नकल करता है। यह AI की भविष्यवाणियों को कनेक्शन के मानचित्र के रूप में मानता है और इन मानचित्रों को तेजी से संरेखित करने के लिए एक चतुर "सॉर्टिंग" ट्रिक का उपयोग करता है। परिणाम स्वरूप, एक ऐसा फ्यूज्ड AI मिलता है जो उन मॉडल्स की तुलना में जटिल, बहु-चरणीय समस्याओं को हल करने में बहुत अधिक स्मार्ट है जो केवल शब्दों को अलग-थलग देखते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।