LLM-Rosetta: A Hub-and-Spoke Intermediate Representation for Cross-Provider LLM API Translation
LLM-Rosetta एक ओपन-सोर्स, हब-एंड-स्पोक इंटरमीडिएट रिप्रजेंटेशन फ्रेमवर्क है जो प्रमुख LLM API प्रदाताओं के बीच लॉसलेस, द्विदिश अनुवाद को सक्षम बनाता है, जो न्यूनतम ओवरहेड के साथ विविध सिंटैक्टिक प्रारूपों को एक एकीकृत सिमेंटिक कोर में मैप करके एडैप्टर समस्या को प्रभावी ढंग से हल करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक यात्री हैं जो चार अलग-अलग देशों की यात्रा कर रहे हैं: OpenAI, Anthropic, Google, और OpenAI की नई "Responses" सेवा।
प्रत्येक देश में, स्थानीय लोग एक ही भाषा की थोड़ी अलग बोली बोलते हैं। वे सभी "messages," "tools," और "thinking" के बारे में बात करना चाहते हैं, लेकिन वे अपने वाक्यों को अलग तरह से लिखते हैं।
- OpenAI में, आप कह सकते हैं, "यहाँ संदेशों की एक सूची है।"
- Anthropic में, आप कह सकते हैं, "यहाँ कंटेंट ब्लॉक्स की एक सूची है।"
- Google में, आप कह सकते हैं, "यहाँ बातचीत के भाग हैं।"
यदि आप इन चारों देशों में काम करने वाला एक ट्रैवल ऐप बनाना चाहते हैं, तो वर्तमान में आप एक दुस्वप्न का सामना कर रहे हैं। अपने ऐप को हर जगह काम करने के लिए, आपको देशों के हर एक जोड़े के लिए एक विशिष्ट अनुवादक (translator) बनाना होगा।
- OpenAI Anthropic
- OpenAI Google
- Anthropic Google
- ...और इसी तरह।
यदि 100 देश हैं, तो आपको हजारों अनुवादक चाहिए होंगे। यह की समस्या है: जैसे-जैसे आप देश जोड़ते हैं, काम विस्फोटक रूप से बढ़ता जाता है।
LLM-Rosetta: एक सार्वभौमिक "हब" (Universal Hub)
इस शोध पत्र के लेखकों ने, जिनका नेतृत्व पेंग डिंग (Peng Ding) ने किया, महसूस किया कि विभिन्न बोलियों के बावजूद, वास्तव में सभी एक ही बात कह रहे हैं। वे सभी वास्तव में इनके बारे में बात करते हैं:
- कौन बोल रहा है? (System, User, Assistant)
- क्या कहा जा रहा है? (Text, Images, Audio)
- किन टूल्स का उपयोग किया जा रहा है? (Calculators, Search engines)
- हमें कैसे सोचना चाहिए? (Reasoning steps)
उन्होंने LLM-Rosetta बनाया, जो एक सार्वभौमिक मुद्रा विनिमय (universal currency exchange) या एक केंद्रीय रेलवे स्टेशन की तरह कार्य करता है।
प्रत्येक देश के बीच सीधा रास्ता बनाने के बजाय, उन्होंने एक केंद्रीय हब (एक "मध्यवर्ती प्रतिनिधित्व" या Intermediate Representation - IR) बनाया।
- द स्पोक (The Spoke): आप अपने विशिष्ट अनुरोध (जैसे, OpenAI से) को लेते हैं और उसे सार्वभौमिक भाषा (The Hub) में एक बार अनुवादित करते हैं।
- द हब (The Hub): हब मूल अर्थ को पूरी तरह से समझता है। इसे मूल देश के अजीब फॉर्मेट की परवाह नहीं है।
- द स्पोक (The Spoke): हब फिर उस सार्वभौमिक भाषा को गंतव्य देश (जैसे, Google) की विशिष्ट बोली में अनुवादित करता है।
अब, यदि आप एक 5वां देश (जैसे, एक नया AI प्रदाता) जोड़ना चाहते हैं, तो आपको अपने पुराने अनुवादकों को फिर से लिखने की आवश्यकता नहीं है। आपको बस उस देश से हब तक एक नया अनुवादक बनाना होगा। गणित के उलझे हुए विस्फोट से बदलकर एक सरल जोड़ () में बदल जाता है।
यह कैसे काम करता है ("Ops" किचन)
यह शोध पत्र इन अनुवादकों को बनाने के एक चतुर तरीके का वर्णन करता है जिसे "Ops-Composition" कहा जाता है।
कल्पना कीजिए कि एक किचन है जहाँ आपको चार अलग-अलग संस्कृतियों के लिए भोजन पकाना है। एक शेफ द्वारा एक साथ चार अलग-अलग रेसिपी याद रखने के बजाय, आपके पास चार विशिष्ट स्टेशन हैं:
- द कंटेंट स्टेशन (The Content Station): भोजन (टेक्स्ट, इमेज, फाइल्स) को संभालता है।
- द मैसेज स्टेशन (The Message Station): भोजन के क्रम (कौन पहले बोलता है) को संभालता है।
- द टूल स्टेशन (The Tool Station): बर्तनों/उपकरणों (कैलकुलेटर, कोड) को संभालता है।
- द कॉन्फ़िग स्टेशन (The Config Station): तापमान और समय (कितनी तेजी से सोचना है, कितनी रचनात्मकता होनी चाहिए) को संभालता है।
जब आपको OpenAI से Google में अनुवाद करने की आवश्यकता होती है, तो आप बस प्रत्येक स्टेशन पर "OpenAI शेफ" को "Google शेफ" से बदल देते हैं। बाकी किचन वैसा ही रहता है। यह सिस्टम को मॉड्यूलर, सुधारने में आसान और परीक्षण करने में आसान बनाता है।
"लाइव स्ट्रीम" की चुनौती
AI के साथ बात करने का सबसे कठिन हिस्सा यह है कि वह एक साथ जवाब नहीं देता; वह शब्दों को एक-एक करके "स्ट्रीम" करता है, जैसे एक लाइव वीडियो फीड। विभिन्न प्रदाता इस डेटा के "chunks" को अलग-अलग तरीकों से भेजते हैं।
- OpenAI एक "start" सिग्नल, फिर "text," और फिर "end" भेज सकता है।
- Google अब तक का पूरा वाक्य भेज सकता है, फिर अगला भाग।
LLM-Rosetta एक लाइव सबटाइटल अनुवादक की तरह कार्य करता है। यह आने वाली स्ट्रीम को देखता है, इसे "सार्वभौमिक भाषा" (10 मानक इवेंट प्रकारों) में सामान्य करता है, और फिर इसे उस प्रारूप में री-स्ट्रीम करता है जिसकी गंतव्य अपेक्षा करता है। यह "स्टेट" (state) का ट्रैक रखता है ताकि यदि एक टूल कॉल एक चंक में शुरू होता है और दूसरे में समाप्त होता है, तो अनुवाद भ्रमित न हो।
यह एक बड़ी बात क्यों है?
- यह लॉसलेस (Lossless) है: आप OpenAI से हब को एक संदेश भेज सकते हैं और वापस OpenAI को, और यह बिल्कुल वैसा ही दिखेगा जैसा कि पहले था (सूक्ष्म मेटाडेटा विवरणों सहित), ठीक वैसे ही जैसे किसी किताब को फ्रेंच में अनुवाद करना और फिर वापस अंग्रेजी में अनुवाद करना बिना कहानी का एक भी बिंदु खोए।
- यह तेज़ है: अनुवाद 100 माइक्रोसेकंड (यानी 0.0001 सेकंड) से भी कम समय में होता है। यह इतना तेज़ है कि यह आपके ऐप को धीमा नहीं करता है।
- यह पहले से ही काम कर रहा है: यह केवल सिद्धांत नहीं है। इसका उपयोग वर्तमान में आर्गोन नेशनल लेबोरेटरी (Argonne National Laboratory) में शोधकर्ताओं को उनके कोड को फिर से लिखे बिना विभिन्न AI मॉडल के बीच स्विच करने में मदद करने के लिए किया जा रहा है।
निचोड़
LLM-Rosetta AI के लिए रोसेटा स्टोन है। इसने महसूस किया कि जबकि AI कंपनियां अलग-अलग "बोलियाँ" बोलती हैं, वे सभी एक ही "व्याकरण" साझा करती हैं। एक सार्वभौमिक मध्यस्थ बनाकर, यह डेवलपर्स को एक कंपनी तक सीमित होने से मुक्त करता है। अब आप एक ऐसा ऐप बना सकते हैं जो आज OpenAI से बात करता है, और यदि आप कल Google पर स्विच करना चाहते हैं, तो आप बस एक स्विच फ्लिप कर सकते हैं। आपके ऐप को फिर से बनाने की आवश्यकता नहीं है; इसे बस हब के लिए एक नया अनुवादक चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।