← नवीनतम पेपर
💻 computer science

OpenJarvis: Personal AI, On Personal Devices

OpenJarvis एक विखंडित (decomposed), टाइप किया गया व्यक्तिगत AI आर्किटेक्चर पेश करता है जो क्लाउड-स्तरीय सटीकता के साथ ऑन-डिवाइस सिस्टम को सक्षम बनाने के लिए LLM-निर्देशित स्पेक सर्च का लाभ उठाते हुए पांच स्वतंत्र प्रिमिटिव्स को अनुकूलित करता है, जिससे API लागत और विलंबता (latency) में भारी कमी आती है।

मूल लेखक: Jon Saad-Falcon, Avanika Narayan, Robby Manihani, Tanvir Bhathal, Herumb Shandilya, Hakki Orhun Akengin, Gabriel Bo, Andrew Park, Matthew Hart, Caia Costello, Chuan Li, Christopher Ré, Azalia Mirhosei
प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jon Saad-Falcon, Avanika Narayan, Robby Manihani, Tanvir Bhathal, Herumb Shandilya, Hakki Orhun Akengin, Gabriel Bo, Andrew Park, Matthew Hart, Caia Costello, Chuan Li, Christopher Ré, Azalia Mirhoseini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व-स्तरीय व्यक्तिगत सहायक है जो क्लाउड में रहता है। वह अविश्वसनीय रूप से बुद्धिमान है, जटिल समस्याओं को हल कर सकता है, और आपके संवेदनशील डेटा (जैसे आपके ईमेल, कैलेंडर और स्वास्थ्य रिकॉर्ड) को एक विशाल सर्वर फार्म में भेजकर संभालता है। यह अच्छा काम करता है, लेकिन इसके लिए हर महीने बहुत पैसा खर्च होता है, इसके लिए इंटरनेट कनेक्शन की आवश्यकता होती है, और इसका मतलब यह है कि आप अपनी निजी डायरी किसी अजनबी को पढ़ने के लिए सौंप रहे हैं।

अब, कल्पना कीजिए कि आप चाहते हैं कि वही सहायक आपके अपने लैपटॉप या फोन के अंदर रहे। आप चाहते हैं कि यह निजी हो, इसमें कोई मासिक शुल्क न हो, और यह बिना वाई-फाई के भी काम करे, जैसे कि जब आप एक विमान में हों।

समस्या यह है कि यदि आप केवल क्लाउड सहायक के "मस्तिष्क" (एक शक्तिशाली AI मॉडल) को लेकर उसे अपने फोन पर चलाने की कोशिश करते हैं, तो वह क्रैश हो जाता है। यह ऐसा है जैसे एक कॉम्पैक्ट सेडान कार में फॉर्मूला 1 रेस कार के इंजन को चलाने की कोशिश करना; कार उस इंजन के लिए नहीं बनी थी। कार का सस्पेंशन, फ्यूल सिस्टम और स्टीयरिंग (सॉफ्टवेयर स्टैक) छोटे इंजन के लिए ट्यून किया गया है। यदि आप बिना बाकी हिस्से बदले इंजन बदल देते हैं, तो सब कुछ बिखर जाएगा।

यही वह मुख्य समस्या है जिसे "OPENJARVIS" पेपर हल करता है।

समस्या: "इंजन स्वैप" की विफलता

शोधकर्ताओं ने एक सरल प्रयोग किया: उन्होंने मौजूदा व्यक्तिगत AI सिस्टम (जैसे OpenClaw या Hermes Agent) को लिया और बस क्लाउड मस्तिष्क को एक स्थानीय (local) मस्तिष्क (एक छोटा AI मॉडल जो आपके डिवाइस पर चलता है) से बदल दिया।

परिणाम? सिस्टम बेहद खराब हो गया। सटीकता में 25-39% की गिरावट आई।
क्यों? क्योंकि "निर्देश", "टूल्स" और "मेमोरी सेटिंग्स" विशेष रूप से विशाल क्लाउड मस्तिष्क के लिए लिखी गई थीं। जब आप एक स्थानीय मस्तिष्क डालते हैं, तो वह उन निर्देशों से भ्रमित हो जाता है जिन्हें उसका पालन करने के लिए डिज़ाइन नहीं किया गया था।

समाधान: "LEGO ब्लूप्रिंट" (द स्पेक)

लेखकों ने महसूस किया कि आप केवल मस्तिष्क को नहीं बदल सकते; आपको नए इंजन के अनुकूल बनाने के लिए पूरी कार को फिर से बनाना होगा। ऐसा करने के लिए, उन्होंने OPENJARVIS बनाया।

OPENJARVIS को एक यूनिवर्सल LEGO ब्लूप्रिंट (जिसे "Spec" कहा जाता है) के रूप में सोचें। कोड के एक उलझे हुए ढेर के बजाय, उन्होंने व्यक्तिगत AI सिस्टम को पांच अलग-अलग, बदलने योग्य LEGO ब्लॉक्स में विभाजित किया:

  1. इंटेलिजेंस (Intelligence): मस्तिष्क (AI मॉडल)।
  2. इंजन (Engine): कार का इंजन और ट्रांसमिशन (मॉडल कैसे चलता है)।
  3. एजेंट्स (Agents): ड्राइवर का तर्क (वह कैसे सोचता और निर्णय लेता है)।
  4. टूल्स और मेमोरी (Tools & Memory): मानचित्र और टूलबॉक्स (वह फाइलों और इंटरनेट तक कैसे पहुँचता है)।
  5. लर्निंग (Learning): मैकेनिक (कैसे सिस्टम खुद को बेहतर बनाता है)।

चूंकि ये अलग-अलग ब्लॉक हैं, इसलिए आप "इंटेलिजेंस" ब्लॉक को एक स्थानीय मॉडल के लिए बदल सकते हैं और फिर इसे पूरी तरह से मैच करने के लिए अन्य चार ब्लॉकों को ट्यून कर सकते हैं। यह बिल्कुल वैसा ही है जैसे रेस कार के इंजन को लेना और फिर उस इंजन के लिए विशेष रूप से सस्पेंशन, टायर और फ्यूल मिक्स को एडजस्ट करना, न कि उसे जबरदस्ती एक सेडान में फिट करने की कोशिश करना।

जादुई ट्रिक: "ट्यूटर और स्टूडेंट" सर्च

LEGO ब्लॉक्स के साथ भी, एक स्थानीय मस्तिष्क अभी भी क्लाउड मस्तिष्क की तुलना में कम स्मार्ट होता है। आप स्थानीय वाले को क्लाउड वाले जितना प्रदर्शन करने वाला कैसे बना सकते हैं?

उन्होंने LLM-guided spec search नामक एक विधि का आविष्कार किया। एक ट्यूटर-स्टूडेंट (शिक्षक-छात्र) संबंध की कल्पना करें:

  • स्टूडेंट (छात्र): आपके डिवाइस पर चल रहा स्थानीय AI।
  • ट्यूटर (शिक्षक): एक अत्यंत बुद्धिमान क्लाउड AI (जैसे वे जिनके लिए आप भुगतान करते हैं)।

यह यहाँ काम करता है:

  1. द टेस्ट (परीक्षण): स्टूडेंट एक कार्य करने की कोशिश करता है और विफल हो जाता है।
  2. द डायग्नोसिस (निदान): ट्यूटर विफलता को देखता है और कहता है, "आह, आप इसलिए विफल हुए क्योंकि आपने कैलेंडर टूल का सही उपयोग नहीं किया," या "आपको अपने रीजनिंग स्टेप्स को बदलने की आवश्यकता है।"
  3. द एडिट (संपादन): ट्यूटर केवल उत्तर नहीं देता; यह LEGO ब्लूप्रिंट को फिर से लिखता है। यह कह सकता है, "टूल का विवरण बदलें," "मेमोरी सेटिंग्स को एडजस्ट करें," या "मस्तिष्क के पैरामीटर्स को ट्यून करें।"
  4. द गेटकीपर (द्वारपाल): एक सख्त नियम जाँचता है: "क्या इस बदलाव ने स्टूडेंट को अन्य चीजों में खराब किए बिना बेहतर बनाया?" यदि हाँ, तो बदलाव स्वीकार किया जाता है। यदि नहीं, तो इसे अस्वीकार कर दिया जाता है।
  5. द रिजल्ट (परिणाम): स्टूडेंट सीखता है और अपने ब्लूप्रिंट में सुधार करता है।

महत्वपूर्ण बात: ट्यूटर केवल "सर्च" चरण (सेटअप) के दौरान मदद करता है। एक बार ब्लूप्रिंट परफेक्ट हो जाने के बाद, स्टूडेंट पूरी तरह से आपके डिवाइस पर चलता है और क्लाउड कॉल की आवश्यकता शून्य होती है। क्लाउड ट्यूटर गायब हो जाता है, और आपके पास एक अत्यधिक अनुकूलित, निजी, स्थानीय सहायक बचता है।

परिणाम: निजी, तेज़ और सस्ता

पेपर का परीक्षण 8 वास्तविक दुनिया के कार्यों (कोडिंग, रिसर्च, शेड्यूलिंग आदि) पर किया गया। यहाँ पाया गया:

  • परफॉरमेंस (प्रदर्शन): अनुकूलित स्थानीय सहायक लगभग क्लाउड सहायकों जितने ही अच्छे प्रदर्शन करते हैं। 8 में से 4 परीक्षणों में, स्थानीय संस्करण वास्तव में बेहतर या बराबर था। औसतन, वे सबसे अच्छे क्लाउड मॉडल से केवल 3.2% कम सटीक थे।
  • कॉस्ट (लागत): क्योंकि स्थानीय मॉडल आपके अपने हार्डवेयर पर चलता है, इसलिए प्रति क्वेरी लागत लगभग 800 गुना कम हो गई। आप मासिक सदस्यता के लिए भुगतान करना बंद कर देते हैं।
  • स्पीड (गति): स्थानीय संस्करण 4 गुना तेज़ था क्योंकि इसे डेटा को क्लाउड तक जाने और वापस आने का इंतज़ार नहीं करना पड़ा।
  • प्राइवेसी (गोपनीयता): सामान्य उपयोग के दौरान आपका डेटा आपके डिवाइस को कभी नहीं छोड़ता है।

सारांश

OPENJARVIS व्यक्तिगत AI बनाने का एक नया तरीका है। एक स्थानीय AI को क्लाउड AI की तरह काम करने के लिए मजबूर करने के बजाय, यह सिस्टम को हिस्सों में तोड़ देता है और एक "ट्यूटर" का उपयोग करता है जो उन हिस्सों को विशेष रूप से स्थानीय हार्डवेयर के लिए फिर से डिज़ाइन करता है। परिणाम एक ऐसा व्यक्तिगत AI है जो आपकी जेब में रहता है, आपके रहस्यों को सुरक्षित रखता है, इसे चलाने में लगभग कुछ भी खर्च नहीं होता है, और महंगे क्लाउड दिग्गजों जितना ही स्मार्ट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →