← नवीनतम पेपर
🤖 AI

NOEM3^{3}A: a Neuro-symbolic Ontology-Enhanced Method for Multi-intent understanding in Mobile Agents

यह शोध पत्र NOEM3^{3}A प्रस्तुत करता है, जो एक हल्का न्यूरो-सिम्बोलिक फ्रेमवर्क है जो मल्टी-इंटेंट (बहु-इरादा) समझ, सटीकता और गोपनीयता को बेहतर बनाने के लिए एक इंटेंट ऑन्टोलॉजी को एकीकृत करके ऑन-डिवाइस मोबाइल एजेंटों के लिए कॉम्पैक्ट लैंग्वेज मॉडल्स को उन्नत करता है और साथ ही कम लेटेंसी बनाए रखता है।

मूल लेखक: Ioannis Tzachristas, Aifen Sui

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ioannis Tzachristas, Aifen Sui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके फोन में रहने वाला एक बहुत ही स्मार्ट लेकिन छोटा रोबोट असिस्टेंट है। इसका काम आपकी बातों को सुनना (जैसे "एक फ्लाइट बुक करो और पिज्जा ऑर्डर करो") और यह समझना है कि इसे पूरा करने के लिए ठीक कौन से बटन दबाने हैं।

समस्या यह है कि एक रोबोट को जटिल अनुरोधों को समझने के लिए पर्याप्त स्मार्ट बनाने के लिए एक विशाल मस्तिष्क (एक बहुत बड़े AI मॉडल) की आवश्यकता होती है। लेकिन विशाल मस्तिष्क धीमे होते हैं, बहुत अधिक बैटरी खर्च करते हैं, और अक्सर आपकी निजी जानकारी को क्लाउड पर भेजने की आवश्यकता होती है, जो गोपनीयता का जोखिम है।

यह पेपर NOEM3A पेश करता है, जो एक चतुर "ट्रेनिंग व्हील्स" (सीखने के सहायक उपकरण) प्रणाली है जो एक छोटे, तेज़ रोबोट मस्तिष्क को एक विशाल मस्तिष्क का काम करने देती है, बिना वास्तव में बड़ा हुए।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करके:

1. खाली पन्ने के बजाय "मेन्यू" (विकल्पों की सूची)

सामान्य रूप से, AI से आपके अनुरोध को समझने के लिए कहना एक शेफ से एकदम नया व्यंजन बनाने के लिए कहने जैसा है। वे गलत अंदाजा लगा सकते हैं, या इसमें उन्हें बहुत समय लग सकता है।

NOEM3A खेल बदल देता है और AI को एक सख्त मेन्यू देता है।

  • ऑन्टोलॉजी (द मेन्यू): शोधकर्ताओं ने फोन द्वारा वास्तव में किए जा सकने वाले हर कार्य की एक संरचित सूची बनाई है (जैसे, "फ्लाइट बुकिंग," "पिज्जा ऑर्डर करना," "रिमाइंडर सेट करना")। इसे कार्यों का एक पूर्व-अनुमोदित मेन्यू समझें।
  • रिट्रीवल (शेफ के विशेष व्यंजन): जब आप कहते हैं, "मैं पेरिस जाना चाहता हूँ और एक पिज्जा लेना चाहता हूँ," तो सिस्टम AI से पूरे मेन्यू का अनुमान लगाने के लिए नहीं कहता। इसके बजाय, यह जल्दी से मेन्यू को देखता है और केवल प्रासंगिक वस्तुओं को हाइलाइट करता है: फ्लाइट बुकिंग और पिज्जा ऑर्डरिंग
  • प्रॉम्प्ट (ऑर्डर): यह नन्हे AI को एक नोट थमाता है कि: "यहाँ केवल दो चीजें हैं जिन्हें आप चुन सकते हैं: फ्लाइट बुकिंग या पिज्जा ऑर्डरिंग। आपकी वाक्य रचना में कौन सी फिट बैठती है?"

2. "चुंबकीय" डिकोडिंग (मैग्नेटिक डिकोडिंग)

मेन्यू के साथ भी, एक छोटा AI अभी भी भ्रमित हो सकता है और गलत शब्द चुन सकता है। NOEM3A मदद की एक दूसरी परत जोड़ता है: मैग्नेटिक डिकोडिंग

कल्पित करें कि AI अपना उत्तर, अक्षर-दर-अक्षर लिखने की कोशिश कर रहा है।

  • यदि AI एक ऐसा शब्द लिखने की कोशिश करता है जो मेन्यू में नहीं है (जैसे, जब आपके पास केवल फ्लाइट/पिज्जा मेन्यू है तो "कार खरीदें" लिखना), तो NOEM3A उन अक्षरों पर एक चुंबकीय प्रतिकर्षण (repulsion) लगा देता है, जिससे उन्हें लिखना कठिन हो जाता है।
  • यदि AI एक ऐसा शब्द लिखने की कोशिश करता है जो मेन्यू में है (जैसे, "फ्लाइट"), तो यह उन अक्षरों पर चुंबकीय आकर्षण (attraction) लगा देता है, जिससे उन्हें लिखना आसान हो जाता है।

यह नन्हे AI को मजबूर किए बिना उसे सही उत्तर चुनने के लिए धीरे से मार्गदर्शन करता है, यह सुनिश्चित करता है कि वह सुरक्षित, पूर्व-अनुमोदित सूची के भीतर रहे।

3. "फैमिली ट्री" (वंशवृक्ष) की जाँच

कभी-कभी AI सामान्य विचार को सही पकड़ लेता है लेकिन विशिष्ट विवरण को गलत कर देता है। उदाहरण के लिए, यदि आप "ट्रेन बुक" करना चाहते थे लेकिन AI ने "प्लेन बुक" का अनुमान लगाया, तो दोनों "ट्रैवल" परिवार के अंतर्गत आते हैं।

पेपर एक टूल का उपयोग करता है जिसे सिमेंटिक इंटेंट सिमिलैरिटी (SIS) कहा जाता है, जो इसे मापने के लिए है। यह एक फैमिली ट्री की तरह है। यदि AI सटीक व्यक्ति के बजाय एक कजिन (ट्रेन) को चुनता है (प्लेन के बजाय), तो सिस्टम जानता है कि वे संबंधित हैं और यह त्रुटि विनाशकारी नहीं है। यह डेवलपर्स को यह देखने में मदद करता है कि क्या AI केवल थोड़ा सा भटक गया है या पूरी तरह से खो गया है।

परिणाम: छोटा मस्तिष्क, बड़ी जीत

शोधकर्ताओं ने दो छोटे AI मॉडलों (TinyLlama और Llama-3.2-3B) पर परीक्षण किया।

  • NOEM3A के बिना: नन्हे मॉडल ठीक थे, लेकिन गलतियाँ करते थे।
  • NOEM3A के साथ: वही नन्हे मॉडल बहुत अधिक सटीक हो गए। उन्होंने अधिक बार सटीक उत्तर दिए और विशिष्ट विवरणों (जैसे फॉर्म के किस स्लॉट को भरना है) को बहुत बेहतर ढंग से समझा।

यह आपके फोन के लिए क्यों महत्वपूर्ण है

  • गति: "मेन्यू लुकअप" और "मैग्नेटिक गाइड" एक मिलीसेकंड से भी कम समय लेते हैं। यह लगभग तुरंत है।
  • गोपनीयता: क्योंकि AI को आपको समझने के लिए बहुत बड़ा होने की आवश्यकता नहीं है, इसलिए यह पूरी तरह से आपके फोन पर चल सकता है। आपका डेटा आपके डिवाइस को कभी नहीं छोड़ता है।
  • दक्षता: आपको बड़े प्रोसेसर वाला अधिक महंगा फोन खरीदने की आवश्यकता नहीं है। आपको बस अपने मौजूदा प्रोसेसर का उपयोग करने का एक स्मार्ट तरीका चाहिए।

संक्षेप में: NOEM3A एक छोटी, तेज़ कार को GPS देने जैसा है जो केवल वैध सड़कों को दिखाता है। कार को यह जानने के लिए कि कहाँ जाना है, एक विशाल ट्रक होने की आवश्यकता नहीं है; उसे बस एक स्पष्ट मानचित्र और सही रास्ते पर रहने के लिए एक हल्के धक्के की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →