← नवीनतम पेपर
🤖 AI

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Systems

QuickLAP एक बेयसियन फ्रेमवर्क है जो अस्पष्ट भौतिक सुधारों को उच्च-स्तरीय भाषाई फीडबैक के साथ जोड़ने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे अर्ध-स्वायत्त प्रणालियों को वास्तविक समय में उपयोगकर्ता रिवॉर्ड फंक्शन को तेजी से और मजबूती से अनुमानित करने में सक्षम बनाया जा सके।

मूल लेखक: Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को गाड़ी चलाना या अपने हाथ हिलाना सिखा रहे हैं। आपके पास इसे बताने के दो तरीके हैं कि आप क्या चाहते हैं: या तो आप इसे कर सकते हैं (भौतिक रूप से स्टीयरिंग व्हील को धकेलना या रोबोट के हाथ को पकड़ना) या आप इसे कह सकते हैं (उसे कहना "उस कोन से बचो!").

समस्या यह है कि दोनों में से कोई भी तरीका अकेले पूरी तरह से काम नहीं करता है:

  • करना (Physical Correction): यदि आप बाएं मुड़ने के लिए स्टीयरिंग व्हील को पकड़ते हैं, तो रोबोट को पता चल जाता है कि उसे कहाँ जाना है, लेकिन वह यह नहीं जानता कि क्यों। क्या आपने कोन से बचने के लिए बाएं मुड़ा? लेन बदलने के लिए? या क्योंकि आपने एक गड्ढा देखा? रोबोट अनुमान लगाने की स्थिति में रह जाता है।
  • कहना (Language): यदि आप चिल्लाते हैं "कोन से बचो!", तो रोबोट को पता चल जाता है कि आप किस बात की परवाह कर रहे हैं, लेकिन उसे यह नहीं पता कि उनसे बचने के लिए उसे ठीक से कैसे हिलना चाहिए। यह "सावधान रहो!" कहने जैसा है बिना यह जाने कि आप किस चीज़ के लिए सावधान हो रहे हैं।

QuickLAP से मिलिए।

QuickLAP को एक सुपर-स्मार्ट अनुवादक (translator) के रूप में सोचें जो आपके और रोबोट के बीच बैठता है और आपके शब्दों और आपके कार्यों को एक स्पष्ट निर्देश में जोड़कर रोबोट को वास्तविक समय (real-time) में आपसे सीखने का एक नया तरीका देता है।

यह कैसे काम करता है: "जासूस" का रूपक (Analogy)

कल्पना कीजिए कि रोबोट एक जासूस है जो एक रहस्य सुलझाने की कोशिश कर रहा है: "मेरे मानव बॉस वास्तव में क्या चाहते हैं?"

  1. सुराग (Physical Action): आप रोबोट के हाथ को धकेलते हैं। जासूस उस हलचल को देखता है। "ठीक है, बॉस ने हाथ को लाल ब्लॉक से दूर किया।"
  2. गवाही (Language): उसी समय, आप कहते हैं, "लाल ब्लॉक से मत टकराना!"
  3. दिमाग (QuickLAP): QuickLAP एक विशेष AI (एक Large Language Model) का उपयोग करता है जो जासूस के दिमाग के रूप में कार्य करता है। यह आपके शब्दों को देखता है और पूछता है:
    • आपके मूवमेंट का कौन सा हिस्सा महत्वपूर्ण है? ("Attention" वाला हिस्सा)।
    • आप कितने निश्चित हैं? ("Confidence" वाला हिस्सा)।
    • आपके शब्दों के आधार पर मुझे अपनी योजना कितनी बदलनी चाहिए?

यदि आप हाथ को धकेलते समय कहते हैं "लाल ब्लॉक से मत टकराना!", तो QuickLAP को एहसास होता है: "आह, बॉस विशेष रूप से लाल ब्लॉक को लेकर चिंतित हैं, न कि गति या पथ को लेकर। मुझे उस विशिष्ट वस्तु से बचने पर अपना ध्यान केंद्रित करना चाहिए।"

यदि आप केवल "सावधान रहो!" कहते हुए हाथ को धकेलते हैं, तो QuickLAP थोड़ा भ्रमित हो जाता है। वह जानता है कि आप चिंतित हैं, लेकिन वह यह नहीं जानता कि किस बात को लेकर। इसलिए, वह अंदाजे लगाने के बजाय आपके भौतिक धक्का (nudge) पर अधिक भरोसा करता है ताकि यह समझ सके कि आपने वास्तव में क्या किया।

जादुई सूत्र (The Magic Formula)

यह शोध पत्र एक गणितीय "नुस्खा" (Bayesian framework) का वर्णन करता है जो इन दो सामग्रियों को मिलाता है:

  • भौतिक धक्का (Physical Nudge): यह रोबोट को बदलाव की दिशा बताता है।
  • शब्द (Words): ये रोबोट को बताते हैं कि उसे किस विशिष्ट चीज़ पर ध्यान केंद्रित करना है और वह अपने विचार को कितनी मजबूती से बदले।

इन दोनों को मिलाकर, QuickLAP रोबोट के "दिमाग" (इसके रिवॉर्ड फंक्शन) को तुरंत अपडेट कर सकता है। यह बिल्कुल वैसा ही है जैसे आप कुत्ते को बैठने के लिए सिखा रहे हों। यदि आप कुत्ते को नीचे दबाते हैं (भौतिक) और साथ में "बैठो!" कहते हैं (भाषा), तो कुत्ता तुरंत सीख जाता है। यदि आप केवल बिना कुछ कहे उसे नीचे दबाते हैं, तो कुत्ते को लग सकता है कि आप उसे लेटने के लिए कह रहे हैं। यदि आप कुत्ते के दौड़ते समय केवल "बैठो!" कहते हैं, तो कुत्ता भ्रमित हो जाता है। QuickLAP यह सुनिश्चित करता है कि रोबोट दोनों का सही मिश्रण प्राप्त करे।

उन्होंने क्या पाया

शोधकर्ताओं ने दो दुनियाओं में इसका परीक्षण किया:

  1. एक रोबोटिक आर्म: बाधाओं से टकराए बिना ब्लॉक को हिलाने की कोशिश।
  2. एक स्वायत्त कार (Self-Driving Car): कोन और गड्ढों के आसपास गाड़ी चलाने की कोशिश।

परिणाम:

  • कम गलतियाँ: जब QuickLAP का उपयोग किया गया, तो रोब का केवल भौतिक धक्के या शब्दों और कार्यों के सरल संयोजन वाले तरीकों की तुलना में, आपकी इच्छा सीखने में 70% से अधिक कम गलतियाँ कीं।
  • बेहतर समझ: वास्तविक मनुष्यों के साथ किए गए परीक्षणों में, लोगों को लगा कि QuickLAP उन्हें बहुत बेहतर समझता है। उन्हें यह अधिक सहयोगात्मक लगा, जैसे कि रोबोट उनके शब्दों को समझने के लिए उनके कार्यों को "सुन" रहा हो।
  • भ्रम को संभालना: जब मनुष्यों ने अस्पष्ट निर्देश दिए (जैसे "देखकर चलो!") या गलतियाँ कीं (जैसे "कोन" कहा लेकिन "गड्ढे" की ओर बढ़े), तो QuickLAP भौतिक क्रिया को देखकर शब्दों को सही संदर्भ देने और वास्तविक इरादे को समझने में सक्षम था।

मुख्य निष्कर्ष (The Bottom Line)

QuickLAP एक ऐसा सिस्टम है जो रोबोट को आपके कार्यों को समझने के लिए आपके शब्दों को एक मार्गदर्शक के रूप में उपयोग करके तेजी से और अधिक सटीक रूप से सीखने में मदद करता है। यह रोबोट को यह अनुमान लगाने से रोकता है कि आपने उसे क्यों हिलाया और उसे यह समझने में मदद करता है कि आप वास्तव में किस बात की परवाह करते हैं, जिससे मानव-रोबोट टीम वर्क बहुत अधिक सहज और सहजपूर्ण हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →