← नवीनतम पेपर
💻 computer science

RoboCritics: Enabling Reliable End-to-End LLM Robot Programming through Expert-Informed Critics

RoboCritics एक नवीन ढांचा है जो मोशन-स्तर के उल्लंघनों का पता लगाने, पारदर्शी फीडबैक प्रदान करने और मानव-इन-द-लूप इंटरफ़ेस के माध्यम से पुनरावृत्ति सुधार को सक्षम करने के लिए विशेषज्ञ-सूचित क्रिटिक्स को एकीकृत करके एंड-टू-एंड एलएलएम-आधारित रोबोट प्रोग्रामिंग की सुरक्षा और विश्वसनीयता को बढ़ाता है।

मूल लेखक: Callie Y. Kim, Nathan Thomas White, Evan He, Frederic Sala, Bilge Mutlu

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Callie Y. Kim, Nathan Thomas White, Evan He, Frederic Sala, Bilge Mutlu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ RoboCritics पेपर का स्पष्टीकरण दिया गया है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी समस्या: वह "जादुई" रोबोट जो देख नहीं सकता

कल्पना कीजिए कि आपके पास एक बिल्कुल नया, अविश्वसनीय रूप से स्मार्ट रोबोट सहायक है। आप इससे इंसानों की तरह बात कर सकते हैं, जैसे, "उस हरे सेब को उठाओ और उसे सफेद बॉक्स में रख दो।"

यह रोबट एक Large Language Model (LLM) का उपयोग करता है—जो मूल रूप से एक सुपर-स्मार्ट AI है जो कोड पढ़ और लिख सकता है। यह आपकी बातों को समझने और उन्हें निर्देशों की एक सूची में बदलने में बहुत माहिर है।

लेकिन यहाँ एक पेंच है: यह AI एक ऐसे प्रतिभाशाली लेखक की तरह है जिसने वास्तव में कभी कोई भौतिक वस्तु हिलाई नहीं है। वह "उठाने" और "ले जाने" जैसे शब्दों को जानता है, लेकिन वह भौतिक विज्ञान (physics) को वास्तव में नहीं समझता।

  • वह रोबोट को अपना हाथ इतनी तेज़ी से घुमाने के लिए कह सकता है कि वह टूट जाए।
  • वह रोबोट को सेब उठाने के लिए कह सकता है जबकि उसका हाथ पहले से ही दीवार के अंदर फंसा हुआ हो।
  • वह भूल सकता है कि रोबोट भारी है और यदि वह बहुत तेज़ी से चलता है तो आपके हाथ को कुचल सकता है।

अतीत में, यदि आप किसी AI को रोबोट प्रोग्राम करने के लिए कहते, तो वह आपको केवल कोड का एक "ब्लैक बॉक्स" दे देता। आप "रन" बटन दबाते, और यदि रोब lewat या कुछ टकरा जाता या चोट पहुँचती, तो आपको पता भी नहीं चलता कि क्यों या इसे कैसे ठीक किया जाए।

समाधान: RoboCritics (रोबोट का "सेफ्टी कोच")

इस पेपर के लेखकों ने RoboCritics नामक एक सिस्टम बनाया है। इसे एक सख्त, विशेषज्ञ सुरक्षा कोच (safety coach) को काम शुरू करने से पहले रोबोट का होमवर्क चेक करने के लिए रखने जैसा समझें।

यह सिस्टम कैसे काम करता है, इसे एक सरल उपमा के माध्यम से समझते हैं:

1. छात्र (The LLM)

आप AI को एक प्रोग्राम लिखने के लिए कहते हैं: "सेब को बॉक्स में ले जाओ।" AI एक स्क्रिप्ट लिखता है।

2. कोच (The Critics)

रोबोट के वास्तव में हिलने से पहले, क्रिटिक्स (Critics) हस्तक्षेप करते हैं। ये केवल स्पेल-चेकर नहीं हैं; ये रोबोटिक्स फिजिक्स के विशेषज्ञ हैं। वे स्क्रिप्ट को देखते हैं और अपने दिमाग में (या कंप्यूटर सिमुलेशन में) उस हलचल का परीक्षण करते हैं। वे विशिष्ट खतरों की जाँच करते हैं:

  • स्पीड कोच (The Speed Coach): "रुको, तुम रोबोट को 100 मील प्रति घंटे की रफ्तार से हाथ घुमाने के लिए कह रहे हो! यह खतरनाक है। धीमे हो जाओ।"
  • कोलिजन कोच (The Collision Coach): "यदि रोबकी रोबोट वहाँ जाता है, तो उसकी कोहनी मेज से टकरा जाएगी। इसे थोड़ा ऊपर ले जाएँ।"
  • पिंच कोच (The Pinch Coach): "यदि रोबोट इस तरह से चलता है, तो वह मानव हाथ को एक तंग जगह में फँसा सकता है। ऐसा न करें।"

3. "वन-क्लिक" फिक्स (The "One-Click" Fix)

अतीत में, यदि किसी इंसान को कोई त्रुटि मिलती थी, तो उन्हें खुद कोड फिर से लिखना पड़ता था। RoboCritics के साथ, कोच केवल यह नहीं कहता कि "आप गलत हैं।" वह कहता है:

*"चेतावनी: आप बहुत तेज़ चल रहे हैं। मेरा सुझाव है कि यहाँ एक 'धीमा होने' का कमांड जोड़ें। इसे स्वचालित रूप से ठीक करने के लिए इस बटन पर क्लिक करें।"*

उपयोगकर्ता बटन पर क्लिक कर सकता है, और AI तुरंत कोड को सुरक्षित बनाने के लिए उसे फिर से लिख देता है।

4. लूप (The Loop)

उपयोगकर्ता "Fix" पर क्लिक करना और बार-बार सिमुलेशन चलाना जारी रख सकता है जब तक कि कोच संतुष्ट न हो जाए। उसके बाद ही रोबोट वास्तविक दुनिया में चलता है।

उन्होंने क्या पाया (परिणाम)

शोधकर्ताओं ने इसका परीक्षण 18 लोगों के साथ किया जो रोबोटिक्स विशेषज्ञ नहीं थे। उन्होंने दो समूहों की तुलना की:

  1. ग्रुप A: केवल AI से बात की (The "Black Box" approach)।
  2. ग्रुप B: RoboCritics का उपयोग किया (The "Coach" approach)।

परिणाम:

  • ग्रुप B ने कम गलतियाँ कीं। उनके रोबोट टकराए नहीं, बहुत तेज़ नहीं चले और न ही कहीं फंसे।
  • ग्रुप B अधिक आत्मविश्वासी महसूस कर रहा था। भले ही वे विशेषज्ञ नहीं थे, "कोच" ने उन्हें यह समझने में मदद की कि कोई हलचल खतरनाक क्यों थी।
  • "जादू" पर्याप्त नहीं था। जब उन्होंने सुरक्षा नियमों को AI के दिमाग के अंदर डालने की कोशिश की (AI को "सावधान रहने" के लिए कहना), तब भी AI गलतियाँ करता रहा। उसे वास्तविक हलचल की जाँच करने के लिए एक बाहरी (external) कोच की आवश्यकता थी।

मानवीय तत्व: नियंत्रण बनाम सुविधा (Control vs. Convenience)

अध्ययन में यह दिलचस्प बात सामने आई कि लोगों ने इस सिस्टम का उपयोग कैसे किया:

  • कुछ लोगों को "वन-क्लिक फिक्स" बहुत पसंद आया। उन्होंने कोच पर भरोसा किया और बस क्लिक करते रहे, उन्हें लगा कि उन्हें तुरंत एक परफेक्ट रोबोट प्रोग्राम मिल रहा है।
  • दूसरों को नियंत्रण चाहिए था। कुछ उपयोगकर्ताओं को लगा कि कोच बहुत अधिक सावधान हो रहा है। वे कोड को खुद ट्यून करना चाहते थे ताकि रोबोट तेज़ या अधिक कुशलता से चल सके। वे नहीं चाहते थे कि कोच सभी निर्णय उनके लिए ले।

मुख्य निष्कर्ष (The Takeaway)

RoboCritics AI के "जादू" और भौतिकी (physics) की "वास्तविकता" के बीच एक सेतु है।

यह साबित करता है कि हम केवल AI पर रोबोट कोड लिखने के लिए भरोसा नहीं कर सकते। हमें विशेषज्ञ उपकरणों की आवश्यकता है जो उस कोड के भौतिक परिणामों की जाँच करें। गैर-विशेषज्ञों को एक "सेफ्टी कोच" देकर जो गलतियों को पहचानता है और तुरंत सुधार के विकल्प देता है, हम आम लोगों को बिना इंजीनियरिंग की डिग्री के सुरक्षित रूप से रोबोट प्रोग्राम करने में सक्षम बना सकते हैं।

संक्षेप में: यह रोबोट प्रोग्रामिंग को एक उच्च-जोखिम वाले जुए से बदलकर एक सुरक्षित, निर्देशित बातचीत में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →