← नवीनतम पेपर
🤖 AI

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

यह शोध पत्र वेरीफायर-गाइडेड एक्शन सिलेक्शन (VeGAS) का प्रस्ताव करता है, जो एक टेस्ट-टाइम फ्रेमवर्क है जो उम्मीदवार कार्यों (कैंडिडेट एक्शन्स) को सैंपल करके और एक विशेष रूप से प्रशिक्षित जनरेटिव वेरीफायर—जिसे LLM-संचालित डेटा सिंथेसिस रणनीति के माध्यम से बनाया गया है—का उपयोग करके सबसे विश्वसनीय कार्य का चयन करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल-आधारित एम्बोडीड एजेंट्स की मजबूती को बढ़ाता है, जिससे अंतर्निहित पॉलिसी को संशोधित किए बिना जटिल, लॉन्ग-होरिज़न कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपना घर साफ करना सिखा रहे हैं। आप उसे एक सरल निर्देश देते हैं: "एक खेल की वस्तु ढूंढो और उसे काउंटर पर रख दो।"

अतीत में, यदि आप किसी स्मार्ट रोबोट से यह करने को कहते, तो वह एक त्वरित नज़र डालता, अनुमान लगाता कि आगे क्या करना है, और तुरंत पहली चीज़ को पकड़ लेता जो उसे दिखती। यदि वह एक स्पंज को गेंद समझकर उठा लेता, तो रोबोट विफल हो जाता, और उसे तब तक पता नहीं चलता कि उसने गलती की है जब तक कि पूरा कार्य खराब न हो जाए। यह एक छात्र द्वारा परीक्षा देने जैसा था, जो बिना अपने काम की जाँच किए, जो भी पहला उत्तर उसके दिमाग में आया, उसे लिख देता और जमा कर देता।

यह पेपर एक नई विधि पेश करता है जिसे VEGAS (वेगास - Verifier-Guided Action Selection) कहा जाता है ताकि इसे ठीक किया जा सके। VEGAS को रोबोट को कार्य करने से पहले एक "दूसरी राय" देने के रूप में समझें।

समस्या: "आवेगपूर्ण" रोबोट

वर्तमान रोबट बहुत स्मार्ट AI मॉडल (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल कहा जाता है) द्वारा संचालित होते हैं। वे भाषा समझने और तस्वीरें देखने में बहुत अच्छे हैं। हालाँकि, वे थोड़े आवेगपूर्ण जीनियस की तरह हैं। जब उन्हें किसी पेचीदा स्थिति का सामना करना पड़ता है—जैसे "केले" के बजाय "पीला घुमावदार फल" खोजना, या कैबिनेट में रखने से पहले सेब को साफ करना—तो वे अक्सर एक उत्तर की ओर भागते हैं। यदि वे शुरुआत में एक छोटी सी गलती करते हैं, तो पूरी योजना विफल हो जाती है क्योंकि वे कभी रुककर यह नहीं पूछते, "रुको, क्या यह वास्तव में सही है?"

समाधान: "दो बार सोचें" की रणनीति

लेखक एक सरल लेकिन शक्तिशाली बदलाव का प्रस्ताव करते हैं: सिर्फ कार्य न करें; दो बार सोचें, फिर एक बार कार्य करें।

यहाँ बताया गया है कि खाना पकाने के उदाहरण का उपयोग करते हुए VEGAS कैसे काम करता है:

  1. शेफ (द पॉलिसी): कल्पना कीजिए कि रोबोट एक शेफ है जो रेसिपी का पालन करने की कोशिश कर रहा है। केवल एक सामग्री पकड़कर बर्तन में डालने के बजाय, शेफ अब रुकता है।
  2. टेस्टिंग मेनू (सैंपलिंग): शेफ वर्तमान चरण को हल करने के 16 अलग-अलग तरीके सोचता है। शायद "टमाटर पकड़ें," शायद "प्याज पकड़ें," शायद "पहले फ्रिज पर जाएं।" शेफ एक छोटा सा नोट ("चेन ऑफ थॉट") लिखता है जिसमें यह समझाया गया है कि वे प्रत्येक विकल्प को क्यों अच्छा समझते हैं।
  3. क्रिटिक (द वेरीफायर): यह जादुई हिस्सा है। शेफ केवल पहले विचार को नहीं चुनता। वे सभी 16 विचारों को एक क्रिटिक (एक विशेष AI जिसे गलतियाँ पकड़ने के लिए प्रशिक्षित किया गया है) को सौंप देते हैं।
    • क्रिटिक रेसिपी और शेफ के नोट्स को पढ़ता है।
    • क्रिटिक कहता है: "विकल्प 1 गलत है क्योंकि आपने गेंद के बजाय स्पंज पकड़ा है।"
    • "विकल्प 2 गलत है क्योंकि आपने माइक्रोवेव खोलने की कोशिश की जो पहले से ही बंद है।"
    • "विकल्प 3 एकदम सही है!"
  4. अंतिम कदम: शेफ केवल उसी क्रिया को निष्पादित करता है जिसे क्रिटिक ने "थम्स अप" दिया है।

गुप्त नुस्खा: क्रिटिक को प्रशिक्षित करना

आप सोच सकते हैं, "क्या हम क्रिटिक के रूप में एक सुपर-स्मार्ट AI का उपयोग नहीं कर सकते?" लेखकों ने इसे आज़माया, और यह विफल रहा। एक सामान्य-उद्देश्य वाला AI बहुत विनम्र या बहुत अस्पष्ट होता है ताकि विशिष्ट रोबोटिक गलतियों को पकड़ सके।

इसे ठीक करने के लिए, लेखकों ने एक सिंथेटिक फेलियर फैक्ट्री (Synthetic Failure Factory) का आविष्कार किया।

  • उन्होंने हजारों सफल रोबोट कार्यों को लिया।
  • उन्होंने एक शक्तिशाली AI का उपयोग करके उन्हें जानबूझकर बिगाड़ दिया। उन्होंने रोबोट को गलत वस्तु पकड़ने, एक चरण छोड़ने, या गलत दरवाजा खोलने के लिए प्रेरित किया।
  • फिर उन्होंने AI से एक रिपोर्ट लिखने को कहा कि प्रत्येक गलती क्यों खराब थी।
  • उन्होंने इन "नकली गलतियों" और "नकली रिपोर्टों" का उपयोग अपने क्रिटिक को प्रशिक्षित करने के लिए किया।

यह एक सुरक्षा निरीक्षक को हजारों वीडियो दिखाकर प्रशिक्षित करने जैसा है जिनमें लोग खतरनाक काम कर रहे हैं और विस्तार से समझा रहे हैं कि वह क्यों खतरनाक था। अब, जब वास्तविक रोबोट कार्य करता है, तो क्रिटिक उन विशिष्ट त्रुटियों को पहचानने में विशेषज्ञ होता है।

परिणाम

लेखकों ने इसका परीक्षण दो आभासी दुनियाओं (Habitat और ALFRED) में किया जहाँ रोबोटों को घरेलू काम करने होते हैं।

  • VEGAS के बिना: रोबोट लगभग 65% कार्य सही ढंग से करता है।
  • VEGAS के साथ: रोबोट लगभग 71% कार्य सही ढंग से करता है।
  • सबसे कठिन कार्यों पर: सुधार बहुत बड़ा था—पहले की तुलना में 36% तक बेहतर

यह पेपर दिखाता है कि रोबोट को कई विकल्प उत्पन्न करने के लिए मजबूर करके और एक विशेष "क्रिटिक" को सबसे अच्छा चुनने के लिए कहकर, रोबोट बहुत अधिक विश्वसनीय हो जाता है, विशेष रूप से जब निर्देश पेचीदा हों या स्थिति नई हो।

सारांश

यह पेपर यह दावा नहीं करता कि यह कल बीमारियों का इलाज करेगा या कारों को चलाएगा। यह केवल यह दावा करता है कि घरेलू कार्यों को करने वाले रोबोटों के लिए, अपने काम की जाँच करने के लिए धीमा होना (एक प्रशिक्षित वेरीफायर का उपयोग करना) उन्हें काफी स्मार्ट बनाता है और जटिल होने पर उनके विफल होने की संभावना को कम करता है। यह एक "अनुमान लगाने और उम्मीद करने वाले" रोबोट को "योजना बनाने, जाँच करने और निष्पादित करने वाले" रोबोट में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →