← नवीनतम पेपर
💻 computer science

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

यह शोध पत्र CAST का प्रस्ताव करता है, जो रोबोटिक डेटासेट को बढ़ाने के लिए काउंटरफैक्चुअल लेबल उत्पन्न करने हेतु विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे बिना किसी अतिरिक्त डेटा संग्रह के विजन-लैंग्वेज-एक्शन मॉडल्स की निर्देश-अनुपालन क्षमताओं में महत्वपूर्ण सुधार होता है।

मूल लेखक: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

प्रकाशित 2026-06-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर में रास्ता खोजने या वस्तुओं को उठाने के बारे में सिखाने की कोशिश कर रहे हैं। आप उसे एक वीडियो दिखाते हैं जिसमें एक रोबोट गलियारे में चल रहा है और दाएं मुड़ रहा है। आप रोबोट से कहते हैं, " 'सीधे जाओ' का मतलब यह है।"

समस्या यह है कि रोबोट थोड़ा आलसी छात्र है। वह ध्यान देता है कि हर बार जब वह गलियारा देखता है, तो वीडियो में रोबोट दाएं मुड़ जाता है। इसलिए, वह एक शॉर्टकट सीख लेता है: "अगर मैं गलियारा देखूँ, तो मैं दाएं मुड़ जाऊँगा।" वह आपके विशिष्ट निर्देशों (जैसे "नीली मेज पर बाएं मुड़ें") को सुनना बंद कर देता है क्योंकि उसे लगता है कि गलियारे का चित्र ही उसे सब कुछ बता देने के लिए काफी है। शोध पत्र की तकनीकी शब्दावली में, इसे "पोस्टीरियर कोलैप्स" (posterior collapse) कहा जाता है—रोबोट आपकी आवाज़ को अनदेखा कर देता है और केवल वही अनुमान लगाता है जो वह देख रहा है।

CAST समाधान: "क्या होगा अगर?" का खेल

इस पेपर के लेखक, जो UC बर्कले और प्रिंसटन से हैं, इस समस्या को ठीक करने के लिए एक चतुर तरकीब लेकर आए हैं। वे इसे CAST (काउंटरफैक्टुअल लेबल्स इम्प्रूव इंस्ट्रक्शन फॉलोइंग) कहते हैं।

CAST को एक रोबोट के लिए रचनात्मक लेखन कोच (creative writing coach) के रूप में समझें। केवल उस एक रास्ते को दिखाने के बजाय जो रोबोट ने वास्तव में लिया था, कोच रोबोट को "क्या होगा अगर?" (What If?) का खेल खेलने के लिए कहता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

  1. मूल दृश्य: रोबोट के पास खुद को एक गलियारे में चलते हुए देखने का एक वीडियो है।
  2. "क्या होगा अगर?" वाला प्रश्न: शोधकर्ता एक अत्यंत बुद्धिमान AI (एक विज़न-लैंग्वेज मॉडल) का उपयोग करते हैं, जो उसी गलियारे को देखता है और पूछता है, "हे, यहाँ रोबोट और क्या कर सकता था?"
    • मूल: "सीधे जाओ।"
    • काउंटरफैक्टुअल (क्या होगा अगर): "नारंगी मेज पर दाएं मुड़ें," या "बाईं ओर की दीवार के साथ चलें।"
  3. रास्ता बनाना: AI केवल एक वाक्य ही नहीं बनाता; वह उस नए वाक्य से मेल खाने वाला एक नकली वीडियो पथ भी बनाता है। वह कल्पना करता है, "ठीक है, यदि रोबोट नारंगी मेज पर दाएं मुड़ता, तो अगले कुछ सेकंड कैसे दिखते?"
  4. नया सबक: अब, रोबोट के पास बिल्कुल उसी गलियारे के लिए दो सबक हैं:
    • सबक A: "सीधे जाओ" (वास्तविक वीडियो)।
    • सबक B: "नारंगी मेज पर दाएं मुड़ें" (बनाया गया वीडियो)।

यह सब कुछ कैसे बदल देता है

इस तरकीब से पहले, रोबोट गलियारा देखता था और सोचता था, "मैं इसे जानता हूँ! मैं दाएं मुड़ता हूँ!" उसे आपके शब्दों को सुनने की आवश्यकता नहीं थी।

CAST के बाद, रोबोट वही गलियारा देखता है लेकिन महसूस करता है: "रुको, कभी-कभी मैं सीधा जाता हूँ, और कभी-कभी मैं नारंगी मेज पर दाएं मुड़ता हूँ। केवल चित्र ही मुझे यह नहीं बता सकता कि मुझे क्या करना है। मुझे यह जानने के लिए कि कौन सा रास्ता लेना है, आपके विशिष्ट शब्दों को सुनना ही होगा।"

परिणाम

शोधकर्ताओं ने दो प्रकार के रोबोटों पर इसका परीक्षण किया:

  • नेविगेशन रोबोट: वे रोबोट जो घर के अंदर और बाहर घूमते हैं।
  • मैनिपुलेशन रोबोट: रोबोटिक हाथ जो ब्रोकली या चम्मच जैसी चीजों को उठाते हैं।

उन्होंने पाया कि इस "क्या होगा अगर" वाले डेटा का उपयोग करके (बिना किसी नया वास्तविक दुनिया का वीडियो एकत्र किए), रोबोट निर्देशों का पालन करने में बहुत बेहतर हो गए।

  • नेविगेशन में, सफलता की दर इस तरकीब के बिना प्रशिक्षित रोबोटों की तुलना में दोगुनी हो गई।
  • मैनिपुलेशन कार्यों में (जैसे कि आस-पास की वस्तुओं से ध्यान भटकने के बावजूद वस्तुओं को उठाना), रोबोट में 27% का सुधार हुआ।

मुख्य बात

CAST एक रोबोट को "वैकल्पिक वास्तविकताओं" का पुस्तकालय देने जैसा है। रोबोट को यह दिखाकर कि एक ही दृश्य कई अलग-अलग परिणामों की ओर ले जा सकता है, यह उसे अनुमान लगाने के बजाय ध्यान से सुनने के लिए मजबूर करता है। यह एक ऐसे रोबोट को बदल देता है जो केवल "देखकर अनुमान लगाता है" और उसे एक ऐसे रोबोट में बदल देता है जो वास्तव में "सुनता है और कार्य करता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →