← नवीनतम पेपर
🤖 machine learning

Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models

यह शोध पत्र विज़न-लैंग्वेज-एक्शन मॉडल्स के लिए एक टेम्पोरल-डिफरेंस कैलिब्रेशन फ्रेमवर्क पेश करता है जो एपिसोडिक रोबोटिक्स कार्यों में अनिश्चितता मात्रा निर्धारण और कार्य प्रदर्शन को बेहतर बनाने के लिए अनुक्रमिक ब्रायर स्कोर न्यूनीकरण और वैल्यू फंक्शन्स के बीच संबंध का लाभ उठाता है।

मूल लेखक: Shelly Francis-Meretzki, Mirco Mutti, Yaniv Romano, Aviv Tamar

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shelly Francis-Meretzki, Mirco Mutti, Yaniv Romano, Aviv Tamar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को एक जटिल व्यंजन, जैसे कि सूफ़ले (soufflé) बनाना सिखा रहे हैं। रोबोट को चरणों का एक लंबा क्रम करना होगा: अंडे फोड़ना, उन्हें फेंटना, मैदा मिलाना, बेक करना और फिर यह जांचना कि वह कितना फूला है।

समस्या: अति-आत्मविश्वासी रोबोट
वर्तमान AI रोबोट (जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता) अगले कदम का अनुमान लगाने में बहुत अच्छे होते हैं। वे कह सकते हैं, "मुझे 90% यकीन है कि मुझे अंडे फेंटने चाहिए।" लेकिन पेच यह है: क्या उन्हें पता है कि वे कब विफल होने वाले हैं?

यदि रोबोट कटोरा गिराने वाला है, तो वह अभी भी कह सकता है, "मुझे 90% यकीन है कि मुझे कटोरा गिराना चाहिए!" क्योंकि वह पूरी कहानी को नहीं समझता। यह एक ऐसे छात्र की तरह है जो हर सवाल का जवाब "मुझे 100% यकीन है!" के साथ देता है, भले ही वह केवल अंदाज़ा लगा रहा हो। वे कुछ सवालों में भाग्यशाली हो सकते हैं, लेकिन वे परीक्षा में फेल हो जाएंगे, और उन्हें तब तक पता नहीं चलेगा कि वे मुसीबत में हैं जब तक कि बहुत देर न हो जाए।

रोबोटिक्स में, यह खतरनाक है। यदि एक रोबोट पुल बना रहा है या सर्जरी कर रहा है, तो हमें चाहिए कि वह कहे, "रुको, मुझे यकीन नहीं है कि यह कदम काम करेगा, चलिए रुकते हैं या मदद मांगते हैं," इससे पहले कि कोई आपदा आए।

समाधान: "भविष्य देखने वाला" कोच
यह पेपर रोबोटों को उनके आत्मविश्वास के बारे में ईमानदार होने के लिए प्रशिक्षित करने का एक नया तरीका पेश करता है। लेखक इसे टेम्पोरल डिफरेंस कैलिब्रेशन (TDQC) कहते हैं।

यहाँ सरल उपमा दी गई है:

1. पुराना तरीका: "स्नैपशॉट" कोच

कल्पना कीजिए कि एक कोच जो रोबोट को एक बार में केवल एक सेकंड के लिए देखता है।

  • रोबोट: "मैं फेंटने जा रहा हूँ।"
  • कोच: "ठीक है, क्या तुमने सही ढंग से फेंटा? हाँ? अच्छा काम किया। नहीं? बुरा काम किया।"
  • परिणाम: कोच को यह नहीं पता चलता कि फेंटना बिल्कुल बेकार था क्योंकि रोबोट तीन कदम पहले ओवन को प्रीहीट करना भूल गया था। रोबोट व्यक्तिगत कदमों के बारे में आत्मविश्वासी होना सीख जाता है लेकिन उसे इस बात का कोई अंदाजा नहीं होता कि पूरा व्यंजन सफल होगा या नहीं।

2. नया तरीका: "कहानी सुनाने वाला" कोच (TDQC)

लेखक एक ऐसे कोच का प्रस्ताव देते हैं जो खाना पकाने की प्रक्रिया की पूरी कहानी देखता है। यह कोच समझता है कि एक एकल कदम तभी मायने रखता है जब वह अंत में एक सफल भोजन की ओर ले जाए।

वे वीडियो गेम AI (रीइन्फोर्समेंट लर्निंग) से ली गई एक तकनीक का उपयोग करते हैं। केवल वर्तमान चाल का निर्णय करने के बजाय, कोच पूछता है: "यदि मैं अभी यह चाल चलता हूँ, तो भविष्य में मेरे गेम जीतने (कार्य पूरा करने) की कितनी संभावना है?"

  • "ब्रियर स्कोर" (रिपोर्ट कार्ड): लेखकों ने "सीक्वेंशियल ब्रियर स्कोर" नामक एक नया रिपोर्ट कार्ड बनाया है। यह केवल यह नहीं जांचता कि रोबට अभी सही था या नहीं; यह जांचता है कि रोबोट का आत्मविश्वास पूरे एपिसोड के अंतिम परिणाम से मेल खाता है या नहीं।
    • खराब कैलिब्रेशन: रोबोट कहता है "सफलता की 90% संभावना" लेकिन 50% बार विफल हो जाता है।
    • अच्छा कैलिब्रेशन: रोबोट कहता है "सफलता की 90% संभावना" और 90% बार सफल होता है।

3. जादू का मंत्र: "आगे देखना"

गुप्त सूत्र को टेम्पोरल डिफरेंस (TD) कहा जाता है।
कल्पना कीजिए कि आप एक अंधेरे जंगल में चल रहे हैं।

  • पुराना तरीका: आप अभी अपने पैरों के नीचे जमीन महसूस करते हैं। "क्या यह कदम सुरक्षित है?"
  • नया तरीका (TD): आप अपने पैरों के नीचे की जमीन देखते हैं और आगे का रास्ता भी देखते हैं। आप पूछते हैं, "यदि मैं यह कदम उठाता हूँ, तो क्या मैं 10 सेकंड में सुरक्षित रहूँगा?"

रोबोट जाते-जाते अपना आत्मविश्वास अपडेट करना सीखता है। यदि वह एक ऐसा कदम उठाता है जो अभी ठीक लग रहा है लेकिन बाद में खाई की ओर ले जाता है, तो "भविष्य देखने वाला" कोच तुरंत उसका आत्मविश्वास स्कोर कम कर देता है। यह रोबोट को दुर्घटना होने से बहुत पहले यह समझने की अनुमति देता है कि, "ओह, मैं मुसीबत में हूँ।"

यह क्यों महत्वपूर्ण है

इस पेपर का परीक्षण वास्तविक रोबोटों और सिम्युलेटेड रोबोटों (जैसे LIBERO बेंचमार्क) पर किया गया। यहाँ बताया गया है कि उन्होंने क्या पाया:

  1. ईमानदारी: यह नया तरीका रोबोटों को यह जानने में बहुत बेहतर बनाता है कि वे कब विफल होने जा रहे हैं। वे अति-आत्मविश्वासी होने से बचते हैं।
  2. ब्लैक-बॉक्स फ्रेंडली: आमतौर पर, रोबोट के आत्मविश्वास को ठीक करने के लिए, आपको उसके "मस्तिष्क" (इसके आंतरिक कोड) के अंदर झांकने की आवश्यकता होती है। यह तरीका तब भी काम करता है जब आप रोबोट के मस्तिष्क के अंदर नहीं देख सकते। आपको बस यह देखने की आवश्यकता है कि वह क्या क्रिया करने का दावा करता है। महंगे, क्लोज्ड-सोर्स AI मॉडल का उपयोग करने के लिए यह बहुत बड़ी बात है।
  3. बेहतर निर्णय: जब रोबोट को पता होता है कि वह अनिश्चित है, तो शोधकर्ताओं ने दिखाया कि वे इस ज्ञान का उपयोग रोबोट को कार्य करने से पहले "गहराई से सोचने" के लिए करने हेतु कर सकते हैं। यह ऐसा है जैसे रोबोट कहता है, "मुझे इस चाल के बारे में यकीन नहीं है, आइए एक चुनने से पहले तीन अलग-अलग विकल्पों का अनुकरण (simulate) कर लें।" इसने वास्तव में रोबोटों को अधिक बार सफल बनाया (कुछ परीक्षणों में 15% तक बेहतर)।

निचोड़

यह पेपर रोबोटों को एक "अंतर्ज्ञान" (gut feeling) देता है जो वास्तव में काम करता है। यह उन्हें अपने वर्तमान कार्यों को अंतिम परिणाम से जोड़ने के लिए सिखाता है, ताकि वे "मैं आश्वस्त हूँ" तभी कह सकें जब उनके पास वास्तव में गेम जीतने का अच्छा मौका हो। यह एक "ब्लैक बॉक्स" रोबोट को, जो अंधाधुंध अनुमान लगाता है, एक विश्वसनीय साथी में बदल देता है जो अपनी सीमाओं को जानता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →