← नवीनतम पेपर
💻 computer science

GIFT: Generalizing Intent for Flexible Test-Time Rewards

यह शोध पत्र GIFT प्रस्तुत करता है, जो प्रदर्शनों (demonstrations) से उच्च-स्तरीय मानवीय इरादे (intent) को समझने के लिए भाषा मॉडलों का लाभ उठाता है, जिससे रिवॉर्ड फंक्शन सतह-स्तर के संकेतों के बजाय इरादे के आधार पर टेस्ट स्टेट्स को व्यवहारिक रूप से समान ट्रेनिंग स्टेट्स से मैप करके, बिना पुन: प्रशिक्षण के नए वातावरण और वस्तुओं के लिए मजबूती से सामान्यीकरण करने में सक्षम होते हैं।

मूल लेखक: Fin Amin, Nathaniel Dennler, Andreea Bobu

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fin Amin, Nathaniel Dennler, Andreea Bobu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को आर्ट क्लास के लिए बैग पैक करना सिखा रहे हैं। आप उसे कुछ बार दिखाते हैं: "पेंटब्रश को बैग में रखो। स्केचबुक को बैग में रखो।"

रोबोट यह सीख जाता है। लेकिन यहाँ एक समस्या है: यदि आप बाद में रोबोट से किसी अलग आर्ट सेशन के लिए सामान पैक करने को कहते हैं, और आप उसके सामने मोल्डिंग क्ले (मिट्टी का लोथड़ा) रख देते हैं, तो एक साधारण रोबोट भ्रमित हो सकता है।

क्यों? क्योंकि रोबोट ने वास्तव में "आर्ट सप्लाइज़" (कला सामग्री) की अवधारणा (concept) नहीं सीखी। इसके बजाय, उसने एक बेतुका नियम सीख लिया: "अगर यह पेंटब्रश जैसा दिखता है, तो इसे बैग में डाल दो।" इसलिए, जब वह एक डिश स्क्रबर (जो ब्रश जैसा दिखता है) या एक टूथब्रश (जिसके नाम में "ब्रश" शब्द है) देखता है, तो वह उन्हें पैक करने की कोशिश कर सकता है। वह वास्तविक लक्ष्य के बजाय सतही विवरणों (surface details) का पालन कर रहा है।

यह पेपर एक नया फ्रेमवर्क पेश करता है जिसे GIFT (Generalizing Intent for Flexible Test-Time rewards) कहा जाता है ताकि इस समस्या को ठीक किया जा सके।

मुख्य विचार: "इन्टेंट डिटेक्टिव" (इरादा खोजने वाला जासूस)

GIFT को एक ऐसे रोबोट के रूप में सोचें जो केवल तस्वीरें याद नहीं करता; बल्कि वह एक जासूस की तरह काम करता है जो आपके मकसद को समझने की कोशिश करता है।

  1. पुराना तरीका (विजुअल/लैंग्वेज सिमिलरिटी - दृश्य/भाषाई समानता):

    • विजुअल (दृश्य): रोबोट एक डिश स्क्रबर और एक पेंटब्रश देखता है। वे दिखने में समान हैं (दोनों में ब्रिसल्स हैं)। रोबोट सोचता है, "ये दोनों एक ही हैं!" और स्क्रबर को पैक कर देता है।
    • लैंग्वेज (भाषा): रोबोट "टूथब्रश" और "पेंटब्रश" पढ़ता है। दोनों के अंत में "ब्रश" आता है। रोबोट सोचता है, "ये दोनों एक ही हैं!" और टूथब्रश को पैक कर देता है।
    • परिणाम: रोबोट विफल हो जाता है क्योंकि वह गलत संकेतों को देख रहा है।
  2. GIFT का तरीका (इन्टेंट सिमिलरिटी - इरादे की समानता):

    • GIFT एक लार्ज लैंग्वेज मॉडल (जैसे कि एक सुपर-स्मार्ट AI चैटबॉट) का उपयोग एक अनुवादक (translator) के रूप में करता है।
    • यह देखता है कि आपने क्या किया (आर्ट का सामान बैग में रखा) और आपने क्या नहीं किया (उसे मेज पर छोड़ दिया)।
    • यह AI से पूछता है: "यहाँ इंसान का वास्तविक लक्ष्य क्या है?"
    • AI जवाब देता है: "लक्ष्य 'Pack Art Supplies' (कला सामग्री पैक करना) है।"

यह कैसे काम करता है: "शेप-शिफ्टिंग" (रूप बदलने वाला) ट्रिक

एक बार जब GIFT को पता चल जाता है कि लक्ष्य "Pack Art Supplies" है, तो यह एक जादू करता है जिसे Intent-Conditioned Alignment कहा जाता है।

कल्पना कीजिए कि रोबोट एक मेज की ओर देख रहा है जिस पर कई नई वस्तुएं हैं जिन्हें उसने पहले कभी नहीं देखा है: मिट्टी का एक लोथड़ा (clay), एक पेचकस (screwdriver), और एक पेंटब्रश।

  • GIFT के बिना: रोबोट मिट्टी को देखता है और सोचता है, "मैंने इसे पहले कभी नहीं देखा। मुझे नहीं पता कि क्या करना है।"
  • GIFT के साथ: रोबोट AI से पूछता है, "'Pack Art Supplies' के नियम के तहत, यह मिट्टी का लोथड़ा किसके तुल्य (equivalent) है?"
    • AI कहता है, "आह, उस नियम के तहत, यह मिट्टी (clay) उसी पेंटब्रश के समान है जिसे आपने ट्रेनिंग के दौरान देखा था।"
    • AI यह भी कहता है, "पेचकस एक विचलित करने वाली चीज़ (distractor) है; यह आर्ट नहीं है।"

GIFT फिर मिट्टी को उसकी मेमोरी में पेंटब्रश के साथ मानसिक रूप से बदल (swap) देता है। वह रोबोट को बताता है: "इस मिट्टी के साथ बिल्कुल वैसा ही व्यवहार करो जैसा तुमने उस पेंटब्रश के साथ किया था।"

अब, रोबोट आज एक पूरी तरह से नई वस्तु को संभालने के लिए कल सीखी गई सटीक निर्देशों का उपयोग कर सकता है, बिना दोबारा ट्रेनिंग लिए।

वास्तविक दुनिया का परीक्षण

शोधकर्ताओं ने एक वास्तविक रोबोट आर्म (एक फ्रैंका पांडा) और एक कंप्यूटर सिमुलेशन पर इसका परीक्षण किया।

  • सेटअप: उन्होंने रोबोट को कुछ उदाहरणों का उपयोग करके "आर्ट सप्लाइज़" या "कीमती वस्तुओं" को पैक करना सिखाया।
  • परीक्षण: उन्होंने रोबोट को ऐसी नई वस्तुएं दीं जिन्हें उसने पहले कभी नहीं देखा था (जैसे मोल्डिंग क्ले या एक विशिष्ट iPhone मॉडल) और इसमें कुछ "ट्रिक" वस्तुएं (जैसे डिश स्क्रबर या पेपर रिंग) मिला दीं।
  • परिणाम:
    • पुराने तरीकों (चित्रों या शब्दों को देखने वाले) को डिश स्क्रबर और पेपर रिंग्स ने चकमा दे दिया।
    • GIFT ने सही ढंग से पहचान लिया कि मिट्टी "आर्ट" थी और iPhone "कीमती" था, और उसने उन ट्रिकी वस्तुओं को अनदेखा कर दिया। वह लगभग हर बार खेल जीत गया।

बड़ी सीख

अधिकांश रोबोट उन छात्रों की तरह होते हैं जो किसी विशिष्ट परीक्षा के उत्तर रट लेते हैं। यदि आप प्रश्न थोड़े से भी बदल दें, तो वे विफल हो जाते हैं।

GIFT रोबोट को विषय वस्तु (subject matter) को समझना सिखाता है। यह "2 + 2 = 4" को रटने और जोड़ (addition) की अवधारणा को समझने के बीच का अंतर है। एक बार जब आप अवधारणा को समझ लेते हैं, तो आप "2 + 2" को हल कर सकते हैं भले ही संख्याएँ किसी अलग फॉन्ट में लिखी हों, या यदि आप संख्याओं के बजाय "सेब" को जोड़ रहे हों।

इंसानी इरादे (क्यों) पर ध्यान केंद्रित करके, न कि सतही विशेषताओं (क्या दिखता है) पर, GIFT रोबोट को लचीला, स्मार्ट और वास्तविक दुनिया के लिए तैयार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →