← नवीनतम पेपर
🤖 machine learning

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

यह शोध पत्र 'डू-अनडू' (Do-Undo) बेंचमार्क प्रस्तुत करता है, जो एक नवीन ढांचा है जो विजन-लैंग्वेज मॉडल्स की वास्तविक दुनिया की क्रियागत गतिशीलता (action dynamics) को समझने की क्षमता का मूल्यांकन करता है, जिसके लिए उन्हें संभावित दृश्य रूपांतरण उत्पन्न करने और तत्पश्चात उन्हें अपनी मूल अवस्थाओं में वापस उलटने की आवश्यकता होती है।

मूल लेखक: Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई फोटो एल्बम है। आप एल्बम को कह सकते हैं, "रेफ्रिजरेटर खोलो," और वह आपको खुले हुए फ्रिज की एक तस्वीर दिखाता है। लेकिन यहाँ एक पेंच है: आज के अधिकांश स्मार्ट AI फोटो एल्बम ऐसे जादूगरों की तरह हैं जो केवल 'ट्रिक' जानते हैं, 'भौतिकी' (physics) नहीं। वे आपको खुला हुआ फ्रिज तो दिखा सकते हैं, लेकिन यदि आप उनसे कहें "इसे फिर से बंद करो," तो वे गलती से फ्रिज को हटा सकते हैं, दीवार का रंग बदल सकते हैं, या दरवाजे को हवा में तैरता हुआ छोड़ सकते हैं। वे वास्तव में यह नहीं समझते कि दरवाजा खोलना और बंद करना एक ही सिक्के के दो पहलू हैं।

यह पेपर एक नया परीक्षण पेश करता है जिसे Do-Undo Bench कहा जाता है, ताकि यह देखा जा सके कि क्या AI वास्तव में यह समझ पाता है कि वास्तविक दुनिया कैसे काम करती है, बजाय इसके कि वह केवल यह अनुमान लगाए कि एक तस्वीर कैसी दिखनी चाहिए।

यहाँ उनके विचार का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "एकतरफा रास्ता" वाला AI

वर्तमान AI मॉडल निर्देशों का पालन करने में बहुत अच्छे हैं जैसे "एक बिल्ली जोड़ें" या "एक पेड़ हटा दें।" लेकिन वे उन कार्यों (actions) के साथ संघर्ष करते हैं जो किसी वस्तु की स्थिति (state) को बदलते हैं।

  • उपमा: एक ऐसे AI के बारे में सोचें जो रेत का महल बनाना जानता है। यदि आप उससे "रेत का महल बनाओ" कहते हैं, तो वह बहुत अच्छा काम करता है। लेकिन यदि आप फिर उससे "इसे वापस करो और रेत को वापस बाल्टी में डालो" कहते हैं, तो वह शायद पूरी तस्वीर ही हटा देगा या रेत को पानी में बदल देगा। वह यह नहीं समझता कि रेत बाल्टी से महल में स्थानांतरित हुई थी और वापस जा सकती है।

2. समाधान: "Do-Undo" चुनौती

शोधकर्ताओं ने AI के लिए एक नया खेल बनाया है। इस परीक्षण को पास करने के लिए, AI को लगातार दो चीजें करनी होती हैं:

  1. Do (करना): एक तस्वीर देखें (जैसे, बंद दराज) और एक कमांड ("दराज खोलें"), फिर एक नई तस्वीर दिखाएं जिसमें दराज खुली हुई हो।
  2. Undo (पूर्ववत करना): उस नई खुली हुई दराज की तस्वीर को देखें और एक विपरीत कमांड ("दराज बंद करें"), फिर एक ऐसी तस्वीर दिखाएं जो बिल्कुल मूल बंद दराज जैसी दिखे।

यदि AI दोनों को पूरी तरह से कर सकता है, तो यह साबित करता है कि वह कारण और प्रभाव (cause and effect) को समझता है। वह जानता है कि "खोलना" दराज को बाहर धकेलता है, और "बंद करना" उसे वापस अंदर खींचता है, बिना बाकी रसोई को बदले।

3. डेटासेट: वास्तविक जीवन के किचन वीडियो

AI को यह सबक सिखाने के लिए, शोधकर्ताओं ने केवल मनगढ़ंत तस्वीरें नहीं बनाईं। उन्होंने Epic-Kitchens डेटासेट से हजारों वास्तविक वीडियो का उपयोग किया (लोग अपने घरों में खाना बनाते हुए)।

  • प्रक्रिया: उन्होंने वास्तविक कार्यों के वीडियो क्लिप लिए, जैसे "चम्मच उठाना" या "नल चालू करना।"
  • फ़िल्टर: उन्होंने केवल उन्हीं कार्यों को रखा जिन्हें उलटा (reverse) किया जा सकता था। आप दराज खोल और बंद कर सकते हैं, लेकिन आप कागज के टुकड़े को "काटकर" उसे अन-कट नहीं कर सकते। इसलिए, उन्होंने उन्हें हटा दिया जो अपरिवर्तनीय थे।
  • विस्तार: मूल वीडियो विवरण बहुत छोटे थे (जैसे "दराज खोलें")। शोधकर्ताओं ने इन विवरणों को लंबी, विस्तृत कहानियों में बदलने के लिए एक स्मार्ट AI का उपयोग किया (जैसे, "अपने दाहिने हाथ से लकड़ी की दराज को पीछे की ओर खींचें जब तक कि वह पूरी तरह से खुल न जाए, जिससे चांदी के बर्तन दिखाई देने लगें")। यह AI को क्या करना है, इसका एक बहुत स्पष्ट नक्शा देता है।

4. परिणाम: AI अभी भी सीख रहा है

शोधकर्ताओं ने इस नए "Do-Undo" खेल पर दुनिया के सबसे अच्छे AI मॉडल का परीक्षण किया।

  • स्कोर: यहाँ तक कि सबसे स्मार्ट मॉडल भी विफल रहे। वे तस्वीर को सुंदर बनाने में अच्छे थे (उच्च दृश्य गुणवत्ता), लेकिन वे भौतिकी (physics) को सही करने में बहुत खराब थे।
    • उदाहरण: जब "नल बंद करने" के लिए कहा गया, तो कुछ मॉडलों ने पानी बहता हुआ छोड़ दिया या नल को गायब कर दिया। जब "चाकू वापस रखने" के लिए कहा गया, तो वे चाकू को हवा में तैरता हुआ छोड़ सकते थे।
  • सुधार: शोधकर्ताओं ने एक मॉडल (जिसे BAGEL कहा जाता है) लिया और उसे विशेष रूप से उनके "Do-Undo" डेटासेट पर प्रशिक्षित किया।
    • परिणाम: इस प्रशिक्षित मॉडल ने खेल में बहुत सुधार किया। इसने सीखा कि यदि आप एक दराज खोलते हैं, तो आपको इसे बंद करके ठीक शुरुआती बिंदु पर वापस आना चाहिए। इसने समझना शुरू कर दिया कि कार्य वस्तुओं की स्थिति को बदलते हैं, न कि केवल छवि की शैली को।

5. यह क्यों महत्वपूर्ण है

पेपर का तर्क है कि AI के वास्तविक दुनिया में (जैसे रसोई में रोबोटिक हाथ की मदद करने के लिए) वास्तव में उपयोगी होने के लिए, उसे स्थिर छवियों के बजाय गतिशीलता (dynamics) को समझने की आवश्यकता है।

  • रूपक (Metaphor): अभी, AI एक ऐसे बच्चे की तरह है जिसने शब्दों का शब्दकोश रट लिया है लेकिन वाक्य बोलना नहीं सीखा है। वे जानते हैं कि "खोलना" और "बंद करना" का क्या अर्थ है, लेकिन वे नहीं जानते कि वे शब्द भौतिक दुनिया के साथ कैसे परस्पर क्रिया करते हैं।
  • लक्ष्य: यह "Do-Undo" परीक्षण एक नया रिपोर्ट कार्ड है। यह AI को यह साबित करने के लिए मजबूर करता है कि वह समझता है कि दुनिया प्रतिवर्ती (reversible) और तार्किक है, जो स्मार्ट रोबोट और वर्चुअल असिस्टेंट के लिए मार्ग प्रशस्त करता है जो केवल सुंदर तस्वीरें ही नहीं बनाते, बल्कि वास्तव में यह समझते हैं कि चीजें कैसे काम करती हैं।

संक्षेप में: पेपर कहता है, "हमने एक ऐसा परीक्षण बनाया है जहाँ AI को यह साबित करने के लिए कि वह भौतिकी को समझता है, एक दरवाजा खोलना और फिर उसे पूरी तरह से बंद करना होगा। वर्तमान AI इस परीक्षण में विफल रहता है, लेकिन यदि हम इसे वास्तविक जीवन के प्रतिवर्ती कार्यों पर प्रशिक्षित करते हैं, तो यह इसे सही ढंग से करना शुरू कर देता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →