← नवीनतम पेपर
🤖 machine learning

OrigamiBench: An Interactive Environment to Synthesize Flat-Foldable Origamis

यह शोध पत्र ओरिगामीबेंच (OrigamiBench) को प्रस्तुत करता है, जो ओरिगामी फोल्डिंग के माध्यम से क्रमिक भौतिक नियोजन के लिए विजुअल परसेप्शन और कॉज़ल रीजनिंग को एकीकृत करने की एआई प्रणालियों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक इंटरैक्टिव बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान विजन-लैंग्वेज मॉडल स्केलिंग के बावजूद सुसंगत बहु-चरणीय रणनीतियों के साथ संघर्ष करते हैं।

मूल लेखक: Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कागज के एक टुकड़े को मोड़कर हंस (swan) बनाना सिखा रहे हैं। आप केवल नहीं चाहते कि रोबोट हंस की एक तस्वीर देखे और कहे, "यह एक हंस जैसा दिखता है।" आप चाहते हैं कि रोबोट वास्तव में इसे करे: उसे यह समझना चाहिए कि यदि आप ऊपर के कोने को नीचे की ओर मोड़ते हैं, तो नीचे का हिस्सा अपना आकार बदल लेता है, और यदि आप कोई गलती करते हैं, तो कागज पूरी तरह से नहीं मुड़ पाएगा।

यह बिल्कुल वही है जिसके बारे में यह शोध पत्र "OrigamiBench" है। यह एक नया "जिम" (एक बेंचमार्क) पेश करता है ताकि यह परीक्षण किया जा सके कि क्या आर्टिफिशियल इंटेलिजेंस (AI) वास्तव में कागज मोड़ने के भौतिक विज्ञान (physics) और तर्क (logic) को समझ सकता है, न कि केवल चीजों के दिखने के आधार पर अनुमान लगा सकता है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. समस्या: "फोटो एल्बम" बनाम "शेफ"

आज के अधिकांश AI मॉडल फोटोग्राफरों की तरह हैं। वे पैटर्न पहचानने में माहिर हैं। यदि आप उन्हें मुड़े हुए सारस (crane) की एक तस्वीर दिखाते हैं, तो वे बता सकते हैं, "यह एक सारस है!" या "यह किताब में दिए गए सारस जैसा दिखता है!"

लेकिन शोधकर्ता यह जानना चाहते थे: क्या ये AI शेफ बन सकते हैं? क्या वे एक खाली कागज के पन्ने को ले सकते हैं और, चरण-दर-चरण, उस सारस को बनाने के लिए रेसिपी (विधि) का पता लगा सकते हैं?

समस्या यह है कि कई मौजूदा परीक्षण केवल AI को एक फोटो देखने और एक प्रश्न का उत्तर देने के लिए कहते हैं। वे यह परीक्षण नहीं करते कि क्या AI 'कारण और प्रभाव' (cause and effect) को समझता है।

  • AI की खामी: वह सोच सकता है, "यदि मैं यहाँ मोड़ता हूँ, तो यह लक्ष्य जैसा दिखेगा," बिना यह समझे कि भौतिक रूप से, वह मोड़ कागज को फाड़ देगा या बाद में उसे पूरी तरह से समतल रूप से मोड़ना असंभव बना देगा। यह एक ऐसे शेफ की तरह है जो जानता है कि केक कैसा दिखता है, लेकिन यह नहीं जानता कि ओवन में डालने से पहले अंडे मिलाना क्यों जरूरी है।

2. समाधान: OrigamiBench (एक इंटरैक्टिव प्लेग्राउंड)

लेखकों ने OrigamiBench बनाया है, जो AI के लिए एक वीडियो गेम की तरह है।

  • सेटअप: AI को कागज का एक खाली चौकोर टुकड़ा और एक लक्षित आकृति (जैसे, एक ड्रैगन) की तस्वीर दी जाती है।
  • खेल: AI एक चाल चलता है। वह कहता है, "मैं ऊपर-बाएँ कोने को नीचे की ओर मोड़ूँगा।"
  • रेफरी: एक कंप्यूटर प्रोग्राम ("रेफरी") उस चाल की जाँच करता है।
    • क्या यह शारीरिक रूप से संभव है? (क्या कागज फट रहा है? क्या यह ज्यामिति के नियमों का उल्लंघन करता है?)
    • क्या यह लक्ष्य के करीब पहुँच रहा है? (क्या कागज अब ड्रैगन जैसा दिख रहा है?)
  • लूप: यदि चाल अच्छी है, तो कागज अपडेट होता है, और AI फिर से प्रयास करता है। यदि चाल खराब है, तो AI को "फिर से प्रयास करें" का संकेत मिलता है।

यह AI को केवल अंतिम उत्तर का अनुमान लगाने के बजाय, चालों के एक पूरे क्रम की योजना बनाने के लिए मजबूर करता है।

3. दो परीक्षण

शोधकर्ताओं ने AI का दो तरीकों से परीक्षण किया:

परीक्षण A: "अगला कदम" क्विज़ (एक-चरणीय/One-Step)

  • परिदृश्य: आप AI को आंशिक रूप से मुड़ा हुआ कागज दिखाते हैं और चार संभावित "अगले कदमों" के विकल्प देते हैं।
  • जाल:
    • द "विजुअल मैच" ट्रैप: कुछ विकल्प लक्ष्य के बहुत समान दिखते हैं लेकिन वास्तव में गलत होते हैं क्योंकि वे मोड़ने के नियमों को तोड़ते हैं।
    • द "कॉज़ल" टेस्ट: AI को यह समझना होगा कि एक मोड़ क्यों काम करता है।
  • परिणाम: सबसे स्मार्ट AI मॉडल दृश्य समानताओं को पहचानने में बहुत अच्छे थे (जैसे एक फोटो एल्बम)। लेकिन जब परीक्षण के लिए उन्हें मोड़ने के तर्क (लॉजिक) को समझने की आवश्यकता थी (कॉज़ल टेस्ट), तो वे अटक गए। वे एक ऐसे मोड़ के बीच अंतर नहीं कर सके जो काम करता है और एक ऐसे मोड़ के बीच जो दिखने में तो समान है लेकिन असंभव है।

परीक्षण B: "पूर्ण निर्माण" चुनौती (इंटरैक्टिव/Full Build)

  • परिстановка: AI को शुरुआत से पूरी आकृति बनानी होती है।
  • परिणाम: AI मॉडल बुरी तरह विफल रहे। वे एक या दो मोड़ तो बना सकते थे, लेकिन वे लंबी श्रृंखला की योजना नहीं बना सके। वे या तो अटक जाते थे, या ऐसी चाल चलते थे जिससे कागज को मोड़ना असंभव हो जाता, या वे बस हार मान लेते थे। यह एक ऐसे शेफ की तरह था जो अंडा फोड़ना तो जानता है लेकिन केक बनाना नहीं जानता।

4. बड़ी खोज: बड़ा होना हमेशा बेहतर नहीं होता

शोधकर्ताओं ने उपलब्ध सबसे बड़े, सबसे शक्तिशाली AI मॉडलों (विशाल मस्तिष्क/Giant Brains) का उपयोग करके देखा।

  • आश्चर्य: AI को बड़ा बनाना समस्या को हल नहीं कर सका। विशाल मॉडल अभी भी कागज मोड़ने के भौतिक विज्ञान को समझने में खराब थे।
  • सबक: केवल अधिक डेटा या बड़ा दिमाग होने से AI को भौतिक दुनिया के बारे में तर्क करना नहीं सिखाया जा सकता। AI को केवल चित्रों को याद करने के बजाय, "खेल के नियमों" (ज्यामिति और भौतिकी) को सीखने की आवश्यकता है।

5. यह क्यों महत्वपूर्ण है?

यदि हम चाहते हैं कि AI वास्तविक दुनिया में हमारी मदद करे—जैसे कि कार असेंबल करने वाले रोबोट बनाना, कपड़े तह करना, या सर्जरी करना—तो उन्हें कारण और प्रभाव को समझना होगा। उन्हें यह जानना होगा कि यदि वे यहाँ एक ब्लॉक को धकेलते हैं, तो वह वहाँ गिरेगा।

OrigamiBench इसका परीक्षण करने का एक सरल, कागज-आधारित तरीका है। यदि कोई AI कागज के टुकड़े को हंस में मोड़ने का तरीका नहीं समझ सकता, तो वह शायद पुल बनाने या कार चलाने के लिए तैयार नहीं है।

सारांश उपमा (Summary Analogy)

वर्तमान AI मॉडलों को उन पर्यटकों के रूप में सोचें जिन्होंने पेरिस की लाखों तस्वीरें देखी हैं। वे एक तस्वीर में एफिल टॉवर की ओर इशारा कर सकते हैं और कह सकते हैं, "यह वही है!"
OrigamiBench उनसे LEGO ब्रिक्स से एफिल टॉवर बनाने के लिए कहता है।
अध्ययन में पाया गया कि सबसे बुद्धिमान पर्यटक (सबसे बड़े AI मॉडल) भी भ्रमित हो जाते हैं जब उन्हें वास्तव में इसे बनाना पड़ता है। वे बार-बार ईंटों को ऐसे जोड़ने की कोशिश करते हैं जो फिट नहीं बैठतीं, क्योंकि उन्होंने केवल टॉवर को देखा है, कभी उसे बनाया नहीं है।

यह शोध पत्र सुझाव देता है कि बेहतर AI बनाने के लिए, हमें उन्हें केवल चित्र दिखाना बंद करना होगा और उन्हें चीजों के आपस में जुड़ने के नियमों को सिखाना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →