← नवीनतम पेपर
💻 computer science

OCCAM: Open-set Causal Concept explAnation and Ontology induction for black-box vision Models

OCCAM एक नवीन ढांचा है जो ओपन-सेट विजुअल कॉन्सेप्ट्स की खोज करके, ऑब्जेक्ट-लेवल इंटरवेंशन के माध्यम से उनके कारण प्रभाव (causal impact) को परिमाणित करके, और वैश्विक मॉडल रीजनिंग और पूर्वाग्रहों को प्रकट करने के लिए इस साक्ष्य को एक संरचित ऑन्टोलॉजी (ontology) में एकत्रित करके ब्लैक-बॉक्स विजन मॉडल्स की व्याख्या करता है।

मूल लेखक: Chiara Maria Russo, Simone Carnemolla, Simone Palazzo, Daniela Giordano, Concetto Spampinato, Matteo Pennisi

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chiara Maria Russo, Simone Carnemolla, Simone Palazzo, Daniela Giordano, Concetto Spampinato, Matteo Pennisi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान, लेकिन पूरी तरह से गुप्त रोबोट है जो तस्वीरों को देखता है और आपको बताता है कि उनमें क्या है। आप इसे एक कुत्ते की तस्वीर दिखा सकते हैं और यह कहता है "कुत्ता।" लेकिन यदि आप पूछते हैं, "आपने ऐसा क्यों कहा?" तो रोबोट उत्तर देने से मना कर देता है। वह आपको अपने आंतरिक गियर, अपना कोड, या अपनी विचार प्रक्रिया नहीं दिखाएगा। यह एक "ब्लैक बॉक्स" है।

यही वह समस्या है जिसे OCCAM पेपर हल करने की कोशिश करता है। लेखकों ने इस ब्लैक बॉक्स के अंदर झांकने का एक नया तरीका बनाया है, बिना उसे तोड़े। वे ऐसा एक बहुत ही सावधान संपादक की तरह करते हैं जो यह देखने के लिए फोटो से चीजों को काट देता है कि क्या होता है।

यहाँ बताया गया है कि OCCAM कैसे काम करता है, सरल उपमाओं के माध्यम से:

1. "क्या होगा अगर?" खेल (ओपन-सेट डिस्कवरी)

पिछले अधिकांश तरीकों ने एक निश्चित शब्दों की सूची (जैसे कि शब्दकोश) का उपयोग करके यह अनुमान लगाने की कोशिश की कि रोबोट क्या सोच रहा है। यदि रोबोट ने एक "गोल्डन रिट्रीवर" देखा, लेकिन शब्दकोश में केवल "कुत्ता" था, तो यह सूक्ष्म अंतर को समझने में चूक सकता था।

OCCAM अलग है। यह एक स्मार्ट AI सहायक (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) का उपयोग करता है जो फोटो को देखता है और कहता है, "हे, मुझे एक फूला हुआ पूंछ, एक धूप वाला पार्क, और एक लाल गेंद दिख रही है।" इसे पहले से लिखी गई सूची की आवश्यकता नहीं है; यह मौके पर ही जो चीजें वह देखता है, उनके लिए अवधारणाएं (concepts) बना लेता है। यह "ओपन-सेट" वाला हिस्सा है—यह जो कुछ भी पाता है उसके बारे में बात कर सकता है।

2. "जादुई इरेज़र" (कॉज़ल इंटरवेंशन)

एक बार जब OCCAM इन अवधारणाओं (जैसे कि "फूला हुआ पूंछ") की पहचान कर लेता है, तो वह केवल उनकी ओर इशारा नहीं करता। यह एक कॉज़ल टेस्ट (कारण परीक्षण) करता है।

कल्पना कीजिए कि आपके पास पार्क में एक कुत्ते की फोटो है। OCCAM बस पूंछ को सावधानीपूर्वक हटाने के लिए एक "जादुगत इरेज़र" का उपयोग करता है, और बैकग्राउंड को इस तरह भर देता है कि वह प्राकृतिक लगे। फिर, यह इस संपादित फोटो को फिर से रोबोट को दिखाता है।

  • यदि रोबोट अभी भी कहता है "कुत्ता": तो पूंछ निर्णय लेने के लिए बहुत महत्वपूर्ण नहीं थी।
  • यदि वह अचानक कहता है "मुझे नहीं पता" या अपना मन बदल लेता है: तो पूंछ एक महत्वपूर्ण सुराग थी।

ऐसा करके, हर उस अवधारणा के लिए जिसे वह पाता है, OCCAM सीखता है कि चित्र के कौन से हिस्से वास्तव में उसके निर्णय लेने का कारण बन रहे हैं। यह एक जासूस की तरह है जो यह देखने के लिए एक-एक करके सुरागों को हटाता है कि असली सबूत क्या था।

3. विचारों का "फैमिली ट्री" बनाना (ऑन्टोलॉजी इंडक्शन)

अब तक, OCCAM ने एक फोटो की व्याख्या की है। लेकिन लेखक रोबोट की केवल एक प्रतिक्रिया को नहीं, बल्कि उसके संपूर्ण व्यक्तित्व को समझना चाहते थे।

वे हजारों फोटो के परिणामों को लेते हैं और एक विशाल, संरचित मानचित्र बनाते हैं जिसे ऑन्टोलॉजी कहा जाता है। इसे एक फैमिली ट्री या रोबोट के मस्तिष्क के लिए एक जटिल सबवे मैप की तरह समझें।

  • यह अवधारणाओं को वर्गों से जोड़ता है (जैसे, "फूला हुआ पूंछ" \rightarrow "कुत्ता")।
  • यह अवधारणाओं को अन्य अवधारणाओं से जोड़ता है (जैसे, "मुस्कुराता चेहरा" अक्सर "खुश कुत्ता" के साथ आता है)।

यह मानचित्र किसी इंसान द्वारा नहीं बनाया गया है; यह रोबोट के अपने व्यवहार से उभरता है। यह छिपे हुए पैटर्न को प्रकट करता है, जैसे कि "इस रोबोट को 'वॉलीबॉल खिलाड़ी' को खुश वर्गीकृत करने के लिए हमेशा एक 'मुस्कान' देखने की आवश्यकता होती है," या "यह रोबोट यह सोचने के लिए पक्षपाती है कि 'घास' का अर्थ 'आउटडोर' है, भले ही घास नकली हो।"

4. यह क्यों महत्वपूर्ण है

पेपर दिखाता है कि यह तरीका दो मुख्य तरीकों से पिछले तरीकों से बेहतर काम करता है:

  • यह गुप्त रोबोटों पर काम करता है: आपको रोबोट के कोड को देखने की आवश्यकता नहीं है (जिसे आप आमतौर पर नहीं देख सकते)। आपको बस उसे तस्वीरें दिखाने और उत्तर प्राप्त करने की आवश्यकता है।
  • यह वास्तविक कारण ढूंढता है: दृश्य साक्ष्य को वास्तव में हटाकर, यह कारणता (causality) को सिद्ध करता है। यह केवल अनुमान नहीं लगाता; यह परीक्षण करता है।

लेखकों ने इसे प्रसिद्ध इमेज डेटासेट्स (जैसे Broden और ImageNet) पर परखा और पाया कि OCCAM आंतरिक कोड एक्सेस पर निर्भर करने वाले तरीकों की तुलना में रोबोट के निर्णयों की अधिक सटीक रूप से व्याख्या कर सकता है। उन्होंने यह भी दिखाया कि जब उन्होंने इस संरचित "फैमिली ट्री" मानचित्र को सारांश निकालने के लिए दूसरे AI को दिया, तो सारांश बहुत गहरे और अधिक सटीक थे।

संक्षेप में: OCCAM एक ऐसा उपकरण है जो ब्लैक-बॉक्स AI के साथ एक रहस्य की तरह व्यवहार करता है जिसे चित्र के हिस्सों को व्यवस्थित रूप से मिटाकर यह सुलझाया जाता है कि AI वास्तव में किस बात पर ध्यान देता है, और फिर उन निष्कर्षों को AI के सोचने के तरीके के स्पष्ट मानचित्र में व्यवस्थित किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →