← नवीनतम पेपर
🤖 AI

Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

यह शोध पत्र MMIOC-1M प्रस्तुत करता है, जो ओपन-वोकेबुलरी और क्लोज्ड-सेट इंडस्ट्रियल डिफेक्ट डिटेक्शन दोनों के लिए पहला बड़े पैमाने का एकीकृत बेंचमार्क है, और RTVP-Net का प्रस्ताव करता है, जो एक नवीन नेटवर्क है जिसमें विशेषज्ञ-सहायता प्राप्त डोमेन प्रोजेक्शन, ऊर्जा-आधारित स्पार्स सैंपलिंग और द्विदिश टेक्स्ट-विजुअल इंटरैक्शन शामिल है ताकि मैनुअल प्रॉम्प्ट निर्भरता को समाप्त करते हुए अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Zekai Zhang, Jinglin Zhang, Qinghui Chen, Gang Li, Da Chen, Shuainan Jing, He Wang, Dagang Li, Cong Liu, Cong Bai, Shengyong Chen

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zekai Zhang, Jinglin Zhang, Qinghui Chen, Gang Li, Da Chen, Shuainan Jing, He Wang, Dagang Li, Cong Liu, Cong Bai, Shengyong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, दुनिया देख चुके कला समीक्षक (एक लार्ज विजुअल-लैंग्वेज मॉडल) को कार के इंजन में बारीक दरारें या स्मार्टफोन की स्क्रीन पर खरोंच पहचानना सिखाने की कोशिश कर रहे हैं।

समस्या यह है कि इस समीक्षक ने केवल सुंदर परिदृश्य, बिल्लियों और सूर्यास्त (प्राकृतिक छवियों) को ही देखा है। जब आप उन्हें एक फैक्ट्री का फर्श दिखाते हैं, तो वे भ्रमित हो जाते हैं। लाइटिंग अजीब होती है, बनावट औद्योगिक होती है, और "दोष" (defects) उन टूटी हुई टहनियों या फटे हुए कपड़ों जैसा बिल्कुल नहीं दिखता जिन्हें वे देखने के आदी हैं।

यह पेपर दो बड़ी समस्याओं का समाधान पेश करता है: प्रशिक्षण डेटा की कमी और भ्रमित करने वाले निर्देश

1. नया "ट्रेनिंग जिम": MMIOC-1M

पुराने तरीके को ऐसे समझें जैसे आप केवल एक शांत, खाली पार्किंग लॉट में अभ्यास करके ड्राइविंग सीखने की कोशिश कर रहे हों। यह पेपर तर्क देता है कि औद्योगिक कारखाने एक अराजक, बारिश वाले हाईवे और निर्माण क्षेत्रों की तरह हैं।

इसे ठीक करने के लिए, लेखकों ने MMIOC-1M बनाया है।

  • यह क्या है: एक विशाल डिजिटल लाइब्रेरी जिसमें औद्योगिक दोषों की दस लाख से अधिक छवियां शामिल हैं।
  • विविधता: यह केवल एक प्रकार की फैक्ट्री नहीं है। यह 29 अलग-अलग "दृश्यों" (जैसे स्टील मिल, कपड़ा कारखाने, इलेक्ट्रॉनिक्स असेंबली) और 351 विशिष्ट प्रकार के दोषों (जैसे "जंग लगे बोल्ट", "फटा हुआ कपड़ा", या "शॉर्ट सर्किट") को कवर करता है।
  • ट्विस्ट: यह कंप्यूटर को दो तरीकों से सीखने के लिए प्रशिक्षित करता है:
    1. क्लोज्ड-सेट (Closed-Set): "यहाँ वे 50 विशिष्ट दोष हैं जिन्हें आपको ढूंढना है।"
    2. ओपन-वोकेबुलरी (Open-Vocabulary): "कुछ भी ऐसा खोजें जो गलत दिखता हो, भले ही मैंने अभी तक उसका नाम न लिया हो।"
  • यह क्यों महत्वपूर्ण है: इससे पहले, शोधकर्ताओं को छोटे, बिखरे हुए डेटासेट को जोड़कर काम चलाना पड़ता था। यह पहला "ऑल-इन-वन" जिम है जो AI को वास्तविक, अस्त-व्यस्त औद्योगिक दुनिया के लिए तैयार करता है।

2. नया "कोच": RTVPNet

एक बेहतरीन जिम होने के बावजूद, आपको एक अच्छे कोच की आवश्यकता है जो AI को यह सिखा सके कि कैसे देखना है। लेखकों ने एक नई प्रणाली बनाई है जिसे RTVPNet (रिफाइंड टेक्स्ट-विजुअल प्रॉम्प्ट नेटवर्क) कहा जाता है।

यह तीन रचनात्मक तरीकों का उपयोग करके कैसे काम करता है, यहाँ बताया गया है:

A. "एक्सपर्ट ट्रांसलेटर" (डोमेन प्रोजेक्शन)

कल्पना कीजिए कि AI एक सामान्य डॉक्टर है जो मनुष्यों के बारे में सब कुछ जानता है लेकिन उसने कभी घोड़े को नहीं देखा है। यदि आप उससे घोड़े का निदान करने के लिए कहते हैं, तो वह विफल हो सकता है।

  • समाधान: पेपर एक "एक्सपर्ट मॉडल" (एक विशेषज्ञ जो औद्योगिक दोषों को जानता है) का उपयोग करता है जो एक अनुवादक के रूप में कार्य करता है। यह सामान्य AI के ज्ञान को लेता है और उसे औद्योगिक दुनिया में "प्रोजेक्ट" करता है। यह सामान्य डॉक्टर को घोड़े को देखने से पहले एक विशेष पशु चिकित्सा नियमावली देने जैसा है। यह AI को बिना दोबारा प्रशिक्षित किए तेजी से अनुकूलित होने में मदद करता है।

B. "अंधेरे में टॉर्च की रोशनी" (रिफाइंड विजुअल प्रॉम्प्ट्स)

फैक्ट्री में, बैकग्राउंड अक्सर शोर वाला होता है (चमकदार धातु, जटिल बनावट)। यदि आप बस AI को कहते हैं "यहाँ देखो," तो वह एक चमक वाली चमक (reflection) से विचलित हो सकता है और उसे दोष समझ सकता है।

  • समाधान: मानव द्वारा उंगली दिखाने (जो धीमा और व्यक्तिपरक है) के बजाय, AI एक "एनर्जी फ्लैशलाइट" का उपयोग करता है। यह छवि को स्कैन करता है ताकि उच्च "अनिश्चितता" या उच्च-आवृत्ति विवरण वाले क्षेत्रों (वे हिस्से जो अजीब दिखते हैं) को पाया जा सके। फिर यह स्वचालित रूप से वास्तविक दोष के चारों ओर एक सटीक, रिफाइंड हाइलाइट बनाता है, जिससे बैकग्राउंड के शोर को अनदेखा किया जा सके। यह AI द्वारा नाइट-विज़न गॉगल्स पहनने जैसा है जो केवल दरारों को रोशन करते हैं, धूल को नहीं।

C. "दो-तरफा बातचीत" (टेक्स्ट-विजुअल इंटरैक्शन)

आमतौर पर, AI एक तस्वीर देखता है और फिर एक टेक्स्ट विवरण पढ़ता है, लेकिन वे वास्तव में एक-दूसरे से बात नहीं करते हैं।

  • समाधान: RTVPNet टेक्स्ट और इमेज के बीच दो-तरफा बातचीत को संभव बनाता है।
    • टेक्स्ट इमेज को बताता है: "एक दरार (crack) खोजो।"
    • इमेज टेक्स्ट को बताती है: "मुझे यहाँ एक दरार दिख रही है, लेकिन वह वहाँ एक खरोंच (scratch) जैसी दिखती है।"
    • वे एक-दूसरे की समझ को तब तक परिष्कृत करते हैं जब तक कि वे इस पर सहमत न हो जाएं कि दोष वास्तव में कहाँ और क्या है। यह AI को बहुत अस्पष्ट शब्दों या बहुत धुंधली छवियों से भ्रमित होने से रोकता है।

3. परिणाम: दौड़ में कौन जीता?

लेखकों ने अपने नए सिस्टम (RTVPNet) का परीक्षण अपने नए डेटासेट (MMIOC-1M) और अन्य प्रसिद्ध डेटासेट्स (जैसे COCO और LVIS) पर मौजूद सर्वश्रेष्ठ मौजूदा AI मॉडलों के खिलाफ किया।

  • स्कोर: RTVPNet जीत गया। इसने अन्य मॉडलों की तुलना में अधिक सटीकता से दोषों को पाया, भले ही दोष बहुत छोटे हों, बैकग्राउंड शोर वाला हो, या दोष का प्रकार ऐसा हो जिसे AI ने पहले कभी नहीं देखा हो।
  • दक्षता (Efficiency): इसने यह सब उन विशाल "लार्ज लैंग्वेज मॉडल्स" की तुलना में बहुत कम कंप्यूटर पावर का उपयोग करके किया जो आमतौर पर यह काम करते हैं। यह एक भारी टैंक के बजाय एक हल्के स्पोर्ट्स कार के साथ दौड़ जीतने जैसा है।

सारांश

सरल शब्दों में, यह पेपर कहता है:

  1. हमने औद्योगिक दोषों के लिए अब तक की सबसे बड़ी, सबसे विविध प्रशिक्षण नियमावली (MMIOC-1M) बनाई है।
  2. हमने एक स्मार्ट कोच (RTVPNet) बनाया है जो एक एक्सपर्ट ट्रांसलेटर, एक स्मार्ट फ्लैशलाइट और एक दो-तरफा बातचीत का उपयोग करके AI को फैक्ट्री दोषों को पहचानने का तरीका सिखाता है।
  3. यह नया कोच वर्तमान में उपलब्ध किसी भी अन्य चीज़ की तुलना में बेहतर, तेज़ और अधिक सटीक है।

पेपर निष्कर्ष निकालता है कि यह संयोजन AI को अंततः औद्योगिक कारखानों की अस्त-व्यस्त, जटिल वास्तविकता को समझने की अनुमति देता है, जो केवल प्रकृति की सुंदर तस्वीरों को देखने से आगे बढ़कर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →