← नवीनतम पेपर
🤖 AI

Large-Scale Universal Defect Generation: Foundation Models and Datasets

यह शोध पत्र UDG का परिचय देता है, जो 300K सामान्य-असामान्य-मास्क-कैप्शन चतुष्टयों (quadruplets) का एक बड़े पैमाने का डेटासेट है, और Uni-DG, एक सार्वभौमिक फाउंडेशन मॉडल जो इस डेटा और एक दो-चरणीय प्रशिक्षण रणनीति का लाभ उठाता है ताकि प्रति-श्रेणी फाइन-ट्यूनिंग की आवश्यकता के बिना विभिन्न डोमेन में उच्च गुणवत्ता वाले, विविध दोष उत्पन्न किए जा सकें, जिससे विसंगति पहचान (anomaly detection) प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कारखाने में एक गुणवत्ता निरीक्षक (quality inspector) हैं। आपका काम दोषपूर्ण उत्पादों को पहचानना है—जैसे फोन की स्क्रीन पर खरोंच, कपड़े का फटा हुआ हिस्सा, या सिरेमिक टाइल में दरार। इस काम के लिए कंप्यूटर को प्रशिक्षित करने के लिए, आपको "खराब" उत्पादों की हजारों तस्वीरों की आवश्यकता होती है।

लेकिन, समस्या यह है: वास्तविक दोषपूर्ण उत्पाद दुर्लभ होते हैं। आप केवल कुछ टूटी हुई चीजों के रोलिंग आउट होने का इंतजार करके लाखों टूटे हुए आइटम नहीं जुटा सकते। और यदि आप केवल कुछ उदाहरणों (जैसे कि तीन टूटे हुए कप दिखाना) का उपयोग करके कंप्यूटर को सिखाने की कोशिश करते हैं, तो कंप्यूटर भ्रमित हो जाता है। वह सोच सकता है कि सभी टूटे हुए कप बिल्कुल उन तीन के जैसे ही दिखते हैं, या वह एक ऐसा "टूटा हुआ कप" बना सकता है जो एक पिघली हुई मोमबत्ती जैसा दिखता है बजाय इसके कि वह एक दरार वाला कप हो।

यह पेपर एक समाधान पेश करता है जिसे UniDG (यूनिवर्सल डिफेक्ट जनरेटर) कहा जाता है। इसे एक सुपर-स्मार्ट, जादुगत आर्ट टीचर के रूप में समझें जो टूटी हुई चीजों के अनंत, वास्तविक उदाहरण बना सकता है ताकि आपके गुणवत्ता निरीक्षक रोबोट्स को प्रशिक्षित करने में मदद मिल सके।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "फ्यू-शॉट" का जाल (The "Few-Shot" Trap)

पिछले तरीके ऐसे थे जैसे केवल एक फोटो देखकर पोर्ट्रेट पेंट करना सीखने की कोशिश करना।

  • समस्या: यदि आप कंप्यूटर को केवल एक "खरोंच" के तीन उदाहरण दिखाते हैं, तो वह उन तीन खरोंचों को पूरी तरह से याद कर लेता है लेकिन यह समझने में विफल रहता है कि एक नई खरोंच कैसी दिखती है। यह ओवरफिट (overfit) हो जाता है।
  • परिणाम: कंप्यूटर अजीब, नकली दिखने वाले दोष उत्पन्न करता है जो मानवीय आंखों को नहीं धोखा दे पाते, या वह एक अलग प्रकार की वस्तु (जैसे लकड़ी पर खरोंच बनाम धातु पर खरोंच) पर खरोंच को पहचान नहीं पाता है।

2. समाधान: "यूनिवर्सल डिफेक्ट लाइब्रेरी" (UDG)

कंप्यूटर को सिखाने से पहले, शोधकर्ताओं ने UDG नामक एक विशाल लाइब्रेरी बनाई।

  • उपमा: कल्पना करें कि एक लाइब्रेरी है जिसमें 3,00,000 किताबें हैं। लेकिन कहानियों के बजाय, प्रत्येक "किताब" चार वस्तुओं का एक सेट है:
    1. एक उत्तम उत्पाद की तस्वीर (जैसे, एक बेदाग जूता)।
    2. उसी जूते की एक तस्वीर जिसमें दोष है (जैसे, चमड़े पर निशान/scuff mark)।
    3. एक मास्क (एक स्टेंसिल) जो ठीक से दिखाता है कि निशान कहाँ है।
    4. एक विस्तृत विवरण (जैसे, "चमड़े के पंजे पर एक छोटा, गहरा निशान, लगभग 2 सेमी चौड़ा")।
  • उन्होंने इसे कैसे बनाया: उन्होंने AI "एजेंट्स" (जैसे एक डिजिटल निर्माण दल) की एक टीम का उपयोग किया। एक एजेंट दोषों को मिटाकर उत्तम जूते बनाता था, दूसरे एजेंट विवरण लिखते थे, और तीसरे एजेंट ने सब कुछ सटीक सुनिश्चित करने के लिए एक सख्त संपादक के रूप में कार्य किया।
  • यह क्यों मायने रखता है: यह लाइब्रेरी औद्योगिक मशीनों से लेकर मेडिकल स्कैन और प्रकृति तक सब कुछ कवर करती है। यह कंप्यूटर को केवल एक विशिष्ट चित्र नहीं, बल्कि एक दोष की अवधारणा (concept) सिखाती है।

3. जादुई उपकरण: UniDG (द जनरेटर)

अब, उन्होंने इस लाइब्रेरी पर एक फाउंडेशन मॉडल (एक विशाल AI मस्तिष्क) को प्रशिक्षित किया। यह UniDG है।

  • उपमा: UniDG को एक गिरगिट जैसे कलाकार (chameleon artist) के रूप में सोचें।
    • रेफरेंस मोड: आप उसे केले पर एक विशिष्ट खरोंच की तस्वीर दिखाते हैं। फिर आप एक जूते की ओर इशारा करते हैं और कहते हैं, "यहाँ वैसी ही एक खरोंच डाल दो।" UniDG केवल केले की खरोंच को कॉपी-पेस्ट नहीं करता है; वह खरोंच के टेक्सचर और स्टाइल को समझता है और जूते पर एक वास्तविक खरोंच पेंट करता है जो लाइटिंग और सामग्री के अनुकूल हो।
    • टेक्स्ट मोड: आप केवल टाइप भी कर सकते, "इस धातु की प्लेट में एक गहरी दरार जोड़ें," और यह उसे कर देता है।
  • सीक्रेट सॉस: यह "डिफेक्ट-कॉन्टेक्स्ट एडिटिंग" नामक एक तकनीक का उपयोग करता है। पूरे जूते को फिर से बनाने के बजाय, यह केवल उस विशिष्ट स्थान पर ध्यान केंद्रित करता है जहाँ दोष होना चाहिए, जिससे यह सुनिश्चित होता है कि बाकी जूता एकदम सही रहे।

4. प्रशिक्षण रणनीति: "विविधता" फिर "निरंतरता" (Diversity then Consistency)

इस AI को प्रशिक्षित करना दो चरणों वाला नृत्य था:

  1. Diversity-SFT (द "वाइल्ड" फेज): पहले, उन्होंने AI को रचनात्मक होने के लिए सिखाया। उन्होंने उसे कई अलग-अलग तरीकों से दिखाया कि एक दोष कैसा दिख सकता है। इससे AI कई अलग-अलग प्रकार के दोष उत्पन्न करने में सक्षम हुआ ताकि वह केवल एक ही शैली पर न अटक जाए।
  2. Consistency-RFT (द "स्ट्रिक्ट" फेज): इसके बाद, उन्होंने AI को सटीक होने के लिए सिखाया। उन्होंने एक "रिवॉर्ड सिस्टम" (जैसे एक वीडियो गेम स्कोरिंग सिस्टम) का उपयोग किया। यदि AI ने ऐसी खरोंच बनाई जो बहुत नकली दिखती थी या जो रेफरेंस इमेज से मेल नहीं खाती थी, तो उसे कम स्कोर मिला। यदि वह एकदम सही दिखी, तो उसे उच्च स्कोर मिला। इसने AI को "अनियंत्रित" होने के बजाय "सटीक" होने के लिए मजबूर किया।

5. परिणाम: हमें इसकी परवाह क्यों करनी चाहिए?

शोधकर्ताओं ने मानक औद्योगिक डेटासेट्स (जैसे MVTec-AD और VisA) पर इसका परीक्षण किया।

  • परिणाम: UniDG ने ऐसे दोष उत्पन्न किए जो इतने वास्तविक थे कि इन नकली छवियों पर प्रशिक्षित कंप्यूटर ने किसी भी पिछले तरीके की तुलना में वास्तविक दोषों को बेहतर ढंग से पहचाना।
  • प्रभाव:
    • कोई इंतज़ार नहीं: कारखानों को अपने सुरक्षा सिस्टम को प्रशिक्षित करने के लिए वास्तविक टूटे हुए उत्पादों का इंतजार करने की आवश्यकता नहीं है। वे तुरंत लाखों "क्या होगा अगर" (what-if) परिदृश्य उत्पन्न कर सकते हैं।
    • यूनिवर्सल: यह लकड़ी, धातु, कपड़े और यहाँ तक कि मेडिकल इमेज पर भी बिना दोबारा प्रशिक्षित किए काम करता है।
    • ओपन सोर्स: वे कोड और इस विशाल डेटासेट को दुनिया के साथ साझा कर रहे हैं, ताकि हर कोई बेहतर सुरक्षा प्रणाली बना सके।

सारांश

संक्षेप में, UniDG एक ऐसा टूल है जो गुणवत्ता नियंत्रण में "डेटा की कमी" की समस्या को हल करता है। "परफेक्ट बनाम टूटे हुए" उदाहरणों की एक विशाल लाइब्रेरी बनाकर और एक स्मार्ट AI को उनसे सीखने के लिए प्रशिक्षित करके, उन्होंने एक ऐसा सिस्टम बनाया जो मांग पर वास्तविक दोषों का आविष्कार कर सकता है। यह बेहतर AI निरीक्षकों को प्रशिक्षित करने में मदद करता है, जिससे हमारे उत्पाद सुरक्षित और हमारे कारखाने अधिक कुशल बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →