← नवीनतम पेपर
🤖 machine learning

ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

ReFP-AD उच्च-आयामी टोकन स्पेस में एनर्जी-बेस्ड मॉडल ट्रेनिंग को स्थिर करने के लिए ऑप्टिमल ट्रांसपोर्ट-कपल्ड रेक्टिफाइड फ्लो के माध्यम से एक ज्यामितीय रीपैरामीट्रिज़ेशन पेश करता है, जिससे MVTec-AD और VisA डेटासेट्स पर स्टेट-ऑफ-द-आर्ट यूनिफाइड एनोमली डिटेक्शन प्रदर्शन प्राप्त होता है।

मूल लेखक: Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक गैलरी में नकली पेंटिंग को पकड़ने की कोशिश कर रहे एक जासूस हैं। आपने हजारों असली उत्कृष्ट कृतियों का अध्ययन करने में अपने वर्ष बिताए हैं, इसलिए आप जानते हैं कि ब्रश के स्ट्रोक, रंग और बनावट कैसी होनी चाहिए। लेकिन आपने कभी कोई नकली पेंटिंग नहीं देखी है। आपका काम एक कमरे में नई पेंटिंग्स के बीच उस एक पेंटिंग की ओर तुरंत इशारा करना है जो वहां फिट नहीं बैठती। यह आर्टिफिशियल इंटेलिजेंस की दुनिया में "एनोमली डिटेक्शन" (विसंगति का पता लगाने) की चुनौती है। AI को यह सीखना होगा कि "सामान्य" क्या दिखता है, बिना किसी "खराब" उदाहरण को देखे।

इसे करने के लिए, आधुनिक AI अक्सर "फाउंडेशन मॉडल्स" का उपयोग करता है, जो सुपर-स्मार्ट दिमागों की तरह हैं जिन्हें पूरे इंटरनेट पर प्रशिक्षित किया गया है। ये मॉडल छवियों को "टोकन" नामक छोटे टुकड़ों में तोड़ते हैं और उन्हें संख्याओं की लंबी सूचियों (एम्बेडिंग्स) में बदल देते हैं जो छवि के अर्थ को दर्शाती हैं। हालांकि, ये संख्याओं की सूचियाँ अव्यवस्थित होती हैं। वे उलझे हुए ऊन के गोले की तरह हैं जहाँ कुछ धागे कसकर खींचे गए हैं और कुछ ढीले, और वे सभी जटिल तरीकों से एक-दूसरे में गुंथे हुए हैं। यदि आप इन अव्यवस्थित सूचियों का उपयोग यह मापने के लिए करते हैं कि कोई नई छवि कितनी "अजीब" है, तो गणित भ्रमित और अस्थिर हो जाता है। यह एक ऐसी रस्सी पर चलने जैसा है जो आपके पैरों के नीचे लगातार मुड़ रही हो। यह शोध पत्र विशेष रूप से इसी समस्या पर प्रहार करता है: कि कैसे उस उलझी हुई रस्सी को सीधा किया जाए ताकि AI विश्वसनीय रूप से नकली चीज़ों को पहचान सके।


उलझी हुई रस्सी की समस्या

इस पेपर के पीछे के शोधकर्ताओं, कैमिल लैंडरिंग और आइनहोवन यूनिवर्सिटी ऑफ टेक्नोलॉजी की उनकी टीम ने देखा कि AI विसंगतियों का पता लगाने के तरीके में एक निराशाजनक खामी है। वे "एनर्जी-बेस्ड मॉडल्स" (EBMs) नामक गणित के एक शक्तिशाली प्रकार का उपयोग कर रहे थे। EBM को पहाड़ियों और घाटियों के परिदृश्य के रूप रूप में सोचें। "सामान्य" छवियां (जैसे कारखाने का एक आदर्श पुर्जा या एक स्वस्थ पत्ती) गहरी, चिकनी घाटियों में आराम से स्थित होती हैं। "विसंगतियां" (जैसे एक खरोंच या दोष) ऊबड़-खाबड़ चोटियों पर होनी चाहिए।

समस्या यह थी कि AI इस परिदृश्य को खोजने के लिए "लैंज्विन डायनेमिक्स" (Langevin dynamics) नामक विधि का उपयोग कर रहा था, जो वास्तव में सबसे निचले बिंदु को खोजने के लिए एक रैंडम वॉक (यादृच्छिक भ्रमण) है। लेकिन चूंकि डेटा उन अव्यवस्थित, उलझे हुए फाउंडेशन मॉडल्स से आया था, इसलिए परिदृश्य एक चिकनी घाटी नहीं थी; बल्कि वह एक मुड़ा हुआ, एनिसोट्रोपिक (एक दिशा में खिंचा हुआ) दुःस्वप्न था। रैंडम वॉक फंस जाता था, दीवारों से टकराता था, या नियंत्रण से बाहर हो जाता था। यह एक ऐसी स्लाइड पर मार्बल रोल करने जैसा था जिसे मोड़कर एक गेंद बना दिया गया हो। इसे ठीक करने के पिछले प्रयासों में डेटा को एक छोटे, सरल आकार में दबाना शामिल था, लेकिन इससे बहुत अधिक विवरण खो गया, जिससे AI सूक्ष्म दोषों के प्रति अंधा हो गया।

सीधा करने वाला समाधान: ReFP-AD

टीम ने ReFP-AD (रेक्टिफाइड फ्लो प्रीकंडीशनिंग फॉर एनोमली डिटेक्शन) नामक एक चतुर नया तरीका प्रस्तावित किया। अव्यवस्थित डेटा को नियंत्रित करने की कोशिश करने के बजाय, उन्होंने एक "ज्यामितीय सीधा करने वाला" (geometric straightener) बनाया।

कल्पना कीजिए कि आपके पास एक ड्राइंग वाला कागज का एक मुड़ा हुआ टुकड़ा है। यदि आप मुड़े हुए कागज पर ड्राइंग को मापने की कोशिश करते हैं, तो आपका स्केल गलत उत्तर देगा। ReFP-AD एक जादुई मशीन की तरह है जो कागज को धीरे से बिना फटे या स्याही खोए पूरी तरह से सीधा और सपाट फैला देती है। तकनीकी शब्दों में, वे एक "रेक्टिफाइड फ्लो" (एक प्रकार का गणितीय मानचित्र) का उपयोग करते हैं जो अव्यवस्थित, उच्च-आयामी टोकन सूचियों को एक साफ, सुव्यवस्थित "लेटेंट स्पेस" में बदल देता है।

इस नए, सीधे स्थान में, विसंगति परिदृश्य की "पहाड़ियाँ और घाटियाँ" चिकनी और अनुमानित हो जाती हैं। अब, जब AI सबसे निचले बिंदु (सामान्य डेटा) को खोजने के लिए अपना रैंडम वॉक करता है, तो वह फंसने के बजाय सुचारू रूप से चलता है। यह AI को मूल फाउंडेशन मॉडल के पूर्ण, समृद्ध विवरण का उपयोग करने की अनुमति देता है, बिना उसे एक छोटे, कम सटीक संस्करण में सिकोड़े।

उन्होंने क्या पाया

परिणाम प्रभावशाली थे। टीम ने दो प्रमुख औद्योगिक डेटासेट्स पर अपने तरीके का परीक्षण किया: MVTec-AD (वस्तुओं की 15 श्रेणियों के साथ) और VisA (12 श्रेणियों के साथ)। उन्होंने एक सख्त "यूनिफाइड" प्रोटोकॉल का उपयोग किया, जिसका अर्थ है कि उन्होंने प्रत्येक वस्तु के लिए एक अलग मॉडल प्रशिक्षित करने के बजाय, सभी विभिन्न वस्तुओं को एक साथ संभालने के लिए केवल एक ही AI मॉडल को प्रशिक्षित किया।

  • MVTec-AD डेटासेट पर, ReFP-AD ने 98.6% का इमेज AUROC और 97.9% का पिक्सेल AUROC प्राप्त किया।
  • VisA डेटासेट पर, इसने इमेज के लिए 97.3% और पिक्सेल के लिए 99.0% स्कोर किया।

इसे समझने के लिए, पिछले यूनिफाइड मॉडल्स जो बिना "सीधा करने" वाले तरीके के ऐसा करने की कोशिश कर रहे थे, उन्हें काफी संघर्ष करना पड़ा। पेपर बताता है कि ReFP-AD ने इमेज डिटेक्शन सटीकता में पिछले सर्वश्रेष्ठ एनर्जी-बेस्ड मॉडल बेसलाइन्स से +10.8% तक बेहतर प्रदर्शन किया।

शोधकर्ताओं ने यह साबित करने के लिए कई प्रयोग चलाए कि उनका विचार ही मुख्य कुंजी थी। जब उन्होंने "सीधा करने" वाले चरण को हटा दिया और कच्चे, अव्यवized डेटा पर AI को प्रशिक्षित करने की कोशिश की, तो प्रदर्शन गिर गया (VisA पर 87.0% तक)। उन्होंने यह भी पाया कि चूंकि स्थान अब बहुत अच्छी तरह से व्यवस्थित था, इसलिए AI को उत्तर खोजने के लिए सैकड़ों चरणों की आवश्यकता नहीं थी; इसे सही करने के लिए इसे केवल लगभग 20 चरणों की आवश्यकता थी, जबकि पहले इसे कई अधिक चरणों की आवश्यकता होती या यह विफल हो जाता।

यह क्यों मायने रखता है

यह पेपर सुझाव देता है कि दोषों को पहचानने में AI को स्मार्ट बनाने में बाधा बड़े दिमाग या अधिक जटिल मॉडल बनाने के बारे में नहीं है। यह इस बारे में है कि आप उन मॉडल्स के सोचने के लिए डेटा को कैसे तैयार करते हैं। डेटा की ज्यामिति को पहले ठीक करके, शोधकर्ताओं ने मौजूदा फाउंडेशन मॉडल्स की पूरी क्षमता को अनलॉक कर दिया।

हालांकि यह विधि वर्तमान में कुछ सरल डिटेक्टरों की तुलना में थोड़ी धीमी है क्योंकि इसे निर्णय लेने से पहले इस "सीधा करने" वाले गणित को करना पड़ता है, लेकिन यह साबित करता है कि हम एक एकल, एकीकृत AI बना सकते हैं जो कई अलग-अलग प्रकार की वस्तुओं में दोषों को पहचानने में अविश्वसनीय रूप से अच्छा है। यह एक ऐसे भविष्य की ओर एक कदम है जहां एक अकेला स्मार्ट जासूस पूरी फैक्ट्री में गश्त कर सकता है, एक धातु के गियर पर खरोंच और कपड़े के रोल में फटने को उसी उच्च स्तर की सटीकता के साथ पहचान सकता है, और वह भी बिना कभी यह देखे कि "खराब" क्या दिखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →