← नवीनतम पेपर
💻 computer science

CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD Detection

यह शोध पत्र CRoFT का प्रस्ताव करता है, जो विजन-लैंग्वेज प्री-ट्रेनड मॉडल्स के लिए एक एकीकृत फाइन-ट्यूनिंग फ्रेमवर्क है जो डोमेन-कंसिस्टेंट हेसियन (Hessians) प्राप्त करने के लिए एनर्जी स्कोर्स के ग्रेडिएंट मैग्नीट्यूड को न्यूनतम करके आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन और ओपन-सेट डिटेक्शन को समवर्ती रूप से अनुकूलित करता है।

मूल लेखक: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lin Zhu, Yifeng Yang, Qinying Gu, Xinbing Wang, Chenghu Zhou, Nanyang Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन है जिसका नाम CLIP है। इस लाइब्रेरियन ने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। इस वजह से, वे उन चीजों को पहचानने में माहिर हैं जिन्हें उन्होंने पहले देखा है, जैसे कि एक "कुत्ता" या "कार", भले ही तस्वीर थोड़ी धुंधली हो या किसी अजीब कोण से ली गई हो।

हालाँकि, वास्तविक दुनिया अव्यवस्थित होती है। कभी-कभी, लाइब्रेरियन को नई तस्वीरों को छाँटने में मदद करने के लिए दो विशिष्ट समस्याओं का सामना करना पड़ता है:

  1. "स्टाइल शिफ्ट" की समस्या (कोवेरिएट शिफ्ट - Covariate Shift): आप लाइब्रेरियन को एक कुत्ते की तस्वीर दिखाते हैं, लेकिन वह एक स्केच शैली में बनी है, या एक ब्लैक-एंड-व्हाइट फोटो है, या बारिश में ली गई है। लाइब्रेरियन जानता है कि यह एक कुत्ता है, लेकिन क्योंकि इसकी शैली (style) उन किताबों से बहुत अलग है जिनका उन्होंने अध्ययन किया था, वे भ्रमित हो जाते हैं और कहते हैं, "मुझे यकीन नहीं है।"

  2. "अज्ञात जानवर" की समस्या (ओपन-सेट OOD): आप उन्हें एक पांडा की तस्वीर दिखाते हैं। उन्होंने अपने प्रशिक्षण वाली किताबों में कभी पांडा नहीं देखा है। "मुझे नहीं पता कि यह क्या है" कहने के बजाय, लाइब्रेरियन इसे उस बॉक्स में फिट करने की कोशिश करता है जिसे वे जानते हैं, जैसे कि कहना, "ओह, यह ज़रूर एक भालू होगा!" या "यह एक कुत्ता है!" यह खतरनाक है क्योंकि सिस्टम आत्मविश्वास के साथ गलत होता है।

अधिकांश पिछले तरीकों ने इनमें से एक समस्या को ठीक करने की कोशिश की लेकिन दूसरी को बिगाड़ दिया। यदि आपने लाइब्रेरियन को स्केच को बेहतर ढंग से संभालने के लिए सिखाया, तो वे अज्ञात जानवरों को पहचानने में कमजोर हो सकते थे। यदि आपने उन्हें अज्ञात जानवरों को पहचानने के लिए सिखाया, तो वे स्केच को संभालने की क्षमता भूल सकते थे।

समाधान: CRoFT (एक "डबल-चेक" करने वाला लाइब्रेरियन)

यह पेपर एक नए तरीके का परिचय देता है जिसे CRoFT कहा जाता है। CRoFT को एक विशेष प्रशिक्षण कार्यक्रम के रूप में सोचें जो लाइब्रेरियन को बिना भ्रमित हुए एक ही समय में ये दोनों चीजें करने के लिए सिखाता है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "एनर्जी स्कोर" (कॉन्फिडेंस मीटर)

पेपर एक अवधारणा का उपयोग करता है जिसे "एनर्जी स्कोर" कहा जाता है। कल्पना करें कि जब भी लाइब्रेरियन किसी तस्वीर को देखता है, तो उनके पास एक "कॉन्फिडेंस मीटर" होता है।

  • लो एनर्जी (Low Energy): "मुझे पूरा विश्वास है कि यह एक कुत्ता है।"
  • हाई एनर्जी (High Energy): "यह अजीब लग रहा है। मुझे यकीन नहीं है।"

लक्ष्य मीटर को उन चीजों के लिए लो रखना है जिन्हें लाइब्रेरियन जानता है (कुत्ते) और अज्ञात चीजों (पांडा) के लिए हाई रखना है।

2. गुप्त ट्रिक: "पहाड़ियों को समतल करना" (Flattening the Hills)

लेखकों ने एक चतुर गणितीय ट्रिक की खोज की। उन्होंने महसूस किया कि यदि आप लाइब्रेरियन को अपने "कॉन्फिडेंस मीटर" को बहुत स्थिर बनाने के लिए सिखाते हैं (गणितीय रूप से, इसका अर्थ है "ग्रेडिएंट मैग्नीट्यूड" को कम करना या "हेसियन" को सुसंगत बनाना), तो दो जादु적인 चीजें एक साथ होती हैं:

  • ट्रिक A: लाइब्रेरियन "अजीब" तस्वीरों को पहचानने में बेहतर हो जाता है (ओपन-सेट डिटेक्शन)। पांडा के लिए मीटर स्पष्ट रूप से ऊपर जाता है।
  • ट्रिक B: लाइब्रेरियन स्टाइल परिवर्तनों के प्रति अधिक मजबूत (robust) हो जाता है (OOD जनरलाइजेशन)। क्योंकि उनका आंतरिक "मानचित्र" अधिक सुचारू और सुसंगत है, इसलिए कुत्ते का एक स्केच भी उन्हें एक कुत्ते जैसा ही लगता है।

यह एक हाइकर (पर्वतारोही) को एक सपाट, चिकने रास्ते पर चलने के लिए सिखाने जैसा है। यदि रास्ता सपाट है, तो वे एक छोटे पत्थर (स्टाइल परिवर्तन) से नहीं लड़खड़ाएंगे, और वे स्पष्ट रूप से देख पाएंगे कि क्या कोई चट्टान का किनारा आ रहा है (एक अज्ञात जानवर)।

3. "एडवर्सरियल ट्रेनिंग" (तनाव परीक्षण - Stress Test)

यह सुनिश्चित करने के लिए कि लाइब्रेरियन वास्तव में वास्तविक दुनिया के लिए तैयार है, CRoFT एक "तनाव परीक्षण" बनाता है।

  • कल्पना कीजिए कि लाइब्रेरियन एक कुत्ते की फोटो का अध्ययन कर रहा है।
  • CRoFT उस कुत्ते की फोटो का एक "भ्रमित" (hallucinated) संस्करण बनाता है जो थोड़ा विकृत है (जैसे कि एक बहुत ही खराब स्केच या एक अजीब फ़िल्टर) लेकिन फिर भी एक कुत्ता ही दिखता है।
  • लाइब्रेरियन को फिर इस "खराब" फोटो को पहचानने का अभ्यास करने के लिए मजबूर किया जाता है।
  • इन "सबसे खराब स्थिति" वाले परिदृश्यों पर अभ्यास करके, लाइब्रेरियन बेहद मजबूत बन जाता है। वे सीखते हैं कि भले ही फोटो अजीब दिखे, कुत्ते का विचार अभी भी वहां मौजूद है।

परिणाम

पेपर का दावा है कि इस "डबल-चेक" दृष्टिकोण (ऊर्जा परिदृश्य को समतल करना + तनाव परीक्षण) का उपयोग करके, लाइब्रेरियन (AI मॉडल) बनता है:

  1. अज्ञात को पहचानने में बेहतर: यह यह अनुमान लगाने के बजाय कि पांडा एक कुत्ता है, यह कहना बंद कर देता है कि "मैं इसे नहीं जानता।"
  2. अजीब शैलियों को संभालने में बेहतर: वे कुत्ते के स्केच को कुत्ते की फोटो की तरह ही अच्छी तरह पहचान लेते हैं।

अपने परीक्षणों में, यह विधि पिछले तरीकों की तुलना में काफी बेहतर थी। इसने अज्ञात जानवरों को पहचानने की क्षमता में 20% तक सुधार किया और उन मामलों को कम किया जहाँ मॉडल स्टाइल परिवर्तनों से भ्रमित हो जाता था।

संक्षेप में: CRoFT एक प्रशिक्षण विधि है जो AI मॉडलों को दोनों रूप से सक्षम बनाती है—लचीला (विभिन्न शैलियों को संभालने के लिए) और ईमानदार (यह स्वीकार करने के लिए कि वे ऐसी चीज़ देख रहे हैं जो उन्होंने पहले कभी नहीं देखी है), और यह सब उनके दुनिया के बारे में सोचने के तरीके को सुचारू बनाकर किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →