← नवीनतम पेपर
🤖 AI

Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models

यह शोध पत्र FusionProxy को प्रस्तुत करता है, जो एक वास्तविक समय का, प्लग-एंड-प्ले इमेज फ्यूजन मॉड्यूल है जो डिस्टिल्ड डिफ्यूजन मॉडल और पूरक वेरिएंस सांख्यिकी का लाभ उठाकर थर्मल और RGB डेटा को निर्बाध रूप से एकीकृत करता है, जिससे बिना किसी संयुक्त अनुकूलन (joint optimization) के रात और कोहरे जैसी चुनौतीपूर्ण स्थितियों में विजुअल परसेप्शन सिस्टम की मजबूती और सुरक्षा को महत्वपूर्ण रूप से बढ़ाया जाता है।

मूल लेखक: Yuchen Guo, Junli Gong, Wenjun Dong, Yiuming Cheung, Weifeng Su

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Guo, Junli Gong, Wenjun Dong, Yiuming Cheung, Weifeng Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रात के समय घने कोहरे में कार चला रहे हैं। आपकी आँखें (या एक मानक कैमरा) केवल दृश्य प्रकाश स्पेक्ट्रम (visible light spectrum) को देख सकती हैं—जैसे कि एक गंदी, अंधेरी खिड़की के माध्यम से देखना। आप काले कोट पहने किसी पैदल यात्री या टूटी हुई टेललाइट वाली कार को मिस कर सकते हैं क्योंकि वहां उनसे परावर्तित होने के लिए पर्याप्त रोशनी नहीं है।

अब, कल्पना कीजिए कि आपके पास "हीट गॉगल्स" (एक इन्फ्रारेड कैमरा) की एक जोड़ी भी है। इन्हें रोशनी की आवश्यकता नहीं होती; वे जीवित चीजों और इंजनों की गर्माहट को देखते हैं। समस्या यह है कि हीट गॉगल्स धुंधले होते हैं और उनमें विवरण की कमी होती है, जबकि आपका नियमित कैमरा स्पष्ट होता है लेकिन अंधेरे में अंधा होता है।

समस्या:
वैज्ञानिकों ने पहले इन दो दृश्यों को मिलाने की कोशिश की है। कुछ तरीके एक आदर्श, क्रिस्टल-क्लियर "सुपर-इमेज" बनाते हैं जो हजारों अनुमान लगाने और उन्हें औसत करने से बनता है। लेकिन यह केक को परोसने से पहले उसे 1,000 बार चखने जैसा है—इसमें बहुत अधिक समय लगता है। जब तक इमेज तैयार हो जाती है, तब तक आप दुर्घटना का शिकार हो चुके होते हैं। अन्य तेज़ तरीके त्वरित तो हैं लेकिन वे एक धुंधला, कम गुणवत्ता वाला कचरा पैदा करते हैं जो ज्यादा काम का नहीं होता।

समाधान: FusionProxy
शोधकर्ताओं ने एक नया टूल बनाया है जिसे FusionProxy कहा जाता है। इसे एक "स्मार्ट अनुवादक" के रूप में समझें जो आपके नियमित कैमरे के तीखे विवरणों को इन्फ्रारेड कैमरे की गर्मी महसूस करने की शक्ति के साथ तुरंत जोड़ देता है।

उन्होंने इसे बनाने के लिए, नीचे दिए गए कुछ सरल उपमाओं (analogies) का उपयोग किया है:

1. "मास्टर शेफ" (शिक्षक)

सबसे पहले, शोधकर्ताओं ने दो विशेषज्ञ "मास्टर शेफ" (ये जटिल AI मॉडल हैं जिन्हें डिफ्यूजन मॉडल्स कहा जाता है) को काम पर रखा। ये शेफ दोनों कैमरा दृश्यों को मिलाकर एक आदर्श छवि बनाने में अविश्वसनीय रूप से प्रतिभाशाली हैं, लेकिन वे बहुत धीमे हैं। वे सही परिणाम पाने के लिए बार-बार स्वाद लेते हैं और सुधार करते हैं।

  • ट्रिक: हर बार गाड़ी चलाने के दौरान शेफ से खाना बनवाने के बजाय, शोधकर्ताओं ने शेफ को पहले से कुछ बार खाना बनाने दिया और उनके "नोट्स" लिख लिए। उन्होंने न केवल अंतिम व्यंजन को नोट किया, बल्कि यह भी नोट किया कि शेफ के बीच कहाँ असहमति थी।

2. "फास्ट फूड ट्रेनी" (छात्र)

इसके बाद, उन्होंने एक "फास्ट फूड ट्रेनी" (एक हल्का AI मॉडल) को प्रशिक्षित किया। यह ट्रेनी तेज़ है और पलक झपकते ही भोजन बना सकता है, लेकिन आमतौर पर, भोजन बहुत अच्छा नहीं होता है।

  • प्रशिक्षण: ट्रेनी ने केवल अंतिम व्यंजन की नकल नहीं की। इसके बजाय, उसने मास्टर शेफ द्वारा छोड़े गए नोट्स से सीखा।
    • "कॉन्फिडेंस" नोट: यदि दोनों शेफ एक विशिष्ट स्थान (जैसे एक पैदल यात्री का चेहरा) पर सहमत थे, तो ट्रेनी ने सीखा कि उस स्थान को उच्च आत्मविश्वास के साथ कैसे चित्रित किया जाए। यदि शेफ भ्रमित थे या अलग-अलग चीजें देख रहे थे, तो ट्रेनी ने सावधानी बरतना सीखा और गलत अनुमान लगाने से परहेज करना सीखा।
    • "स्पेशलिस्ट" नोट: शोधकर्ताओं ने ट्रेनी को चार अलग-अलग "फूड क्रिटिक्स" (विशेषज्ञ AI मॉडल जो आकार, बनावट और वस्तुओं को समझते हैं) की आँखों से भी व्यंजन दिखाया। यदि एक आलोचक छवि के किसी विशेष भाग को लेकर भ्रमित था, तो ट्रेनी ने दूसरे आलोचकों की बात सुनना सीखा जो उस भाग के बारे में आश्वस्त थे।

3. परिणाम: त्वरित, उच्च-गुणवत्ता वाला फ्यूजन

एक बार प्रशिक्षित होने के बाद, "फास्ट फूड ट्रेनी" (FusionProxy) नियमित कैमरा और हीट कैमरा से एक कच्ची इमेज ले सकता है और उन्हें तुरंत मर्ज कर सकता है।

  • गति: यह इतना तेज़ है कि एक मानक लैपटॉप या कार के कंप्यूटर पर चल सकता है (लगभग 30 से 80 फ्रेम प्रति सेकंड की गति से)।
  • गुणवत्ता: भले ही यह तेज़ है, फिर भी इसकी इमेज लगभग उतनी ही अच्छी दिखती है जितनी कि मास्टर शेफ द्वारा बनाई गई धीमी, पूर्ण संस्करण वाली इमेज।
  • प्लग-एंड-प्ले: सबसे अच्छी बात यह है कि आपको कार के मौजूदा सुरक्षा सिस्टम को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस नियमित कैमरा फीड को इस नए "सुपर-फीड" से बदल देते हैं, और कार का दिमाग (जिसे केवल नियमित कैमरों पर प्रशिक्षित किया गया था) बिना किसी अतिरिक्त काम के अचानक "हीट-अवेयर" (गर्मी के प्रति जागरूक) हो जाता है।

वास्तविक दुनिया पर प्रभाव

परीक्षणों में, उन्होंने इस प्रणाली को एक सिम्युलेटेड ड्राइविंग वातावरण (CARLA नामक एक वीडियो गेम की दुनिया) में भारी कोहरे और अंधेरे के साथ इस्तेमाल किया।

  • FusionProxy के बिना: कार का AI एक पैदल यात्री को नहीं देख सका और लगभग उससे टकरा गया।
  • FusionProxy के साथ: "सुपर-फीड" ने गर्मी के माध्यम से पैदल यात्री को स्पष्ट रूप से दिखाया, और कार के AI ने सफलतापूर्वक दुर्घटना से बचने के लिए रास्ता बदल लिया।

संक्षेप में:
FusionProxy एक धीमे, महंगे कैमरे की "सुपरपावर्स" एक तेज़, सस्ते कैमरे को देने जैसा है। यह गर्मी और रोशनी को तुरंत संयोजित करना सीखने के लिए एक चतुर शिक्षण पद्धति का उपयोग करता है, जिससे बिना सुपर-कंप्यूटर के गणित हल किए, अंधेरे में सेल्फ-ड्राइविंग कारों और सुरक्षा प्रणालियों को सुरक्षित बनाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →