← नवीनतम पेपर
💻 computer science

Privacy-Preserving Clothing Classification using Vision Transformer for Thermal Comfort Estimation

यह शोध पत्र विजन ट्रांसफॉर्मर्स (ViT) का उपयोग करके एक गोपनीयता-संरक्षित कपड़ों के वर्गीकरण की विधि प्रस्तावित करता है जो एन्क्रिप्टेड छवियों पर उच्च सटीकता बनाए रखकर सुरक्षित निवासी-केंद्रित थर्मल आराम नियंत्रण को सक्षम बनाता है, जिससे पारंपरिक गोपनीयता-संरक्षित छवि वर्गीकरण योजनाओं से जुड़ी गंभीर सटीकता गिरावट पर विजय प्राप्त की जा सकती है।

मूल लेखक: Tatsuya Chuman, Yousuke Udagawa, Hitoshi Kiya

प्रकाशित 2026-04-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Tatsuya Chuman, Yousuke Udagawa, Hitoshi Kiya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप चाहते हैं कि आपके घर का एयर कंडीशनिंग बिल्कुल आरामदायक हो, लेकिन आप अपनी पारिवारिक तस्वीरें उस कंपनी को नहीं दिखाना चाहते जो इस सिस्टम को मैनेज करती है। यह पेपर इसी समस्या का समाधान करता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल शब्दों में:

समस्या: "कांच के घर" की दुविधा

एक कमरे को बिल्कुल सही महसूस कराने के लिए, हीटिंग और कूलिंग सिस्टम को यह जानने की जरूरत होती है कि लोगों ने क्या पहना है। एक भारी कोट का मतलब है कि कमरे को थोड़ा गर्म करने की जरूरत है; टी-शर्ट का मतलब है कि इसे ठंडा रखा जा सकता है।

आमतौर पर, कैमरे लोगों के कपड़े पहचानने के लिए उनकी तस्वीरें लेते हैं। लेकिन कच्ची (raw) तस्वीरों को क्लाउड सर्वर पर भेजना अपनी डायरी किसी अजनबी को पढ़ने के लिए देने जैसा है। यह गोपनीयता (privacy) का एक बुरा सपना है।

वैज्ञानिकों ने तस्वीरों को भेजने से पहले उन्हें स्क्रैम्बल (encrypt) करके इसे ठीक करने की कोशिश की है। हालाँकि, इसमें एक पेंच है: स्क्रैम्बल करने से अक्सर वह "दिमाग" (AI) टूट जाता है जो फोटो को पढ़ने की कोशिश कर रहा होता है। यह एक जिग्सॉ पहेली (jigsaw puzzle) को हल करने जैसा है जब कोई उसके टुकड़ों को बहुत छोटे, अपरिचित हिस्सों में काट दे। पुराने तरीके स्क्रैम्बल की गई तस्वीरों को पढ़ने में इतने खराब थे कि AI लगभग आधे समय गलत अनुमान लगा लेता था।

समाधान: "लेगो ब्लॉक" वाला दिमाग

इस पेपर के लेखकों ने तस्वीरों को स्क्रैम्बल करने का एक नया तरीका खोजा जिससे AI का दिमाग खराब नहीं होता। उन्होंने एक विशेष प्रकार के AI का उपयोग किया जिसे विज़न ट्रांसफॉर्मर (Vision Transformer - ViT) कहा जाता है।

एक सामान्य AI (जैसे CNN) को एक ऐसे जासूस के रूप में सोचें जो फोटो को पिक्सेल-दर-पिक्सेल देखता है, जैसे एक किताब को एक-एक अक्षर करके पढ़ना। यदि आप अक्षरों को इधर-उधर कर दें, तो जासूस कहानी नहीं पढ़ पाएगा।

विज़न ट्रांसफॉर्मर, हालांकि, एक ऐसे जासूस की तरह है जो फोटो को बड़े टुकड़ों (जैसे लेगो ब्लॉक्स) में देखता है। उसे ब्लॉक के अंदर के छोटे पिक्सेल के सटीक क्रम की परवाह नहीं है; उसे बस पूरे ब्लॉक के आकार और रंग की परवाह है।

जादू का तरीका: गुप्त शफल (Secret Shuffle)

यहाँ उनकी विधि का चतुर हिस्सा है:

  1. सेटअप: AI डेवलपर एक पहले से प्रशिक्षित "दिमाग" लेता है और उसे एक गुप्त कुंजी (secret key) के साथ लॉक कर देता है।
  2. स्क्रैम्बल: जब कोई उपयोगकर्ता अपने पहनावे की जांच करना चाहता है, तो वे अपनी फोटो लेते हैं और उसे उन्हीं बड़े "लेगो ब्लॉक्स" में काट देते हैं। फिर, गुप्त कुंजी का उपयोग करके, वे ब्लॉक्स को इधर-उधर घुमाते (shuffle) हैं और प्रत्येक ब्लॉक के भीतर के पिक्सेल को मिला देते हैं
    • उपमा: कल्पना कीजिए कि बिल्ली की एक फोटो है। पुराना तरीका उस फोटो को शोर (static noise) में बदल देता। यह नई विधि उस फोटो को ऐसा बना देती है जहाँ बिल्ली का सिर बाईं ओर है, पूंछ दाईं ओर है, और फर का रंग अलग है, लेकिन बिल्ली का आकार अभी भी मौजूद है।
  3. परिणाम: क्योंकि विज़न ट्रांसफॉर्मर केवल बड़े टुकड़ों को देखता है, इसलिए वह अभी भी "बिल्ली" (या "कोट") को पहचान सकता है, भले ही तस्वीर एक बिखरी हुई अव्यवस्था जैसी दिखे।

उन्होंने क्या पाया

शोधकर्ताओं ने कपड़ों की तस्वीरों के एक विशाल डेटाबेस पर इसका परीक्षण किया, जिन्हें चार समूहों में बांटा गया था: स्लीवलेस, शॉर्ट-स्लीव, लॉन्ग-स्लीव और भारी बाहरी कपड़े (heavy outerwear)।

  • पुराना तरीका (Pixel-based): जब उन्होंने तस्वीरों को स्क्रैम्बल किया, तो AI की सटीकता काफी गिर गई। भारी कोट के लिए, AI सही होने की दर 73% से गिरकर केवल 65% रह गई। वह स्वेटर और जैकेट के बीच अंतर करने में संघर्ष कर रहा था।
  • नया तरीका (ViT-based): जब उन्होंने अपने नए "लेगो ब्लॉक" शफल का उपयोग किया, तो AI ने 95.65% बार सही अनुमान लगाया।
    • चमत्कार: स्क्रैम्बल की गई तस्वीरों पर सटीकता बिल्कुल वैसी ही थी जैसी मूल, बिना स्क्रैम्बल की गई तस्वीरों पर सटीकता थी। स्क्रैम्बल करने से AI पर कोई बुरा असर नहीं पड़ा।

मुख्य निष्कर्ष

यह पेपर दिखाता है कि अब हम क्लाउड पर "स्क्रैम्बल की गई" तस्वीरें भेज सकते हैं ताकि यह पता लगाया जा सके कि लोग क्या पहने हुए हैं (तापमान नियंत्रण के लिए), बिना अपनी गोपनीयता से समझौता किए।

यह एक लॉक किए गए, इधर-उधर किए गए पहेली को एक ऐसे दोस्त को भेजने जैसा है जिसके पास उसे तुरंत हल करने का विशेष कौशल है, जबकि तस्वीर को बाकी सभी से छिपा कर रखा गया है। यह स्मार्ट, आरामदायक घरों को बिना आपकी प्राइवेसी खोए संभव बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →