Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps
यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) यूरोपीय संघ की भाषाओं में उच्च क्रॉस-लिंगुअल प्रदर्शन प्राप्त करके गोपनीयता नीति ऑडिट को अंग्रेजी से प्रभावी ढंग से आगे बढ़ा सकते हैं, जो यह प्रकट करता है कि केवल अंग्रेजी-आधारित ऑडिट स्पेनिश गूगल प्ले स्टोर जैसे बहुभाषी ऐप पारिस्थितिक तंत्रों में घोषित और प्रेक्षित डेटा प्रथाओं के बीच पारदर्शिता अंतराल और विसंगतियों को व्यवस्थित रूप से छिपा देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे पुस्तकालय की तरह है जहाँ हर ऐप एक किताब है। इससे पहले कि आप कोई किताब पढ़ सकें, आपको उसका "पिछला कवर" देखना चाहिए ताकि यह देख सकें कि वह आपके बारे में क्या रहस्य रख सकती है। डिजिटल दुनिया में, इस पिछले कवर को प्राइवेसी पॉलिसी (गोपनीयता नीति) कहा जाता है। यह ऐप बनाने वाले की ओर से एक कानूनी वादा है जो कहता है, "यहाँ बताया गया है कि हम आपके फोन से कौन सा डेटा लेंगे और हम उसका उपयोग कैसे करेंगे।" वर्षों से, शोधकर्ता इन वादों को पढ़ने और यह जाँचने के लिए रोबोट बना रहे हैं कि क्या ऐप्स सच बोल रहे हैं। लेकिन एक समस्या है: अधिकांश रोबोट केवल अंग्रेजी बोलते हैं।
यह यूरोपीय संघ जैसे स्थानों के लिए एक समस्या पैदा करता है, जहाँ लोग 24 अलग-अलग आधिकारिक भाषाएँ बोलते हैं। यदि कोई ऐप स्पेनिश, फ्रेंच या ग्रीक में लिखा है, लेकिन रोबोट केवल अंग्रेजी समझता है, तो वह ऐप ऑडिट (जाँच) के लिए अदृश्य हो जाता है। यह एक पूरे शहर की इमारतों की सुरक्षा जाँचने की कोशिश करने जैसा है, लेकिन आपका निरीक्षक केवल उन घरों के ब्लूप्रिंट पढ़ सकता है जो अंग्रेजी में बने हैं। यह शोध पत्र एक बड़ा सवाल पूछता है: क्या हम अपने रोबोट निरीक्षकों को बिना किसी मानव विशेषज्ञ के हर एक भाषा सिखाए, सभी भाषाएँ समझने के लिए तैयार कर सकते हैं? और यदि हम ऐसा कर सकते हैं, तो उन ऐप्स को देखने पर हमें क्या छिपे हुए रहस्य मिलते हैं जिन्हें पहले अनदेखा किया गया था?
भाषा तोड़ने वाला रोबोट
इस शोध पत्र के शोधकर्ताओं ने एक "बहुभाषी सुपर-निरीक्षक" बनाने का निर्णय लिया, जो आर्टिफिशियल इंटेलिजेंस (AI) के एक प्रकार, जिसे 'लार्ज लैंग्वेज मॉडल' (LLM) कहा जाता है, का उपयोग करता है। एक LLM को एक सुपर-स्मार्ट छात्र के रूप में सोचें जिसने इंटरनेट पर लगभग सब कुछ पढ़ा है। पुराने रोबोटों के विपरीत, जिन्हें हर भाषा के लिए एक विशिष्ट पाठ्यपुस्तक की आवश्यकता होती थी (जिसे लिखना कठिन है), यह छात्र स्पेनिश या पोलिश प्राइवेसी पॉलिसी को केवल देखकर उसका अर्थ समझ सकता है, भले ही उन्हें मुख्य रूप से अंग्रेजी पर प्रशिक्षित किया गया हो।
यह परीक्षण करने के लिए कि क्या यह छात्र वास्तव में एक कानूनी ऑडिटर बनने के लिए पर्याप्त स्मार्ट था, टीम ने केवल अनुमान नहीं लगाया। उन्होंने एक विशाल "अभ्यास परीक्षा" बनाई। उन्होंने दो प्रसिद्ध, विशेषज्ञ द्वारा लिखित प्राइवेसी पॉलिसी (जो मूल रूप से अंग्रेजी में थीं) लीं और एक उच्च-गुणवत्ता वाले अनुवाद टूल का उपयोग करके उन्हें यूरोपीय संघ की सभी 24 आधिकारिक भाषाओं में बदल दिया। फिर उन्होंने अपने AI छात्र से उन अनुवादित नीतियों को पढ़ने और यह पहचानने के लिए कहा कि किस प्रकार का व्यक्तिगत डेटा ऐप्स एकत्र करने का दावा करते हैं, जैसे कि आपका स्थान, आपके संपर्क, या आपकी स्वास्थ्य जानकारी।
परिणाम आश्चर्यजनक रूप से अच्छे थे। AI छात्र ने लगभग 91% से 94% बार सही उत्तर दिए, चाहे वह कोई भी भाषा पढ़ रहा हो। इससे कोई फर्क नहीं पड़ता था कि नीति एस्टोनियाई में थी या फ्रेंच में; रोबोट ने अंग्रेजी में उतना ही अच्छा काम किया जितना उसने अंग्रेजी में किया था। इसने साबित कर दिया कि हमें हर भाषा के लिए 24 अलग-अलग कानूनी विशेषज्ञों की टीम की आवश्यकता नहीं है; एक स्मार्ट AI सभी भाषाओं में भारी काम कर सकता है।
द ग्रेट स्पेनिश ऐप ऑडिट
अपने नए बहुभाषी रोबट के तैयार होने के बाद, टीम एक वास्तविक मिशन पर निकली। उन्होंने स्पेनिश गूगल प्ले स्टोर से 2,611 एंड्रॉइड ऐप्स डाउनलोड किए और उनका परीक्षण किया। यह एक बड़ी बात थी क्योंकि पिछले ऑडिट में ज्यादातर लोकप्रिय व्यावसायिक (कमर्शियल) ऐप्स देखे जाते थे, जो अक्सर अपनी नीतियां अंग्रेजी में लिखते हैं। शोधकर्ता यह देखना चाहते थे कि क्या होता है जब वे "अन्य" ऐप्स को शामिल करते हैं: सरकारी सेवाएँ, स्थानीय नगर पालिका उपकरण और सार्वजनिक परिवहन ऐप्स, जो आमतौरता पर अपनी नीतियां स्पेनिश में लिखते हैं।
उन्होंने केवल नीतियों को नहीं पढ़ा; उन्होंने ऐप्स को चलते हुए भी देखा। उन्होंने टेस्ट फोन पर ऐप्स चलाए और रिकॉर्ड किया कि ऐप्स द्वारा इंटरनेट पर भेजा जाने वाला डेटा का हर एक हिस्सा क्या था। फिर, उन्होंने "वादे" (पॉलिसी) की "वास्तविकता" (वास्तविक डेटा भेजा गया) के साथ तुलना की।
यहाँ उन्हें क्या मिला, और यह एक दिलचस्प मोड़ है:
1. भाषा की बाधा सच्चाई को छिपाती है
ऑडिट ने एक स्पष्ट विभाजन का खुलासा किया। लोकप्रिय व्यावसायिक ऐप्स (जैसे गेम और शॉपिंग टूल्स) ज्यादातर अपनी प्राइवेसी पॉलिसी अंग्रेजी में लिखते थे। सार्वजनिक क्षेत्र के ऐप्स (जैसे सरकारी सेवाएँ) अपनी नीतियां स्पेनिश में लिखते थे। क्योंकि अधिकांश पिछले ऑडिट केवल अंग्रेजी बोलते थे, वे प्रभावी रूप से सार्वजनिक क्षेत्र के ऐप्स के प्रति अंधे थे। स्पेनिश बोलकर, शोधकर्ता अंततः देख सके कि ये सरकारी ऐप्स क्या कर रहे हैं।
2. "चूक" (ओमिशन) की समस्या
जब उन्होंने वादों की वास्तविकता से तुलना की, तो उन्होंने पाया कि कई ऐप्स "चूक द्वारा झूठ" बोल रहे थे—यानी, उन्होंने यह नहीं कहा कि वे डेटा एकत्र कर रहे हैं, लेकिन वे फिर भी ऐसा कर रहे थे।
- व्यावसायिक ऐप्स: लगभग 15.1% लोकप्रिय व्यावसायिक ऐप्स की ऐसी नीतियां थीं जो उनके व्यवहार से मेल नहीं खाती थीं।
- सार्वजनिक ऐप्स: सरकारी ऐप्स के लिए स्थिति बहुत खराब थी। लगभग 49.5% ऐप्स की नीतियों में प्रमुख डेटा संग्रह गतिविधियाँ छूट गई थीं।
3. क्या गायब था?
सबसे आम रहस्य "डिवाइस टेलीमेट्री" (device telemetry) था। यह तकनीकी शब्दावली है जो आपके फोन के मॉडल, उसके सॉफ्टवेयर संस्करण और उसकी विशिष्ट आईडी के बारे में जानकारी चुपचाप इंटरनेट पर भेजने के लिए उपयोग की जाती है। ऐप्स अक्सर अपनी नीतियों में इसका उल्लेख नहीं करते थे।
- सार्वजनिक क्षेत्र के ऐप्स के लिए, उनके द्वारा देखे गए डेटा प्रवाहों में से 79.6% उनकी प्राइवेसी पॉलिसी में उल्लेखित नहीं थे।
- भले ही ये सरकारी ऐप्स थे, वे अक्सर बड़ी टेक कंपनियों (जैसे गूगल) और अमेरिका तथा यूके के सर्वरों को डेटा भेज रहे थे, बिना उपयोगकर्ता को स्पष्ट रूप से बताए कि यह हो रहा है।
यह क्यों मायने रखता है
यह शोध पत्र सुझाव देता है कि समस्या केवल यह नहीं है कि कुछ ऐप्स बुरे कर्ता हैं; बल्कि समस्या यह है कि उन्हें जाँचने की पूरी प्रणाली भाषा के कारण टूटी हुई है। केवल अंग्रेजी नीतियों का ऑडिट करके, शोधकर्ता और नियामक डिजिटल पारिस्थितिकी तंत्र के एक बड़े हिस्से को खो रहे थे, विशेष रूप से उन सेवाओं को जो सरकारें अपने नागरिकों को प्रदान करती हैं।
यह अध्ययन दिखाता है कि जब आप अंततः स्पेनिश बोलने वाले ऐप्स को देखते हैं, तो आप पारदर्शिता के एक अलग प्रकार के अंतर को देखते हैं। यह केवल विज्ञापनों और ट्रैकिंग के बारे में नहीं है; यह इस बारे में है कि कैसे सार्वजनिक सेवाएँ भी जटिल, छिपे हुए तीसरे पक्ष के उपकरणों पर निर्भर करती हैं जो स्पष्ट स्पष्टीकरण के बिना स्वचालित रूप से डेटा भेजते हैं। शोधकर्ता निष्कर्ष निकालते हैं कि गोपनीयता को ठीक करने के लिए, हमें भाषा को एक बाधा के रूप में मानना बंद करना होगा। हमें ऐसे उपकरणों की आवश्यकता है जो हर भाषा का ऑडिट कर सकें, क्योंकि ऐप्स जो रहस्य रखते हैं, उन्हें इस बात से कोई फर्क नहीं पड़ता कि आप कौन सी भाषा बोलते हैं। गोपनीयता की जाँच करने का "केवल अंग्रेजी" तरीका एक पहेली को हल करने की कोशिश करने जैसा है जबकि आप केवल आधे टुकड़ों को देख रहे हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।