The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs
यह शोध पत्र AEGIS को प्रस्तुत करता है, जो एक प्रदाता-पारदर्शी (provider-transparent) API राउटर है जो प्लेनटेक्स्ट LLM इंटरैक्शन को एक हार्डवेयर एनक्लेव के भीतर सीमित करने के लिए प्रमाणित विश्वसनीय निष्पादन वातावरण (attested TEEs) का लाभ उठाता है, जिससे मौजूदा प्रदाता APIs के साथ कम विलंबता और अनुकूलता बनाए रखते हुए दुर्भावनापूर्ण राउटरों को एजेंट टूल कॉल्स में हेरफेर करने, डिपेंडेंसी बदलने या रहस्यों को चुराने से रोका जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "The Proxy Knows Too Much" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करते हुए हिंदी अनुवाद दिया गया है।
समस्या: "बहुत अधिक जानने वाला" बिचौलिया
कल्पना कीजिए कि आपने अपने लिए कोड लिखने के लिए एक पर्सनल असिस्टेंट (एक AI Agent) को काम पर रखा है। अपना काम करने के लिए, इस असिस्टेंट को ज्ञान के एक विशाल पुस्तकालय (जैसे OpenAI या Google जैसा LLM Provider) से बात करने की आवश्यकता होती है।
आमतौर पर, आपका असिस्टेंट सीधे पुस्तकालय से बात नहीं करता है। यह एक Router (एक मध्यस्थ गेटवे) के माध्यम से जाता है। इस राउटर को एक डाकघर सॉर्टिंग सुविधा की तरह समझें।
- आप डाकघर को एक सीलबंद पत्र भेजते हैं।
- डाकघर उस पत्र को खोलता है, उसके अंदर की हर चीज़ को पढ़ता है, उसे फिर से सील करता है, और पुस्तकालय को भेज देता है।
- पुस्तकालय जवाब देता है, डाकघर उसे खोलता है, उसे पढ़ता है, और उसे वापस आप तक पहुँचा देता है।
खतरा: क्योंकि डाकघर पत्र को खोलता है, इसलिए डाकघर चलाने वाला व्यक्ति (Router Operator) सब कुछ देख सकता है। वे यह कर सकते हैं:
- सामग्री को बदलना: एक कमांड को "सुरक्षित टूल इंस्टॉल करें" से बदलकर "वायरस इंस्टॉल करें" कर देना।
- अपने निशान मिटाना: केवल तभी पत्र को बदलना जब उन्हें लगे कि कोई देख नहीं रहा है (एक "ट्रिगर" हमला)।
- राज चुराना: आपके पासवर्ड या निजी डेटा को पढ़ना जो आपके संदेश के साथ गुजर रहा है।
वर्तमान सुरक्षा उपाय इस तरह हैं जैसे प्राप्तकर्ता को पत्र मिलने के बाद उसे चेक करने के लिए कहना। लेकिन तब तक, नुकसान हो चुका होता है, या जालसाज पहले ही भाग चुका होता है।
समाधान: AEGIS (एक "ग्लास-बॉक्स" तिजोरी)
लेखक AEGIS नामक एक नया सिस्टम प्रस्तावित करते हैं। एक साधारण डाकघर के बजाय, कल्पना कीजिए कि आपके और पुस्तकालय के बीच एक हाई-टेक, पारदर्शी तिजोरी है।
यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:
1. "ग्लास बॉक्स" (द एनक्लेव)
AEGIS एक विशेष कंप्यूटर हार्डवेयर का उपयोग करता है जिसे Trusted Execution Environment (TEE) कहा जाता है। इसे डाकघर के भीतर एक कांच की दीवारों वाली तिजोरी के रूप में सोचें।
- नियम: तिजोरी अटूट कांच से बनी है। डाकघर चलाने वाला व्यक्ति (अविश्वसनीय होस्ट) देख सकता है कि तिजोरी मौजूद है, लेकिन वे इसके अंदर होने वाली किसी भी चीज़ को छू, पढ़ या बदल नहीं सकते।
- प्रक्रिया: आपका असिस्टेंट पत्र को तिजोरी के अंदर भेजता है। तिजोरी उसे पढ़ती है, पुस्तकालय को भेजती है, पुस्तकालय से जवाब लेती है, और उसे वापस आपके असिस्टेंट को सौंप देती है। डाकघर का कर्मचारी केवल तिजोरी के बाहरी हिस्से को देखता है; वे कभी भी पत्र को स्वयं नहीं देख पाते।
2. "आईडी चेक" (रिमोट अटेस्टेशन)
पत्र भेजने से पहले, आपको यह सुनिश्चित करना होगा कि तिजोरी असली है और उसके साथ कोई छेड़छाड़ नहीं की गई है।
- उदाहरण: कल्पना कीजिए कि तिजोरी के कांच पर एक अद्वितीय, लेजर-एच्ड सीरियल नंबर है। इससे पहले कि आप इस पर भरोसा करें, आप एक सार्वजनिक, अपरिवर्तनीय लेजर (एक Transparency Log) की जांच करते हैं ताकि यह देख सकें कि क्या वह सीरियल नंबर एक "अच्छे" तिजोरी के ब्लूप्रिंट से मेल खाता है।
- परिणाम: यदि सीरियल नंबर ब्लूप्रिंट से मेल खाता है, तो आप जानते हैं कि तिजोरी ठीक उसी ईमानदार सॉफ़्टवेयर को चला रही है जिसे आपने स्वीकृत किया था। यदि यह मेल नहीं खाता है, तो आप पत्र भेजना मना कर देते हैं। यह आपके रहस्य प्रकट करने से पहले होता है।
3. "वफादार संदेशवाहक"
तिजोरी के अंदर, सॉफ़्टवेयर बहुत सरल है। यह स्मार्ट होने की कोशिश नहीं करता; यह केवल एक वफादार संदेशवाहक के रूप में कार्य करता है।
- यह आपके पत्र को बिल्कुल वैसा ही लेता है जैसा वह है और पुस्तकालय को सौंप देता है।
- यह पुस्तकालय के जवाब को बिल्कुल वैसा ही लेता है जैसा वह है और वापस आपको सौंप देता है।
- यह एक शब्द भी दोबारा नहीं लिखता, न ही सारांश बनाता है और न ही बदलता है। यह सुनिश्चित करता है कि AI एजेंट को वही मिले जो उसने मांगा था, बिना किसी छिपे हुए धोखे के।
यह क्यों महत्वपूर्ण है
पेपर ने इस सिस्टम का परीक्षण चार विशिष्ट तरीकों के विरुद्ध किया जिनसे एक बुरा राउटर ऑपरेटर हमला कर सकता था:
- टूल्स को फिर से लिखना: कोड कमांड को बदलना। (रोका गया)
- टाइपोस्क्वाटिंग: एक सुरक्षित सॉफ़्टवेयर पैकेज को नकली, दुर्भावनापूर्ण पैकेज से बदलना। (रोका गया)
- ट्रिगर किए गए हमले: केवल तभी हमला करना जब उन्हें लगे कि कोई देख नहीं रहा है। (रोका गया)
- राज चुराना: ट्रैफिक में पासवर्ड पढ़ना। (रोका गया)
प्रत्येक परीक्षण में, एक "बुरे" राउटर ऑपरेटर द्वारा एक सामान्य राउटर के साथ ये सभी चीजें की जा सकती थीं, लेकिन AEGIS ने उन्हें पूरी तरह से रोक दिया।
ट्रेड-ऑफ (लागत)
क्या यह पूर्ण है? लगभग।
- गति: यह थोड़ा सा विलंब (लगभग 6 मिलीसेकंड) जोड़ता है क्योंकि पत्र को कांच की तिजोरी के अंदर जाना पड़ता है और बाहर आना पड़ता है। यह एक सुरक्षित दरवाजे से गुजरने में लगने वाले समय की तरह है; AI के सोचने के समय की तुलना में यह नगण्य है।
- ऑपरेटर अभी भी क्या देख सकता है: ऑपरेटर अभी भी यह देख सकता है कि आप कितना उपयोग कर रहे हैं (जैसे, "100 शब्द भेजे गए") और आप कब उपयोग कर रहे हैं, लेकिन वे यह नहीं देख सकते कि आपने क्या कहा। यह एक डाकघर को यह जानने जैसा है कि आपने दोपहर 2 बजे एक भारी पैकेज भेजा है, लेकिन वे यह नहीं जानते कि उसमें जन्मदिन का कार्ड था या बम।
निष्कर्ष
AEGIS "द प्रॉक्सी नोज़ टू मच" की समस्या को एक कांच की दीवारों वाली, सत्यापित तिजोरी में संवेदनशील बातचीत को स्थानांतरित करके हल करता है जिसे ऑपरेटर छू नहीं सकता। यह सुनिश्चित करता है कि AI एजेंट को ठीक वही मिले जो उसने मांगा था, और ऑपरेटर गुप्त रूप से सौदे को बदल नहीं सकता, रहस्य नहीं चुरा सकता, या मैलवेयर नहीं डाल सकता, और इसके लिए AI कंपनियों (जैसे OpenAI) को अपने सिस्टम बदलने की आवश्यकता नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।