ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent
यह शोध पत्र ProfileFoundry को प्रस्तुत करता है, जो 100,000 सिंथेटिक, क्रॉस-फील्ड सुसंगत "पर्सन ऑब्जेक्ट्स" का एक नियतात्मक जनरेटर और फिक्स्ड रेफरेंस रिलीज़ है, जिसे वास्तविक उपयोगकर्ता डेटा और असंगत सिंथेटिक विकल्पों की सीमाओं को दूर करते हुए मेमोरी, प्राइवेसी और टूल-यूज़ कार्यों में फाउंडेशन मॉडल्स के जिम्मेदार मूल्यांकन को सक्षम करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक फिल्म निर्देशित करने की कोशिश कर रहे हैं जो एक जटिल पारिवारिक ड्रामा (family drama) के बारे में है, लेकिन आप वास्तविक लोगों का उपयोग नहीं कर सकते। आप वास्तविक अभिनेताओं की निजी तस्वीरें, उनके वास्तविक पते, या उनके वास्तविक पारिवारिक वंश (family trees) का उपयोग नहीं कर सकते, क्योंकि यह गोपनीयता का एक बड़ा उल्लंघन होगा। यदि आप बस यादृच्छिक (random) नाम और नंबर बना देते हैं, तो कहानी बिखर जाएगी क्योंकि "भाई" किसी दूसरे देश में रह सकता है जबकि "बहन" कहीं और, या "पति" की नौकरी उसकी उम्र के साथ मेल नहीं खाएगी।
ProfileFoundly एक हाई-टेक, डिजिटल कठपुतली फैक्ट्री की तरह है जो इस समस्या को हल करता है।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. "डिजिटल कठपुतली" (The Person Object - व्यक्ति वस्तु)
आपको केवल एक नकली नाम और नकली पता देने के बजाय, ProfileFoundry एक पूर्ण, जुड़ी हुई डिजिटल पहचान बनाता है। इसे एक "डिजिटल कठपुतली" के रूप में सोचें जो अपने साथ आती है:
- एक स्नैपशॉट: वे अभी कौन हैं (नौकरी, पता, आयु)।
- एक वंशावली (Family Tree): उनके माता-पिता, भाई-बहन और जीवनसाथी कौन हैं।
- एक घर (Household): वे किसके साथ रहते हैं।
- एक इतिहास: उनके जीवन की एक समयरेखा (Timeline) (वे कब स्थानांतरित हुए, कब उनकी शादी हुई, या उन्होंने कब नौकरी बदली)।
- एक कनेक्शन मैप: वे अन्य "कठपुतलियों" से कैसे जुड़े हैं (जैसे, "यह व्यक्ति उस व्यक्ति के साथ एक ही कंपनी में काम करता है")।
जादू यह है कि सब कुछ सुसंगत (consistent) है। यदि कठपुतली कहती है कि वह 25 वर्ष की है, तो उसके पास पीएचडी (PhD) नहीं हो सकती (क्योंकि इसमें आमतौर पर अधिक समय लगता है)। यदि वह विवाहित है, तो सिस्टम जानता है कि उसका जीवनसाथी कौन है और यह सुनिश्चित करता है कि जीवनसाथी की आयु तर्कसंगत हो।
2. "मास्टर ब्लूप्रिंट" (The Generator - जनरेटर)
यह पेपर एक डिटरमिनिस्टिक जनरेटर (deterministic generator) का वर्णन करता है। इसे एक मास्टर आर्किटेक्ट के रूप में सोचें जो घर बनाने से पहले उसका ब्लूप्रिंट तैयार करता है।
- चरण 1: आर्किटेक्ट निर्णय लेता है, "मैं चार लोगों का एक परिवार बनाऊंगा: दो माता-पिता और दो वयस्क बच्चे।"
- चरण 2: इस निर्णय के आधार पर, सिस्टम विवरणों को भरता है। माता-पिता को एक साझा पता मिलता है; बच्चों को माता-पिता से जोड़ा जाता है।
- चरण 3: सिस्टम उनकी वर्तमान आयु से पीछे की ओर (backwards) उनके जीवन की कहानियाँ लिखता है ताकि समयरेखा समझ में आए (जैसे, वे पैदा होने से पहले किसी नए शहर में नहीं जा सकते थे)।
यह सुनिश्चित करता है कि यदि आप सिस्टम से पूछते हैं, "मुझे वे सभी लोग दिखाएं जो अपने माता-पिता के साथ रहते हैं," तो यह उन लोगों की एक ऐसी सूची देता है जहाँ गणित वास्तव में सही बैठता है।
3. "सुरक्षित सैंडबॉक्स" (हमें इसकी आवश्यकता क्यों है)
AI (जैसे Large Language Models) का अध्ययन करने वाले शोधकर्ताओं को चीजों का परीक्षण करने की आवश्यकता होती है, जैसे:
- स्मृति (Memory): क्या AI 100 बातचीत के बाद भी उपयोगकर्ता का नाम याद रख सकता है?
- गोपनीयता (Privacy): क्या AI अनजाने में किसी नकली व्यक्ति का पता प्रकट कर सकता है?
- टूल्स (Tools): क्या AI किसी विशिष्ट व्यक्ति के लिए कैलेंडर ऐप का सही ढंग से उपयोग कर सकता है?
इनका परीक्षण करने के लिए, उन्हें डेटा की आवश्यकता होती है। लेकिन वे वास्तविक लोगों के डेटा का उपयोग नहीं कर सकते (यह अवैध और अनैतिक है)। यदि वे यादृच्छिक (random) नकली डेटा का उपयोग करते हैं, तो परीक्षण विफल हो जाते हैं क्योंकि डेटा वास्तविक जीवन जैसा नहीं दिखता (जैसे, AI भ्रमित हो जाता है क्योंकि "पिता" "बेटे" से छोटा है)।
ProfileFoundry 1,00,000 नकली लोगों का एक सुरक्षित सैंडबॉक्स प्रदान करता है। यह AI के लिए एक प्रशिक्षण जिम की तरह है जहाँ "वजन" (डेटा) भारी और यथार्थवादी है, लेकिन कोई वास्तविक मानव जोखिम में नहीं है।
4. "ऑडिट ट्रेल" (The Receipt - रसीद)
इस पेपर का एक सबसे शानदार हिस्सा जवाबदेही (accountability) है।
आमतौर पर, जब आप नकली डेटा उत्पन्न करते हैं, तो यह एक "ब्लैक बॉक्स" होता है। आपको परिणाम मिलता है, लेकिन आप नहीं जानते कि यह कैसे बनाया गया था। ProfileFoundly प्रत्येक व्यक्ति के लिए एक रसीद के साथ आता है।
- यह आपको ठीक से बताता है कि किस "सीड" (शुरुआती रैंडम नंबर) ने उन्हें बनाया।
- यह साबित करता है कि "भाई" और "बहन" को एक साथ बनाया गया था, न कि अलग-अलग।
- यह जांच करता है कि कहीं दो नकली व्यक्तियों का जन्मदिन और नाम गलती से एक जैसा तो नहीं हो गया (एक "कोलिजन")।
- यह विशेष ईमेल पतों का उपयोग करता है (जैसे
name@profilefoundry.example) जो गारंटी के साथ नकली हैं और कभी भी किसी वास्तविक व्यक्ति के नहीं होंगे।
यह क्या नहीं है
लेखक बहुत स्पष्ट हैं कि यह टूल क्या नहीं है:
- यह एक ऐसा "क्रिस्टल बॉल" नहीं है जो सटीक रूप से भविष्यवाणी करता है कि वास्तविक मनुष्य कैसे व्यवहार करेंगे। यह एक सिमुलेशन है, जनगणना (census) नहीं।
- यह गोपनीयता कवच (privacy shield) नहीं है। आप इन नकली नामों का उपयोग वास्तविक लोगों को कॉल करने या बैंकों को धोखा देने के लिए नहीं कर सकते।
- यह किसी विशिष्ट गेम या मूवी के लिए कोई तैयार उत्पाद नहीं है। यह एक कच्चा माल (raw material/substrate) है जिसका उपयोग शोधकर्ता अपने स्वयं के परीक्षण बनाने के लिए कर सकते हैं।
निचोड़ (The Bottom Line)
ProfileFoundry पुन: प्रयोज्य (reusable), ऑडिट योग्य और सुसंगत नकली लोगों का एक सेट है जिसे AI को सुरक्षित रूप से परीक्षण करने में मदद करने के लिए डिज़ाइन किया गया है। यह वैज्ञानिकों को 1,00,000 सावधानीपूर्वक तैयार की गई, आपस में जुड़ी हुई पुतलों (mannequins) का एक बॉक्स देने जैसा है ताकि वे सर्जरी (या इस मामले में, AI परीक्षण) का अभ्यास कर सकें, बिना कभी भी किसी वास्तविक मानव को छूने की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।