← नवीनतम पेपर
🤖 AI

Tracking the Behavioral Trajectories of Adapting Agents

यह शोध पत्र एजेंट व्यवहारिक लक्षणों को टेक्स्ट एम्बेडिंग स्पेस में दिशाओं के रूप में परिभाषित करके उन्हें मापने के लिए एक ढांचे का परिचय देता है, जो कौशल फ़ाइल संपादन (skill file edits) को मापने में सक्षम बनाता है और एक विश्वसनीय मध्यस्थ के माध्यम से व्यवहारिक परिवर्तनों के सुरक्षित एजेंट-से-एजेंट मूल्यांकन की सुविधा प्रदान करता है।

मूल लेखक: Jonah Leshin, Manish Shah, Ian Timmis

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jonah Leshin, Manish Shah, Ian Timmis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आधुनिक AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) डिजिटल कर्मचारियों की तरह हैं। ठीक वैसे ही जैसे एक मानव कर्मचारी के पास एक बायोडाटा (resume), एक हैंडबुक और नियमों का एक सेट होता है, इन AI एजेंटों के पास भी "टेक्स्ट फाइलें" होती हैं जो उन्हें बताती हैं कि क्या करना है, उन्हें क्या याद रखना है और वे कौन हैं। ये फाइलें उनके व्यवहार के लिए उनका "सोर्स कोड" हैं।

समस्या यह है कि ये फाइलें बदल सकती हैं। कभी-कभी कोई इंसान इन्हें अपडेट करता है, और कभी-कभी AI खुद ही इन्हें अपडेट करता है। ज्यादातर समय, ये बदलाव हानिरहित होते हैं, जैसे किसी बग को ठीक करने के लिए एक नया कौशल जोड़ना। लेकिन कभी-कभी, एक फाइल में ऐसा बदलाव किया जा सकता है जिससे एजेंट कुछ खतरनाक करने लगे, जैसे चुपके से पासवर्ड या निजी डेटा चुराना।

चुनौती:
हजारों नियमित अपडेटों की एक विशाल स्ट्रीम में एक खतरनाक बदलाव को आप कैसे पहचानेंगे? यह एक ट्रक भर फल में एक खराब सेब को खोजने जैसा है जो लगातार नए फलों से भरा जा रहा है। आप पूरे ट्रक को नहीं देख सकते; आपको बदलाव की दिशा मापने का एक तरीका चाहिए।

समाधान: एक "व्यवहार संबंधी दिशा-सूचक" (Behavioral Compass)
इस शोध पत्र के लेखकों ने एक "कंपस" (दिशा-सूचक) का उपयोग करके इन बदलावों को ट्रैक करने का एक तरीका बनाया है जो गणित से बना है। यह कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

  1. "पहले और बाद का" स्नैपशॉट:
    बजाय पूरी फाइल को पढ़ने के, वे डिफ (diff) को देखते हैं—यानी स्किल फाइल के "पुराने संस्करण" और "नए संस्करण" के बीच किए गए विशिष्ट परिवर्तन। इसे एक कहानी के दो ड्राफ्टों की तुलना करने जैसा समझें ताकि यह देखा जा सके कि कौन से वाक्य जोड़े या हटाए गए हैं।

  2. "ट्रेट वेक्टर" (द कंपस):
    उन्होंने एक कंप्यूटर मॉडल को एक विशिष्ट "लक्षण" (trait) को समझने के लिए प्रशिक्षित किया, इस मामले में, "डेटा-खोजने वाला" (data-seeking) (गुप्त जानकारी या पासवर्ड खोजने की प्रवृत्ति)।

  • उन्होंने फाइल परिवर्तनों के 68 उदाहरण लिए। कुछ को लेबल किया गया था "यह परिवर्तन एजेंट को डेटा चुराने के लिए अधिक संभावित बनाता है" (+1), और कुछ को "यह परिवर्तन एजेंट को सुरक्षित बनाता है" (-1)।
  • मॉडल ने एक उच्च-आयामी गणितीय स्थान (high-dimensional mathematical space) में एक रेखा (वेक्टर) खींचना सीखा जो "अच्छे" परिवर्तनों को "बुरे" परिवर्तनों से अलग करती है। यह रेखा उनका ट्रेट वेक्टर (Trait Vector) है।
  1. नए परिवर्तनों को स्कोर देना:
    जब कोई नया फाइल एडिट होता है, तो सिस्टम "पहले और बाद के" टेक्स्ट को एक गणितीय दिशा में बदल देता है, और देखता है कि वह ट्रेट वेक्टर के सापेक्ष किस दिशा में इशारा करता है।
  • यदि यह "डेटा चुराने वाले" वेक्टर की दिशा में इशारा करता है, तो इसे उच्च जोखिम स्कोर मिलता है।
  • यदि यह दूसरी दिशा में इशारा करता है, तो इसे सुरक्षित स्कोर मिलता है।

परिणाम:
उन्होंने 68 उदाहरणों पर इसका परीक्षण किया।

  • सटीकता (Accuracy): सिस्टम ने 91.2% बार सही ढंग से पहचाना कि परिवर्तन "अच्छा" था या "बुरा"।
  • रैंकिंग (Ranking): यह एक छोटे जोखिम भरे बदलाव और एक बड़े खतरनाक बदलाव के बीच अंतर बताने में भी बहुत अच्छा था (एक सहसंबंध स्कोर 0.82)।
  • तुलना: यह साधारण कीवर्ड सर्च नियमों (जो संदर्भ को मिस कर देते थे) की तुलना में बहुत बेहतर था, लेकिन एक सुपर-स्मार्ट AI से फाइल को मैन्युअल रूप से पढ़वाने की तुलना में थोड़ा कम सटीक था। हालांकि, उनका तरीका तेज, सस्ता और सुसंगत है (यह एक मानव या बड़े AI की तरह हर बार अलग उत्तर नहीं देता, बल्कि एक जैसा उत्तर देता है)।

"एजेंट-टू-एजेंट" प्रोटोकॉल (विश्वस्त मध्यस्थ)
यह शोध पत्र एक तरीका भी बताता है जिससे एक AI दूसरे AI की फाइलों की जांच कर सकता है, बिना एक-दूसरे पर सीधे भरोसा किए। वे एक विश्वस्त मध्यस्थ (Trusted Intermediary) का उपयोग करते हैं (एक सुरक्षित सर्वर) जो एक रेफरी की तरह कार्य करता है:

  1. एजेंट A (बॉस) रेफरी से एजेंट B (वर्कर) की जांच करने के लिए कहता है।
  2. रेफरी एजेंट B को एक सुरक्षित, लॉक-डाउन टूल भेजता है।
  3. एजेंट B इस टूल का उपयोग अपने स्वयं के फाइल परिवर्तनों की "गणितीय दिशा" की गणना करने के लिए करता है और केवल वे नंबर ही रेफरी को वापस भेजता है।
  4. रेफरी उन नंबरों पर "ट्रेट वेक्टर" (कंपस) लागू करता है और एजेंट A को अंतिम स्कोर बताता है।

यह सुनिश्चित करता है कि एजेंट B स्कोर के बारे में झूठ न बोल सके, और एजेंट A एजेंट B की निजी फाइलों को कभी नहीं देख पाता।

संक्षेप में:
यह शोध पत्र AI एजेंटों के लिए एक "व्यवहार संबंधी रडार" बनाने का तरीका प्रस्तुत करता है। टेक्स्ट फाइलों में बदलावों को गणितीय स्थान में एक दिशा के रूप में मानकर, वे स्वचालित रूप से पता लगा सकते हैं कि क्या कोई एजेंट खतरनाक व्यवहार (जैसे डेटा चुराना) की ओर बढ़ रहा है और समीक्षा के लिए फ्लैग कर सकते हैं, और वह भी बिना किसी इंसान द्वारा कोड की हर एक लाइन को पढ़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →