PromptCanary Detecting Silent Behavioral Drift in Large Language Model APIs
यह शोधपत्र PromptCanary को प्रस्तुत करता है, जो एक ओपन-सोर्स टूल है जो कस्टमाइज़ेबल प्रॉम्प्ट्स और स्कोरिंग प्रोब्स का उपयोग करके वर्शन्ड बेसलाइन्स के विरुद्ध वर्तमान आउटपुट की तुलना करके लार्ज लैंग्वेज मॉडल (LLM) APIs में साइलेंट बिहेवियरल ड्रिफ्ट का पता लगाने के लिए गोल्डन-मास्टर रिग्रेशन टेस्टिंग लागू करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक जादुई, सर्वज्ञानी रोबोट मित्र (एक लार्ज लैंग्वेज मॉडल) है जिससे आप एक विशेष खिड़की (API) के माध्यम से हर दिन बात करते हैं। आपने इसे एक बहुत ही विशिष्ट तरीके से अपने सवालों के जवाब देने के लिए प्रशिक्षित किया है: शायद यह हमेशा आपको एक साफ-सुथरे JSON बॉक्स में सामग्री की सूची देता है, या शायद यह हमेशा सलाह देने से पहले एक दोस्ताना "Hello!" के साथ शुरुआत करता है।
लेकिन यहाँ एक मोड़ है: रोबोट के मालिक बिना आपको बताए किसी भी समय रोबोट का मस्तिष्क बदल सकते हैं। वे मस्तिष्क को अपग्रेड कर सकते हैं, व्यक्तित्व में बदलाव कर सकते हैं, या इसे पूरी तरह से एक अलग रोबोट से बदल सकते हैं। खिड़की बिल्कुल वैसी ही दिखती है, दरवाजा भी नहीं चरमराता, और कोई अलार्म नहीं बजता। लेकिन अचानक, आपका रोबोट मित्र आपको एक सूची के बजाय टेक्स्ट का एक पैराग्राफ देने लगता है, या वह "Hello" कहना भूल जाता है। आपके ऐप्स टूट जाते हैं, आपके पार्सर क्रैश हो जाते हैं, और आपको पता भी नहीं चलता कि क्यों। इसे लेखक Silent Behavioral Drift (मौन व्यवहारिक विचलन) कहते हैं।
पेश है PromptCanary, एक नया ओपन-सोर्स टूल जिसे आपका "कोयले की खान में कैनरी" (चेतावनी देने वाला संकेत) बनने के लिए डिज़ाइन किया गया है।
द गोल्डन मास्टर: एक समय-यात्रा करने वाला स्नैपशॉट
PromptCanory को एक समय-यात्रा करने वाले फोटोग्राफर की तरह समझें। पारंपरिक सॉफ़्टवेयर में, यदि आप आज किसी प्रोग्राम के आउटपुट की फोटो लेते हैं, तो कल उसे बिल्कुल वैसा ही दिखना चाहिए। यदि वह बदल जाता है, तो आप जानते हैं कि कुछ टूट गया है। लेकिन AI के साथ, आउटपुट स्वाभाविक रूप से थोड़ा अस्थिर होता है (जैसे एक बिल्ली जो बाईं या दाईं ओर बैठ सकती है)।
PromptCanary इसे एक "गोल्डन मास्टर" स्नैपशॉट लेकर हल करता है। आप टूल को महत्वपूर्ण प्रश्नों (प्रॉम्प्ट्स) की एक छोटी सूची देते हैं और कहते हैं, "एक अच्छा उत्तर कैसा दिखता है, यह रहा।" यह उस उत्तर को एक बेसलाइन के रूप में सहेज लेता है। बाद में, जब आप वही प्रश्न पूछते हैं, तो PromptCanary केवल यह जाँचने के लिए नहीं देखता कि उत्तर "सही" है या "गलत"। इसके बजाय, यह एक अत्यंत सूक्ष्म पर्यवेक्षक जासूस की तरह कार्य करता है, नए उत्तर की पुराने फोटो के साथ तुलना करता है ताकि यह देखा जा सके कि क्या शैली या संरचना में कोई बदलाव आया है।
जासूसी किट: प्रोब्स (Probes)
इसे कैसे पता चलता है कि रोबोट भटक रहा है? यह प्रोब्स (Probes) का उपयोग करता है। कल्पना करें कि ये 19 अलग-अलग आवर्धक लेंस (magnifying glasses) हैं, जिनमें से प्रत्येक एक विशिष्ट सुराग की तलाश कर रहा है।
- द JSON ग्लास: यह जाँचता है कि क्या उत्तर अभी भी एक व्यवस्थित डेटा बॉक्स है।
- द रीजनिंग ग्लास: यह जाँचता है कि क्या रोबोट अभी भी अपना काम चरण-दर-चरण दिखा रहा है।
- द रिफ्यूज़ल ग्लास: यह जाँचता है कि क्या रोबोट ने अचानक उन चीजों के लिए "नहीं" कहना शुरू कर दिया है जिनका वह पहले जवाब देता था।
प्रत्येक प्रोब एक स्कोर देता है। यह केवल एक साधारण "पास" या "फेल" नहीं है। यह एक ग्रेड की तरह है। यदि रोबोट को आपको 5 तथ्य देने थे और उसने केवल 4 दिए, तो प्रोब इसे 80% का स्कोर दे सकता है। यह आपको यह देखने में मदद करता है कि रोबोट पूरी तरह से टूटने से पहले कितनी धीरे-धीरे खराब हो रहा है।
"सुइट" समस्या: क्लासरूम में एक गड़बड़ी
लेखकों ने यह परीक्षण करने के लिए कि यह वास्तविक दुनिया में कितनी अच्छी तरह काम करता है, कुछ परीक्षण चलाए। उन्होंने एक सिमुलेशन सेट किया जहाँ उन्होंने आठ दिनों तक धीरे-धीरे "ड्रिफ्ट" (बुरा व्यवहार) पेश किया।
यहाँ एक मज़ेदार (और थोड़ा शर्मनाक) तथ्य मिला: यह टूल थोड़ा अधिक उत्सुक है।
उनके परीक्षण में, उनके पास एक "सुइट" (प्रश्नों का समूह) और प्रोब्स की एक सूची थी। टूल ने प्रत्येक प्रश्न पर प्रत्येक प्रोब लागू किया। इसलिए, उनके पास "JSON बॉक्स" खोजने वाला एक प्रोब था और एक प्रश्न था जो "एक कविता" के लिए पूछा गया था। JSON प्रोब कविता वाले प्रश्न पर हर बार विफल हुआ, यहाँ तक कि पहले दिन भी जब सब कुछ बिल्कुल ठीक था!
इसका मतलब था कि पूरे समूह का "स्कोर" कम (66.7% पर) से शुरू हुआ क्योंकि इनमें मिसमैच था। हालाँकि, लेखकों ने एक अच्छी खबर खोजी: टूल शोर (noise) को अनदेखा करने के लिए पर्याप्त स्मार्ट है। भले ही स्कोर कम था, टूल ने सही ढंग से पहचान लिया कि पहले, दूसरे और तीसरे दिन कुछ भी नया नहीं बदला था। इसने तभी अलार्म बजाया जब चौथे दिन रोबोट ने वास्तव में चीजों को बिगाड़ना शुरू किया।
इससे एक डिज़ाइन संबंधी खामी का पता चला: वर्तमान में, आप टूल को यह नहीं बता सकते कि, "केवल JSON प्रश्नों के लिए JSON की जाँच करें।" आपको हर चीज़ की हर चीज़ के विरुद्ध जाँच करनी होती है। लेखक स्वीकार करते हैं कि यह एक सीमा है जिसे उन्हें ठीक करने की आवश्यकता है, लेकिन उन्होंने यह भी पाया कि उनका टूल इसके बावजूद संभालने के लिए पर्याप्त मजबूत है।
PromptCanary क्या नहीं है
यह जानना महत्वपूर्ण है कि यह टूल क्या नहीं करता है।
- यह यह परीक्षण करने के लिए नहीं है कि रोबोट कितना "स्मार्ट" है या वह विज्ञान की समस्याओं को हल कर सकता है या नहीं। वह अन्य टूल्स के लिए है।
- यह भविष्य की भविष्यवाणी करने वाला कोई जादुई क्रिस्टल बॉल नहीं है। यह केवल आज की तुलना कल से करता है।
- यह कोई सांख्यिकीय सुपर-कंप्यूटर नहीं है। यह यह अनुमान लगाने के लिए जटिल गणित का उपयोग नहीं करता है कि परिवर्तन एक इत्तेफाक है या नहीं; यह उपयोगकर्ता द्वारा निर्धारित नियमों पर निर्भर करता है।
निर्णय
लेखकों ने इस टूल को एक हल्के, उपयोग में आसान पायथन लाइब्रेरी के रूप में बनाया है। उन्होंने इसका गहन परीक्षण किया, लेकिन एक ट्विस्ट के साथ: उन्होंने परीक्षण के दौरान वास्तविक रोबोट को कॉल नहीं किया। इसके बजाय, उन्होंने एक "मॉक" रोबोट (एक नकली रोबोट जो हमेशा एक ही उत्तर देता है) का उपयोग किया ताकि यह सुनिश्चित हो सके कि उनका टूल क्रैश न हो। इसका मतलब है कि वे इस बात के प्रति बहुत आश्वस्त हैं कि टूल सिद्धांत रूप में काम करता है, लेकिन वे स्वीकार करते हैं कि वास्तविक दुनिया के रोबोट के अजीब व्यवहार (जैसे विशिष्ट कंपनियों से आने वाले अजीब एरर मैसेज) अभी भी बच निकल सकते हैं।
यह टूल अभी उपयोग के लिए उपलब्ध है। यह एक सरल, व्यावहारिक तरीका है यह कहने का कि, "हे, क्या रोबोट ने मुझसे बात करने के तरीके में बदलाव किया है?" और आपके ऐप के टूटने से पहले एक स्पष्ट उत्तर प्राप्त करने का। यह कोई रामबाण इलाज नहीं है, लेकिन यह अंधेरे कमरे में एक बहुत ही सहायक टॉर्च की तरह है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।