Testing JSON Schema Instruction Artifacts: Distributional Robustness under Validation-Equivalent Serialization and JSON Mode
यह अध्ययन प्रदर्शित करता है कि सत्यापन-तुल्य (validation-equivalent) JSON स्कीमा सीरियलाइजेशन, भाषा मॉडल के आउटपुट वितरणों में सांख्यिकीय रूप से महत्वपूर्ण और व्यावहारिक रूप से अर्थपूर्ण परिवर्तन उत्पन्न कर सकते हैं, जो यह प्रकट करता है कि तैनात प्रणालियों में वितरण संबंधी सुदृढ़ता सुनिश्चित करने के लिए केवल सत्यापन तुल्यता ही एक अपर्याप्त रिग्रेशन ओरेकल (regression oracle) है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक अर्थ निकालने वाले (literal-minded) रोबोट को एक विशिष्ट प्रकार का सैंडविच बनाने के निर्देश दे रहे हैं। आप निर्देशों को कागज के एक टुकड़े पर लिखते हैं। अब, कल्पना कीजिए कि आपके पास एक जादुई स्टैम्प है जिस पर लिखा है, "यह सैंडविच रेसिपी एकदम सही है।" यह स्टैम्प यह जाँचता है कि क्या आपके पास सभी सही सामग्रियाँ (ब्रेड, चीज़, हैम) हैं और क्या आपने गलती से सरसों (mustard) छोड़ तो नहीं दी है। लेकिन यहाँ एक पेंच है, स्टैम्प इस बात की परवाह नहीं करता कि आपने चरणों का क्रम किस क्रम में लिखा है। चाहे आप कहें "ब्रेड पर हैम रखें, फिर चीज़ रखें" या "ब्रेड पर चीज़ रखें, फिर हैम रखें," स्टैम्प वही "परफेक्ट" थम्स-अप देता है क्योंकि अंतिम सैंडविच के हिस्से समान होते हैं।
कंप्यूटर विज्ञान की दुनिया में, इस "स्टैम्प" को JSON Schema कहा जाता है। यह एक नियम पुस्तिका है जो कंप्यूटर प्रोग्राम को बताती है कि डेटा का एक हिस्सा कैसा दिखना चाहिए। जब हम आर्टिफिशियल इंटेलिजेंस (AI) से कोड लिखने या जानकारी व्यवस्थित करने के लिए कहते हैं, तो हम अक्सर उसे इस नियम पुस्तिका के रूप में निर्देशों का एक सेट देते हैं। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं, वह यह है कि यदि हम कागज पर निर्देशों के क्रम को बदल दें—नियमों या "परफेक्ट" स्टैम्प को बदले बिना—तो क्या AI अभी भी बिल्कुल वही सैंडविच बनाएगा? या क्या AI नए क्रम से भ्रमित हो जाएगा और स्टैम्प की जाँच पास करने के बावजूद कुछ थोड़ा अलग परोस देगा? यह महत्वपूर्ण है क्योंकि यदि AI केवल शब्दों के क्रम को बदलने से अपना मन बदल लेता है, तो यह मेडिकल रिकॉर्ड या वित्तीय रिपोर्ट जैसे महत्वपूर्ण कार्यों के लिए अविश्वसनीय हो जाता है।
यह शोध पत्र एक जासूसी कहानी की तरह है जहाँ लेखक, शेनग्याओ सन (Shengyao Sun), यह जांच करते हैं कि क्या AI का "दिमाग" इन नियम पुस्तिकाओं में शब्दों के क्रम के प्रति संवेदनशील है। इस अध्ययन ने विभिन्न AI मॉडलों को एक ही पहेली को हल करने के लिए कहने के माध्यम से इसका परीक्षण किया, जिसमें नियम पुस्तिकाएं समान थीं, लेकिन निर्देश अलग-अलग क्रम में लिखे गए थे। उन्होंने इसे केवल एक बार नहीं पूछा; उन्होंने प्रत्येक संस्करण के लिए पाँच बार पूछा ताकि यह सुनिश्चित किया जा सके कि कोई भी बदलाव केवल संयोगवश न हो। उन्होंने पाया कि कुछ AI सिस्टम के लिए, शब्दों का क्रम महत्ववपूर्ण था। जब गुणों (जैसे "नाम" या "आयु") का क्रम बदला गया, तो AI अलग-अलग उत्तर देने लगा, भले ही वे उत्तर नियम पुस्तिका के अनुसार तकनीकी रूप से "सही" थे।
हालाँकि, हर AI के लिए कहानी एक जैसी नहीं है। लेखक ने पाया कि यह "क्रम संवेदनशीलता" (order sensitivity) पूरी तरह से इस बात पर निर्भर करती है कि आप किस विशिष्ट AI सिस्टम का उपयोग कर रहे हैं। "Sonnet" और "Qwen" सिस्टम के लिए, क्रम बदलने से उत्तरों में उल्लेखनीय बदलाव आया—सामान्य से लगभग 5% से 12% अधिक असहमति देखी गई। लेकिन "GPT" और "DeepSeek" सिस्टम के लिए, क्रम बदलने से बहुत कम अंतर पड़ा। अध्ययन ने यह भी जाँच की कि क्या एक विशेष "JSON मोड" (एक सेटिंग जो AI को फॉर्मेटिंग के साथ अतिरिक्त सावधान रहने के लिए कहती है) इस समस्या को ठीक कर देगी। आश्चर्यजनक रूप से, इसने काम नहीं किया; सख्त मोड में भी AI शब्दों के क्रम से भ्रमित होता रहा।
सबसे महत्वपूर्ण बात यह है कि सिर्फ इसलिए कि एक कंप्यूटर प्रोग्राम एक निर्देश सेट को "वैध" या "सही" कहता है, इसका मतलब यह नहीं है कि AI उसी तरह व्यवहार करेगा यदि आप फॉर्मेटिंग में थोड़ा बदलाव करते हैं। लेखक का सुझाव है कि हमें अब केवल "स्टैम्प" पर भरोसा नहीं करना चाहिए। इसके बजाय, हमें इन निर्देश सेटों के साथ सॉफ्टवेयर कोड की तरह व्यवहार करना चाहिए: हमें उन्हें एक मानक क्रम में लॉक करना चाहिए (जैसे हमेशा सामग्री को वर्णानुक्रम में सूचीबद्ध करना) और वास्तविक दुनिया में चलाने से पहले उनका सावधानीपूर्वक परीक्षण करना चाहिए। अध्ययन साबित करता है कि केवल सत्यापन (validation) पर्याप्त नहीं है; हमें यह जाँचने की आवश्यकता है कि क्या निर्देशों को पुनर्व्यवस्थित करने पर AI का व्यवहार स्थिर रहता है, क्योंकि कुछ AIs के लिए, शब्दों का क्रम गुप्त रूप से रेसिपी का हिस्सा होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।