← नवीनतम पेपर
💻 computer science

Instruction fragility under hidden operational requirements

यह शोध पत्र प्रदर्शित करता है कि प्राकृतिक-भाषा निर्देश छिपे हुए परिचालन संबंधी आवश्यकताओं के तहत नाजुक होते हैं, जो यह प्रकट करता है कि जबकि सामान्य प्रॉम्प्टिंग छूटे हुए बाधाओं को संतुष्ट करने में विफल रहती है, प्रदर्शन में तब महत्वपूर्ण सुधार होता है जब उन बाधाओं को स्पष्ट रूप से प्राप्त और निष्पादित किया जाता है।

मूल लेखक: Chanho Park, Jinbae Gong, Minsu Kim, Gyeongho Gong, Woochan Lee, Yeachan Kwak, Seongim Choi

प्रकाशित 2026-07-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chanho Park, Jinbae Gong, Minsu Kim, Gyeongho Gong, Woochan Lee, Yeachan Kwak, Seongim Choi

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर की व्याख्या दी गई है।

मुख्य समस्या: वह "जीनी" जो चीज़ें गलत कर देता है

कल्पना कीजिए कि आपके पास एक जादुई जीनी (AI) है जो आपकी इच्छाएं पूरी करता है। आप कहते हैं, "मुझे धनवान बना दो।"

जीनी इस बात की हज़ार तरह से व्याख्या कर सकता है:

  • वह आपको एक वैध नौकरी दे सकता है।
  • वह नकली नोट छाप सकता है।
  • वह किसी बैंक को हैक कर सकता है।
  • वह "धन" की परिभाषा ही बदल सकता है ताकि आप "खुशी" में तो अमीर हों लेकिन नकदी में गरीब।

पेपर का तर्क है कि जब आप AI को एक छोटा निर्देश देते हैं, तो आप अनिवार्य रूप से एक ऐसी विश लिस्ट (इच्छा सूची) दे रहे होते हैं जिसमें कुछ चीज़ें गायब हैं। आप सोच सकते हैं कि आप "वैध धन" चाहते हैं, लेकिन आपने यह नहीं कहा कि "कोई अवैध गतिविधियाँ न करें" या "बैंक की त्रुटियों का उपयोग न करें।" क्योंकि आपने यह नहीं कहा, इसलिए AI आपके द्वारा उपयोग किए गए शब्दों के किसी भी संस्करण को चुनने के लिए स्वतंत्र है।

लेखक इसे "इंस्ट्रक्शन फ्रैजिलिटी" (निर्देश की भंगुरता) कहते हैं। निर्देश भंगुर है क्योंकि जब AI आपके छिपे हुए नियमों के गलत संस्करण का अनुमान लगा लेता है, तो यह आसानी से टूट जाता है।

प्रयोग: "गुप्त नियम" का खेल

इसका परीक्षण करने के लिए, शोधकर्ताओं ने 100 अलग-अलग कार्यों (जैसे ईमेल लिखना, रिपोर्ट का सारांश देना, या यात्रा की योजना बनाना) के साथ एक खेल बनाया।

  • दृश्य प्रॉम्प्ट (Visible Prompt): यह वह है जो उपयोगकर्ता देखता है और टाइप करता है (जैसे, "इस लेख का सारांश लिखें")।
  • छिपे हुए आवश्यकताएं (Hidden Requirements): ये वे गुप्त नियम हैं जिन्हें केवल शोधकर्ता (मूल्यांकक) जानते हैं, AI नहीं। उदाहरण के लिए: "50 शब्दों से कम होना चाहिए," "इसमें जोखिम चेतावनी शामिल होनी चाहिए," "JSON फॉर्मेट में होना चाहिए," या "'निश्चित रूप से' शब्द का उपयोग नहीं करना चाहिए।"

AI को दृश्य प्रॉम्प्ट का पालन करना था और साथ ही गुप्त नियमों का भी सटीक अनुमान लगाना था। यदि वह एक भी छिपे हुए नियम को चूक जाता, तो कार्य पूरी तरह से विफल माना जाता।

परिणाम: अनुमान लगाना बनाम पूछना

शोधकर्ताओं ने यह देखने के लिए AI का परीक्षण विभिन्न स्थितियों में किया कि वह इन लुप्त नियमों को कितनी अच्छी तरह संभाल सकता है।

1. "वन-शॉट" अनुमान (2.7% सफलता)

  • उपमा: आप एक शेफ को बताते हैं, "मेरे लिए एक सैंडविच बनाओ," और चले जाते हैं। आप यह नहीं कहते कि "प्याज न डालें," "सोरडो ब्रेड का उपयोग करें," या "इसे बीच से काटें।"
  • परिणाम: AI केवल 2.7% बार सही हुआ। वह लगभग हमेशा छिपे हुए नियमों को चूक गया।

2. "जेनेरिक टेम्पलेट" (7.3% सफलता)

  • उपमा: आप शेफ को एक मानक "सैंडविच ऑर्डर फॉर्म" देते हैं जिसमें "ब्रेड" और "मीट" के लिए बॉक्स हैं, लेकिन फिर भी आपने विशिष्ट "नो अनियन" (प्याज न डालें) वाला बॉक्स नहीं भरा।
  • परिणाम: थोड़ा बेहतर, लेकिन फिर भी ज्यादातर गलत। जेनेरिक फॉर्म लुप्त विवरणों को ठीक नहीं करते हैं।

3. "नकली बातचीत" (1.7% सफलता)

  • उपमा: आप शेफ से पूछते हैं, "क्या आपके पास कोई विशेष नियम हैं?" और शेफ कहता है, "नहीं, बस सैंडविच बनाओ।"
  • परिणाम: इससे कोई मदद नहीं मिली। सही जानकारी प्राप्त किए बिना केवल बात करना बेकार है।

4. "सत्यपूर्ण स्पष्टीकरण" (8.0% सफलता)

  • उपमा: आप शेफ को एक मेनू से विशिष्ट प्रश्न पूछने के लिए मजबूर करते हैं (जैसे, "क्या आपको JSON फॉर्मेट चाहिए?")। शेफ पूछता है, और आप कहते हैं "हाँ।"
  • परिणाम: अभी भी बहुत कम। AI यह समझने में बुरा था कि कौन से प्रश्न पूछने हैं। उसने गलत प्रश्न पूछे या महत्वपूर्ण प्रश्नों को छोड़ दिया।

5. "ओरेकल" (चीट शीट) (64.7% सफलता)

  • उपमा: आप शेफ को खाना बनाना शुरू करने से पहले हर एक छिपे हुए नियम की एक चीट शीट थमा देते हैं।
  • परिणाम: सफलता बढ़कर 64.7% हो गई। यह साबित करता है कि यदि AI को नियम पता हों, तो वह उनका पालन बहुत बेहतर तरीके से कर सकता है।

बड़ी सीख:
समस्या यह नहीं है कि AI मूर्ख है; समस्या यह है कि वह आपका मन नहीं पढ़ सकता। जब आप नियमों को छिपा देते हैं, तो AI विफल हो जाता है। जब आप स्पष्ट रूप से AI को नियम बताते हैं, तो वह सफल होता है। हालाँकि, चीट शीट के साथ भी, वह लगभग 35% बार विफल रहा, जिसका अर्थ है कि जब उसे नियम पता होते हैं, तब भी वह कभी-कभी उन्हें पूरी तरह से पालन करने में भूल जाता है।

यह क्यों महत्वपूर्ण है ("सेट" सिद्धांत)

यह पेपर इसे सरल बनाने के लिए एक फैंसी गणितीय अवधारणा का उपयोग करता है:

  • अपने निर्देश को एक जाल (Net) के रूप में सोचें।
  • जाल कई संभावित परिणामों (एक्जीक्यूशन) को पकड़ता है।
  • आप केवल चाहते हैं कि AI "अच्छे" परिणामों को पकड़े (वे जो वास्तव में आप चाहते हैं)।
  • यदि आपका जाल बहुत चौड़ा है (क्योंकि आपने नियमों को निर्दिष्ट नहीं किया है), तो यह "बुरे" परिणामों को भी पकड़ लेता है (जैसे अवैध लेनदेन या गलत फॉर्मेट)।
  • सुरक्षा (Safety) का अर्थ है जाल को तब तक सिकोड़ना जब तक कि यह केवल अच्छी चीजों को ही पकड़े। आप ऐसा तब तक नहीं कर सकते जब तक कि आप स्पष्ट रूप से AI को यह न बताएं कि किसे बाहर रखना है।

"विफलता के तरीकों" (Failure Modes) का सारांश

पेपर बताता है कि AI क्यों विफल हुआ:

  1. सूचना की कमी: AI को नियम पता नहीं थे (सबसे बड़ी समस्या)।
  2. बुरे प्रश्न: नियमों को खोजने के लिए AI ने गलत प्रश्न पूछे।
  3. एक्जीक्यूशन त्रुटियां: भले ही AI को नियम पता थे, फिर भी वह कभी-कभी उन्हें सही ढंग से लिखना भूल गया।

निष्कर्ष

यदि आप चाहते हैं कि कोई AI किसी काम को सुरक्षित और सही ढंग से करे, तो आप केवल एक अस्पष्ट कमांड देकर यह उम्मीद नहीं कर सकते कि वह इसे "समझ" जाएगा। आपको छिपे हुए प्रतिबंधों (जैसे शब्द गणना, फॉर्मेट और सुरक्षा सीमाएं) को स्पष्ट रूप से बताना ही होगा। जेनेरिक प्रॉम्प्ट और जेनेरिक बातचीत पर्याप्त नहीं हैं; आपको विशेष रूप से लुप्त नियमों को प्राप्त करने और उनकी पुष्टि करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →