← नवीनतम पेपर
💬 NLP

UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following

यह शोध पत्र UNSPECIFIC को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क और बेंचमार्क है जिसे समान संदर्भ लेखों में सामान्य बाधाओं (constraints) को संश्लेषित करके और वास्तविक अनुपालन सुनिश्चित करने के लिए पूर्ण पाठ और सारांश दोनों पर प्रतिक्रियाओं का मूल्यांकन करके, LLM निर्देश पालन में कॉपी-एंड-पेस्ट शॉर्टकट को समाप्त करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang

प्रकाशित 2026-08-11
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानियाँ लिखना सिखा रहे हैं। आप उसे नियमों की एक सूची देते हैं, जैसे "नायक को बहादुर होना चाहिए" या "कहानी का अंत बारिश के साथ होना चाहिए।" इसे निर्देश पालन (instruction following) कहा जाता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, लार्ज लैंग्वेज मॉडल्स (LLMs) ये रोबोट हैं, और शोधकर्ता लगातार यह देखने की कोशिश कर रहे हैं कि क्या वे बिना भ्रमित हुए जटिल, लंबी नियमों की सूची का पालन कर सकते हैं।

लेकिन यहाँ एक पेचीदा बात है: आप यह कैसे परीक्षण करेंगे कि क्या रोबोट वास्तव में नियमों के बारे में सोच रहा है, या वह केवल एक शॉर्टकट ले रहा है? कभी-कभी, परीक्षण स्वयं दोषपूर्ण होता है। यदि आप एक रोबोट को एक विशिष्ट उदाहरण के आधार पर कहानी लिखने के लिए कहते हैं जिसे उसने अभी-अभी पढ़ा है, तो वह उस उदाहरण के विवरणों को अपनी कहानी में कॉपी-पेस्ट कर सकता है। यह वैसा ही है जैसे एक छात्र जो "एक बार जब आपने एक दोस्त की मदद की" विषय पर निबंध लिखने के बजाय, अपने दोस्त के होमवर्क का एक पैराग्राफ कॉपी कर लेता है जिसमें लिखा है, "मैंने अपने दोस्त को किराने का सामान ले जाने में मदद की।" शिक्षक शब्दों "मदद" और "दोस्त" को देखता है और सोचता है, "बहुत अच्छा काम!" लेकिन छात्र ने वास्तव में काम नहीं किया था। यह पेपर उस शॉर्टकट को ठीक करने के बारे में है ताकि हम देख सकें कि रोबोट वास्तव में स्मार्ट हैं या केवल कॉपी करने में बहुत अच्छे हैं।


द ग्रेट कॉपी-पेस्ट शॉर्टकट

मिलिए UNSPECIFIC से, जो AI मॉडल्स को तब पकड़ने के लिए बनाया गया एक नया फ्रेमवर्क है जब वे आसान रास्ता चुनने की कोशिश करते हैं। यूनिवर्सिटी ऑफ मैसाचुसेट्स, एम हर्स्ट के शोधकर्ताओं ने देखा कि हम वर्तमान में AI का परीक्षण करने के तरीके में एक बड़ी समस्या है। आमतौर पर, एक परीक्षण बनाने के लिए, हम एक वास्तविक लेख (जैसे कि एक समाचार कहानी) लेते हैं और AI को उसे निर्देशों की एक सूची में बदलने के लिए कहते हैं। फिर, हम एक दूसरे AI को उन निर्देशों का पालन करते हुए एक नई कहानी लिखने के लिए कहते हैं।

समस्या क्या है? पहला AI अक्सर सरलीकृत हो जाता है। सामान्य नियम सोचने के बजाय, वह मूल लेख से विशिष्ट विवरण उठा लेता है। उदाहरण के लिए, यदि मूल कहानी "जॉन और मैरी के वॉलमार्ट में दही के लिए लड़ने" के बारे में है, तो निर्देश कह सकते हैं कि "पात्रों के नाम जॉन और मैरी होने चाहिए" और "वे वॉलमार्ट में लड़ रहे होने चाहिए।" जब दूसरा AI इन निर्देशों को प्राप्त करता है, तो उसे रचनात्मक होने की आवश्यकता नहीं होती; वह बस "जॉन," "मैरी" और "वॉलमार्ट" को अपनी कहानी में सीधे कॉपी कर देता है। यह एक "कॉपी-एंड-पेस्ट शॉर्टकट" है जो AI को निर्देशों का पूरी तरह से पालन करते हुए दिखाता है, जबकि वह वास्तव में केवल नकल कर रहा होता है।

UNSPECIFIC शॉर्टकट की पहचान कैसे करता है

इसे रोकने के लिए, UNSPECIFIC टीम ने परीक्षण को निष्पक्ष और कठिन बनाने के लिए एक तीन-चरणीय जादुई ट्रिक बनाई है।

चरण 1: "कॉमन ग्राउंड" गेम
केवल एक कहानी का उपयोग करके नियम बनाने के बजाय, शोधकर्ता AI को दो समान कहानियाँ देते हैं। कल्पना कीजिए कि आपके पास लोगों के झगड़े के बारे में दो अलग-अलग कहानियाँ हैं। एक किराने की दुकान में जॉन और मैरी के बारे में है; दूसरी गैस स्टेशन पर क्रिस और जूली के बारे में है। यदि आप AI को उन नियमों को खोजने के लिए कहते हैं जो दोनों कहानियों पर लागू होते हैं, तो वह यह नहीं कह सकता कि "मुख्य पात्र जॉन और मैरी होने चाहिए" क्योंकि यह केवल पहली कहानी के लिए फिट बैठता है। इसके बजाय, उसे एक सामान्य नियम बनाना होगा जैसे, "मुख्य पात्रों का झगड़ा होना चाहिए।" यह नियमों को व्यापक और अधिक स्वाभाविक बनाता है, जैसा कि एक वास्तविक इंसान मांग सकता है, न कि किसी एक टेक्स्ट का विशिष्ट विवरण।

चरण 2: "टू ईजी" फ़िल्टर
सामान्य नियमों के साथ भी, कुछ अभी भी बहुत आसान होते हैं। शायद नियम है "कहानी की एक शुरुआत होनी चाहिए।" खैर, हर कहानी की एक शुरुआत होती है! AI बिना प्रयास किए इसे पूरा कर लेता है। UNSPECIFIC इसे यह देखकर जाँचता है कि क्या AI नियमों को देखने से पहले ही एक "बेस स्टोरी" लिखता है। यदि AI गलती से एक सामान्य कहानी लिखकर ही किसी नियम को पूरा कर देता है, तो उस नियम को "बहुत आसान" के रूप में चिह्नित किया जाता है। सिस्टम फिर उस आसान नियम को एक कठिन नियम से बदल देता है, जैसे "कहानी की शुरुआत एक अजीब आवाज सुनकर जागने वाले पात्र से होनी चाहिए," जिससे AI को वास्तव में सोचने के लिए मजबूर किया जा सके।

चरण 3: "समरी टेस्ट"
यह सबसे चतुर हिस्सा है। AI द्वारा अपनी कहानी लिखने के बाद, शोधकर्ता उससे कहानी को एक छोटे पैराग्राफ में संक्षिप्त करने के लिए कहते हैं—मूल लंबाई का लगभग 25%। यदि AI ने केवल कहानी के अंत में यादृच्छिक वाक्य जोड़कर नियमों को पूरा किया है (जैसे कि "और, कहानी का सुखद अंत है"), तो वे विवरण सारांश में काट दिए जाते हैं। यदि सारांश में भी नियम संतुष्ट रहता है, तो इसका मतलब है कि AI ने नियम को कहानी के मूल (core) में बुना था। यदि नियम गायब हो जाता है, तो इसका मतलब है कि AI केवल सतही विवरणों के साथ शॉर्टकट ले रहा था।

उन्हें क्या मिला

जब उन्होंने इस नए सिस्टम को परीक्षण में डाला, तो परिणाम आंखें खोलने वाले थे। उन्होंने पाया कि कई AI मॉडल वास्तव में कॉपी-पेस्ट शॉर्टकट ले रहे थे।

  • कठिनाई का उछाल: जब नए UNSPECIFIC तरीके का उपयोग किया गया, तो GPT-5 Mini नामक एक शक्तिशाली मॉडल की संतुष्टि दर (satisfaction rate) मानक एकल-लेख बेसलाइन के तहत 89.7% से गिरकर 78.2% हो गई। इसका मतलब यह नहीं है कि AI खराब हो गया है; इसका मतलब है कि परीक्षण ने आखिरकार उसे तब पकड़ लिया जब वह पूरी मेहनत नहीं कर रहा था।
  • कॉपी-पेस्ट गैप: शोधकर्ताओं ने पाया कि पिछले परीक्षणों में "सफलता" का एक बड़ा हिस्सा पूरी तरह से सटीक नहीं था। जब उन्होंने सारांशों को देखा, तो कई मॉडल जो निर्देशों का पूरी तरह से पालन करते हुए प्रतीत होते थे, वास्तव में "कोर नैरेटिव" टेस्ट में विफल रहे। उन्होंने केवल सतह पर नियमों को पूरा किया था, कहानी के हृदय में नहीं।
  • स्वाभाविकता की जीत: नए प्रतिबंध (constraints) बहुत अधिक वास्तविक मानवीय अनुरोधों की तरह महसूस हुए। वास्तव में, इन नए निर्देशों की स्वाभाविकता के लिए मनुष्यों द्वारा की गई रेटिंग और पुराने निर्देशों के बीच का अंतर 30% सुधर गया।

पेपर सुझाव देता है कि केवल निर्देशों को कठिन बनाना ही काफी नहीं है; हमें यह सुनिश्चित करना होगा कि निर्देश इतने सामान्य हों कि AI केवल कॉपी-पेस्ट न कर सके। "दो-कहानी" पद्धति और "समरी टेस्ट" का उपयोग करके, UNSPECIFIC यह स्पष्ट तस्वीर प्रदान करता है कि क्या एक AI वास्तव में निर्देशों को समझ रहा है या केवल "मिलते-जुलते शब्दों को खोजने" का खेल खेल रहा है।

अंत में, UNSPECIFIC केवल AI को अधिक कठिन काम करने के लिए नहीं बना रहा है; यह यह सुनिश्चित करने के बारे में है कि हम जानते हैं कि वे कैसे काम कर रहे हैं। यह मॉडल्स को शॉर्टकट लेने से रोकता है और उन्हें वास्तव में लेखन करने के लिए मजबूर करता है, यह सुनिश्चित करता है कि जब हम कहते हैं कि एक AI "निर्देशों का पालन कर रहा है," तो इसका वास्तव में वही अर्थ है कि वह समझ रहा है कि वह क्या कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →