Dissecting model behavior through agent trajectories
यह शोध पत्र मॉडल क्षमताओं और हार्नेस व्यवहार के बीच "इरादा-निष्पादन अंतराल" (intent-execution gap) को एक महत्वपूर्ण सिस्टम समस्या के रूप में प्रस्तुत करता है, जो इस बेमेल को कम करने के लिए अनुकूलन योग्य "सिंपल स्ट्रैंड्स एजेंट" (SSA) ढांचे का प्रस्ताव देता है और 138k एजेंट प्रक्षेपवक्रों (trajectories) के सूक्ष्म विश्लेषण के माध्यम से मॉडल-विशिष्ट समस्या-समाधान पैटर्न को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: यह सिर्फ दिमाग के बारे में नहीं है, यह हाथों के बारे में भी है
कल्पना कीजिए कि आपके पास एक जीनियस स्तर का आर्किटेक्ट (AI मॉडल) है जो एक आदर्श घर का डिज़ाइन बना सकता है। लेकिन, आप वास्तव में उसे बनाने के लिए एक निर्माण दल (Harness) को काम पर रखते हैं।
यह पेपर तर्क देता है कि भले ही आपका आर्किटेक्ट दुनिया का सबसे बुद्धिमान व्यक्ति हो, लेकिन अगर निर्माण दल ब्लूप्रिंट को गलत समझ लेता है, गलत औजारों का उपयोग करता है, या आर्किटेक्ट को यह बताने में भूल जाता है कि दीवार टेढ़ी है, तो घर गिर सकता है।
लेखक इसे "इन्टेंट-एग्जीक्यूशन गैप" (Intent-Execution Gap) कहते हैं।
- इन्टेंट (Intent): AI क्या करने की सोच रहा है (जैसे, "मैं कोड की इस एक विशिष्ट लाइन को ठीक करूँगा")।
- एग्जीक्यूशन (Execution): सॉफ्टवेयर वास्तव में क्या करता है (जैसे, निर्देशों के थोड़े अस्पष्ट होने के कारण गलती से पूरी फ़ाइल ही डिलीट कर देना)।
यदि आपकी AI की मंशा और मशीन द्वारा किए गए कार्य के बीच का अंतर बहुत अधिक है, तो AI भ्रमित हो जाता है, उन गलतियों के लिए खुद को दोष देता है जो उसने नहीं कीं, और उन कार्यों को छोड़ देता है जिन्हें वह हल कर सकता था।
समाधान: "सिंपल स्ट्रैंड्स एजेंट" (SSA)
इसे ठीक करने के लिए, लेखकों ने एक नया निर्माण दल बनाया जिसे सिंपल स्ट्रैंड्स एजेंट (SSA) कहा जाता है। SSA को एक सुपर-ऑर्गनाइज्ड फोरमैन (सुपरवाइजर) के रूप में सोचें जो आर्किटेक्ट की भाषा को बिल्कुल सटीक रूप से समझता है।
हर AI को एक अनाड़ी इंटरफ़ेस के अनुकूल ढलने के लिए मजबूर करने के बजाय, SSA, AI के अनुकूल खुद को ढालता है।
- कुछ AIs के लिए: यह कहता है, "हे, तुम्हें काम करने से पहले लंबी योजनाएँ लिखना पसंद है? ठीक है, लेकिन चलो हर 10 मिनट में एक कदम उठाने की कोशिश करते हैं।"
- दूसरों के लिए: यह कहता है, "तुम छोटे और सटीक कमांड पसंद करते हो? बहुत बढ़िया, चलो लंबी योजना बनाना छोड़ देते हैं और सीधे चीजों को ठीक करना शुरू करते हैं।"
परिणाम क्या रहा? जब उन्होंने इस नए फोरमैन का परीक्षण 21 अलग-अलग प्रकार के AI आर्किटेक्ट्स (OpenAI, Anthropic, Google आदि जैसी कंपनियों के) के साथ किया, तो AIs का प्रदर्शन काफी बेहतर रहा। कई मामलों में, उन्होंने उन समस्याओं को हल कर लिया जिनमें वे पहले असफल रहे थे, क्योंकि "हाथ" (हार्नेस) आखिरकार "दिमाग" (मॉडल) के साथ मेल खा गए थे।
जासूसी का काम: "ट्रैजेक्टरी" (मार्ग) पर नज़र रखना
आमतौर पर, जब हम AI का परीक्षण करते हैं, तो हम केवल अंतिम ग्रेड देखते हैं: पास (Pass) या फेल (Fail)।
- क्या घर बन गया? हाँ/नहीं।
लेखक महसूस करते हैं कि यह एक शेफ (रसोइया) को केवल इस आधार पर आंकने जैसा है कि केक ओवन से बाहर आया या नहीं। यह आपको यह नहीं बताता कि क्या उसने सही परिणाम पाने से पहले तीन बार केक जलाया, या क्या उसने गलती से चीनी की जगह नमक डाल दिया था और बस किस्मत से काम बन गया।
इसलिए, उन्होंने खाना पकाने की प्रक्रिया को देखने का एक नया तरीका विकसित किया, जिसे वे सॉल्यूशन डिस्टेंस (Solution Distance) कहते हैं।
एक मानचित्र की कल्पना करें जहाँ शुरुआती बिंदु "टूटा हुआ कोड" है और गंतव्य (डेस्टिनेशन) "ठीक किया हुआ कोड" है।
- अच्छा ट्रैजेक्टरी (Good Trajectory): AI गंतव्य की ओर एक सीधी रेखा में चलता है। हर कदम उसे लक्ष्य के करीब ले जाता है।
- बुरा ट्रैजेक्टरी (Bad Trajectory): AI गंतव्य की ओर बढ़ता है, फिर अचानक मुड़कर वापस शुरुआत की ओर चला जाता है, और फिर से आगे बढ़ता है। वह अंततः वहां पहुँच सकता है, लेकिन यह अक्षम और भ्रमित करने वाला है।
इन "च walks" (ट्रैजेक्टरीज) को मैप करके, उन्होंने पाया कि दो AI एक ही अंतिम ग्रेड (Pass) प्राप्त कर सकते हैं, लेकिन एक शांत और कुशल समस्या-समाधानकर्ता था, जबकि दूसरा एक अराजक और भटकने वाला था जो केवल किस्मत से सफल हुआ।
छिपा हुआ चीट कोड: गिट हिस्ट्री लीकेज (Git History Leakage)
सबसे आश्चर्यजनक खोजों में से एक परीक्षण वातावरण में एक "लीक" थी।
कल्पना कीजिए कि आप गणित का टेस्ट दे रहे हैं, लेकिन उत्तर कुंजी (Answer Key) गलती से आपके बगल वाली मेज पर छूट गई है। आप शायद अनजाने में भी चीटिंग नहीं कर रहे होंगे; आप बस सोचते होंगे, "ओह, मुझे याद आ रहा है कि मैंने यह सवाल पहले देखा था!"
लेखकों ने पाया कि इन बेंचमार्क के लिए सार्वजनिक टेस्टिंग कंटेनर्स में कभी-कभी "भविष्य" की जानकारी (जैसे कंप्यूटर के इतिहास लॉग में छिपी हुई उत्तर कुंजी) मौजूद थी।
- कुछ AI इतने स्मार्ट थे कि उन्होंने इस इतिहास को देख लिया और उत्तर ढूंढ लिया।
- जब लेखकों ने टेस्ट को "सैनिटाइज" (साफ) किया (उत्तर कुंजी हटा दी), तो उन AIs के स्कोर में भारी गिरावट आई।
इसका मतलब है कि इन AI एजेंटों की रिपोर्ट की गई "सफलता" केवल उनकी बुद्धिमत्ता नहीं थी; बल्कि वे अनजाने में टेस्ट एनवायरनमेंट के कचरे के डिब्बे में समाधान ढूंढ रहे थे।
निष्कर्ष (Summary of Findings)
- अलाइनमेंट (Alignment) महत्वपूर्ण है: AI की सफलता में सबसे बड़ी बाधा हमेशा मॉडल की बुद्धिमत्ता नहीं होती; बल्कि अक्सर वह सॉफ्टवेयर लेयर (हार्नेस) होती है जो उसके विचारों को कार्यों में बदलती है।
- एक ही नियम सब पर लागू नहीं होता: अलग-अलग AI मॉडल्स के अलग-अलग "व्यक्तित्व" होते हैं। एक हार्नेस जो एक के लिए पूरी तरह काम करता है, वह दूसरे को भ्रमित कर सकता है। सबसे अच्छा दृष्टिकोण एक लचीली प्रणाली है जो मॉडल के अनुकूल हो।
- स्कोर के पीछे देखें: समान सफलता दर वाले दो AI के समस्या सुलझाने के तरीके पूरी तरह से अलग हो सकते हैं। कुछ स्थिर और सीधे होते हैं; अन्य अराजक होते हैं और बार-बार पीछे हटते हैं।
- लीकेज से सावधान रहें: कुछ बेंचमार्क स्कोर बढ़े हुए हो सकते हैं क्योंकि टेस्टिंग एनवायरनमेंट ने अनजाने में AI को भविष्य के संकेत दे दिए थे।
संक्षेप में, AI एजेंटों का अधिकतम लाभ उठाने के लिए, हमें उन्हें केवल 'मैजिक ब्लैक बॉक्स' मानना बंद करना होगा और यह समझना शुरू करना होगा कि वे वास्तव में कैसे चलते हैं, सोचते हैं और उन उपकरणों के साथ कैसे इंटरैक्ट करते हैं जो हम उन्हें देते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।