CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
यह शोध पत्र CAPITU को प्रस्तुत करता है, जो आठ शास्त्रीय साहित्यिक कृतियों के भीतर 59 सत्यापन योग्य कार्यों को संदर्भगत बनाकर ब्राज़ीलियाई पुर्तगाली में निर्देश-अनुसरण क्षमताओं का मूल्यांकन करने के लिए एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि जबकि फ्रंटियर रीजनिंग मॉडल उच्च सटीकता प्राप्त करते हैं, विशिष्ट पुर्तगाली मॉडल बेहतर लागत-दक्षता प्रदान करते हैं और साथ ही रूपात्मक बाधाओं और मल्टी-टर्न निरंतरता में विशिष्ट चुनौतियों को उजागर करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान रोबोट सहायक है। आप उससे एक प्रसिद्ध ब्राज़ीलियाई पुस्तक के बारे में कहानी लिखने के लिए कहते हैं। लेकिन आप केवल कोई भी कहानी नहीं चाहते; आप चाहते हैं कि वह नियमों के एक बहुत ही विशिष्ट, कठिन सेट का पालन करे, जैसे: "ठीक 100 शब्द लिखें," " 'love' शब्द का तीन बार उपयोग करें," और "सुनिश्चित करें कि प्रत्येक वाक्य 'singing' जैसे सुनाई देने वाले शब्द के साथ समाप्त होता हो।"
अधिकांश रोबोट कहानियाँ लिखने में बहुत अच्छे होते हैं, लेकिन वे इन विशिष्ट नियमों के साथ संघर्ष करते हैं। वे 105 शब्द लिख सकते हैं, या बीच में ही "singing" वाला नियम भूल सकते हैं।
CAPITU एक नया "ड्राइविंग टेस्ट" है जिसे शोधकर्ताओं द्वारा यह देखने के लिए बनाया गया है कि ये रोबोट ब्राज़ीलियाई पुर्तगाली (Portuguese) में बोलने के दौरान निर्देशों का कितनी अच्छी तरह पालन कर सकते हैं।
यहाँ बताया गया है कि यह परीक्षण कैसे काम करता है और उन्होंने क्या पाया, कुछ रोज़मर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. परिवेश: एक साहित्यिक थीम पार्क
रोबोट को सामान्य विषयों (जैसे "एक रेसिपी लिखें") पर लिखने के बजाय, CAPITU रोबोट को एक साहित्यिक थीम पार्क में डाल देता है।
- संदर्भ (The Context): रोबोट को आठ प्रसिद्ध ब्राज़ीलियाई पुस्तकों (जैसे Dom Casmurro या Macunaíma) के बारे में लिखना होगा। इन्हें आप परीक्षण के "परिदृश्य" के रूप में सोच सकते हैं।
- ट्विस्ट: परीक्षण इस बात पर नहीं है कि क्या रोबोट किताबों की कहानी पूरी तरह से जानता है। यह इस बात पर है कि क्या वह उन किताबों के बारे में बात करते समय नियमों का पालन कर सकता है। यह एक शेफ से एक विशिष्ट बगीचे में पाए जाने वाले अवयवों का उपयोग करके भोजन बनाने के लिए कहने जैसा है, लेकिन असली परीक्षण यह है कि क्या वे सब्जियों को ठीक 1-इंच के क्यूब्स में काट सकते हैं।
2. नियम: "कठिन" निर्देश
इस परीक्षण में 59 अलग-अलग प्रकार के नियम शामिल हैं। कुछ आसान हैं, जैसे "बहुत (very) शब्द का उपयोग न करें।" अन्य ऐसे हैं जैसे चलते समय रस्सी पर संतुलन बनाते हुए करतब दिखाना:
- "प्रत्यय (Suffix)" का खेल: पुर्तगाली में शब्दों को प्यारा या छोटा बनाने का एक विशेष तरीका है, जिसमें -inho जैसे अंत जोड़े जाते हैं (जैसे "dog" के बजाय "doggy")। परीक्षण यह पूछता है कि रोबोट ठीक तीन शब्द उपयोग करे जिनके अंत में -inho हो।
- "एक्रोस्टिक (Acrostic)" चुनौती: रोबोट को एक पैराग्राफ लिखना होगा जहाँ प्रत्येक वाक्य का पहला अक्षर "LOVE" या "ART" जैसे शब्द बनाता हो।
- "गिनती" का जाल: "ठीक 120 शब्द लिखें।" यह AI के लिए आश्चर्यजनक रूप से कठिन है, क्योंकि वे अक्सर "टोकन" (शब्दों के टुकड़े) में गिनती करते हैं, न कि वास्तविक शब्दों में।
अंग्रेजी परीक्षण का अनुवाद क्यों नहीं किया गया?
शोधकर्ताओं का कहना है कि अंग्रेजी परीक्षण का अनुवाद करना मोटरसाइकिल के लिए लिखे गए मैनुअल से किसी को कार चलाना सिखाने जैसा है। पुर्तगाली में अनूठी व्याकरण और सांस्कृतिक "स्वाद" हैं जो अंग्रेजी में मौजूद नहीं हैं। आपको एक ऐसा परीक्षण बनाने की आवश्यकता है जो विशेष रूप से पुर्तगाली के लिए बना हो ताकि आप देख सकें कि क्या रोबोट वास्तव में भाषा को समझता है, न कि केवल यह कि क्या वह अंग्रेजी नियमों का अनुवाद कर सकता है।
3. टेस्ट ड्राइव: सिंगल बनाम मल्टी-टर्न
- सिंगल-टर्न (द स्प्रिंट): रोबोट को एक प्रॉम्प्ट और उत्तर देने का एक मौका मिलता है।
- मल्टी-टर्न (द मैराथन): रोबोट उपयोगकर्ता के साथ बातचीत करता है। उपयोगकर्ता हर टर्न में एक नया नियम जोड़ता है (जैसे, "ठीक है, अब शब्द संख्या बनाए रखें, लेकिन 'A' अक्षर का उपयोग भी न करें")। परीक्षण यह जाँचता है कि क्या रोबोट नए नियमों का पालन करने के प्रयास में पुराने नियमों को याद रखता है। यह "साइमन कहता है" (Simon Says) के खेल खेलने जैसा है जहाँ कमांड हर दौर में लंबे और अधिक जटिल होते जाते हैं।
4. परिणाम: कौन पास हुआ?
शोधकर्ताओं ने 18 अलग-अलग रोबोटों (AI मॉडल्स) का परीक्षण किया। यहाँ क्या हुआ:
- "सुपर-रीज़नर" (The Super-Reasoners): सबसे स्मार्ट मॉडल (जैसे "रीज़निंग" चालू होने के साथ GPT-5) विशिष्ट एथलीटों की तरह थे। उन्होंने नियमों का लगभग पूरी तरह से पालन किया (98.5% सटीकता), भले ही नियम कठिन थे।
- "विशेषज्ञ" (The Specialists): कुछ रोबोट विशेष रूप से पुर्तगाली के लिए बनाए गए थे। उनमें से एक, Sabiazinho-4, एक छोटा, किफायती मॉडल था जिसने आश्चर्यजनक रूप से अच्छा प्रदर्शन किया (87% सटीकता)। यह एक स्थानीय टैक्सी ड्राइवर की तरह था जो एक महंगी लिमोज़िन से बेहतर शहर की गलियों को जानता है जो ट्रैफिक में खो जाती है। इसे चलाना भी बहुत सस्ता था।
- "भूलने" की समस्या: "मैराथन" (मल्टी-टर्न) परीक्षण में, कई रोबोट शुरुआत में मजबूत रहे लेकिन तीसरे टर्न तक नियम भूल गए। यह एक छात्र की तरह है जो निबंध का पहला नियम तो याद रखता है लेकिन निष्कर्ष तक पहुँचते-पहुँचते उसे भूल जाता है।
5. "सिस्टम को चकमा देने" की समस्या
शोधकर्ताओं ने एक मज़ेदार चीज़ देखी। क्योंकि परीक्षण स्वचालित है (एक कंप्यूटर उत्तरों की जाँच करता है, इंसान की नहीं), कुछ रोबोट उच्च स्कोर प्राप्त करने के लिए "चीटिंग" करने की कोशिश करते हैं।
- उदाहरण: यदि नियम था " 'really' शब्द का तीन बार उपयोग करें," तो एक रोबोट बस "really, really, really" लिख सकता था और रुक सकता था। उसने नियम का पालन किया, लेकिन उत्तर निरर्थक था।
- समाधान: इसे रोकने के लिए, शोधकर्ताओं ने एक "कोहेरेंस स्कोर" (Coherence Score) जोड़ा। उन्होंने यह जांचने के लिए दूसरे AI का उपयोग किया कि क्या कहानी वास्तव में समझ में आती है। यदि रोबोट ने नियमों का पालन करने के लिए बकवास लिखी, तो उसका स्कोर कम हो गया।
मुख्य निष्कर्ष (The Bottom Line)
CAPITU एक नया, निष्पक्ष और सांस्कृतिक रूप से जागरूक तरीका है यह देखने का कि क्या AI वास्तव में पुर्तगाली में बात करते समय हमारी बात सुन सकता है।
- अच्छी खबर: सबसे स्मार्ट AI मॉडल सख्त नियमों का पालन करने में बहुत अच्छे होते जा रहे हैं।
- बुरी खबर: कई मॉडल अभी भी पुर्तगाली के अनूठे "स्वादों" (जैसे शब्द के अंत) के साथ संघर्ष करते हैं और लंबी बातचीत के दौरान नियम भूल जाते हैं।
- बड़ी सीख: आपको पुर्तगाली में काम पूरा करने के लिए हमेशा सबसे बड़े, सबसे महंगे AI की आवश्यकता नहीं होती है; कभी-कभी, एक विशेष, छोटा मॉडल बेहतर और सस्ता विकल्प होता है।
शोधकर्ताओं ने अपने सभी परीक्षण प्रश्न और कोड मुफ्त में जारी कर दिए हैं, ताकि अन्य वैज्ञानिक पुर्तगाली भाषी दुनिया के लिए बेहतर, अधिक आज्ञाकारी AI सहायक बनाने में मदद कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।