TurkCuisineBench: A source-grounded short-answer benchmark for large language models’ factual knowledge of Turkish cuisine and culinary heritage
यह शोध पत्र TurkCuisineBench को प्रस्तुत करता है, जो एक 72-आइटम वाला, स्रोत-आधारित लघु-उत्तर बेंचमार्क है जो तुर्की व्यंजनों और विरासत के बारे में बड़े भाषा मॉडलों के तथ्यात्मक ज्ञान का मूल्यांकन करता है, और यह प्रदर्शित करता है कि सटीक-स्ट्रिंग मिलान (exact-string matching) की तुलना में सिमेंटिक मूल्यांकन सटीकता मूल्यांकन में महत्वपूर्ण सुधार करता है, जबकि विभिन्न मॉडल एंडपॉइंट्स के बीच प्रदर्शन के पर्याप्त अंतर को भी उजागर करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, कंप्यूटर मानव भाषाओं को बढ़ती हुई दक्षता के साथ बोलना सीख गए हैं, जो अक्सर इतिहास, विज्ञान और संस्कृति के बारे में प्रश्नों के उत्तर आश्चर्यजनक सहजता के साथ देते हैं। हालाँकि, इन मशीनों का परीक्षण करने के तरीके में एक महत्वपूर्ण अंतर बना हुआ है। अधिकांश मानक परीक्षण बहुविकल्पीय प्रश्नों या सरल शब्द-दर-शब्द मिलान पर निर्भर करते हैं, जो उस सूक्ष्मता को 놓 सकते हैं जो एक अलग तरीके से लिखे गए सही उत्तर की विशेषता होती है। यह विशेष रूप से तुर्की जैसी भाषाओं के लिए सच है, जो एक लचीली संरचना का उपयोग करती है जहाँ वाक्य में अपनी भूमिका के अनुसार शब्द अपना रूप बदलते हैं, और पाक विरासत जैसे विशिष्ट क्षेत्रों के लिए, जहाँ एक व्यंजन को कई नामों से जाना जा सकता है या क्षेत्र के आधार पर अलग-अलग विवरणों के साथ वर्णित किया जा सकता है। शोधकर्ता तेजी से यह पूछ रहे हैं कि क्या ये डिजिटल मस्तिष्क वास्तव में किसी समुदाय के विशिष्ट सांस्कृतिक ज्ञान को समझते हैं या वे केवल उन पैटर्न के आधार पर अनुमान लगा रहे हैं जिन्हें उन्होंने पहले देखा है। इसका उत्तर देने के लिए, हमें ऐसे परीक्षणों की आवश्यकता है जो न केवल व्यापक हों, बल्कि किसी स्थान के विशिष्ट तथ्यों और परंपराओं में गहराई से निहित हों, और जो केवल स्वचालित स्कोरिंग सिस्टम के बजाय वास्तविक मानव विशेषज्ञों द्वारा सत्यापित हों।
एक नया अध्ययन इस प्रकार के ज्ञान को मापने के लिए डिज़ाइन किए गए एक विशेष परीक्षण को पेश करता है: तुर्की के व्यंजनों और उनके इतिहास के बारे में तथ्यात्मक प्रश्नों के उत्तर देने की बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) की क्षमता। शोधकर्ताओं ने, मुहम्मद बुगरा यिलमाज़ के नेतृत्व में, 'टर्कक्युज़ीनबेंच' (TurkCuisineBench) नामक एक बेंचमार्क बनाया, जिसमें बहत्तर लघु-उत्तर वाले प्रश्न शामिल हैं। ये प्रश्न मनगढ़ंत नहीं थे; प्रत्येक एक आधिकारिक रिकॉर्ड से लिया गया था, जैसे कि भौगोलिक संकेत (जियोग्राफिकल इंडिकेशंस) के लिए सरकारी डेटाबेस और यूनेस्को (UNESCO) की अमूर्त सांस्कृतिक विरासत की सूचियाँ। लक्ष्य यह देखना था कि क्या आर्टिफिशियल इंटेलिजेंस ऐसे उत्तर दे सकता है जो इन विश्वसनीय स्रोतों से मेल खाते हों, भले ही शब्दों का चयन समान न हो। इस अध्ययन में आठ अलग-अलग एआई (AI) मॉडल शामिल थे, जो प्रसिद्ध वाणिज्यिक प्रणालियों से लेकर ओपन-सोर्स संस्करणों तक विस्तृत थे, जिनसे तुर्की में बिना जानकारी खोजे या बाहरी उपकरणों का उपयोग किए प्रश्नों के उत्तर देने के लिए कहा गया था। प्रक्रिया को कड़ाई से नियंत्रित किया गया था: मॉडलों के शुरू होने से पहले प्रश्न स्थिर कर दिए गए थे, और उत्तरों का मूल्यांकन मानव विशेषज्ञों द्वारा किया गया था जिन्होंने केवल वर्तनी के बजाय अर्थ की जाँच की।
परिणामों ने विभिन्न मॉडलों के प्रदर्शन के बीच एक बड़ा अंतर प्रकट किया। जब उत्तरों का निर्णय सख्ती से इस आधार पर किया गया कि क्या वे स्रोत पाठ से बिल्कुल मेल खाते हैं, तो स्कोर मामूली थे, जिसमें सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल लगभग बासट प्रतिशत सही उत्तर दे पाया। हालाँकि, जब मानव विशेषज्ञों ने उत्तरों की समीक्षा की कि क्या वे 'सिमेंटिकली' (अर्थपूर्ण रूप से) सही थे—अर्थात, भले ही शब्द अलग हों, लेकिन वे समान तथ्यात्मक अर्थ रखते हों—तो स्कोर में उल्लेखनीय सुधार हुआ। शीर्ष मॉडल ने लगभग इकहत्तर प्रतिशत की सिमेंटिक सटीकता हासिल की, जबकि सबसे कम प्रदर्शन करने वाले मॉडल चौदह प्रतिशत तक पहुँचने के लिए भी संघर्ष करते रहे। यह अंतर वर्तमान में एआई प्रणालियों के मूल्यांकन में एक गंभीर खामी को उजागर करता है: एक मशीन एक बिल्कुल सही उत्तर दे सकती है जो डेटाबेस से केवल अलग तरह से लिखा गया हो, और एक कठोर कंप्यूटर प्रोग्राम उसे गलत मान लेगा। उत्तरों की समीक्षा करके, अध्ययन ने उन तैंतालीस सही उत्तरों को पुनः प्राप्त किया जो सख्त स्वचालित स्कोरिंग द्वारा छूट जाते, जिससे सर्वश्रेष्ठ मॉडलों की समग्र सटीकता सात प्रतिशत से अधिक बढ़ गई।
अध्ययन ने इस बात पर भी बारीकी से नज़र डाली कि मॉडल कहाँ विफल हुए। जब उन्होंने कोई उत्तर गलत दिया, तो सबसे आम गलती 'प्रतिस्थापन' (substitution) थी, जहाँ मॉडल सही प्रकार की जानकारी तो देता था लेकिन गलत विशिष्ट विवरण, जैसे कि किसी व्यंजन के लिए गलत सामग्री या गलत क्षेत्र का नाम देना। एक अन्य दिलचस्प निष्कर्ष यह था कि मॉडल कितनी बार उत्तर देने से मना करते थे। एक विशिष्ट मॉडल ने लगभग आधे मामलों में यह कहना चुना कि वह उत्तर नहीं जानता, जबकि अन्य मॉडल लगभग हमेशा उत्तर देने का प्रयास करते थे, भले ही वह गलत ही क्यों न हो। यह सुझाव देता है कि विभिन्न एआई प्रणालियों के पास अनिश्चितता को संभालने के लिए बहुत अलग-अलग रणनीतियाँ हैं। शोधकर्ताओं ने यह भी परीक्षण किया कि क्या प्रश्न में कुछ संकेतों की उपस्थिति से मॉडलों के लिए सही उत्तर देना आसान हो जाता है, लेकिन डेटा ने ऐसा कोई स्पष्ट प्रमाण नहीं दिखाया कि ऐसा हुआ हो; प्रश्न की कठिनाई प्रश्न की शब्दावली के बजाय विशिष्ट विषय पर अधिक निर्भर थी, जैसे कि क्या यह किसी विशिष्ट व्यंजन के बारे में था या एक व्यापक ऐतिहासिक परंपरा के बारे में।
शायद इस कार्य का सबसे महत्वपूर्ण निष्कर्ष यह नहीं है कि कौन सा एआई मॉडल सबसे अच्छा है, बल्कि यह है कि हमें उन्हें कैसे मापना चाहिए। अध्ययन यह प्रदर्शित करता है कि सांस्कृतिक रूप से विशिष्ट ज्ञान के लिए, केवल स्वचालित, सटीक-मिलान स्कोरिंग पर निर्भर रहना, एक मॉडल की क्षमताओं की एक अधूरी और अक्सर अनुचित तस्वीर प्रस्तुत करता है। सख्त स्रोत सत्यापन को सावधानीपूर्वक मानव समीक्षा के साथ जोड़कर, शोधकर्ता इन प्रणालियों के वास्तविक ज्ञान का अधिक सटीक और निष्पक्ष मूल्यांकन कर सकते हैं। यह बेंचमार्क जानबूझकर संकुचित है, जो केवल उन तथ्यों पर केंद्रित है जिन्हें आधिकारिक दस्तावेजों से जोड़ा जा सकता है, जिसका अर्थ है कि यह तुर्की खाना पकाने की संपूर्ण, जीवंत संस्कृति का प्रतिनिधित्व करने का दावा नहीं करता है। इसके बजाय, यह परीक्षण करने का एक पारदर्शी, ऑडिट योग्य तरीका प्रदान करता है कि क्या मशीनें विरासत के विशिष्ट, दस्तावेजी तथ्यों को संभाल सकती हैं। यह दृष्टिकोण भविष्य के मूल्यांकनों के लिए एक ब्लूप्रिंट प्रदान करता है, जो यह दिखाता है कि मानव संस्कृति को संभालने के मामले में आर्टिफिशियल इंटेलिजेंस को वास्तव में समझने के लिए, हमें केवल शब्द मिलान से परे देखना होगा और उत्तरों के पीछे निहित अर्थ के साथ जुड़ना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।