← नवीनतम पेपर
💬 NLP

A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering

यह शोध पत्र खमेर-भाषा के टेलीकॉम दस्तावेजों के लिए एक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) प्रणाली का तुलनात्मक अध्ययन प्रस्तुत करता है, जिसमें BGE-M3 को बेहतर रिट्रिवर के रूप में पहचाना गया है और यह प्रदर्शित किया गया है कि हालांकि कोई भी एकल जनरेटर मॉडल सभी प्रदर्शन मेट्रिक्स में हावी नहीं है, विभिन्न मॉडल विशिष्ट क्षेत्रों जैसे कि निष्ठा (faithfulness), तथ्यात्मक शुद्धता, या अर्थ संबंधी समानता में उत्कृष्ट हैं।

मूल लेखक: Sereiwathna Ros, Phannet Pov, Ratanaktepi Chhor, Kimleang Ly, Wan-Sup Cho, Saksonita Khoeurn

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sereiwathna Ros, Phannet Pov, Ratanaktepi Chhor, Kimleang Ly, Wan-Sup Cho, Saksonita Khoeurn

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कंबोडियाई दूरसंचार कानूनों के बारे में एक बहुत ही विशिष्ट प्रश्न का उत्तर देने की कोशिश कर रहे हैं, लेकिन आपके पास उत्तर याद नहीं है। आपके पास दस्तावेजों की एक विशाल लाइब्रेरी (रिट्रीवर/खोजकर्ता) है और एक बहुत ही स्मार्ट, बातूनी सहायक (जेनेरेटर/लेखक) है जो उन दस्तावेजों को पढ़ सकता है और आपके लिए उत्तर लिख सकता है।

यह शोध पत्र इस प्रणाली को बनाने के लिए उपयोग किए जाने वाले विभिन्न उपकरणों के स्वाद परीक्षण (टेस्ट टेस्ट) और प्रदर्शन समीक्षा की तरह है, जो विशेष रूप से खमेर भाषा (कंबोडिया की भाषा) के लिए है। क्योंकि खमेर एक अद्वितीय लिपि का उपयोग करती है और इसमें अंग्रेजी की तुलना में डिजिटल संसाधन कम हैं, इसलिए शोधकर्ताओं ने यह देखना चाहा कि कौन से उपकरण वास्तव में एक साथ सबसे अच्छा काम करते हैं।

यहाँ उनके प्रयोग का विवरण सरल रूप में दिया गया है:

1. लाइब्रेरियन (द रिट्रीवर)

सबसे पहले, टीम को एक "लाइब्रेरियन" की आवश्यकता थी जिसका काम लाइब्रेरी में सही पन्ने ढूंढना हो जब आप कोई प्रश्न पूछें। उन्होंने तीन अलग-अलग लाइब्रेरियन (AI मॉडल) का परीक्षण किया:

  • BGE-M3
  • Jina-Embeddings-v3
  • Qwen3-Embedding

परिणाम: BGE-M3 स्पष्ट विजेता था। यह एक ऐसे लाइब्रेरियन की तरह था जो वास्तव में डेवी डेसिमल सिस्टम (Dewey Decimal system) को जानता है।

  • जब सही दस्तावेज़ खोजने के लिए पूछा गया, तो BGE-M3 ने 70% बार सही सोर्स फ़ाइल ढूंढी।
  • अन्य दो लाइब्रेरियन केवल लगभग 50% बार ही सही फ़ाइल ढूंढ पाए।
  • दिलचस्प मोड़: हारने वाले लाइब्रेरियन में से एक (Jina) ने उच्चतम "समानता स्कोर" (जैसे यह कहना कि, "ये दो पन्ने बहुत समान दिखते हैं!") दिया, लेकिन वह वास्तव में गलत पन्ना था। इसने शोधकर्ताओं को सिखाया कि उच्च समानता स्कोर का मतलब हमेशा यह नहीं होता कि उत्तर वास्तव में वहां मौजूद है।

2. लेखक (द जेनेरेटर)

एक बार जब लाइब्रेरियन सही पन्ने ढूंढ लेता है, तो "लेखक" (एक लार्ज लैंग्वेज मॉडल) उन्हें पढ़ता है और अंतिम उत्तर लिखता है। टीम ने पांच अलग-अलग लेखकों का परीक्षण किया:

  • Qwen3 और Qwen3.5 (सामान्य बहुभाषी लेखक)
  • Sailor2 (दक्षिण पूर्व एशिया के लिए विशेष)
  • SeaLLMs (दक्षिण पूर्व एशिया के लिए विशेष)
  • Llama-SEA-LION (दक्षिण पूर्व एशिया के लिए विशेष)

उन्होंने केवल यह नहीं पूछा, "क्या उत्तर अच्छा है?" उन्होंने लेखकों को ग्रेड करने के लिए छह अलग-अलग तरीकों का उपयोग किया, जैसे एक शिक्षक एक रूब्रिक (rubric) का उपयोग करता है:

  • विश्वसनीयता (क्या लेखक तथ्यों पर टिका रहा?): Qwen3.5 सबसे ईमानदार था। इसने शायद ही कभी मनगढ़ंत बातें बनाईं और सख्ती से वही कहा जो दस्तावेजों में लिखा था।
  • तथ्यात्मक शुद्धता (क्या लेखक ने नंबर और नाम सही लिखे?): Qwen3 विशिष्ट विवरणों (जैसे फोन नंबर या कानून कोड) को बिल्कुल सटीक रूप से लिखने में सबसे अच्छा था।
  • प्रासंगिकता और समानता (क्या उत्तर ऐसा लगा जैसे कोई इंसान बोल रहा हो?): SeaLLMs सबसे अच्छा था क्योंकि यह स्वाभाविक रूप से बोलने और "गोल्ड स्टैंडर्ड" उत्तरों की शैली से मेल खाने में सक्षम था।
  • हारने वाला: Llama-SEA-LION को सबसे अधिक संघर्ष करना पड़ा, अक्सर तथ्य गढ़ रहा था या दस्तावेजों को अनदेखा कर रहा था।

3. मुख्य निष्कर्ष

शोधकर्ताओं ने पाया कि कोई एक "परफेक्ट" रोबोट नहीं है। यह इस पर निर्भर करता है कि आपको क्या चाहिए:

  • यदि आपको विश्वास (यह सुनिश्चित करने के लिए कि AI झूठ न बोले) चाहिए, तो Qwen3.5 का उपयोग करें।
  • यदि आपको सटीकता (सटीक नंबर प्राप्त करने के लिए) चाहिए, तो Qwen3 का उपयोग करें।
  • यदि आप चाहते हैं कि उत्तर स्वाभाविक लगे और मानवीय वाक्यांशों से मेल खाए, तो SeaLLMs का उपयोग करें।

बाधा (The Bottleneck):
सबसे बड़ी समस्या लेखक नहीं थी; बल्कि लाइब्रेरियन था। यहाँ तक कि सबसे अच्छा लाइब्रेरियन (BGE-M3) भी शीर्ष 3 परिणामों में से सही दस्तावेज़ केवल 28% बार ही ढूंढ पाया। इसका मतलब है कि पूरी प्रणाली इसलिए बाधित है क्योंकि सबसे पहले सही जानकारी ढूंढना बहुत कठिन है।

4. एक कमी (The Catch)

शोध पत्र कुछ सीमाओं को स्वीकार करता है:

  • परीक्षण: उन्होंने केवल 200 प्रश्नों का परीक्षण किया। हालांकि वे सावधानीपूर्वक चुने गए थे, फिर भी वे हर उस संभावित प्रश्न को कवर नहीं कर सकते जो एक नागरिक पूछ सकता है।
  • ग्रेडर: उन्होंने उत्तरों को ग्रेड करने के लिए एक अन्य AI (GPT-4o-mini) का उपयोग किया, न कि वास्तविक मनुष्यों का। हालांकि यह मानक है, लेकिन मानवीय फीडबैक ही अंतिम परीक्षण होगा।
  • सेटअप: कुछ लेखकों का परीक्षण अलग-अलग कंप्यूटर सेटअप पर किया गया था, जिससे परिणाम थोड़े प्रभावित हो सकते थे।

सारांश

संक्षेप में, खमेर भाषा के लिए एक स्मार्ट प्रश्न-उत्तर प्रणाली बनाना एक रिले रेस टीम बनाने जैसा है। आपको बैटन (baton) खोजने के लिए एक महान धावक (लाइब्रेरियन) और उसे फिनिश लाइन तक ले जाने के लिए एक महान धावक (लेखक) की आवश्यकता है। शोधकर्ताओं ने पाया कि बैटन खोजने के लिए BGE-M3 सबसे अच्छा धावक है, लेकिन बैटन ले जाने के लिए सबसे अच्छा धावक इस बात पर निर्भर करता है कि आप ईमानदारी, सटीकता या शैली को महत्व देते हैं। सबसे महत्वपूर्ण बात यह है कि दौड़ वर्तमान में धीमी है क्योंकि बैटन ढूंढना अभी भी बहुत कठिन है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →