← नवीनतम पेपर
💻 computer science

STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

STELLAR-E एक पूर्णतः स्वचालित, दो-चरणीय ढांचा है जो LLM अनुप्रयोग मूल्यांकन के लिए उच्च-गुणवत्ता वाले, अनुकूलन योग्य सिंथेटिक डेटासेट उत्पन्न करता है, जो मौजूदा बेंचमार्क के समान मूल्यांकन गुणवत्ता प्राप्त करते हुए मैनुअल डेटा संग्रह का एक स्केलेबल और कुशल विकल्प प्रदान करता है।

मूल लेखक: Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हेड शेफ हैं जो एक नए, बहुत बुद्धिमान किचन रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) को विशिष्ट व्यंजन बनाना सिखाने की कोशिश कर रहे हैं। उसे सिखाने के लिए, आपको एक रेसिपी बुक (एक डेटासेट) की आवश्यकता है जिसमें हजारों प्रश्न और उत्तर हों।

समस्या:
आमतौर पर, ये रेसिपी प्राप्त करना एक बुरा सपना होता है। आपको उन्हें लिखने के लिए मानव विशेषज्ञों को काम पर रखना पड़ता है, जो धीमा, महंगा और अक्सर असंभव है यदि रेसिपी में कोई गुप्त पारिवारिक सामग्री (निजी डेटा) या सख्त स्वास्थ्य नियम शामिल हों। इसके अलावा, अधिकांश रेसिपी बुक्स केवल अंग्रेजी में लिखी जाती हैं, जिससे इतालवी, स्वाहिली या अन्य भाषा बोलने वाले शेफ पीछे छूट जाते हैं।

समाधान: STELLAR-E
इस शोध पत्र के लेखकों ने STELLAR-E नामक एक मशीन बनाई है। इसे एक स्वचालित "रेसिपी फैक्ट्री" के रूपके रूप में समझें जो किसी भी भाषा में उच्च गुणवत्ता वाली, कस्टम रेसिपी बुक्स तुरंत प्रिंट कर सकती है, बिना किसी मानव लेखक या मौजूदा गुप्त रेसिपी के।

यह फैक्ट्री कैसे काम करती है, इसे सरल चरणों में यहाँ दिया गया है:

1. ब्लूप्रिंट (विषय निर्माण - Topic Generation)

यह अनुमान लगाने के बजाय कि क्या पूछना है, फैक्ट्री पहले एक स्मार्ट AI से "विषयों" (जैसे "इतालवी पास्ता" या "जर्मन बैंकिंग नियम") की एक सूची बनाने के लिए कहती है। फिर यह एक सख्त संपादक की तरह कार्य करती है, और उन सभी विषयों को हटा देती है जो बहुत अस्पष्ट या अप्रासंगिक हैं।

2. प्रश्न लिखना (निर्देश निर्माण - Instruction Generation)

एक बार जब अच्छे विषय मिल जाते हैं, तो फैक्ट्री वास्तविक प्रश्न तैयार करती है। लेकिन यह केवल एक बार प्रश्न लिखकर उम्मीद नहीं करती कि सब ठीक हो जाएगा। यह एक "फीडबैक लूप" का उपयोग करती है:

  • AI एक प्रश्न लिखता है।
  • एक "जज AI" उसे ग्रेड देता है।
  • यदि ग्रेड बहुत कम है, तो AI को उसे फिर से लिखना पड़ता है।
  • यह तब तक होता रहता है जब तक कि प्रश्न एकदम सही न हो जाए।
  • उपमा: यह एक छात्र द्वारा निबंध को तब तक फिर से लिखने जैसा है जब तक कि शिक्षक उसे A+ न दे दे, बजाय इसके कि वह केवल अपना पहला ड्राफ्ट जमा कर दे।

3. इसे कठिन बनाना (कठिनाई वृद्धि - Difficulty Enhancement)

कभी-कभी, AI द्वारा जनरेट किए गए प्रश्न बहुत आसान होते हैं, जैसे "आसमान का रंग क्या है?" पूछना। फैक्ट्री के पास एक विशेष मॉड्यूल है जो प्रश्नों को पैराफ्रेस (Paraphrase) करके उन्हें अधिक पेचीदा बनाता है, यह सुनिश्चित करने के लिए कि रोबोट शेफ को उत्तर देने के लिए वास्तव में कड़ी मेहनत करनी पड़े।

4. विविधता की जाँच करना (विविधता वृद्धि - Diversity Enhancement)

यदि फैक्ट्री गलती से 100 ऐसे प्रश्न प्रिंट कर देती है जिनका अर्थ एक ही है, तो यह समय की बर्बादी है। सिस्टम एक "सिमेंटिक स्कैनर" (एक ऐसा टूल जो शब्दों के अर्थ को समझता है) का उपयोग करता है ताकि प्रश्नों के बीच की दूरी की जाँच की जा सके। यदि दो प्रश्न बहुत समान हैं, तो यह एक को हटा देता है। यह सुनिश्चित करता है कि अंतिम पुस्तक में विविध और अद्वितीय चुनौतियाँ हों।

5. अंतिम परीक्षा (मूल्यांकन - Evaluation)

फैक्ट्री केवल किताब बनाकर ही नहीं रुक जाती; वह रोबोट शेफ का परीक्षण भी करती है। उन्होंने इस सिस्टम का उपयोग अंग्रेजी और इतालवी में टेस्ट बुक्स बनाने के लिए किया और उनकी तुलना वास्तविक, मानव-लिखित टेस्ट बुक्स से की।

उन्हें क्या मिला?

  • "काफी अच्छा" मानक: सिंथेटिक (AI-निर्मित) टेस्ट बुक्स की गुणवत्ता वास्तविक मानव-लिखित बुक्स के बहुत करीब थी। वास्तव में, AI-निर्मित बुक्स वास्तविक बुक्स की तुलना में केवल लगभग 5.7% "आसान" थीं।
  • छोटे रोबोटों के लिए जाल: अध्ययन में पाया गया कि जबकि बड़े, शक्तिशाली AI मॉडल सिंथेटिक टेस्ट को अच्छी तरह से संभालते हैं, छोटे, कमजोर AI मॉडल वास्तविक मानव टेस्ट को AI-निर्मित टेस्ट की तुलना में बहुत अधिक कठिन पाते हैं। ऐसा लगता है कि AI-निर्मित टेस्ट में अनजाने में कुछ "चीट कोड्स" या पैटर्न थे जिनका छोटे रोबोट्स उच्च स्कोर प्राप्त करने के लिए फायदा उठा सकते थे, जबकि वास्तविक मानव टेस्ट अधिक वास्तविक रूप से कठिन थे।
  • भाषा मायने रखती है: सिस्टम अंग्रेजी और इतालवी दोनों के लिए अच्छी तरह से काम करता है, जो यह साबित करता है कि अन्य भाषाओं के लिए अंग्रेजी टेस्ट का अनुवाद करने की आवश्यकता नहीं है; आप उन्हें मूल रूप से (Natively) जनरेट कर सकते हैं।

मुख्य निष्कर्ष (The Bottom Line)
STELLAR-E एक ऐसा टूल है जो कंपनियों को तुरंत अपना कस्टम, निजी और बहुभाषी टेस्ट सूट बनाने की अनुमति देता है। यह उस समस्या को हल करता है कि "हमारे पास अपने AI का परीक्षण करने के लिए पर्याप्त डेटा नहीं है।" हालांकि ये टेस्ट पूरी तरह से मानव-निर्मित टेस्ट के समान नहीं हैं (विशेष रूप से छोटे AI मॉडल के लिए), फिर भी वे मानव संपादकों की फौज को काम पर रखने के एक तेज़, सस्ते और विश्वसनीय विकल्प के रूप में पर्याप्त अच्छे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →