← नवीनतम पेपर
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

यह शोध पत्र Prosa को प्रस्तुत करता है, जो पहला वास्तविक-उपयोगकर्ता मल्टी-टर्न ब्राज़ीलियाई पुर्तगाली चैट बेंचमार्क है, और यह प्रदर्शित करता है कि मल्टी-जज फ़िल्टरिंग के साथ बाइनरी रूब्रिक स्कोरिंग का उपयोग करने से पारंपरिक समग्र LLM-as-a-judge विधियों की तुलना में मूल्यांकन स्थिरता और विभेदक शक्ति में महत्वपूर्ण सुधार होता है।

मूल लेखक: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

प्रकाशित 2026-05-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शहर के सर्वश्रेष्ठ शेफ को रैंक करने की कोशिश कर रहे हैं। अतीत में, आप शायद एक खाद्य समीक्षक (food critic) से किसी व्यंजन को चखने और उसे 1 से 10 के बीच एक एकल स्कोर देने के लिए कहते। यह वैसा ही है जैसे वर्तमान में अधिकांश AI मॉडल का मूल्यांकन किया जाता है: एक "जज" AI एक प्रतिक्रिया को पढ़ता है और उसे एक समग्र (holistic) स्कोर देता है।

समस्या यह है, जैसा कि यह शोध पत्र बताता है, कि अलग-अलग समीक्षकों की पसंद अलग होती है। एक को तीखा भोजन पसंद हो सकता है, जबकि दूसरा उससे नफरत करता है। यदि आप तीन अलग-अलग समीक्षकों से 16 शेफ को रैंक करने के लिए कहें, तो वे इस बात पर सहमत हो सकते हैं कि सबसे खराब कौन है, लेकिन वे इस बात पर पूरी तरह असहमत हो सकते हैं कि सबसे अच्छा कौन है। यह रैंकिंग को अविश्वसनीय बनाता है।

शोध पत्र का समाधान: "चेकलिस्ट" विधि

Prosa (ब्राजीलियाई पुर्तगाली AI चैट के लिए एक नया बेंचमार्क) के पीछे के शोधकर्ताओं ने खेल बदलने का फैसला किया। जज से यह पूछने के बजाय कि, "यह व्यंजन कुल मिलाकर कैसा है?", उन्होंने जजों को एक विशिष्ट चेकलिस्ट दी जिसमें बाइनरी (हाँ/नहीं) प्रश्न थे।

  • पुराना तरीका (समग्र): "इस बातचीत को 1 से 10 तक रेट करें।" (व्यक्तिपरक, पूर्वाग्रह के प्रति संवेदनशील)।
  • नया तरीका (रूब्रिक-आधारित): "क्या AI ने प्रश्न का उत्तर दिया? हाँ/नहीं। क्या वह विनम्र रहा? हाँ/नहीं। क्या उसने मनगढ़ंत बातें बनाने से परहेज किया? हाँ/नहीं।"

इसे एक ड्राइविंग टेस्ट की तरह समझें। इसके बजाय कि एक प्रशिक्षक कहे, "आपने काफी अच्छा चलाया, मैं आपको 8 अंक दूंगा," वे विशिष्ट बॉक्स चेक करते हैं: "क्या आपने अपने टर्न सिग्नल का उपयोग किया? हाँ/नहीं। क्या आपने रेड लाइट पर रोका? हाँ/नहीं।"

"फिल्टरिंग" का जादू

शोधकर्ताओं ने महसूस किया कि कभी-कभी चेकलिस्ट के आइटम स्वयं भी त्रुटिपूर्ण होते हैं। हो सकता है कि कोई एक प्रश्न इतना आसान हो कि हर शेफ उसमें पास हो जाए, या इतना कठिन हो कि हर कोई फेल हो जाए। ये "टूटे हुए प्रश्न" रैंकिंग को बिगाड़ देते हैं।

इसलिए, उन्होंने एक फिल्टरिंग स्टेप जोड़ा। स्कोर को अंतिम रूप देने से पहले, उन्होंने गुणवत्ता नियंत्रण टीम के माध्यम से चेकलिस्ट को चलाया। उन्होंने उन प्रश्नों को हटा दिया जो बहुत आसान, बहुत कठिन, या भ्रमित करने वाले थे। इससे उन्हें प्रश्नों का एक सटीक, उच्च-गुणवत्ता वाला सेट मिला जो वास्तव में एक अच्छे शेफ और एक महान शेफ के बीच अंतर बता सकता था।

बड़ी खोज

यहाँ उनके निष्कर्षों का सबसे आश्चर्यजनक हिस्सा है:

  1. विधि, जज से अधिक महत्वपूर्ण है: जब उन्होंने पुराने "1-से-10" तरीके का उपयोग किया, तो तीन अलग-अलग AI जजों (अलग-अलग कंपनियों से) ने शीर्ष शेफ के लिए पूरी तरह से अलग रैंकिंग दी। लेकिन जब उन्होंने "चेकलिस्ट + फिल्टरिंग" पद्धति को अपनाया, तो तीनों जजों ने सभी 16 शेफ के लिए बिल्कुल एक ही रैंकिंग दी।
  2. यह सस्ता है: क्योंकि चेकलिस्ट कार्य को सरल हाँ/नहीं प्रश्नों में विभाजित करती है, इसलिए आपको जजिंग करने के लिए एक अत्यंत महंगे, "सुपर-स्मार्ट" AI की आवश्यकता नहीं है। आप एक सस्ते, तेज़ AI (जैसे Gemini 3 Flash) का उपयोग कर सकते हैं और फिर भी वही सटीक रैंकिंग प्राप्त कर सकते हैं। इस पद्धति के साथ एक नए मॉडल का मूल्यांकन करने में लगभग $2.10 खर्च होते हैं, जबकि अन्य तरीकों की तुलना में लागत बहुत अधिक होती है।

Prosa क्या है?

Prosa इस प्रकार का पहला बेंचमार्क है जो ब्राजीलियाई पुर्तगाली के लिए है।

  • वास्तविक जीवन: बनावटी परीक्षण प्रश्नों (जैसे स्कूल परीक्षा) के बजाय, उन्होंने 1,000 वास्तविक बातचीत का उपयोग किया जो ब्राजील में वास्तविक लोगों ने AI के साथ की थीं। यह कैप्चर करता है कि लोग वास्तव में कैसे बात करते हैं, वे किस तरह की बोलचाल (slang) का उपयोग करते हैं, और वे किन वास्तविक समस्याओं को हल करने की कोशिश करते हैं।
  • परिणाम: उन्होंने 16 अलग-अलग AI मॉडलों को रैंक किया। शीर्ष स्थान OpenAI के GPT-5.2 को मिला, जिसके ठीक बाद Google और Alibaba के मॉडल्स रहे। दिलचस्प बात यह है कि एक ओपन-सोर्स मॉडल (Qwen3-235B) ने इतना अच्छा प्रदर्शन किया कि उसने कई महंगे, प्रोप्राइटरी मॉडल्स को भी पीछे छोड़ दिया।

सारांश में

यह शोध पत्र तर्क देता है कि AI मॉडलों को निष्पक्ष रूप से रैंक करने के लिए, हमें जजों से गुणवत्ता के बारे में एक अस्पष्ट "एहसास" पूछना बंद करना चाहिए और सरल तथ्यों के एक सख्त, फिल्टर किए गए चेकलिस्ट का उपयोग करना चाहिए। यह विधि विशिष्ट जज के पूर्वाग्रह को हटा देती है, उनकी रैंकिंग को बहुत अधिक स्थिर बनाती है, और पैसे बचाती है, और यह सब ब्राजील की वास्तविक बातचीत को परीक्षण के मैदान के रूप में उपयोग करते हुए किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →