← नवीनतम पेपर
💬 NLP

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

यह शोध पत्र QQJ को प्रस्तुत करता है, जो एक स्केलेबल और मानव-संरेखित मूल्यांकन ढांचा है जो विशेषज्ञ-निर्मित, बहु-आयामी रूब्रिक्स में लार्ज लैंग्वेज मॉडल इवैल्यूएटर्स को एंकर करके स्वचालित मूल्यांकन और मानवीय निर्णय के बीच के अंतर को पाटता है, जिससे पारंपरिक मेट्रिक्स और अनकन्स्ट्रेंड एलएलएम इवैल्यूएटर्स की तुलना में जनरेटिव एआई सिस्टम के लिए बेहतर निरंतरता, व्याख्यात्मकता और नैदानिक क्षमता प्राप्त होती है।

मूल लेखक: Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल आर्ट गैलरी चला रहे हैं जो रोबोटों द्वारा बनाई गई पेंटिंग्स और कहानियों से भरी हुई है। रोबोट हर दिन बेहतर होते जा रहे हैं, लेकिन आपके सामने एक बड़ी समस्या है: आप यह कैसे तय करेंगे कि वास्तव में कौन सी कृतियाँ अच्छी हैं?

यह शोध पत्र QQJ (क्वांटिफाइंग क्वालिटेटिव जजमेंट) नामक एक नई प्रणाली पेश करता है ताकि इस समस्या को हल किया जा सके। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है:

समस्या: "सतही स्तर" बनाम "असली चीज़"

वर्तमान में, लोग इन रोबोट कृतियों को आंकने के लिए दो मुख्य तरीकों का उपयोग करते हैं, और दोनों में खामियां हैं:

  1. "मैथ चेक" (पारंपरिक मेट्रिक्स): कल्पना कीजिए कि एक रोबोट जज है जो केवल यह गिनता है कि रोबोट की कला और एक आदर्श उदाहरण के बीच कितने शब्द या रंग मेल खाते हैं। यह एक छात्र के निबंध को केवल इस आधार पर ग्रेड करने जैसा है कि उसने कितनी बार "the" शब्द का उपयोग किया है। यह तेज़ और आसान है, लेकिन इसे इस बात की परवाह नहीं है कि कहानी समझ में आ रही है या पेंटिंग वास्तव में सुंदर है या नहीं। यह गुणवत्ता के 'एहसास' को छोड़ देता है।
  2. "मानवीय भीड़" (मानव मूल्यांकन): कल्पना कीजिए कि आप हर एक कृति को देखने के लिए हजारों कला समीक्षकों को काम पर रखते हैं। वे गहरी गुणवत्ता को पहचानने में माहिर होते हैं, लेकिन यह अविश्वसनीय रूप से महंगा, धीमा है, और वे आपस में असहमत भी हो सकते हैं। आप लाखों रोबोट कृतियों के लिए ऐसा नहीं कर सकते।
  3. "स्मार्ट रोबोट जज" (LLM इवैल्यूएटर्स): हाल ही में, लोगों ने सुपर-स्मार्ट AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग करना शुरू कर दिया है जो जजों के रूप में कार्य करते हैं। वे इंसानों की तुलना में तेज़ हैं, लेकिन वे अक्सर भ्रमित, पक्षपाती या असंगत हो जाते हैं। वे एक सुंदर तस्वीर को उच्च स्कोर दे सकते हैं जो वास्तव में निरर्थक है क्योंकि वे एक सख्त नियम पुस्तिका का पालन नहीं कर रहे हैं।

समाधान: "मास्टर शेफ की रेसिपी बुक" (QQJ)

लेखकों ने QQJ बनाया ताकि दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त किया जा सके: एक रोबोट की गति और एक मानव विशेषज्ञ का ज्ञान। वे इसे करने के लिए क्या खोजा जा रहा है और कैसे इसकी जांच की जा रही है, को अलग करते हैं।

यहाँ खाना बनाने की उपमा का उपयोग करते हुए चरण-दर-चरण प्रक्रिया दी गई है:

चरण 1: विशेषज्ञ रेसिपी (रूब्रिक कंस्ट्रक्शन)
रोबोट जज को यह अनुमान लगाने देने के बजाय कि "अच्छा" क्या दिखता है, मानव विशेषज्ञ एक सख्त रेसिपी बुक (जिसे रूब्रिक कहा जाता है) लिखते हैं।

  • उपमा: मिशलिन-स्टार शेफ के बारे में सोचें जो एक फूड क्रिटिक के लिए चेकलिस्ट लिख रहा है। चेकलिस्ट केवल "स्वादिष्ट" नहीं कहती। यह इसे विस्तार से बताती है: "क्या नमक का स्तर सही है? क्या मांस बिल्कुल सही तापमान पर पका है? क्या प्लेटिंग साफ है?"
  • QQJ में, इंसान किसी भी निर्णय से पहले इन विशिष्ट आयामों (जैसे "क्या तथ्य सत्य है?" या "क्या इसने निर्देशों का पालन किया?") को परिभाषित करते हैं।

चरण 2: ट्रेनिंग कैंप (कैलिब्रेशन)
रोबोट जज (AI) को उदाहरणों का एक छोटा सेट दिया जाता है जिन्हें मानव विशेषज्ञों ने उस रेसिपी बुक का उपयोग करके पहले ही ग्रेड कर दिया है।

  • उपमा: रोबोट जज एक ट्रेनिंग कैंप में जाता है जहाँ मास्टर शेफ उसे दिखाता है: "यह एक व्यंजन है जिसे 5/5 मिले क्योंकि इसने रेसिपी का पूरी तरह से पालन किया। यह एक व्यंजन है जिसे 2/5 मिले क्योंकि इसमें लहसुन जल गया। अब, इन ग्रेड्स का उपयोग करके तुम खुद कोशिश करो।"
  • यह रोबोट को केवल अनुमान लगाने के बजाय विशेषज्ञ की तरह सोचना सिखाता है।

चरण 3: मास प्रोडक्शन लाइन (स्केलेबल इवैल्यूएशन)
एक बार जब रोबोट जज रेसिपी सीख लेता है, तो वह हजारों रोबोट कृतियों को तुरंत ग्रेड कर सकता है।

  • उपमा: अब, रोबोट जज एक घंटे में 10,000 व्यंजनों का स्वाद परीक्षण कर सकता है। क्योंकि वह मास्टर शेफ की विशिष्ट चेकलिस्ट का पालन कर रहा है, वह थकता नहीं है, वह पक्षपाती नहीं होता है, और वह केवल एक अस्पष्ट स्कोर देने के बजाय एक विस्तृत रिपोर्ट देता है (जैसे, "स्वाद अच्छा था, लेकिन बनावट गलत थी")।

यह बेहतर क्यों है?

पेपर ने टेक्स्ट और इमेज जनरेशन दोनों पर पुराने तरीकों के मुकाबले QQJ का परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • यह इंसान की तरह सोचता है: QQJ "मैथ चेक" या अनट्रेंड "स्मार्ट रोबोट जज" की तुलना में मानव विशेषज्ञों के साथ बहुत अधिक बार सहमत हुआ।
  • यह सुसंगत है: यदि आप QQJ रोबोट को वही तस्वीर दो बार आंकने के लिए कहते हैं, तो वह समान स्कोर देता है। अन्य रोबोट जज अक्सर अपना मन बदल लेते हैं।
  • यह चालाकी भरी गलतियों को पकड़ लेता है: QQJ "हैलुसिनेशन" (जब रोबोट तथ्य गढ़ता है) या "इन्टेंट मिसमैच" (जब रोबोट आपके द्वारा पूछे गए निर्देश को अनदेखा कर देता है) को पकड़ने में बहुत अच्छा है। पुराने गणित-आधारित तरीके अक्सर इन्हें पूरी तरह से छोड़ देते थे क्योंकि रोबोट का उत्तर वास्तविक उत्तर के समान दिखता था, भले ही वह गलत हो।

निष्कर्ष

QQJ एक सख्त, मानव-लिखित नियम पुस्तिका और एक छोटे प्रशिक्षण सत्र के साथ रोबोट को देने जैसा है। यह हमें लाखों AI कृतियों को तेजी से और सस्ते में मूल्यांकन करने की अनुमति देता है, जबकि वास्तव में कुछ "अच्छा" क्या बनाता है, इसकी गहरी, मानवीय समझ को भी बनाए रखता है। यह गुणवत्ता के निर्णय लेने की अव्यवस्थित, व्यक्तिपरक कला को एक स्पष्ट, दोहराने योग्य विज्ञान में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →