← नवीनतम पेपर
🤖 AI

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

यह शोधपत्र CriterAlign को प्रस्तुत करता है, जो एक मानदंड-केंद्रित (criterion-centric) ढांचा है जो स्वतंत्र स्कोरिंग को सीधे मानदंड-स्तरीय तुलनाओं से बदलकर और मानव-वरीयता-संरेखित मार्गदर्शन (Human-Preference-Aligned Guidance - HPAG) को शामिल करके युग्वद (pairwise) कोड वरीयता भविष्यवाणी को बढ़ाता है, जिससे मौजूदा मोनोलिथिक जजों की तुलना में महत्वपूर्ण रूप से बेहतर प्रदर्शन होता है।

मूल लेखक: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मैनेजर हैं जो यह तय करने की कोशिश कर रहे हैं कि दो कर्मचारियों (मान लीजिए एलिस और बॉब) में से किसने कोडिंग प्रोजेक्ट पर बेहतर काम किया। आपके पास उनका कोड है, उनके द्वारा दिए गए परिणाम हैं, और पालन करने के लिए नियमों की एक सूची है।

लंबे समय तक, इस काम को करने की कोशिश करने वाले AI मॉडल एक एकल, अत्यधिक व्यस्त सुपरवाइजर की तरह व्यवहार करते थे। वे एलिस के काम को देखते, उसे 10 में से एक स्कोर देते। फिर वे बॉब के काम को देखते, उसे 10 में से एक स्कोर देते। अंत में, वे दोनों नंबरों की तुलना करते और विजेता चुनते।

"CriterAlign" पेपर तर्क देता है कि कोडिंग के लिए यह "स्कोर-फर्स्ट" दृष्टिकोण त्रुटिपूर्ण है। यह एक कुकिंग प्रतियोगिता को जज करने जैसा है जहाँ प्रत्येक शेफ को अलग-अलग "स्वाद," "प्रस्तुति," और "गति" के लिए स्कोर दिया जाता है, और फिर उन्हें जोड़ दिया जाता है। समस्या यह है कि AI अक्सर सतही चीजों (जैसे किसने अधिक शब्द लिखे या किसने अधिक फैंसी फॉर्मेटिंग का उपयोग किया) से विचलित हो जाता है और उन वास्तविक, सूक्ष्म अंतरों को मिस कर देता है जिनकी इंसानों को परवाह होती है।

CriterAlign एक नया तरीका है जो गेम बदल देता है—यह "स्कोरिंग" से बदलकर "प्रत्यक्ष तुलना" (direct comparison) में बदल जाता है। यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. "हेड-टू-हेड" मुकाबला (पेयरवाइज जजिंग)

एलिस और बॉब को अलग-अलग स्कोर देने के बजाय, CriterAlign उन्हें हर एक नियम के लिए एक रिंग में खड़ा कर देता है।

  • पुराना तरीका: "एलिस गति के लिए 8/10 पाती है। बॉब गति के लिए 7/10 पाता है।"
  • CriterAlign का तरीका: "एलिस और बॉब के बीच, वास्तव में कौन अधिक तेज़ है?"
    AI को मजबूर किया जाता है कि वह उन्हें अगल-बगल देखे और कहे, "एलिस इस विशिष्ट बिंदु पर जीतती है," या "यह एक टाई है," या "बॉब जीतता है।" यह उस तरह से काम करता है जैसे इंसान वास्तव में दो विकल्पों की तुलना करते समय सोचते हैं।

2. "रेफरी का माइक्रोस्कोप" (टाई-ड्रिवन रिफाइनमेंट)

कभी-कभी, AI एक नियम (जैसे, "क्या कोड कुशल है?") को देखता है और कहता है, "वे दोनों बराबर हैं; मैं अंतर नहीं बता सकता।"
पुराने सिस्टम में, AI बस उस टाई को स्वीकार कर लेता और आगे बढ़ जाता। CriterAlign उस "टाई" को एक संकेत के रूप में लेता है कि नियम बहुत अस्पष्ट था।

  • उपमा: कल्पना कीजिए कि दो धावक एक दौड़ पूरी करते हैं और बिल्कुल एक ही समय पर पहुँचते हैं। एक बुरा रेफरी कहता है, "यह एक टाई है।" एक अच्छा रेफरी कहता है, "रुको, चलो उनके फुटवर्क को देखते हैं। क्या एक धावक थोड़ा लड़खड़ाया था?"
    CriterAlign उस "टाई" को लेता है और उस नियम को छोटे, अधिक सटीक सवालों में तोड़ देता है (जैसे, "किसने एज केसेस को बेहतर तरीके से संभाला?") जब तक कि वह वास्तविक अंतर नहीं ढूंढ लेता।

3. "निष्पक्षता की जाँच" (स्वैप-कंसिस्टेंसी)

AI जज क्रम (order) से पक्षपाती होने के लिए कुख्यात हैं। यदि आप एलिस का कोड पहले दिखाते हैं, तो AI उसे अधिक पसंद कर सकता है क्योंकि वह पहले दिखाई दी थी।

  • उपमा: कल्पना कीजिए कि एक टेस्ट है जहाँ जज हमेशा पहले पिए गए पानी के गिलास को पसंद करता है।
    CriterAlign एक "निष्पक्षता जाँच" चलाता है। यह AI को जोड़े को फिर से जज करने के लिए कहता है, लेकिन इस बार, यह क्रम को बदल देता है (पहले बॉब, फिर एलिस)। यदि AI केवल इसलिए अपना मन बदल देता है क्योंकि क्रम बदल गया था, तो CriterAlign उस विशिष्ट साक्ष्य को कचरे में डाल देता है। यह केवल उन्हीं निर्णयों को रखता है जो स्थिर और निष्पक्ष हैं, चाहे कोई भी पहले आए।

4. "मानवीय फुसफुसाहट" (HPAG)

यहाँ तक कि बेहतर नियमों के साथ भी, AI का एक अलग "व्यक्तित्व" हो सकता है। यह "क्लीन कोड" को "कूल विजुअल इफेक्ट्स" से अधिक महत्व दे सकता है, जबकि इंसान इसके विपरीत पसंद कर सकते हैं।

  • उपमा: कल्पना कीजिए कि एक रोबोट जज है जिसने कभी इंसान नहीं देखा है। उसे इंसानों द्वारा लिखे गए एक "चीट शीट" की आवश्यकता है जो कहता है, "हे, जब आप एक वेब डिज़ाइन देखें, तो याद रखें कि इंसान इस बात की अधिक परवाह करते हैं कि वह कैसा दिखता है बजाय इसके कि कोड कैसे व्यवस्थित है।"
    CriterAlign इस "चीट शीट" (जिसे HPAG कहा जाता है) को उन हजारों पिछले उदाहरणों का अध्ययन करके बनाता है जहाँ AI ने मानव की तुलना में गलत उत्तर दिया था। यह तर्क के "अंतरालों" (gaps) को निकालता है और इन सीखों को निर्णय शुरू करने से पहले AI के मस्तिष्क में इंजेक्ट करता है। यह AI को पूरे मॉडल को फिर से प्रशिक्षित किए बिना, इंसान की तरह सोचना सिखाता है।

परिणाम

जब शोधकर्ताओं ने कोडिंग कार्यों के एक बड़े बेंचमार्क पर इस नए सिस्टम का परीक्षण किया:

  • पुराने "एकल सुपरवाइजर" AI ने लगभग 60% उत्तर सही दिए (मानव प्राथमिकताओं से मेल खाते हुए)।
  • पुराने "स्कोरिंग" रूब्रिक सिस्टम वास्तव में एकल सुपरवाइजर की तुलना में और भी खराब प्रदर्शन करते थे।
  • CriterAlign की सटीकता बढ़कर 66% हो गई।

संक्षेप में: CriterAlign AI को व्यक्तिगत रूप से पेपर ग्रेड करने से रोकता है। इसके बजाय, यह AI को एक मानव रेफरी की तरह कार्य करने के लिए मजबूर करता है: दो उत्तरों की आमने-सामने तुलना करना, वास्तविक विजेता खोजने के लिए टाई पर ज़ूम करना, क्रम के पूर्वाग्रह को अनदेखा करना, और यह सुनिश्चित करने के लिए "मानवीय चीट शीट" का पालन करना कि वह सही चीजों को महत्व दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →