← नवीनतम पेपर
🤖 AI

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

यह शोधपत्र RubricForge को प्रस्तुत करता है, जो रिवॉर्ड-फ्री मूल्यांकन में विफल एजेंट व्यवहारों के अत्यधिक क्रेडिट (over-crediting) को काफी हद तक कम करने के लिए ग्राउंड-ट्रुथ ट्रेजेक्टरीज से मानव-पठनीय जजिंग रूब्रिक्स विकसित करने की एक विधि है, जो जेनेरिक बेसलाइन्स के साथ कच्चे समझौते (raw agreement) के बजाय निष्ठा (faithfulness) और फॉल्स-पास रिडक्शन को प्राथमिकता देता है।

मूल लेखक: Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan

प्रकाशित 2026-08-17
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि हम एक ऐसी दुनिया बना रहे हैं जहाँ हम डिजिटल सहायक बना रहे हैं—स्मार्ट एजेंट जो कंप्यूटर और वेबसाइटों से बात करके उड़ानें बुक कर सकते हैं, कपड़े खरीद सकते हैं, या कोड लिख सकते हैं। ये एजेंट बहुत ही आत्मविश्वासी और विनम्र लगने में अविश्वसनीय रूप से कुशल होते जा रहे हैं। लेकिन पेचीदा हिस्सा यह है: हमें कैसे पता चलेगा कि उन्होंने वास्तव में काम किया है, या उन्होंने बस काम करने की एक बहुत ही सुचारू, विश्वसनीय कहानी दी है? अतीत में, हमें हर एक काम को मैन्युअल रूप रूप से जांचना पड़ता था, जैसे एक शिक्षक हर निबंध को हाथ से ग्रेड करता है। लेकिन अब, इतने एजेंटों को एक-एक करके जांचना संभव नहीं है। इसलिए, वैज्ञानिकों ने एक दूसरे AI का उपयोग करना शुरू किया जो एक "जज" के रूप में कार्य करता है ताकि पहले वाले को ग्रेड दे सके। यह एक दूसरे रोबोट के काम को ग्रेड देने के लिए एक रोबोट शिक्षक को काम पर रखने जैसा है। समस्या यह है कि ये रोबोट शिक्षक अक्सर आसानी से मूर्ख बन जाते हैं। उन्हें एक अच्छी कहानी पसंद है। यदि कोई एजेंट एक लंबा, सुचारू, आत्मविश्वासी दिखने वाला रिपोर्ट लिखता है लेकिन वास्तव में उड़ान बुक करने में विफल रहता है, तो जज उसे केवल इसलिए "A" ग्रेड दे सकता है क्योंकि लेखन बहुत अच्छा था। यह खतरनाक है क्योंकि इसका मतलब है कि हम ऐसा टूटा हुआ सॉफ्टवेयर शिप कर रहे हैं जो कागज पर तो एकदम सही दिखता है लेकिन असल जिंदगी में क्रैश हो जाता है।

यह शोध पत्र इन रोबट जजों को प्रशिक्षित करने का एक चतुर नया तरीका पेश करता है ताकि वे "स्मूथ टॉकर" (मीठी बातें करने वाले) के जाल में न फंसें। जज को केवल एक सामान्य नियम पुस्तिका के साथ यह बताने के बजाय कि उसे क्या देखना चाहिए, या जज के दिमाग को ट्यून करने के बजाय (जो महंगा और समझने में कठिन है), लेखकों ने RUBRICFORGE नामक एक विधि बनाई है। इसे एक जासूस द्वारा एक नए साथी को प्रशिक्षित करने के रूप में सोचें। केवल साथी को नियमों की एक सूची देने के बजाय, वे उसे वास्तविक मामलों का एक छोटा ढेर दिखाते हैं जहाँ वे ठीक से जानते हैं कि कौन अपराध करके बच निकला और कौन नहीं। फिर जासूस साथी को उन विशिष्ट मामलों के आधार पर नियमों का एक नया सेट लिखने के लिए कहता है, और वे उन नियमों को तब तक परिष्कृत करते रहते हैं जब तक कि साथी नकली लोगों को पूरी तरह से पहचानने में सक्षम न हो जाए। परिणाम निर्देशों का एक सेट है जो साधारण अंग्रेजी में लिखा गया है जिसका जज पालन करता है। सबसे बड़ा आश्चर्य? यह नया तरीका जरूरी नहीं कि जज को साधारण हाँ/ना वाले सवालों पर "सत्य" के साथ अधिक सहमत बनाए। इसके बजाय, यह जज को उस विशिष्ट प्रकार की गलती को पकड़ने में बहुत बेहतर बनाता है जो सबसे महत्वपूर्ण है: एक ऐसी विफलता को पास होने का ग्रेड देना जो बहुत अच्छी लग रही थी।

"स्मूथ-टॉकिंग" रोबोट की कहानी

आर्टिफिशियल इंटेलिजेंस की दुनिया में, हमारे पास ये "एजेंट्स" हैं जो डिजिटल कर्मचारियों की तरह काम करते हैं। वे शर्ट खरीदने या बग ठीक करने जैसे कार्य करने की कोशिश करते हैं। यह देखने के लिए कि क्या उन्होंने अच्छा काम किया है, हमारे पास आमतौर पर एक "ग्राउंड ट्रुथ" (ground truth) होता है—एक आदर्श, अपरिवर्तनीय उत्तर कुंजी। उदाहरण के लिए, यदि एजेंट को लाल शर्ट खरीदने के लिए कहा गया था, तो ग्राउंड ट्रुथ एक डेटाबेस चेक है: "क्या लाल शर्ट कार्ट में जोड़ी गई?"

लेकिन उस डेटाबेस की जांच करना धीमा, महंगा है, या कभी-कभी असंभव है यदि कार्य में वास्तविक पैसा या खतरनाक क्रियाएं शामिल हों। इसलिए, हम एक दूसरे AI, एक "जज" का उपयोग करते हैं, जो एजेंट की बातचीत को देखता है और अनुमान लगाता है कि क्या वह सफल रहा। समस्या यह है कि ये जज पक्षपाती होते हैं। वे एक ऐसे शिक्षक की तरह हैं जो एक छात्र को 'A' ग्रेड देता है जो एक सुंदर निबंध लिखता है लेकिन गणित में गलत होता है। वे उन उत्तरों को पसंद करते हैं जो सुचारू, आत्मविश्वासी और लंबे होते हैं, भले ही वास्तविक कार्य विफल हो गया हो। इसे "ओवर-क्रेडिटिंग" (over-crediting) कहा जाता है। यह एक साइलेंट किलर है क्योंकि यदि आप सोचते हैं कि आपका एजेंट काम कर रहा है क्योंकि जज ने "पास" कहा है, लेकिन वास्तव में वह टूटा हुआ है, तो आप इसे जनता के लिए रिलीज़ कर सकते हैं और आपदा का कारण बन सकते हैं।

समाधान: RUBRICFORGE

लेखक, डैराग क्विन और उनकी टीम, इसे ठीक करना चाहते थे। वे केवल हाथ से एक बेहतर नियम पुस्तिका नहीं लिखना चाहते थे (जो धीमी है और इसमें चीजें छूट सकती हैं) या जज के दिमाग को फिर से प्रशिक्षित नहीं करना चाहते थे (जो महंगा है और एक "ब्लैक बॉक्स" बनाता है जिसे हम समझ नहीं सकते)। इसके बजाय, उन्होंने RUBRICFORGE का आविष्कार किया।

यह कैसे काम करता है, चरण-दर-चरण:

  1. प्रशिक्षण का मैदान (The Training Ground): वे वास्तविक एजेंट प्रयासों का एक छोटा सेट लेते हैं जहाँ वे पहले से ही वास्तविक परिणाम (ग्राउंड ट्रुथ) जानते हैं। कुछ सफल हुए, कुछ विफल रहे।
  2. विकास (The Evolution): वे "रिफ्लेक्टिव इवोल्यूशन" (reflective evolution) नामक एक प्रक्रिया का उपयोग करते हैं। कल्पना कीजिए कि एक रोबोट एक नियम पुस्तिका लिखने की कोशिश कर रहा है। वह एक ड्राफ्ट लिखता है, ज्ञात मामलों पर उसका परीक्षण करता है, और देखता है कि उसने कहाँ गलतियाँ कीं। फिर, वह गलतियों को देखता है और पूछता है, "मैंने यह गलत क्यों किया? मैंने कौन सा वास्तविक संकेत मिस कर दिया?" वह उस विशिष्ट त्रुटि को ठीक करने के लिए नियम पुस्तिका को फिर से लिखता है। वह इसे बार-बार करता है, हर प्रयास के साथ स्मार्ट होता जाता है।
  3. फ्रीज (The Freeze): एक बार जब नियम पुस्तिका प्रशिक्षण मामलों के लिए पूर्ण हो जाती है, तो वे इसे "फ्रीज" कर देते हैं। वे जज के दिमाग में कोई बदलाव नहीं करते हैं; वे बस उसे यह नया, सुपर-विशिष्ट सेट दिए गए निर्देश देते हैं।
  4. परीक्षण (The Test): वे इस फ्रीज किए गए जज का उपयोग नए, अनदेखे एजेंट प्रयासों पर करते हैं। चूंकि जज एक टेक्स्ट-आधारित नियम पुस्तिका का पालन कर रहा है, इसलिए हर बार जब वह ग्रेड देता है, तो वह ठीक से बता सकता है कि उसने किस नियम का उपयोग किया। यह पारदर्शी है।

उन्होंने क्या पाया: "कठिन से ठगने वाला" खोज

परिणाम दिलचस्प और थोड़े विरोधाभासी थे। लेखक जो उन्होंने पाया और जो नहीं पाया, उसके बारे में बहुत ईमानदार थे।

सबसे पहले, उन्होंने जांचा कि क्या नया जज एक मानक, जेनेरिक जज की तुलना में "सत्य" के साथ अधिक बार सहमत होता है। उत्तर था: वास्तव में नहीं। एक साधारण पास/फेल टेस्ट पर, नया तरीका और पुराना तरीका लगभग बराबर थे। शोध पत्र स्पष्ट रूप से बताता है कि समग्र सहमति में अंतर सांख्यिकीय रूप से महत्वपूर्ण नहीं था। दूसरे शब्दों में, यदि आपने केवल पूछा, "क्या वे उत्तर कुंजी के साथ सहमत थे?", तो नया तरीका स्पष्ट जीत हासिल नहीं कर सका।

हालाँकि, असली जीत सुरक्षा में थी। शोध पत्र एक विशिष्ट प्रकार की त्रुटि पर ध्यान केंद्रित करता है: फॉल्स पास (False Pass)। यह तब होता है जब जज एक ऐसे एजेंट को "सफलता" कहता है जो वास्तव में विफल रहा। यह खतरनाक त्रुटि है क्योंकि यह टूटे हुए सॉफ्टवेयर को रिलीज करती है।

  • मानक जेनेरिक जज ने विफल प्रयासों को लगभग 17.3% समय "पास" दिया (τ\tau-bench डेटासेट पर)।
  • नया RUBRICFORGE जज ने विफल एजेंटों को केवल 11.5% समय "पास" दिया।

यह एक बड़ी गिरावट है। नए तरीके ने उन तीन विशिष्ट मामलों को पकड़ा जहाँ पुराना जज एक अच्छी कहानी से मूर्ख बन गया था, और नए जज ने सही ढंग से "फेल" कहा। महत्वपूर्ण रूप से, नया जज कभी भी ऐसी गलती नहीं करता जो पुराना जज पहले से ही नहीं कर रहा था; इसने केवल अधिक त्रुटियों को पकड़ा। यह "ठगना कठिन" (harder to fool) है।

"फ्लुएंट फेल्योर" (सुचारू विफलता) का जाल

शोध पत्र इस बात पर प्रकाश डालता है कि यह लाभ तब दिखाई देता है जब एजेंट "फ्लुएंट" होता है—जब वह बहुत बोलता है और बहुत आत्मविश्वासी लगता है।

  • एयरलाइन (Airline) डोमेन (एक कठिन कार्य) में, पुराना जज विफल प्रयासों पर 43.8% बार मूर्ख बन गया था।
  • नया जज केवल 25.0% बार मूर्ख बना।
    यह विशेष रूप से उन एजेंटों के लिए सच था जो "सेल्फ-इवॉल्विंग" रणनीति का उपयोग कर रहे थे जो लंबी, विस्तृत रिपोर्ट लिखते थे। पुराने जज को लंबी रिपोर्ट पसंद थीं; नया जज साक्ष्य को देखता था और विफलता देख लेता था।

शोध पत्र "ग्रेड" स्कोर (जैसे 0 से 100 ग्रेड) को भी देखता है। यहाँ, नया तरीका रैंकिंग (यह जानना कि कौन सा एजेंट दूसरे से बेहतर है) में बेहतर है, लेकिन पुराना तरीका सटीक संख्या देने में थोड़ा बेहतर है। लेखक सावधानी बरतते हुए कहते हैं कि: यदि आपको एजेंटों की तुलना करने की आवश्यकता है कि कौन सबसे अच्छा है, तो नए तरीके का उपयोग करें। यदि आपको एक रिपोर्ट के लिए सटीक स्कोर की आवश्यकता है, तो पुराना तरीका थोड़ा अधिक सटीक हो सकता है।

यह क्यों मायने रखता है

सबसे महत्वपूर्ण बात सफलता को मापने के तरीके में बदलाव है। शोध पत्र तर्क देता है कि AI एजेंटों के लिए, सहमति लक्ष्य नहीं है; निष्ठा (faithfulness) लक्ष्य है। एक जज जो 90% समय सत्य के साथ सहमत होता है लेकिन उन 10% टूटे हुए एजेंटों को चूक जाता है जो एकदम सही दिखते हैं, वह बेकार है। एक जज जो उन टूटे हुए एजेंटों को पकड़ लेता है, भले ही वह अन्य चीजों में थोड़ा कम सटीक हो, उपयोग के लिए सुरक्षित है।

जज के नियमों को विफलता के वास्तविक, लेबल किए गए उदाहरणों के आधार पर स्थापित करके, लेखकों ने एक ऐसी प्रणाली बनाई है जो "गुडहार्ट्स लॉ" (Goodhart's Law) के जाल का विरोध करती है (जहाँ किसी मीट्रिक को अनुकूलित करने से मीट्रिक बेकार हो जाता है)। उन्होंने केवल जज को स्मार्ट नहीं बनाया; उन्होंने उसे अधिक ईमानदार बनाया। अंतिम फैसला? नया तरीका सहमत होने की तुलना में ठगना अधिक कठिन है, और हमें अपने AI एजेंटों पर भरोसा करने के लिए वास्तव में इसी की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →