← नवीनतम पेपर
🤖 AI

AdaRubric: Task-Adaptive Rubrics for LLM Agent Evaluation

AdaRubric एक कार्य-अनुकूलित (task-adaptive) ढांचे को पेश करता है जो गतिशील रूप से विशिष्ट मूल्यांकन रूब्रिक्स (rubrics) उत्पन्न करता है और स्थिर LLM-as-Judge मूल्यांकन की सीमाओं को दूर करने के लिए एक नवीन DimensionAwareFilter का उपयोग करता है, जिससे मानव निर्णयों के साथ काफी उच्च सहसंबंध प्राप्त होता है और बिना किसी मैनुअल रूब्रिक इंजीनियरिंग के विविध बेंचमार्क पर एजेंट के प्रदर्शन में सुधार होता है।

मूल लेखक: Liang Ding

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liang Ding

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप जटिल काम करने के लिए AI सहायकों (AI assistants) की एक टीम को काम पर रख रहे हैं। कुछ को टूटा हुआ कोड ठीक करने की ज़रूरत है, कुछ को किसी वेबसाइट पर उड़ान बुक करने की, और कुछ को डेटाबेस व्यवस्थित करने की।

अतीत में, जब हमने यह जांचने की कोशिश की कि इन AI सहायकों ने अपना काम कितनी अच्छी तरह किया, तो हम एक "एक ही आकार का रिपोर्ट कार्ड" (one-size-fits-all report card) इस्तेमाल करते थे। हम एक अति-बुद्धिमान AI (जिसे "जज" कहा जाता है) से हर कार्य को बिल्कुल एक ही तीन प्रश्नों का उपयोग करके ग्रेड देने के लिए कहते थे:

  1. क्या यह सहायक था?
  2. क्या यह प्रवाहपूर्ण (सुनने में अच्छा) था?
  3. क्या यह सुरक्षित था?

समस्या: यह एक सर्जन और एक शेफ को एक ही टेस्ट से ग्रेड देने जैसा है।

  • यदि एक सर्जन एक सटीक कट लगाता है लेकिन बोलते समय थोड़ा हकलाता है, तो "एक ही आकार का" जज उसे कम ग्रेड दे सकता है क्योंकि वह "प्रवाहपूर्ण" नहीं था।
  • यदि एक शेफ स्टेक जला देता है लेकिन उसके बारे में एक सुंदर कविता लिखता है, तो जज उसे उच्च स्कोर दे सकता है क्योंकि कविता "सहायक" और "प्रवाहपूर्ण" थी।

AI एजेंट इसलिए विफल हो रहे थे क्योंकि ग्रेडिंग सिस्टम को इस बात की परवाह नहीं थी कि उस विशिष्ट कार्य के लिए वास्तव में क्या महत्वपूर्ण है।

पेश है: ADARUBRIC (द "कैमेलियन" ग्रेडर)

यह पेपर ADARUBRIC को पेश करता है, जो एक नया सिस्टम है जो एक गिरगिट (chameleon) की तरह काम करता है। एक निश्चित रिपोर्ट कार्ड के बजाय, यह विशिष्ट जॉब डिस्क्रिप्शन को पढ़ता है और तुरंत एक नया, कस्टम ग्रेडिंग रूब्रिक (grading rubric) बनाता है।

यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. कस्टम मेनू (अनुकूली रूब्रिक जनरेशन - Adaptive Rubric Generation)

AI के काम शुरू करने से पहले, ADARUBRIC जॉब डिस्क्रिप्शन को पढ़ता है और खुद से पूछता है: "यहाँ सफलता के लिए वास्तव में क्या मायने रखता है?"

  • एक कोड डीबगर के लिए: यह "क्या कोड चला?", "क्या इसने त्रुटियों को पकड़ा?", और "क्या यह कुशल था?" जैसे आयामों (dimensions) के साथ एक मेनू बनाता है।
  • एक वेब ब्राउज़र के लिए: यह "क्या इसने सही लिंक खोजा?", "क्या इसने सही बटन पर क्लिक किया?", और "क्या इसने परिणाम का सारांश दिया?" के साथ एक मेनू बनाता है।

यह एक ऐसे रेस्टोरेंट की तरह है जो केवल "भोजन" परोसता नहीं है। यदि आप सुशी ऑर्डर करते हैं, तो वह एक ताज़ा चाकू और वसाबी लेकर आता है। यदि आप पिज्जा ऑर्डर करते हैं, तो वह एक कटर और चीज़ लेकर आता है। यह कार्यों के अनुसार अपने उपकरणों को अनुकूलित करता है।

2. स्टेप-बाय-स्टेप स्कोरकार्ड (कॉन्फिडेंस-वेटेड इवैल्यूएशन - Confidence-Weighted Evaluation)

एक बार जब AI एजेंट काम करने की कोशिश करता है, तो ADARUBRIC केवल एक अंतिम "पास" या "फेल" नहीं देता। यह एजेंट की हर चाल पर नज़र रखता है।

  • यह हर कदम के लिए एक स्कोर देता है (1 से 5 स्टार)।
  • "कॉन्फिडेंस" वाला तरीका: कभी-कभी AI का एक कदम किसी विशिष्ट कार्य के लिए महत्वपूर्ण नहीं होता है। उदाहरण के लिए, यदि AI केवल "सोच" (reasoning) रहा है और उसने अभी तक "टूल एक्यूरेसी" (Tool Accuracy) आयाम को नहीं छुआ है, तो ADARUBUBRIC कहता है, "मैं इस कदम को सटीकता के लिए कैसे ग्रेड दूँ, इस बारे में 100% निश्चित नहीं हूँ, इसलिए मैं इसे कम वेटेज दूँगा।"
  • यह एक अजीब कदम को पूरे ग्रेड को खराब करने से, या एक भाग्यशाली अनुमान को बड़ी विफलता को छिपाने से रोकता है।

3. "छिपने का कोई रास्ता नहीं" फ़िल्टर (डायमेंशन-अवेयर फ़िल्टर - Dimension-Aware Filter)

यही इस पेपर का असली मंत्र (secret sauce) है। कल्पना कीजिए कि एक AI एजेंट जो लिंक खोजने में परफेक्ट है लेकिन पेज पर लिखे टेक्स्ट को पढ़ने में बहुत बुरा है।

  • एक सामान्य ग्रेडर कह सकता है: "वाह, उन्होंने 10 लिंक खोज लिए! वह 5 में से 4 है!" (लिंक्स पर उच्च स्कोर, पढ़ने की विफलता को छिपा देता है)।
  • ADARUBRIC का फ़िल्टर कहता है: "रुको। यदि वे 'रीडिंग' (पढ़ने) के आयाम में विफल रहे, तो वे पूरे कार्य में विफल माने जाएंगे, चाहे वे लिंक खोजने में कितने भी अच्छे क्यों न रहे हों।"
  • यह सुनिश्चित करता है कि कोई भी एक कमजोरी, एक अकेली ताकत द्वारा छिपाई न जा सके।

यह क्यों मायने रखता है? (परिणाम)

शोधकर्ताओं ने इसे तीन बड़े चुनौतियों पर परखा:

  1. वेब ऑटोमेशन (वेब ब्राउज़ करना)।
  2. ToolBench (डेटा प्राप्त करने के लिए API का उपयोग करना)।
  3. AgentBench (कोडिंग और OS कार्य)।

परिणाम जादू की तरह थे:

  • बेहतर ग्रेडिंग: जब मनुष्यों ने ग्रेड की तुलना की, तो ADARUBRIC ने मानव विशेषज्ञों के साथ 79% बार मिलान किया, जबकि पुराने "एक ही आकार के" तरीकों ने केवल लगभग 64% बार मिलान किया।
  • बेहतर ट्रेनिंग: जब उन्होंने AI एजेंटों को प्रशिक्षित करने के लिए ADARUBRIC के ग्रेड का उपयोग किया (उन्हें सिखाने के लिए कि "अच्छा" क्या दिखता है), तो एजेंट अपने कामों में काफी बेहतर हो गए।
    • वेब पर, उनमें 6.8% का सुधार हुआ।
    • ToolBench पर, उनमें 8.5% का सुधार हुआ।
  • सामान्यीकरण (Generalization): यहाँ तक कि जब उन्होंने इसे एक पूरी तरह से नए कार्य पर आज़माया जिसे उन्होंने पहले नहीं देखा था (GitHub कोड बग्स को ठीक करना), तब भी यह बिना किसी मैनुअल ट्यूनिंग के बहुत अच्छा काम करता रहा।

बड़ा चित्र - एक सादृश्य (The Big Picture Analogy)

एक AI एजेंट को प्रशिक्षित करना एक रेस कार ड्राइवर को प्रशिक्षित करने जैसा है।

  • पुराना तरीका: आप उन्हें एक सामान्य टेस्ट देते हैं: "क्या आपने तेज़ गाड़ी चलाई? क्या आप कूल दिखे?" आप इस बात को नज़रअंदाज़ कर देते हैं कि क्या उन्होंने वास्तव में अपनी लेन में रहे या ब्रेक सही समय पर लगाया।
  • ADARUBRIC तरीका: आप उनके विशिष्ट ट्रैक को देखते हैं। क्या यह एक बरसाती ट्रैक है? तो आप उन्हें "ट्रैक्शन कंट्रोल" पर ग्रेड देते हैं। क्या यह एक घुमावदार पहाड़ी रास्ता है? तो आप उन्हें "कॉर्नरिंग" पर ग्रेड देते हैं। आप हर मोड़ को देखते हैं, सटीक फीडबैक देते हैं कि कहाँ गलत हुआ, और उन्हें बताते हैं, "आप एक अच्छे ड्राइवर नहीं बन सकते यदि आप तेज़ हैं लेकिन आप बार-बार गार्डरेल से टकराते रहते हैं।"

संक्षेप में: ADARUBRIC AI एजेंटों को एक सामान्य पैमाने से आंकना बंद करता है और हर काम के लिए एक कस्टम टेप मेजर (custom tape measure) का उपयोग करना शुरू करता है, जिससे AI अधिक स्मार्ट, सुरक्षित और बहुत अधिक विश्वसनीय बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →