← नवीनतम पेपर
🤖 AI

ComplexConstraints and Beyond: Expert Rubrics for RLVR

यह शोधपत्र ComplexConstraints को प्रस्तुत करता है, जो रूब्रिक-आधारित मूल्यांकन के लिए एक विशेषज्ञ-क्यूरेटेड डेटासेट और फ्रेमवर्क है, जो यह प्रदर्शित करता है कि उच्च-गुणवत्ता वाले, परमाणु (atomic) रूब्रिक्स न केवल जटिल LLM व्यवहारों का बेहतर मूल्यांकन प्रदान करते हैं, बल्कि अत्यधिक प्रभावी प्रशिक्षण संकेत के रूप में भी कार्य करते हैं जो विभिन्न आकार के मॉडलों में निर्देश-अनुपालन और एजेंटिक कार्य प्रदर्शन को महत्वपूर्ण रूप से बढ़ाते हैं।

मूल लेखक: Sushant Mehta, Liudas Panavas, Edwin Chen

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sushant Mehta, Liudas Panavas, Edwin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक अर्थ निकालने वाले (literal-minded) रोबोट को निर्देशों का पालन करना सिखा रहे हैं।

लंबे समय तक, हमने इन रोबोटों का परीक्षण सरल "चेकलिस्ट" परीक्षाओं के साथ किया। उदाहरण के लिए, हम कहते, "एक ऐसी कहानी लिखें जिसमें 'e' अक्षर का उपयोग न किया गया हो।" यदि रोबोट ने ऐसा किया, तो उसे पास होने वाला ग्रेड मिल जाता। लेकिन रोबोट 'e' अक्षर से बचते हुए पूरी तरह से निरर्थक (nonsense) बातें लिख सकता था, और फिर भी हम इसे सफलता मान लेते। यह एक छात्र को केवल इस आधार पर ग्रेड देने जैसा है कि क्या उसने लाल शर्ट पहनी थी, जबकि इस बात को नजरअंदाज कर दिया गया कि क्या उसने वास्तव में पाठ को समझा भी था या नहीं।

यह शोध पत्र तर्क देता है कि परीक्षण करने का यह पुराना तरीका टूटा हुआ है। इसके बजाय, लेखक एक नया तरीका प्रस्तावित करते हैं: एक्सपर्ट रूब्रिक्स (Expert Rubrics)। इसे एक साधारण पास/फेल चेकलिस्ट के बजाय मानव विशेषज्ञों द्वारा लिखे गए विस्तृत, सूक्ष्म स्कोरकार्ड के रूप में समझें।

यहाँ उनके दृष्टिकोण का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "लेटर 'E'" का जाल

वर्तमान परीक्षण (जैसे प्रसिद्ध IFEval) को "गेम" करना बहुत आसान है। एक रोबोट यांत्रिक रूप से एक नियम का पालन कर सकता है बिना वास्तव में यह समझे कि मानव वास्तव में क्या चाहता था। यह एक शेफ की तरह है जो रेसिपी का पूरी तरह से पालन करता है लेकिन ओवन चालू करना भूल जाता है; कदम सही थे, लेकिन परिणाम एक विफलता थी।

2. समाधान: "मास्टर शेफ का स्कोरकार्ड"

लेखकों ने COMPLEXCONSTRAINTS नामक एक नया डेटासेट बनाया। साधारण हाँ/ना जाँच के बजाय, उन्होंने हर कार्य के लिए विस्तृत "स्कोरकार्ड" लिखने के लिए मानव विशेषज्ञों को काम पर रखा।

  • उपमा: कल्पना कीजिए कि एक कुकिंग प्रतियोगिता चल रही है। केवल यह जाँचने के बजाय कि "क्या आपने नमक का उपयोग किया?", जज के स्कोरकार्ड में 10-40 विशिष्ट बिंदु हैं: "क्या सूप सही ढंग से सीजन किया गया है?", "क्या बनावट चिकनी है?", "क्या लहसुन जलने से बचाया गया है?", "क्या आपने सही प्रकार के पैन का उपयोग किया है?"
  • सावधानी: ये स्कोरकार्ड इंसानों द्वारा इरादे (intent) को पकड़ने के लिए लिखे गए हैं (कि ग्राहक वास्तव में क्या चाहता था), न कि केवल शाब्दिक शब्दों के लिए।

3. अच्छे स्कोरकार्ड लिखने के पाँच नियम

लेखक इन स्कोरकार्ड को प्रभावी बनाने के लिए पाँच नियम बताते हैं:

  1. अधिकतम व्यवहार्य परमाणुता (Maximum Viable Atomicity): चीजों को बहुत अधिक छोटे टुकड़ों में न तोड़ें। यदि आप "C7 कॉर्ड" मांगते हैं, तो यह जांचना कि रोबोट ने "C" नोट और "E" नोट को अलग-अलग सही पकड़ा या नहीं, ठीक है, लेकिन उन्हें पूरी तरह से असंबंधित न मानें यदि उन्हें सही ध्वनि बनाने के लिए एक साथ काम करने की आवश्यकता है।
  2. इरादा-जागरूक डिज़ाइन (Intent-Aware Design): स्कोरकार्ड को क्यों की समझ होनी चाहिए। यदि कोई उपयोगकर्ता कहता है, "मेरी स्पेनिश सुधारने में मदद करें," लेकिन उल्लेख करता है कि वह पहले से ही अर्थशास्त्र के लेख पढ़ रहा है, तो स्कोरकार्ड को बुनियादी वर्णमाला के फ्लैशकार्ड की सूची के लिए पुरस्कृत नहीं करना चाहिए। इसे उन्नत, अर्थशास्त्र-केंद्रित पाठों के लिए पुरस्कृत करना चाहिए।
  3. तीन-श्रेणी प्रणाली (The Three-Category System): स्कोरकार्ड केवल समान वस्तुओं की सूची नहीं है। इसमें तीन प्रकार हैं:
    • प्राथमिक इरादा (Primary Intent): वे चीजें जो अनिवार्य हैं (जैसे, "सूप गर्म होना चाहिए")।
    • एक्स्ट्रा क्रेडिट (Extra Credit): वे अच्छी चीजें जो इसे बेहतरीन बनाती हैं (जैसे, "सूप को ताजी जड़ी-बूटियों से सजाया गया है")।
    • बचा ली गई गोलियां (Dodged Bullets): वे चीजें जिनसे रोबोट को बचना चाहिए (जैसे, "यदि ग्राहक धातु से एलर्जी वाला है, तो धातु के चम्मच के साथ सूप परोसें नहीं")।
  4. कैलिब्रेशन (Calibration): स्कोरकार्ड का परीक्षण एक AI "जज" के विरुद्ध किया जाता है ताकि यह सुनिश्चित हो सके कि शब्दावली भ्रमित करने वाली नहीं है। यदि AI "alliteration" शब्द से भ्रमित हो जाता है, तो मानव नियम को अधिक स्पष्ट बनाने के लिए उसे फिर से लिखता है।
  5. वास्तविक दुनिया की जटिलता (Real-World Complexity): कार्य वास्तविक नौकरियों (जैसे ग्राहक सेवा टिकट प्रबंधित करना) पर आधारित हैं, न कि काल्पनिक पहेलियों पर।

4. जादू: रोबोट को सिखाने के लिए स्कोरकार्ड का उपयोग करना

यह सबसे रोमांचक हिस्सा है। आमतौर पर, हम इन स्कोरकार्ड का उपयोग केवल रोबोट को ग्रेड देने के लिए करते हैं। लेखकों ने पाया कि ये स्कोरकार्ड बेहतरीन शिक्षण उपकरण (teaching tools) भी हैं।

  • उपमा: कल्पना कीजिए कि एक कोच खिलाड़ी को फीडबैक दे रहा है।
    • पुराना तरीका: "तुम खेल हार गए। फिर से कोशिश करो।" (खिलाड़ी को पता ही नहीं चलता कि क्या सुधारना है)।
    • नया तरीका: "तुमने 3 बार गेंद मिस की क्योंकि तुमने नीचे देखा। तुमने गलत प्ले चलाया। लेकिन तुमने अपने फुटवर्क पर बहुत अच्छा काम किया।" (खिलाड़ी को पता है कि उसे ठीक से क्या सुधारना है)।

इन विस्तृत स्कोरकार्डों को प्रशिक्षण के दौरान "पुरस्कार" (rewards) के रूप में उपयोग करके (जिसे Reinforcement Learning कहा जाता है), रोबोट बहुत तेज़ी से सीखता है।

  • परिणाम: उन्होंने केवल 1,000 विशेषज्ञ-स्कोर वाले उदाहरणों पर एक छोटे रोबोट मॉडल को प्रशिक्षित किया।
    • छोटे रोबोट में निर्देश पालन (instruction following) में 15.5% का सुधार हुआ।
    • एक विशाल रोबोट में 12.2% का सुधार हुआ।
    • महत्वपूर्ण रूप से, रोबोट उन कार्यों में बेहतर हुआ जो उसने पहले कभी नहीं देखे थे, जैसे टूल्स का उपयोग करना या कस्टमर सर्विस चैट संभालना, क्योंकि उसने केवल उत्तरों को रटने के बजाय जटिल बाधाओं (constraints) का पालन करने के कौशल को सीखा।

5. यह क्यों मायने रखता है

शोध पत्र का दावा है कि एक्सपर्ट रूब्रिक्स एक साथ दो समस्याओं का समाधान करते हैं:

  1. बेहतर मापन: वे हमें एक स्मार्ट रोबोट और एक जीनियस रोबोट के बीच का वास्तविक अंतर बताते हैं, जबकि पुराने परीक्षण उन दोनों को एक जैसा दिखाते थे।
  2. बेहतर प्रशिक्षण: वे एक उच्च-गुणवत्ता वाले शिक्षक के रूप में कार्य करते हैं, जिससे रोबोट कम डेटा के साथ जटिल व्यवहार सीख पाते हैं।

संक्षेप में, लेखक कहते हैं कि रोबोटों को सरल चेकलिस्ट के साथ टेस्ट करना बंद करें। उन्हें ग्रेड देने और उन्हें वास्तव में सहायक बनने के लिए सिखाने के लिए विस्तृत, मानव-लिखित स्कोरकार्ड का उपयोग करना शुरू करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →