← नवीनतम पेपर
💬 NLP

Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge

यह शोध पत्र MT-RL-Judge प्रस्तुत करता है, जो एक मल्टी-टास्क रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो विविध विजुअल कार्यों में जज के रूप में उपयोग किए जाने वाले मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की सामान्यीकरण (generalization), निरंतरता और मानवीय संरेखण (human alignment) को बढ़ाता है।

मूल लेखक: Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-गति वाली फैक्ट्री चला रहे हैं जो हर दिन लाखों अद्वितीय, कस्टम-मेड पेंटिंग बनाती है। इनमें से कुछ पेंटिंग मज़ेदार होनी चाहिए, कुछ डरावनी, कुछ सुंदर, और कुछ बच्चों के लिए सुरक्षित होनी चाहिए।

फैक्ट्री को सुचारू रूप से चलाने के लिए, आपको एक क्वालिटी कंट्रोल इंस्पेक्टर (गुणवत्ता नियंत्रण निरीक्षक) की आवश्यकता है। अतीत में, आपने हर पेंटिंग की जांच करने के लिए एक इंसान को काम पर रखा था। लेकिन इंसान थक जाते हैं, वे महंगे होते हैं, और वे एक घंटे में दस लाख पेंटिंग्स की जांच नहीं कर सकते।

इसलिए, आपने एक सुपर-इंटेलिजेंट रोबोट (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल) को निरीक्षण करने के लिए नियुक्त करने का निर्णय लिया। यह रोबक पेंटिंग्स को "देख" सकता है और उनके विवरण को "पढ़" सकता है। यही "MLLM-as-a-Judge" की अवधारणा है।

हालाँकि, शोध पत्र बताता है कि इन रोबोट्स को कैसे प्रशिक्षित किया जा रहा था, इसमें एक बड़ी समस्या है, और यह MT-RL-Judge नामक एक शानदार नया समाधान प्रदान करता है। यहाँ इसका सरल विवरण दिया गया है:

समस्या: "स्पेशलिस्ट" (विशेषज्ञ) बनाम "जनरलिस्ट" (सामान्यज्ञ)

पुराना तरीका (स्पेशलिस्ट):
कल्पना कीजिए कि आप हर काम के लिए एक अलग रोबोट काम पर रखते हैं:

  • रोबोट A को केवल यह जांचने के लिए प्रशिक्षित किया गया है कि क्या पेंटिंग सुरक्षित है (कोई हिंसा नहीं)।
  • रोबोट B को केवल यह जांचने के लिए प्रशिक्षित किया गया है कि क्या रंग पर्याप्त चमकीले हैं।
  • रोबोट C को केवल यह जांचने के लिए प्रशिक्षित किया गया है कि क्या ड्राइंग वास्तविक दिखती है।

समस्या:

  1. बहुत सारे रोबोट: आपको विशेषज्ञों की एक पूरी सेना को प्रबंधित, अपडेट और भुगतान करना पड़ता है। यह अव्यवस्थित और महंगा है।
  2. कमजोर दिमाग (Brittle Brains): यदि आप रोबोट A (सुरक्षा विशेषज्ञ) से यह जांचने के लिए कहते हैं कि क्या कोई ड्राइंग "वास्तविक" है, तो वह भ्रमित हो जाता है। यह एक टैक्स अकाउंटेंट से हार्ट सर्जरी करने के लिए कहने जैसा है। उन्होंने केवल उस विशिष्ट कार्य के नियमों को याद किया है जिसके लिए उन्हें प्रशिक्षित किया गया था और नियम थोड़े बदलने पर वे अनुकूलित नहीं हो पाते।
  3. याद करना बनाम समझना: ये रोबोट अक्सर उन सटीक प्रश्नों को याद कर लेते हैं जो उनसे प्रशिक्षण के दौरान पूछे गए थे। यदि आप प्रश्न की शब्दावली को थोड़ा भी बदल देते हैं, तो वे विफल हो जाते हैं क्योंकि उन्होंने वास्तव में "सुरक्षा" या "गुणवत्ता" की अवधारणा को नहीं समझा था।

समाधान: "मास्टर डिटेक्टिव" (MT-RL-Judge)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे मल्टी-टास्क रीइन्फोर्समेंट लर्निंग (MT-RL-Judge) कहा जाता है। इसे विशेषज्ञों की एक टीम के बजाय एक एकल मास्टर डिटेक्टिव (मुख्य जासूस) के रूप में प्रशिक्षित करने के रूप में सोचें।

यहाँ बताया गया है कि उन्होंने इस मास्टर डिटेक्टिव को कैसे प्रशिक्षित किया:

1. "मल्टी-टास्क" जिम

अलग-अलग तीन स्कूलों में भेजने के बजाय, उन्होंने रोबोट को एक विशाल जिम में डाला जहाँ उसे एक साथ सभी समस्याओं को हल करना है।

  • वह एक डरावनी छवि देखता है और निर्णय लेता है: "क्या यह सुरक्षित है?"
  • फिर, तुरंत बाद, वह एक धुंधली छवि देखता है और निर्णय लेता है: "क्या यह उच्च गुणवत्ता वाली है?"
  • फिर, वह एक अजीब ड्राइंग देखता है और निर्णय लेता है: "क्या यह तर्कसंगत है?"

इन सभी कार्यों को एक साथ करके, रोबोट निर्णय लेने के अंतर्निहित तर्क (underlying logic) को सीखता है। वह महसूस करता है कि "सुरक्षा," "गुणवत्ता," और "तर्क" सभी सोचने के जुड़े हुए तरीके हैं, न कि केवल अलग-अलग नियम।

2. "रीइन्फोर्समेंट लर्निंग" (पुरस्कार प्रणाली)

यही असली सफलता का मंत्र है। पुराने दिनों में, रोबोट को केवल सही और गलत उत्तरों के उदाहरण दिखाए जाते थे (जैसे एक छात्र पाठ्यपुस्तक की नकल करता है)। इसे सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) कहा जाता है। रोबोट बस पाठ्यपुस्तक को रट लेता था।

इस नए तरीके में, वे रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि रोबोट एक वीडियो गेम खेल रहा है। हर बार जब वह एक अच्छा निर्णय लेता है, तो उसे एक अंक मिलता है। हर बार जब वह गलती करता है, तो वह एक अंक खो देता है।
  • ट्विस्ट: रोबोट को केवल "सही" या "गलत" नहीं बताया जाता है। उसे उत्तर देने से पहले ज़ोर से सोचने (think out loud) के लिए मजबूर किया जाता है।
    • पुराना रोबोट: "उत्तर: सुरक्षित।" (उसने अनुमान लगाया)।
    • नया रोबोट: "सोच: मैं एक चाकू देख रहा हूँ, लेकिन यह एक खिलौना है। बैकग्राउंड एक पार्क है। इसलिए, यह सुरक्षित है। उत्तर: सुरक्षित।"

सिस्टम रोबोट को न केवल सही उत्तर के लिए, बल्कि एक अच्छी तर्क प्रक्रिया (reasoning process) के लिए भी पुरस्कृत करता है। यह रोबोट को केवल उत्तरों को रटने के बजाय खेल के नियमों को वास्तव में समझने के लिए मजबूर करता है।

यह एक बड़ी बात क्यों है?

शोध पत्र दिखाता है कि यह नया "मास्टर डिटेक्टिव" तीन कारणों से अद्भुत है:

  1. एक रोबोट सब कुछ करता है: आपको विशेषज्ञों की एक टीम की आवश्यकता नहीं है। एक एकीकृत मॉडल सुरक्षा, गुणवत्ता और तर्क संबंधी जांच को एक साथ संभाल सकता है। इससे पैसा बचता है और फैक्ट्री तेज़ी से चलती है।
  2. यह केवल शक्तिशाली नहीं, बल्कि स्मार्ट है: क्योंकि इसने "ज़ोर से सोचना" और निर्णय लेने के तर्क को समझना सीखा है, इसलिए प्रश्न बदलने पर यह भ्रमित नहीं होता है।
  3. "नई नौकरी" का परीक्षण: लेखकों ने रोबोट का परीक्षण एक पूरी तरह से नए प्रकार के प्रश्न पर किया जो उसने पहले कभी नहीं देखा था (एक छवि के बजाय दो छवियों की आपस में तुलना करना)।
    • पुराने स्पेशलिस्ट्स (पुराने तरीके से प्रशिक्षित) पूरी तरह विफल रहे। वे बहुत कठोर थे।
    • मास्टर डिटेक्टिव (MT-RL-Judge) तुरंत अनुकूलित हो गया। क्योंकि वह निर्णय लेने के सिद्धांतों को समझता था, वह बिना पुन: प्रशिक्षित हुए एक नए प्रारूप में उन्हें लागू करने में सक्षम था।

निचोड़

यह शोध पत्र तर्क देता है कि विशिष्ट कार्यों को रटने वाले लाखों विशेषीकृत, नाजुक रोबोट बनाने के बजाय, हमें एक एक मजबूत, सोचने वाला रोबोट बनाना चाहिए जो अभ्यास और पुरस्कारों के माध्यम से निर्णय लेने की कला सीखता है।

यह हमारे AI निरीक्षकों को अधिक विश्वसनीय, चलाने में सस्ता और वास्तविक दुनिया की अनिश्चित वास्तविकता को संभालने में सक्षम बनाता है। यह एक ऐसे रोबोट के बीच का अंतर है जो केवल जूता बाँधना जानता है और एक ऐसे रोबोट के बीच का अंतर है जो चीज़ों को "बांधने" की अवधारणा को समझता है और जूता, बो (bow), या पैराशूट की गांठ बाँध सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →