← नवीनतम पेपर
🤖 AI

Users as Annotators: LLM Preference Learning from Comparison Mode

यह शोध पत्र एक अपेक्षा-अधिकतमीकरण (expectation-maximization) एल्गोरिदम पेश करके LLM तुलना मोड से प्राप्त उपयोगकर्ता-जनित युग्म-वरीयता डेटा का लाभ उठाने के लिए एक विधि प्रस्तावित करता है, जो विषम मॉडल प्रतिक्रियाओं के माध्यम से अंतर्निहित उपयोगकर्ता गुणवत्ता कारकों का अनुमान लगाता है, जिससे प्रभावी डेटा फ़िल्टरिंग और बेहतर LLM संरेखण सक्षम होता है।

मूल लेखक: Zhongze Cai, Xiaocheng Li

प्रकाशित 2026-05-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhongze Cai, Xiaocheng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) को यह सिखाने की कोशिश कर रहे हैं कि मददगार और विनम्र कैसे बना जाए। ऐसा करने के लिए, आपको उसे "अच्छे" उत्तरों बनाम "बुरे" उत्तरों के उदाहरण दिखाने होंगे। आमतौर पर, कंपनियाँ हर एक उत्तर को पढ़ने और यह वोट देने के लिए कि कौन सा बेहतर है, पेशेवर मानव संपादकों की एक टीम को काम पर रखती हैं। यह महंगा और धीमा है।

यह शोध पत्र एक चतुर शॉर्टकट का प्रस्ताव देता है: रोबोट के नियमित उपयोगकर्ताओं को ही वोट करने दें।

इसे एक रेस्टोरेंट की तरह समझें। हर व्यंजन को चखने के लिए फूड क्रिटिक (खाद्य समीक्षक) को काम पर रखने के बजाय, रेस्टोरेंट ग्राहकों से पूछता है कि वे किन दो व्यंजनों को अधिक पसंद करते हैं। इसका फायदा क्या है? आपको मुफ्त में हजारों वोट मिलते हैं। इसका नुकसान क्या है? कुछ ग्राहक भूखे हो सकते हैं, विचलित हो सकते हैं, या बिना वास्तव में चखे ही बस रैंडम तरीके से कोई भी विकल्प चुन सकते हैं। ये "शोर भरे" (noisy) वोट शेफ को भ्रमित कर सकते हैं।

यहाँ लेखक "विचलित ग्राहकों" की समस्या को हल करने के लिए एक सांख्यिकीय जादू (statistical magic trick) का उपयोग करते हैं।

मुख्य विचार: "असममित" (Asymmetric) परीक्षण

एक सामान्य वोटिंग सिस्टम में, आप उपयोगकर्ता को एक ही रोबोट द्वारा बनाए गए दो उत्तर दिखा सकते हैं। यदि रोबोट अच्छा है, तो दोनों उत्तर बेहतरीन हो सकते हैं, जिससे यह बताना मुश्किल हो जाता है कि उपयोगकर्ता ध्यान दे रहा है या नहीं।

लेखकों का गुप्त मंत्र यह है कि उपयोगकर्ता को दो अलग-अलग रोबोटों (या एक ही रोबोट के दो अलग-अलग संस्करणों) द्वारा बनाए गए दो उत्तर दिखाए जाएं।

  • रोबोट A "स्टार शेफ" (बहुत बुद्धिमान) है।
  • रोबोट B "नौसिखिया शेफ" (कम बुद्धिमान) है।

चूंकि रोबोट A वस्तुनिष्ठ रूप से बेहतर है, इसलिए एक ध्यान देने वाला उपयोगकर्ता लगभग हमेशा रोबोट A को ही चुनेगा। एक विचलित उपयोगकर्ता (जो केवल अनुमान लगा रहा है) रोबोट A या रोबोट B को 50/50 के अनुपात में चुनेगा, जैसे सिक्का उछालना।

जासूसी कार्य: "सिक्का उछालने वालों" (Coin Flippers) को खोजना

शोध पत्र एक गणितीय जासूसी प्रणाली (जिसे एक्सपेक्टेशन-मैक्सिमाइजेशन एल्गोरिदम कहा जाता है) पेश करता है जो यह पता लगाने के लिए कि कौन कौन है, काम करती है।

  1. परिकल्पना (Hypothesis): सिस्टम यह मान लेता है कि प्रत्येक उपयोगकर्ता का एक छिपा हुआ "अटेंशन स्कोर" (ध्यान देने का स्कोर) होता है।

    • स्कोर 1.0: उपयोगकर्ता एक अत्यंत ध्यान देने वाला विशेषज्ञ है जो हमेशा बेहतर रोबोट को चुनता है।
    • स्कोर 0.0: उपयोगकर्ता पूरी तरह से सिक्का उछालने वाला है जो रैंडम चुनाव करता है।
    • स्कोर 0.5: उपयोगकर्ता इनके बीच कहीं है।
  2. जांच: सिस्टम उपयोगकर्ता के इतिहास को देखता है।

    • यूजर X ने 95% बार स्टार शेफ को चुना। सिस्टम कहता है, "आह, यूजर X ध्यान दे रहा है! इसके वोट सोने के समान हैं।"
    • यूजर Y ने 50% बार स्टार शेफ को चुना। सिस्टम कहता है, "यूजर Y केवल अनुमान लगा रहा है। इसके वोट शोर (noise) हैं।"
  3. सफाई (Cleanup): एक बार जब सिस्टम "सिक्का उछालने वालों" की पहचान कर लेता है, तो वह उनके वोटों को हटा देता है। यह केवल उन उपयोगकर्ताओं के वोटों को रखता है जो "ध्यान दे रहे हैं" ताकि रोबोट को प्रशिक्षित किया जा सके।

परिणाम: एक स्वच्छ रसोई (A Cleaner Kitchen)

लेखकों ने इस विचार का वास्तविक डेटा के साथ परीक्षण किया। उन्होंने एक परिदृश्य का अनुकरण किया जहाँ कुछ उपयोगकर्ता विशेषज्ञ थे और कुछ विचलित थे।

  • फिल्टरिंग के बिना: जब उन्होंने रोबोट को प्रशिक्षित करने के लिए सभी वोटों (सिक्का उछालने वालों सहित) का उपयोग किया, तो रोबोट ने कुछ बुरी आदतें सीख लीं।
  • फिल्टरिंग के साथ: जब उन्होंने "डिटेक्टिव" का उपयोग करके सिक्का उछालने वालों को हटाया और केवल ध्यान देने वाले उपयोगकर्ताओं पर प्रशिक्षण दिया, तो रोबोट काफी बेहतर हो गया। इसने कम डेटा का उपयोग करने के बावजूद तेजी से सीखा और कम गलतियाँ कीं।

यह क्यों महत्वपूर्ण है

यह शोध पत्र केवल यह नहीं कहता कि "उपयोगकर्ता डेटा का उपयोग करें।" यह एक गणितीय सुरक्षा जाल (mathematical safety net) प्रदान करता है। यह सिद्ध करता है कि भले ही आप नहीं जानते कि कौन ध्यान दे रहा है, आप यह गणितीय रूप से अनुमान लगा सकते हैं कि वे तब कैसे वोट देते हैं जब विकल्प स्पष्ट रूप से भिन्न होते हैं।

संक्षेप में: यह शोध पत्र दिखाता है कि हम लाखों साधारण उपयोगकर्ताओं को एक उच्च-गुणवत्ता वाली प्रशिक्षण टीम में बदल सकते हैं, बशर्ते हमारे पास उन्हें फिल्टर करने का एक स्मार्ट तरीका हो जो केवल अनुमान लगा रहे हैं। यह एक अराजक भीड़ को विशेषज्ञ जजों के पैनल में बदलने जैसा है, बस उनसे एक मास्टर शेफ और एक नौसिखिए के बीच चयन करने के लिए कहकर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →