← नवीनतम पेपर
📈 economics

The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice

यह शोध पत्र एक तीन-स्रोत ढांचे का प्रस्ताव और मूल्यांकन करता है जो बड़े पैमाने पर अवलोकन संबंधी भाषा मॉडल लॉग्स में निहित चयन पूर्वाग्रह (selection bias) को पहचानने और सुधारने के लिए एक छोटे यादृच्छिक प्रयोग को एक ऑफलाइन सिम्युलेटर के साथ जोड़ता है, जिससे मॉडल प्रदर्शन की वैध कारण तुलना (causal comparisons) सक्षम होती है।

मूल लेखक: Jikai Jin, Vasilis Syrgkanis

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jikai Jin, Vasilis Syrgkanis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि तीन शेफ में से कौन सबसे अच्छा सूप बनाता है। आपके पास एक व्यस्त रेस्टोरेंट के ग्राहकों के रिव्यूज की एक विशाल नोटबुक है (ऑब्जर्वेशनल लॉग, या OBS)। लेकिन, इसमें एक पेंच है: ग्राहकों ने शेफ को रैंडम तरीके से नहीं चुना। उन्होंने उस शेफ को चुना जिसे वे अपने मूड, भूख या पिछले अनुभवों के आधार पर सबसे अच्छा समझते थे।

यदि आप केवल नोटबुक पढ़ेंगे, तो आपको लग सकता है कि शेफ A सबसे अच्छा है क्योंकि जो लोग शेफ A से ऑर्डर कर रहे थे, वे पहले से ही अच्छे मूड में थे और सब कुछ पसंद कर रहे थे। लेकिन हो सकता है कि शेफ B वास्तव में बेहतर हो; बस उन्होंने चिड़चिड़े ग्राहकों को खाना परोसा जो सूप की सराहना करने के लिए बहुत थके हुए थे। यह कन्फाउंडिंग (Confounding) है: लोगों के शेफ चुनने का कारण खाने के प्रति उनके लगाव के साथ मिल गया है।

इस समस्या को हल करने के लिए, आप एक छोटा, सख्त प्रयोग चला सकते हैं जहाँ आप ग्राहकों को रैंडम तरीके से शेफ चुनने के लिए मजबूर करते हैं (रैंडमाइज्ड एक्सपेरिमेंट, या EXP)। यह आपको एक निष्पक्ष, निष्पक्ष टेस्ट देता है। लेकिन यह प्रयोग चलाना महंगा और ग्राहकों के लिए कष्टदायक है, इसलिए आप इसे केवल कुछ ही बार कर सकते हैं।

यह पेपर एक चतुर तीन-भाग वाली रणनीति का प्रस्ताव करता है, जो एक "किचन सिम्युलेटर" को सेतु (ब्रिज) के रूप में उपयोग करती है।

तीन सामग्रियां (The Three Ingredients)

  1. बड़ी नोटबुक (OBS): वास्तविक दुनिया के रिव्यूज का एक बड़ा ढेर। यह पक्षपाती (biased) है, लेकिन इसमें बहुत सारा डेटा है।
  2. छोटा निष्पक्ष टेस्ट (EXP): रिव्यूज का एक छोटा ढेर जहाँ ग्राहकों को रैंडमली चुनने के लिए मजबूर किया गया था। यह निष्पक्ष है, लेकिन यह बहुत छोटा है।
  3. किचन सिम्युलेटर (SIM): एक रोबोट जो सूप को फिर से बना सकता है। यदि आप इसे बताते हैं, "शेफ A ने इस विशिष्ट ग्राहक के लिए यह सूप बनाया," तो रोबोट तुरंत दिखा सकता है कि शेफ A का सूप कैसा होता, भले ही उस ग्राहक ने वास्तव में ऑर्डर न किया हो।

बड़ी खोज: "जादुई ट्रिक" (The Big Discovery: The "Magic Trick")

पेपर का मुख्य निष्कर्ष एक गणितीय प्रमाण (थ्योरम 1) है जो कहता है: आपको यह पता लगाने के लिए कि वास्तव में कौन सा शेफ सबसे अच्छा है, बड़ी नोटबुक की आवश्यकता नहीं है।

यहाँ जादुई ट्रिक है:

  • सिम्युलेटर आपको दिखा सकता है कि प्रत्येक शेफ ने किसी भी ग्राहक के लिए क्या पकाया होता।
  • छोटा निष्पक्ष टेस्ट आपको बताता है कि उन कुछ रैंडम मामलों में सूप कितना अच्छा था।

इन दोनों को मिलाकर, आप हर शेफ के वास्तविक कौशल की गणितीय गणना कर सकते हैं। बड़ी नोटबुक (OBS) यह साबित करने के लिए आवश्यक नहीं है कि कौन बेहतर है; इसका उपयोग बाद में आपके अनुमान को अधिक सटीक बनाने (शोर/नॉइज़ को कम करने) के लिए किया जाता है।

इसे ऐसे समझें: सिम्युलेटर और छोटा निष्पक्ष टेस्ट आपको सच्चाई देते हैं। बड़ी नोटबुक केवल एक आवर्धक लेंस (magnifying glass) है जो आपको उस सच्चाई को अधिक स्पष्ट रूप से देखने में मदद करती है, लेकिन यह सच्चाई खुद पैदा नहीं करती।

सामग्रियों को मिलाने के छह तरीके

एक बार जब आप जान लेते हैं कि सच्चाई को प्राप्त किया जा सकता है, तो पेपर पूछता है: "हम बड़े नोटबुक का उपयोग बिना उसके पक्षपात (bias) के धोखे में आए, मदद करने के लिए कैसे करें?" उन्होंने डेटा को मिलाने के लिए छह अलग-अलग "रेसिपी" (एस्टिमेटर्स) का परीक्षण किया:

  1. शुद्ध प्रयोगकर्ता (EXP-Only): बड़ी नोटबुक को पूरी तरह से अनदेखा करता है। केवल छोटे निष्पक्ष टेस्ट का उपयोग करता है।
    • फायदे: पूरी तरह से निष्पक्ष।
    • नुकसान: यदि निष्पक्ष टेस्ट बहुत छोटा है, तो परिणाम बहुत अस्थिर (high variance) होते हैं।
  2. नोटबुक रीडर (OBS-Only): निष्पक्ष टेस्ट को अनदेखा करता है और बस बड़ी नोटबुक पढ़ता है।
    • फायदे: बहुत स्थिर संख्याएँ।
    • नुकसान: पक्षपात के कारण पूरी तरह से गलत (कम वेरिएंस, उच्च बायस)।
  3. अनुवादक (Representation-EXP): ग्राहकों को क्या पसंद है इसकी एक "भाषा" सीखने के लिए बड़ी नोटबुक का उपयोग करता है, फिर उस भाषा में वास्तविक स्कोर सीखने के लिए छोटे निष्पक्ष टेस्ट का उपयोग करता है।
    • फायदे: अच्छा है यदि नोटबुक की "भाषा" महत्वपूर्ण विवरणों को पकड़ लेती है।
    • नुकसान: विफल हो जाता है यदि नोटबुक महत्वपूर्ण विवरणों को छोड़ देती है।
  4. ग्राउंडेड करेक्टर (Grounded): नोटबुक रीडर के उत्तर से शुरू होता है, फिर गलतियों को "ठीक" करने के लिए छोटे निष्पक्ष टेस्ट का उपयोग करता है।
    • फायदे: बहुत अच्छा है यदि नोटबुक ज्यादातर सही है लेकिन इसमें एक छोटी व्यवस्थित त्रुटि (systematic error) है।
  5. मिक्सर (CVCI): नोटबुक और निष्पक्ष टेस्ट को मिलाता है, और छोटे निष्पक्ष टेस्ट के आधार पर मिश्रण को समायोजित करता है कि कौन सा संयोजन सबसे अच्छा काम करता है।
    • फायदे: अक्सर सबसे संतुलित दृष्टिकोण।
  6. रेसिड्यूअल मिक्सर (CVCI-Residual): मिक्सर के समान, लेकिन पहले नोटबुक का उपयोग करके समस्या के "आसान" हिस्से को हटा देता है, फिर "कठिन" बचे हुए हिस्सों को ठीक करने के लिए निष्पक्ष टेस्ट का उपयोग करता है।

प्रयोग क्या दिखाते हैं

लेखकों ने दो वास्तविक दुनिया के कार्यों पर इन रेसिपी का परीक्षण किया: समाचार लेखों का सारांश बनाना (Summarizing News Articles) और कंप्यूटर कोड को ठीक करना (Fixing Computer Code)

  • कोई "एक आकार सभी के लिए उपयुक्त नहीं" (No "One Size Fits All"): कोई एक विजेता नहीं है। कौन सी रेसिपी सबसे अच्छा काम करती है यह दो चीजों पर निर्भर करता है:
    1. आपके पास कितना डेटा है? यदि आपके पास बहुत कम निष्पक्ष टेस्ट डेटा है, तो आपको नोटबुक पर बहुत अधिक निर्भर करने की आवश्यकता है (लेकिन सावधानी से)। यदि आपके पास बहुत अधिक निष्पक्ष टेस्ट डेटा है, तो आप नोटबुक के पक्षपात को आसानी से अनदेखा कर सकते हैं।
    2. आप क्या माप रहे हैं?
      • सारांश (Summarization) कार्य में, "मिक्सर" (CVCI) आमतौर पर सबसे अच्छा था। इसने बड़ी मात्रा में नोटबुक डेटा को छोटे निष्पक्ष टेस्ट के साथ पूरी तरह से संतुलित किया।
      • कोडिंग (Coding) कार्य में, परिणाम इस बात पर बदल गए कि "सफलता" का क्या अर्थ था। यदि सफलता का अर्थ था "क्या कोड ने बग को ठीक किया?", तो नोटबुक-आधारित तरीके बेहतर थे। यदि सफलता का अर्थ था "क्या कोड की शैली अच्छी है?", तो एक अलग तरीका (Representation-EXP) बेहतर काम करता था।

निचोड़ (The Bottom Line)

जब आप वास्तविक दुनिया के लॉग का उपयोग करके AI मॉडल का मूल्यांकन कर रहे हों, तो आप केवल संख्याओं पर भरोसा नहीं कर सकते क्योंकि लोग छिपे हुए कारकों के आधार पर मॉडल चुनते हैं।

यह पेपर सिद्ध करता है कि यदि आपके पास एक सिम्युलेटर (आउटपुट को फिर से उत्पन्न करने के लिए) और एक छोटा रैंडमाइज्ड टेस्ट (निष्पक्ष स्कोर प्राप्त करने के लिए) है, तो आप मॉडलों के वास्तविक प्रदर्शन को गणितीय रूप से खोज सकते हैं। विशाल पक्षपाती वास्तविक दुनिया के लॉग्स को बारीक ट्यूनिंग (fine-tuning) के लिए उपयोगी है, लेकिन वे सच्चाई को अनलॉक करने की कुंजी नहीं हैं। कुंजी सिम्युलेटर और रैंडमाइज्ड एक्सपेरिमेंट के संयोजन की है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →