← नवीनतम पेपर
📊 statistics

Rejoinder: The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review

यह प्रत्युत्तर ICML 2023 रैंकिंग प्रयोग पर मिली प्रतिक्रिया को चार प्रमुख विषयों के इर्द-गिर्द संरचित करके अपना उत्तर देता है: पीयर रिव्यू को सांख्यिकीय अनुमान के रूप में फ्रेम करना, आइसोटोनिक मैकेनिज्म (Isotonic Mechanism) में इक्विटी और रणनीतिक मुद्दों को कम करना, रिव्यूअर रैंकिंग जैसे पूरक संकेतों को एकीकृत करना, और जनरेटिव एआई (generative AI) के युग के लिए एक मानव-केंद्रित ढांचे का प्रस्ताव देना।

मूल लेखक: Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि शीर्ष स्तर के कंप्यूटर विज्ञान अनुसंधान (विशेष रूप से आर्टिफिशियल इंटेलिजेंस) की दुनिया एक विशाल, अराजक संगीत उत्सव (म्यूजिक फेस्टिवल) की तरह है। हर साल, हजारों बैंड (शोधकर्ता) मुख्य मंच पर खेलने के लिए (अपने शोध पत्र प्रकाशित करने के लिए) संघर्ष करते हैं। लेकिन वहां केवल कुछ सौ जज (समीक्षक) ही हैं जो उन्हें सुनने के लिए उपलब्ध हैं, और जैसे-जैसे यह उत्सव तेजी से बढ़ रहा है, जज आवेदनों के बोझ तले दबते जा रहे हैं।

इस पेपर के लेखक, जो सांख्यिकीविदों (statisticians) और कंप्यूटर वैज्ञानिकों की एक टीम है, तर्क देते हैं कि हमें इस उत्सव को केवल एक साधारण लोकप्रियता प्रतियोगिता की तरह देखना बंद करना चाहिए और इसे एक सांख्यिकीय पहेली (statistical puzzle) की तरह मानना चाहिए। यहाँ उनके विचारों का रोजमर्रा के उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: बहुत अधिक टिकट, लेकिन जज कम

यह उत्सव तेजी से फैल रहा है। 2026 में, उन्हें जज करने के लिए 26,000 से अधिक गाने प्राप्त हुए। जज थक चुके हैं, और वे हर गाने को पूरी तरह से नहीं सुन सकते। कभी-कभी एक जज का दिन खराब होता है, कभी-कभी वे किसी विशिष्ट शैली (genre) को समझ नहीं पाते, और कभी-कभी संगीत इतना अच्छा या इतना बुरा होता है कि वे निष्पक्ष रूप से निर्णय नहीं ले पाते।

लेखक कहते हैं: "हम केवल भीड़ को निर्णय लेने के लिए नहीं छोड़ सकते (जैसे सोशल मीडिया पर 'लाइक्स' गिनना) क्योंकि भीड़ विशेषज्ञ नहीं है। हमें यह पता लगाने का एक बेहतर तरीका चाहिए कि वास्तव में कौन से गाने सबसे अच्छे हैं।"

2. समाधान: "लेखक की प्लेलिस्ट" (आइसोटोनिक मैकेनिज्म)

लेखक एक चतुर तकनीक प्रस्तावित करते हैं जिसे आइसोटोनिक मैकेनिज्म (Isotonic Mechanism) कहा जाता है।

उपमा: कल्पना कीजिए कि आप एक कुकिंग कॉन्टेस्ट के जज हैं। आपको 100 व्यंजन रेट करने हैं। हो सकता है कि आप तीखे खाने के प्रति थोड़े सख्त हों या मीठे व्यंजनों के प्रति थोड़े नरम। आपके स्कोर "नॉइजी" (थोड़े अस्त-व्यस्त) हैं।
अब, कल्पना कीजिए कि वह शेफ (लेखक) जिसने वह व्यंजन बनाया है, वह वहीं खड़ा है। वह अपने भोजन को किसी भी अन्य व्यक्ति से बेहतर जानता है। वह जानता है कि उसके 10 व्यंजन आपस में कैसे तुलना करते हैं।

  • पुराना तरीका: शेफ बस कहता है, "मेरा व्यंजन 10 में से 9 है।" (इस तरह झूठ बोलना आसान है; हर कोई 10 चाहता है)।
  • नया तरीका: शेफ से अपने 10 व्यंजनों को सबसे अच्छे से सबसे खराब के क्रम में रैंक (rank) करने के लिए कहा जाता है। "व्यंजन A, व्यंजन B से बेहतर है, जो व्यंजन C से बेहतर है।"

यह क्यों काम करता है: अपने स्वयं के काम के बारे में रैंकिंग के बारे में झूठ बोलना बहुत कठिन है बिना पकड़े गए। यदि आप कहते हैं कि आपका "व्यंजन C" सबसे अच्छा है, लेकिन आपका "व्यंजन A" वास्तव में बहुत खराब है, तो गणित उस झूठ को पकड़ सकता है। लेखकों को अपने स्वयं के सबमिशन को रैंक करने के लिए कहकर, सिस्टम जज के अस्त-व्यस्त (messy) स्कोर को "साफ" कर सकता है। यह जज की खराब सुनने की क्षमता को ठीक करने के लिए शेफ के अपने ज्ञान का उपयोग करने जैसा है।

3. "अनुचितता" की चिंता को दूर करना

कुछ लोगों ने चिंता जताई: "क्या होगा यदि 50 व्यंजनों वाला एक प्रसिद्ध शेफ केवल 2 व्यंजनों वाले नए शेफ की तुलना में बहुत अधिक लाभ प्राप्त करता है? रैंकिंग सिस्टम उन लोगों के लिए बेहतर काम करता है जिनके पास रैंक करने के लिए अधिक आइटम हैं।"

लेखकों का समाधान: उन्होंने महसूस किया कि यदि आप केवल एक व्यक्ति को सब कुछ रैंक करने देते हैं, तो यह अनुचित है। इसलिए, वे एक "समूहीकरण" (grouping) रणनीति का सुझाव देते हैं।

  • उपमा: प्रसिद्ध शेफ को एक लंबी कतार में सभी 50 व्यंजनों को रैंक करने के लिए कहने के बजाय, उन्हें छोटे "टेस्टिंग मेनू" (जैसे, "सूप मेनू," "डेजर्ट मेनू") में समूह बनाने के लिए कहें। सूप को एक दूसरे के विरुद्ध रैंक करें, और डेसर्ट को एक दूसरे के विरुद्ध रैंक करें।
  • परिणाम: यह खेल के मैदान को समान बनाता है। गणित दिखाता है कि इस समूहीकरण के साथ भी, सिस्टम उनके स्कोर को बहुत सटीक बनाता है, लेकिन यह प्रसिद्ध शेफ को केवल अधिक प्रविष्टियाँ होने के कारण हावी होने से रोकता है।

4. "रणनीति" की समस्या: क्या शेफ धोखाधड़ी कर सकते हैं?

लेखक स्वीकार करते हैं कि यदि रैंकिंग वास्तव में यह तय करती है कि कौन मुख्य मंच पर खेलने के योग्य है, तो शेफ सिस्टम का फायदा उठाने की कोशिश कर सकते हैं।

  • जोखिम: एक शेफ एक भयानक व्यंजन को "शानदार" के रूप में रैंक कर सकता है ताकि उसे स्वीकार किया जा सके, या अपने सबसे अच्छे व्यंजन को कम रैंक दे सकता है ताकि उसे "अगले साल के लिए बचाकर" रखा जा सके।
  • वास्तविकता की जांच: लेखक कहते हैं, "हम सभी धोखाधड़ी को नहीं रोक सकते, लेकिन हम नियमों को ऐसा बना सकते हैं कि धोखाधड़ी करना कठिन हो जाए।" वे सुझाव देते हैं कि शुरुआत छोटे स्तर से करें (रैंकिंग का उपयोग केवल उन शोध पत्रों को चिह्नित करने के लिए करें जिन्हें दूसरी बार देखने की आवश्यकता है, न कि तुरंत स्वीकार या अस्वीकार करने के लिए) ताकि हम उच्च-दांव वाला खेल बनाने से पहले यह सीख सकें कि लोग कैसे व्यवहार करते हैं।

5. भविष्य: मानव + AI, न कि AI बनाम मानव

पेपर एक बड़े दृष्टिकोण के साथ समाप्त होता है। आर्टिफिशियल इंटेलिजेंस इस बात को बदल रहा है कि अनुसंधान कैसे लिखा और समीक्षा की जाती है। AI कोड लिख सकता है, गणित की जांच कर सकता है, और यहाँ तक कि समीक्षा का मसौदा भी तैयार कर सकता है।

लेखकों का रुख:

  • इंसानों को प्रतिस्थापित न करें। AI एक उपकरण है, जैसे कि एक सुपर-पावर्ड कैलकुलेटर। यह डेटा को व्यवस्थित कर सकता है और पैटर्न खोज सकता है, लेकिन इसे अंतिम निर्णायक नहीं होना चाहिए।
  • "ह्यूमन-इन-द-लूप" (Human-in-the-Loop): AI को एक स्टेजहैंड (मंच सहायक) के रूप में सोचें जो लाइट सेट करता है और वाद्ययंत्रों को व्यवस्थित करता है। मानव जज वह है जो तय करता है कि संगीत वास्तव में अच्छा है या नहीं।
  • क्यों? क्योंकि विज्ञान केवल डेटा के बारे में नहीं है; यह रचनात्मकता, नैतिकता और "स्वाद" के बारे में है। AI शोध पत्र की सूक्ष्म आत्मा को मिस कर सकता है या भ्रमित (hallucinate) होकर चीजें बना सकता है। अंतिम निर्णय लेने के लिए इंसानों को नियंत्रण में रहना चाहिए।

सारांश

पेपर का तर्क है कि AI अनुसंधान के अत्यधिक बोझ वाले सिस्टम को ठीक करने के लिए, हमें इसे एक गणितीय समस्या की तरह मानना चाहिए। अपने स्वयं के काम को ईमानदारी से रैंक करने के लिए लेखकों से कहकर, हम जजों के स्कोर से "शोर" (noise) को हटा सकते हैं और अधिक सटीकता के साथ सर्वश्रेष्ठ शोध पत्रों को खोज सकते हैं। हालाँकि, हमें सावधान रहना चाहिए कि हम सिस्टम को गेम (manipulate) न होने दें, और हमें यह सुनिश्चित करना चाहिए कि जबकि AI अराजकता को व्यवस्थित करने में हमारी मदद करता है, अंतिम निर्णय लेने वाला हथौड़ा (gavel) इंसानों के हाथ में ही रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →