← नवीनतम पेपर
🤖 machine learning

Modeling Image-Caption Rating from Comparative Judgments

यह शोध पत्र एक मशीन लर्निंग फ्रेमवर्क प्रस्तावित करता है जो सीधे रेटिंग के बजाय तुलनात्मक निर्णयों के माध्यम से इमेज-कैप्शन गुणवत्ता को मॉडल करता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण न केवल एनोटेशन लागत को कम करता है और मानव सहमति को बढ़ाता है, बल्कि सीधे रेटिंग पर प्रशिक्षित मॉडलों के समान प्रदर्शन भी प्राप्त करता है।

मूल लेखक: Kezia Minni, Qiang Zhang, Monoshiz Mahbub Khan, Zhe Yu

प्रकाशित 2026-03-26
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Kezia Minni, Qiang Zhang, Monoshiz Mahbub Khan, Zhe Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फूड क्रिटिक (खाद्य समीक्षक) हैं। आपका काम एक नए व्यंजन को 1 से 5 स्टार के पैमाने पर रेट करना है।

पुराना तरीका (प्रत्यक्ष रेटिंग):
आप व्यंजन का स्वाद लेते हैं और तय करने की कोशिश करते हैं: "क्या यह 3 है या 4? क्या यह 3.5 है?" यह कठिन है। आपका मूड, आपकी भूख, या क्या आपका दिन बुरा रहा है, यह आपकी रेटिंग बदल सकता है। एक व्यक्ति इसे "4" कह सकता है, जबकि दूसरा ठीक उसी व्यंजन को "2" कह सकता है। यह व्यक्तिपरक (subjective), भ्रमित करने वाला और मानसिक ऊर्जा लेने वाला काम है क्योंकि आपको अपने आंतरिक "स्टार स्केल" को कैलिब्रेट करना पड़ता है।

नया तरीका (तुलनात्मक निर्णय):
अब, कल्पना कीजिए कि शेफ आपके सामने एक साथ दो प्लेटें लाता है। वह आपसे पूछता है, "इनमें से कौन सा बेहतर स्वाद देता है?"
अचानक, कार्य आसान हो जाता है। आपको इस बात की चिंता करने की ज़रूरत नहीं है कि यह 3 है या 4। आप बस दोनों विकल्पों को देखते हैं और कहते हैं, "यह वाला जीत गया।" यह बहुत तेज़, कम तनावपूर्ण है, और लगभग सभी लोग विजेता पर सहमत होते हैं।

यह शोध पत्र कंप्यूटर को बिल्कुल यही सिखाने के बारे में है।

समस्या: AI को "महसूस करना" सिखाना

शोधकर्ता एक ऐसा AI बनाना चाहते थे जो एक तस्वीर और एक वाक्य (कैप्शन) को देख सके और तय कर सके कि वे कितनी अच्छी तरह मेल खाते हैं। उदाहरण के लिए, क्या कैप्शन "बर्फ में खेलता हुआ एक कुत्ता" सफेद पाउडर में एक गोल्डन रिट्रीवर की तस्वीर का सटीक वर्णन करता है?

पारंपरिक रूप से, AI को यह सिखाने के लिए, मनुष्यों को हजारों उदाहरण देने पड़ते थे और उन्हें 1 से 5 तक रेट करना होता था। यह धीमा, महंगा है और रेटिंग अक्सर अव्यवस्थित होती है क्योंकि मनुष्य इस बात पर असहमत होते हैं कि "4" का वास्तव में क्या अर्थ है।

समाधान: "टेस्ट-टेस्ट" दृष्टिकोण

लेखकों ने, केज़िया मिन्नी और उनकी टीम ने, मनुष्यों से स्कोर (1-5) माँगना बंद करने और तुलना करने के लिए कहना शुरू किया।

कैप्शन को "3.5 रेट करें" कहने के बजाय, उन्होंने पूछा: "कैप्शन A और कैप्शन B के बीच, कौन सा तस्वीर का बेहतर वर्णन करता है?"

उन्होंने इस विचार का परीक्षण करने के लिए दो प्रकार के AI मॉडल बनाए:

  1. "स्कोरकीपर" (रिग्रेशन मॉडल): यह पुराना AI है जिसे 1-से-5 स्टार रेटिंग पर प्रशिक्षित किया गया है।
  2. "रेफरी" (तुलनात्मक मॉडल): यह नया AI है जिसे केवल "A, B से बेहतर है" वाले निर्णयों पर प्रशिक्षित किया गया है।

परिणाम: रेफरी जीतता है (लगभग)

यहाँ चौंकाने वाला हिस्सा है: "रेफरी" AI, "स्कोरकीपर" AI के लगभग बराबर प्रदर्शन करता है।

  • सटीकता: रेफरी, स्कोरकीपर की तुलना में केवल लगभग 1% कम सटीक था।
  • गति और निरंतरता: जब मनुष्यों ने प्रशिक्षण दिया, तो "रेफरी" विधि बहुत तेज़ थी। लोगों के बीच इस बात पर बहस कम हुई कि कौन सही था। यदि आप 10 लोगों से एक फोटो को रेट करने के लिए कहते हैं, तो आपको 10 अलग-अलग नंबर मिल सकते हैं। यदि आप उनसे दो फोटो में से बेहतर चुनने के लिए कहते हैं, तो वे लगभग सभी एक ही को चुनेंगे।

एक विशेष ट्रिक: "एक ही तस्वीर" की चुनौती

शोधकर्ताओं ने एक कठिन परिदृश्य का भी परीक्षण किया: क्या होगा यदि आपके पास एक तस्वीर और दो अलग-अलग कैप्शन हों? कौन सा कैप्शन बेहतर है?

  • उदाहरण: बिल्ली की तस्वीर।
    • कैप्शन A: "सोती हुई एक बिल्ली।"
    • कैप्शन B: "मछली खाती हुई एक बिल्ली।"
  • AI जो तुलनाओं पर प्रशिक्षित था, उसने इसे 85% बार सही ढंग से पहचाना, जिससे यह सिद्ध हुआ कि वह बिना किसी संख्यात्मक स्कोर के सूक्ष्म अंतरों को पहचान सकता है।

मुख्य निष्कर्ष

इसे एक स्पोर्ट्स टीम को प्रशिक्षित करने की तरह समझें।

  • पुरानी विधि: आप हर खिलाड़ी को बताते हैं, "आज तुमने 10 में से 7 अंक प्राप्त किए।" खिलाड़ी बहस करते हैं कि 7 का क्या मतलब है।
  • नई विधि: आप खिलाड़ियों को बताते हैं, "तुमने खिलाड़ी X से बेहतर खेला।" खिलाड़ी इसे तुरंत समझ जाते हैं।

पेपर यह निष्कर्ष निकालता है कि कंप्यूटर को व्यक्तिपरक चीजों (जैसे कला, कैप्शन या गुणवत्ता) को समझने के लिए सिखाने के लिए, तुलना ही असली सफलता का मंत्र (secret sauce) है। वे एकत्र करने में सस्ते हैं, संसाधित करने में तेज़ हैं, और एक अधिक स्मार्ट, अधिक सुसंगत AI का परिणाम देते हैं।

संक्षेप में: लोगों को कर्व पर ग्रेडिंग करने के लिए कहना बंद करें; बस उन्हें विजेता चुनने के लिए कहें। कंप्यूटर तेज़ी से सीखता है, और इंसान खुश रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →