← नवीनतम पेपर
🤖 AI

VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation

यह शोध पत्र VLAgeBench प्रस्तुत करता है, जो UTKFace और FG-NET डेटासेट पर चेहरे के आयु अनुमान (facial age estimation) के लिए अत्याधुनिक लार्ज विजन-लैंग्वेज मॉडल्स (GPT-4o, Claude 3.5 Sonnet, और LLaMA 3.2 Vision) का मूल्यांकन करने वाला एक व्यापक ज़ीरो-शॉट बेंचमार्क है, जो उनके प्रतिस्पर्धी प्रदर्शन को प्रदर्शित करते हुए निष्पक्षता (fairness), प्रॉम्प्ट संवेदनशीलता (prompt sensitivity) और व्याख्यात्मकता (interpretability) में महत्वपूर्ण चुनौतियों को उजागर करता है।

मूल लेखक: Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

प्रकाशित 2026-03-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पार्टी में हैं, और कोई आपसे किसी अजनबी के चेहरे को देखकर उसकी उम्र का अनुमान लगाने के लिए कहता है। आप शायद उनकी झुर्रियों को गौर से देखेंगे, उनकी त्वचा की बनावट की जांच करेंगे, और शायद अनुमान लगाएंगे, "हम्म, वे लगभग 35 के लग रहे हैं।" आप डॉक्टर नहीं हैं, और आपने उस विशिष्ट व्यक्ति का अध्ययन नहीं किया है, लेकिन आप अपने सामान्य जीवन के अनुभव का उपयोग एक अच्छा अनुमान लगाने के लिए करते हैं।

यह शोध पत्र सुपर-स्मार्ट AI कंप्यूटरों को बिल्कुल यही करने के लिए सिखाने के बारे में है, लेकिन एक ट्विस्ट के साथ: उन्हें किसी भी ऐसे व्यक्ति की उम्र का अनुमान लगाना है जिसे उन्होंने पहले कभी नहीं देखा है, बिना किसी विशेष प्रशिक्षण के।

यहाँ इस शोध का सरल विवरण दिया गया है:

1. बड़ा विचार: "यूनिवर्सल गेसर्स" (सार्वभौमिक अनुमान लगाने वाले)

वर्षों तक, कंप्यूटरों को उम्र का अनुमान लगाने के लिए "सिखाने" की आवश्यकता होती थी। यह एक ट्यूटर को हजारों 20 साल के लोगों की तस्वीरों, फिर हजारों 50 साल के लोगों की तस्वीरों का अध्ययन करने के लिए नियुक्त करने जैसा था, जब तक कि कंप्यूटर ने पैटर्न को याद न कर लिया। इसे सुपरवाइज्ड लर्निंग (Supervised Learning) कहा जाता है।

लेकिन हाल ही में, लार्ज विजन-लैंग्वेज मॉडल (LVM) नामक एक नए प्रकार का AI उभरा है। इन मॉडलों को "सुपर-रीडर्स" के रूप में सोचें जिन्होंने पूरे इंटरनेट को भी देखा है। वे जानते हैं कि चेहरा कैसा दिखता है, झुर्रियों का क्या मतलब है, और इंटरनेट पर सब कुछ देख और पढ़कर वे कैसे समझते हैं कि समय के साथ त्वचा कैसे बदलती है।

शोधकर्ताओं ने पूछा: क्या ये सुपर-रीडर्स केवल एक फोटो देखकर किसी व्यक्ति की उम्र का अनुमान लगा सकते हैं, बिना हमारे उन्हें विशेष रूप से सिखाए? इसे ज़ीरो-शॉट लर्निंग (Zero-Shot Learning) कहा जाता है (जिसका अर्थ है "शून्य अभ्यास शॉट")।

2. परीक्षण: "एज गेसिंग ओलंपिक्स" (उम्र का अनुमान लगाने वाली ओलंपिक)

यह जानने के लिए, शोधकर्ताओं ने एक प्रतियोगिता आयोजित की। उन्होंने चेहरों के दो प्रसिद्ध फोटो एल्बम (जिन्हें UTKFace और FG-NET कहा जाता है) लिए जिनमें सभी उम्र, नस्ल और लिंग के लोग शामिल थे।

उन्होंने ये तस्वीरें तीन शीर्ष-स्तरीय AI "अनुमान लगाने वालों" को दीं:

  • GPT-4o (OpenAI का वर्तमान भारी वजन वाला चैंपियन)।
  • Claude 3.5 Sonnet (Anthropic का एक बहुत ही तेज प्रतियोगी)।
  • LLaMA 3.2 Vision (एक शक्तिशाली ओपन-सोर्स मॉडल, जैसे कि एक समुदाय-निर्मित उपकरण)।

उन्होंने सेटिंग्स में कोई बदलाव नहीं किया या उन्हें कुछ नया नहीं सिखाया। उन्होंने बस उन्हें एक फोटो दी और कहा, "बताओ कि यह व्यक्ति कितने वर्षों से जीवित है।"

3. परिणाम: कौन जीता?

परिणाम आश्चर्यजनक रूप से अच्छे थे! इन सामान्य-उद्देश्य वाले AI मॉडलों को इस कार्य के लिए प्रशिक्षित करने की आवश्यकता नहीं थी।

  • स्वर्ण पदक विजेता: GPT-4o सबसे सटीक था। बड़े, अव्यवस्थित डेटासेट (UTKFace) पर, इसने औसतन वास्तविक उम्र के भीतर लगभग 5 वर्ष का अनुमान लगाया। छोटे डेटासेट पर, यह और भी बेहतर था।
  • रजत पदक विजेता: Claude 3.5 Sonnet ने भी बहुत अच्छा प्रदर्शन किया, विशेष रूप से छोटे डेटासेट पर जहाँ उम्र की सीमा कम थी।
  • कांस्य पदक विजेता: LLaMA 3.2 Vision ने एक ठोस काम किया, जिससे यह साबित हुआ कि ओपन-सोर्स मॉडल भी बराबरी कर रहे हैं, हालांकि इसने बड़े व्यावसायिक मॉडलों की तुलना में थोड़ी अधिक गलतियाँ कीं।

उपमा (Analogy): एक सामान्य ज्ञान प्रश्नोत्तरी की कल्पना करें। GPT-4o उस व्यक्ति की तरह है जिसने लाइब्रेरी की हर किताब पढ़ी है और केवल आपको देखकर आपकी उम्र का अनुमान लगा सकता है। LLaMA उस बहुत बुद्धिमान छात्र की तरह है जिसने बहुत सारी किताबें पढ़ी हैं लेकिन शायद कुछ अध्याय छूट गए हैं। वे दोनों बिना विशेष रूप से इस क्विज़ का अध्ययन किए उम्मीद से बेहतर प्रदर्शन करते हैं।

4. कमी: यह अभी भी पूर्ण नहीं है

हालांकि AI ने अच्छा काम किया, शोधकर्ताओं ने सिस्टम में कुछ "ग्लिच" (खामियां) भी पाईं:

  • "बेबी" समस्या: AI कभी-कभी बहुत छोटे बच्चों के साथ संघर्ष करता है। यदि एक बच्चा 2 साल का है, तो एक छोटी सी त्रुटि (4 साल का अनुमान लगाना) प्रतिशत के संदर्भ में बहुत बड़ी लगती है। यहाँ गणित जटिल हो जाता है।
  • "बायस" (पक्षपात) की समस्या: इंसानों की तरह, इन AI में भी छिपे हुए पूर्वाग्रह हो सकते हैं। वे किसी व्यक्ति की नस्ल या लिंग के आधार पर उम्र का अलग तरह से अनुमान लगा सकते हैं क्योंकि उनके द्वारा सीखा गया डेटा (इंटरनेट) उन पूर्वाग्रहों को अपने भीतर समेटे हुए है।
  • "प्रॉम्प्ट" संवेदनशीलता: आप सवाल कैसे पूछते हैं, यह मायने रखता है। यदि आप AI से पूछते हैं, "यह कितना पुराना है?" तो यह "अनुमान लगाओ" पूछने की तुलना में अलग उत्तर दे सकता है। AI शब्दों के सटीक उपयोग के प्रति बहुत संवेदनशील है।

5. यह क्यों मायने रखता है?

यह शोध एक बड़ी बात है क्योंकि यह दिखाता है कि हमें हर एक कार्य (जैसे उम्र का अनुमान लगाना, लिंग का पता लगाना, या भावना पढ़ना) के लिए एक नया, विशिष्ट कंप्यूटर मस्तिष्क बनाने की आवश्यकता नहीं हो सकती है।

इसके बजाय, हम इन सामान्य-उद्देश्य वाले "सुपर-ब्रेन" का उपयोग कर सकते हैं और बस उन्हें काम करने के लिए कह सकते हैं। यह तेज़, सस्ता और आसान है।

वास्तविक दुनिया के उपयोगों में शामिल हो सकते हैं:

  • हेल्थकेयर: मरीज की फोटो से उसकी उम्र का तेजी से अनुमान लगाना ताकि यह जांचा जा सके कि उसकी जैविक आयु उसकी कैलेंडर आयु से मेल खाती है या नहीं।
  • सुरक्षा: यह सत्यापित करना कि क्या कोई क्लब में प्रवेश करने या कुछ खरीदने के लिए पर्याप्त उम्र का दिखता है, बिना उसके विशिष्ट चेहरे के डेटाबेस की आवश्यकता के।
  • फोरेंसिक: जांचकर्ताओं को किसी पुरानी, धुंधली फोटो में व्यक्ति की उम्र का अनुमान लगाने में मदद करना।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि ये नए AI मॉडल उन प्रतिभाशाली शौकियों (gifted amateurs) की तरह हैं जो बिना प्रशिक्षण के भी विशेषज्ञों के लगभग बराबर उम्र का अनुमान लगा सकते हैं। वे अभी पूर्ण नहीं हैं—उन्हें अधिक निष्पक्ष और सुसंगत होने की आवश्यकता है—लेकिन वे एक बड़ा कदम हैं। यह ऐसा है जैसे यह पता चलना कि आपका स्मार्ट असिस्टेंट अचानक एक मैनुअल पढ़कर आपके टैक्स भर सकता है, बिना किसी अकाउंटेंट को पहले नियुक्त किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →