A Large-scale Evaluation of Text-guided Models for Facial Editing
यह शोध पत्र चेहरे के संपादन (facial editing) के लिए छह टेक्स्ट-गाइडेड मॉडलों का पहला बड़े पैमाने पर मूल्यांकन प्रस्तुत करता है, जिसमें 169 विशेषताओं (attributes) का एक नया डेटासेट पेश किया गया है और यह खुलासा किया गया है कि जहाँ ये मॉडल बालों और सहायक उपकरणों (accessories) के संशोधनों में उत्कृष्ट हैं, वहीं वे पोज़ परिवर्तन (pose changes) में संघर्ष करते हैं और गहरे रंग के पुरुषों तथा वृद्ध चेहरों के अत्यधिक संपादन (over-editing) में महत्वपूर्ण जनसांख्यिकीय पूर्वाग्रह प्रदर्शित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक डिजिटल कलाकार की कल्पना कीजिए जो एक साधारण वाक्य टाइप करके किसी व्यक्ति के बालों का रंग बदल सकता है, चश्मा जोड़ सकता है, या उनके सिर को क्षितिज की ओर देखने के लिए घुमा सकता है। यह टेक्स्ट-गाइडेड इमेज एडिटिंग (पाठ-निर्देशित छवि संपादन) का वादा है, जो एक तेजी से बढ़ता हुआ क्षेत्र है जहाँ आर्टिफिशियल इंटेलिजेंस मानव भाषा को समझना और उन निर्देशों को तस्वीरों पर लागू करना सीख रहा है। वर्षों से, शोधकर्ताओं ने इन कारनामों में सक्षम सिस्टम बनाए हैं, लेकिन वे अक्सर एक विशिष्ट चुनौती से जूझते रहे हैं: फोटो में व्यक्ति को वैसा ही बनाए रखना जैसा वह स्वयं है, जबकि अनुरोधित परिवर्तन किए जा रहे हों। पुराने तरीके या तो चेहरे को इतना बदल देते थे कि वह पहचान में नहीं आता था, या वे केवल बहुत सीमित समायोजन कर पाते थे, जैसे कि सिर का कोण बदलना। अब, उपकरणों की एक नई पीढ़ी उभरी है जो इन समस्याओं को हल करने का दावा करती है, जो टेक्स्ट प्रॉम्प्ट के आधार पर जटिल, यथार्थवादी संपादन करने की क्षमता प्रदान करती है। लेकिन जैसे-जैसे ये उपकरण अधिक शक्तिशाली होते जा रहे हैं, एक महत्वपूर्ण प्रश्न बना हुआ है: क्या वे सभी के लिए समान रूप से काम करते हैं, या उनमें कुछ छिपे हुए दोष हैं जो विभिन्न समूहों के साथ अन्याय करते हैं?
शोधकर्ताओं की एक टीम ने छह सबसे लोकप्रिय टेक्स्ट-गाइडेड एडिटिंग मॉडल्स का परीक्षण करके इस प्रश्न का उत्तर देने का प्रयास किया। उन्होंने कंप्यूटरों से केवल कुछ यादृच्छिक बदलाव करने के लिए नहीं कहा; उन्होंने लगभग दस लाख इमेज एडिट्स वाले एक विशाल, व्यवस्थित मूल्यांकन का संचालन किया। लक्ष्य यह देखना था कि ये मॉडल लगातार चार अलग-अलग निर्देशों के क्रम को कितनी अच्छी तरह संभाल सकते हैं, जैसे कि व्यक्ति के बालों का रंग बदलना, फिर एक टोपी जोड़ना, फिर टोपी बदलना, और अंत में उनका सिर घुमाना। ऐसा करने के लिए, शोधकर्ताओं ने बाल, सहायक उपकरण (एक्सेसरीज) और सिर की स्थिति पर केंद्रित 169 विशिष्ट संपादन कार्यों की एक नई, विस्तृत लाइब्रेरी बनाई। उन्होंने सेलिब्रिटी फोटो के दो बड़े संग्रहों पर इन मॉडल्स का परीक्षण किया, जिससे पुरुषों और महिलाओं, युवा और वृद्ध, तथा हल्के और गहरे रंग की त्वचा वाले लोगों का एक विविध मिश्रण सुनिश्चित हो सके।
परिणामों ने एक स्पष्ट तस्वीर पेश की कि आज ये तकनीकें कहाँ खड़ी हैं। मॉडल बालों और एक्सेसरीज में बदलाव करने में काफी सक्षम साबित हुए। जब हेयरस्टाइल बदलने या धूप का चश्मा जोड़ने के लिए कहा गया, तो अधिकांश सिस्टम ने अच्छा प्रदर्शन किया, व्यक्ति को पहचानने योग्य रखते हुए निर्देशों का सफलतापूर्वक पालन किया। हालांकि, जब मॉडल्स को किसी व्यक्ति की मुद्रा (पोज़) बदलने के लिए कहा गया, जैसे कि उन्हें बाईं या दाईं ओर देखने के लिए कहना, तो वे काफी संघर्ष करते दिखे। ऐसे मामलों में, सिस्टम अक्सर कमांड का पालन करने में विफल रहे या उन्होंने चेहरे को इस तरह बदल दिया जिससे व्यक्ति पहचान में नहीं आ सका।
शायद अधिक चिंताजनक खोज यह थी कि सभी मॉडल्स में "ओवर-एडिटिंग" (अत्यधिक संपादन) करने की प्रवृत्ति थी। इसका अर्थ यह है कि एक विशिष्ट निर्देश दिए जाने पर, कंप्यूटर अक्सर उन चीजों को भी बदल देता था जिन्हें बदलने के लिए नहीं कहा गया था। उदाहरण के लिए, यदि कोई उपयोगकर्ता मॉडल से किसी व्यक्ति के हेयरस्टाइल को 'बॉब कट' में बदलने के लिए कहता है, तो मॉडल बालों का रंग बदलकर भूरा भी कर सकता है, भले ही उपयोगकर्ता ने रंग परिवर्तन का अनुरोध न किया हो। शोधकर्ताओं ने पाया कि यह बार-बार होता था, मॉडल्स हर 100 निर्देशों के लिए लगभग 25 अतिरिक्त, अनचाहे बदलाव कर देते थे। ये त्रुटियां यादृच्छिक नहीं थीं; ये अक्सर मॉडल्स द्वारा गलत जुड़ाव सीखने से उत्पन्न होती थीं, जैसे कि यह मानना कि एक विशिष्ट हेयरस्टाइल हमेशा एक विशिष्ट बालों के रंग के साथ जाता है।
अध्ययन में यह भी खुलासा हुआ कि इन मॉडल्स में अलग-अलग लोगों के साथ व्यवहार करने में महत्वपूर्ण पूर्वाग्रह (बायस) थे। ओवर-एडिटिंग सभी चेहरों पर समान रूप से वितरित नहीं थी। मॉडल्स द्वारा पुरुषों के चेहरों, विशेष रूप से गहरे रंग की त्वचा वाले पुरुषों के चेहरे को एडिट करते समय, और वृद्ध लोगों के चेहरों को एडिट करते समय अनचाहे बदलाव करने की संभावना बहुत अधिक थी। उदाहरण के लिए, किसी गहरे रंग के पुरुष के बालों को एडिट करने के लिए कहा जाने पर, सिस्टम चेहरे के अन्य फीचर्स को बदलने (जैसे कि दाढ़ी जोड़ना या स्किन टोन बदलना) के प्रति कहीं अधिक प्रवृत्त था, बजाय इसके कि वह किसी हल्के रंग की महिला के चेहरे को एडिट करता। इसी प्रकार, मॉडल्स वृद्ध चेहरों की पहचान बनाए रखने में कम सफल थे, जिससे वे उन्हें या तो युवा बना देते थे या युवाओं की तुलना में उनके फीचर्स को अधिक नाटकीय रूप से बदल देते थे।
ये निष्कर्ष बताते हैं कि हालांकि टेक्स्ट-गाइडेड एडिटिंग टूल्स वास्तविक दुनिया में उपयोग के लिए पर्याप्त शक्तिशाली हो रहे हैं, फिर भी वे पूर्ण नहीं हैं। वे टोपी जोड़ने या बालों का रंग बदलने जैसे सरल कार्यों के लिए अच्छे से काम करते हैं, लेकिन वे अभी भी अधिक जटिल गतिविधियों के लिए संघर्ष करते हैं और उनमें छिपे हुए पूर्वाग्रह हैं जो कुछ समूहों के लिए अनुचित या गलत परिणाम दे सकते हैं। शोधकर्ता इस बात पर जोर देते हैं कि भविष्य के कार्य को ओवर-एडिटिंग की इन आदतों को ठीक करने और यह सुनिश्चित करने पर ध्यान केंद्रित करना चाहिए कि तकनीक हर चेहरे के साथ उम्र, लिंग या त्वचा के रंग की परवाह किए बिना समान स्तर की सटीकता और सम्मान के साथ व्यवहार करे। जब तक ये मुद्दे हल नहीं हो जाते, उपयोगकर्ताओं को यह ध्यान रखना चाहिए कि ये डिजिटल कलाकार अभी सीख रहे हैं, और वे कभी-कभी उससे अधिक बदल सकते हैं जितना उनसे पूछा गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।