← नवीनतम पेपर
💻 computer science

Sapiens2

Sapiens2 उच्च-रिज़ॉल्यूशन वाले मानव-केंद्रित विजन ट्रांसफॉर्मर का एक परिवार है जो 0.4 से 5 बिलियन पैरामीटर्स तक विस्तृत है और एक एकीकृत प्रीट्रेनिंग ऑब्जेक्टिव, 1 बिलियन मानव छवियों के क्यूरेटेड डेटासेट और 4K रिज़ॉल्यूशन तक समर्थन करने वाले आर्किटेक्चरल एन्हांसमेंट्स के माध्यम से पोज़ एस्टीमेशन और सेगमेंटेशन जैसे विविध कार्यों में नया स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

मूल लेखक: Rawal Khirodkar, He Wen, Julieta Martinez, Yuan Dong, Su Zhaoen, Shunsuke Saito

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rawal Khirodkar, He Wen, Julieta Martinez, Yuan Dong, Su Zhaoen, Shunsuke Saito

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट सहायक है जिसने अपना पूरा जीवन लोगों का अध्ययन करने में बिताया है। उसका काम किसी फोटो में दिख रहे इंसान को समझना है: उनकी कोहनियाँ कहाँ हैं, उनकी शर्ट का रंग क्या है, रोशनी उनकी त्वचा पर कैसे पड़ रही है, और यहाँ तक कि तिल या बालों के एक रेशे जैसे सूक्ष्म विवरण भी।

आपने जो पेपर साझा किया है, वह इसी तरह के एक सहायक, Sapiens2 का परिचय देता है, जो मानव शरीर को समझने वाला अब तक का सबसे उन्नत संस्करण है। यह एक विशाल कंप्यूटर मस्तिष्क (एक AI मॉडल) है जिसे विशेष रूप से पिछले किसी भी संस्करण की तुलना में तस्वीरों में इंसानों को बेहतर ढंग से समझने के लिए डिज़ाइन किया गया है।

यहाँ बताया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. "छात्र" और "शिक्षक" (यह कैसे सीखता है)

पुराने दिनों में, AI मॉडल एक पहेली के गायब हिस्सों को भरने की कोशिश करके सीखते थे (जैसे कि एक "मास्क्ड इमेज मॉडलिंग" गेम)। वे चेहरे के ऊपर एक बड़े काले वर्ग वाली तस्वीर देखते थे और अनुमान लगाने की कोशिश करते थे कि उसके नीचे क्या है। यह आकृतियों को सीखने के लिए तो अच्छा है, लेकिन यह अर्थ सीखने के लिए बुरा है।

Sapiens2 एक स्मार्ट रणनीति का उपयोग करता है। कल्पना कीजिए कि एक छात्र और एक शिक्षक मिलकर काम कर रहे हैं:

  • पुनर्निर्माण कार्य (The Reconstruction Task): छात्र एक धुंधली, टूटी हुई तस्वीर को फिर से बनाने की कोशिश करता है। यह AI को बारीक विवरण (जैसे त्वचा की बनावट या स्वेटर की बुनाई) देखने के लिए प्रशिक्षित करता है।
  • कंट्रास्टिव कार्य (The Contrastive Task): शिक्षक छात्र को एक ही व्यक्ति की दो अलग-अलग तस्वीरें दिखाता है (शायद एक मुस्कुराते हुए और एक उदास चेहरे वाली) और कहता है, "ये एक ही व्यक्ति हैं!" फिर, शिक्षक एक अलग व्यक्ति की फोटो दिखाता है और कहता है, "यह वही व्यक्ति नहीं है।" यह AI को मुद्रा (pose) या रोशनी की परवाह किए बिना, व्यक्ति के अर्थ और पहचान को समझाता है।

दोनों कार्यों को एक साथ करके, Sapiens2 सूक्ष्म विवरणों (पिक्सेल) और बड़ी तस्वीर (इंसान की अवधारणा) दोनों को देखना सीख जाता है।

2. एक अरब किताबों का पुस्तकालय (डेटा)

विशेषज्ञ बनने के लिए, आपको बहुत सारी किताबें पढ़नी पड़ती हैं। Sapiens2 ने केवल कुछ किताबें नहीं पढ़ीं; इसने इंसानों की 1 अरब उच्च-गुणवत्ता वाली तस्वीरें पढ़ीं।

  • शोधकर्ताओं ने केवल यादृच्छिक (random) तस्वीरें नहीं लीं। उन्होंने इंटरनेट पर मौजूद अरबों छवियोंों में से सर्वश्रेष्ठ को छाँटा।
  • उन्होंने यह सुनिश्चित किया कि पुस्तकालय में सभी उम्र, नस्ल और पृष्ठभूमि के लोग हों, और वे हर तरह के मौसम और रोशनी में हों।
  • नियम: प्रत्येक छवि में कम से कम एक प्रमुख व्यक्ति होना चाहिए। कोई परिदृश्य (landscapes) नहीं, कोई कार नहीं, केवल इंसान।

3. हाई-डेफिनिशन लेंस (रेज़ोल्यूशन)

पिछले मॉडल एक थोड़े धुंधले खिड़की से किसी व्यक्ति को देखने जैसे थे (1K रेज़ोल्यूशन)। वे देख सकते थे कि आप एक व्यक्ति हैं, लेकिन वे एक विशिष्ट झुमका या आपके माथे की झुर्री को मिस कर सकते थे।

Sapiens2 ऐसा है जैसे आपने 4K हाई-डेफिनिशन चश्मा पहन लिया हो।

  • यह बहुत बड़े रेज़ोल्यूशन (4K) पर छवियों को प्रोसेस कर सकता है।
  • क्योंकि यह बहुत अधिक विवरण देख सकता है, यह उन चीजों के बीच अंतर कर सकता है जो दिखने में बहुत समान होती हैं। उदाहरण के लिए, यह आपके दांतों और मसूड़ों के बीच अंतर कर सकता है, या गहरे रंग की शर्ट के सामने एक छोटी सी चेन वाली माला को बिना भ्रमित हुए पहचान सकता है।
  • यह उन चीजों की भी भविष्यवाणी कर सकता है जिन्हें आप सीधे नहीं देख सकते, जैसे आपके चेहरे का 3D आकार (गहराई) या आपकी त्वचा से रोशनी कैसे टकराती है (अलबेडो/albedo)।

4. स्विस आर्मी नाइफ (बहुमुखी प्रतिभा)

पुराने AI मॉडल अक्सर एक विशिष्ट उपकरण की तरह होते थे: एक हड्डियों को खोजने के लिए, दूसरा बाल काटने के लिए, और तीसरा त्वचा को मापने के लिए। यदि आप दो काम करना चाहते थे, तो आपको दो अलग-अलग उपकरणों की आवश्यकता होती थी।

Sapiens2 एक स्विस आर्मी नाइफ है। क्योंकि इसने इंसानों की इतनी गहरी समझ विकसित की है, आप इसका लगभग किसी भी काम के लिए उपयोग कर सकते हैं:

  • पोज़ एस्टीमेशन (Pose Estimation): व्यक्ति के ऊपर एक कंकाल बनाना ताकि यह देखा जा सके कि उनके जोड़ वास्तव में कहाँ हैं (भले ही वे योग की मुद्रा में हों)।
  • सेगमेंटेशन (Segmentation): हर एक हिस्से (होंठ, जीभ, कान, जूते) को पूरी सटीकता के साथ रंगना।
  • 3D मॉडलिंग (3D Modeling): एक सपाट 2D फोटो को व्यक्ति की सतह के 3D मानचित्र में बदलना।
  • लाइटिंग (Lighting): यह पता लगाना कि रोशनी व्यक्ति पर ठीक कैसे पड़ती है ताकि आप बाद में डिजिटल रूप से लाइटिंग बदल सकें (जैसे कि किसी फिल्म में)।

5. यह एक बड़ी बात क्यों है?

पेपर का दावा है कि Sapiens2 नया "स्टेट-ऑफ-द-आर्ट" (State-of-the-Art) है। इसे ब्लैक-एंड-व्हाइट टीवी से 4K HDR स्क्रीन में अपग्रेड करने जैसा समझें।

  • यह अधिक सटीक है: यह कठिन कार्यों पर कम गलतियाँ करता है।
  • यह अधिक विस्तृत है: यह केवल रूपरेखा नहीं, बल्कि छवि की "आत्मा" को पकड़ता है।
  • यह कुशल है: भले ही यह बहुत बड़ा है (5 बिलियन "न्यूरॉन्स" या पैरामीटर्स तक), शोधकर्ताओं ने इसे आधुनिक कंप्यूटरों पर कुशलतापूर्वक चलाने के लिए बनाया है।

संक्षेप में: Sapiens2 एक सुपर-पावर्ड AI है जिसने लोगों की एक अरब तस्वीरों का अध्ययन किया है। यह "करीब से देखने" और "गहराई से समझने" को जोड़ता है ताकि एक ऐसा मॉडल बनाया जा सके जो कंप्यूटरों द्वारा पहले कभी किए गए काम से बेहतर तरीके से तस्वीरों में इंसानों को देख, माप और समझ सके। यह भविष्य की तकनीक जैसे यथार्थवादी वर्चुअल अवतार, बेहतर मेडिकल इमेजिंग और उन्नत ऑगमेंटेड रियलिटी (AR) की नींव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →