← नवीनतम पेपर
💻 computer science

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can एक नवीन दो-चरणीय ढांचा है जो स्थानिक लेआउट योजना को पहचान रेंडरिंग से अलग करके मल्टी-ह्यूमन इमेज जनरेशन में मौजूदा मॉडलों की सीमाओं को दूर करता है, जिसमें एक आर्किटेक्ट (Architect) का उपयोग संरचित स्थितियों की भविष्यवाणी करने के लिए और एक आर्टिस्ट (Artist) का उपयोग GRPO अनुकूलन के माध्यम से उच्च गणना सटीकता और पहचान संरक्षण के साथ फोटोरियलिस्टिक चित्र संश्लेषित करने के लिए किया जाता है।

मूल लेखक: Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

प्रकाशित 2026-04-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-स्टेक्स पारिवारिक पुनर्मिलन (फैमिली रियूनियन) फोटो आयोजित करने की कोशिश कर रहे हैं। आपके पास विशिष्ट लोगों की एक सूची है (आपकी "पहचानें/identities") और उनके द्वारा किए जा रहे कार्यों का विवरण है (आपका "प्रॉम्ट")।

यदि आप एक मानक AI से "कॉफी पीते हुए पांच दोस्तों की एक फोटो लें" कहते हैं, तो यह अक्सर भ्रमित हो जाता है। यह दो लोगों को मिलाकर एक अजीब दो सिर वाला राक्षस बना सकता है, एक ही व्यक्ति को तीन बार दोहरा सकता है, या आपके दोस्तों में से एक को पूरी तरह से भूल सकता है। यह एक अराजक कलाकार की तरह है जो इस बात का ध्यान नहीं रख पाता कि किसे कहाँ बैठना है।

Ar2Can एक नया सिस्टम है जिसे इस गड़बड़ी को ठीक करने के लिए डिज़ाइन किया गया है। इसके लेखकों (Qualcomm AI Research से) ने महसूस किया कि समस्या यह नहीं है कि AI चेहरे बनाने या शब्दों को समझने में असमर्थ है; समस्या यह है कि यह दोनों काम एक साथ करने की कोशिश करता है।

इस समस्या को हल करने के लिए, उन्होंने काम को दो अलग-अलग भूमिकाओं में विभाजित किया है, जैसे कि एक निर्माण परियोजना (construction project): द आर्किटेक्ट (The Architect) और द आर्टिस्ट (The Artist)

1. द आर्किटेक्ट (द प्लानर - योजनाकार)

एक भी ब्रश स्ट्रोक लगाने से पहले, आपको एक ब्लूप्रिंट की आवश्यकता होती है।

  • यह क्या करता है: आर्किटेक्ट आपके टेक्स्ट प्रॉम्ट (जैसे, "बास्केटबॉल खेलते हुए तीन लोग") को पढ़ता है और एक सख्त मानचित्र (map) बनाता है। यह तय करता है कि प्रत्येक व्यक्ति को वास्तव में कहाँ खड़ा होना चाहिए, वे कितने बड़े होने चाहिए, और वहां कितने लोग होने चाहिए।
  • उपमा: आर्किटेक्ट को एक निर्माण दल पर एक साइट मैनेजर के रूप में सोचें। वे ईंटें नहीं बिछाते या दीवारें नहीं पेंट करते। वे बस जमीन की ओर इशारा करते हैं और कहते हैं, "तुम, यहाँ खड़े हो जाओ। तुम, वहाँ खड़े हो जाओ। सुनिश्चित करो कि तुम में से ठीक तीन ही यहाँ हो।"
  • यह कैसे मदद करता है: "कहाँ" को "कौन" से अलग करके, यह सिस्टम AI को इस बात पर भ्रमित होने से रोकता है कि किसे कहाँ होना चाहिए। यह "दो सिर वाले राक्षस" की समस्या को रोकता है क्योंकि ड्राइंग शुरू होने से पहले ही योजना पत्थर की लकीर बन जाती है।

पेपर वास्तव में दो प्रकार के आर्किटेक्ट प्रदान करता है:

  • आर्किटेक्ट-A: एक टेक्स्ट-सक्षम योजनाकार जो गिनती करने में माहिर है (जैसे, "मैंने देखा कि आपने 'पांच दोस्त' कहा है, इसलिए मैं पांच बॉक्स बनाऊंगा")।
  • आर्किटेक्ट-B: एक विजुअल प्लानर जो यह समझने में माहिर है कि लोग स्वाभाविक रूप से एक समूह में कैसे खड़े होते हैं (जैसे, "लोग आमतौर पर एक सीधी रेखा में नहीं खड़े होते; चलिए इसे स्वाभाविक बनाते हैं")।

2. द आर्टिस्ट (द पेंटर - चित्रकार)

एक बार जब आर्किटेक्ट मैप सौंप देता है, तो आर्टिस्ट कार्यभार संभाल लेता है।

  • यह क्या करता है: आर्टिस्ट मैप और आपके दोस्तों की तस्वीरों (संदर्भ पहचान/reference identities) को देखता है। उनका काम एक यथार्थवादी दृश्य पेंट करना है जहाँ वे विशिष्ट लोग ठीक उन्हीं स्थानों पर दिखाई दें जिन्हें आर्किटेक्ट ने चिह्नित किया है।
  • उपमा: आर्टिस्ट को एक मास्टर पोर्ट्रेट पेंटर के रूप में सोचें जिन्हें विशिष्ट स्थानों पर रखे गए पुतलों (mannequins) का एक सेट दिया गया है। उनका काम आपके दोस्तों के चेहरों को उन पुतलों पर इतनी सटीकता से पेंट करना है कि वह एक असली फोटो जैसा लगे, बिना चेहरों को आपस में मिलाए।

सीक्रेट सॉस: द "हंगेरियन" मैच (The "Hungarian" Match)

यही वह चतुर हिस्सा है जो आर्टिस्ट को इतना अच्छा बनाता है।

आमतौर पर, यदि आप AI को कहते हैं, "जॉन का चेहरा बॉक्स A में रखें," तो AI जॉन के चेहरे को सटीक निर्देशांकों (coordinates) पर चिपकाने की कोशिश कर सकता है। यह अक्सर नकली दिखता है, जैसे कोई बहुत बड़ा या बहुत छोटा स्टिकर हो।

Ar2Can एक स्मार्ट मैचिंग ट्रिक का उपयोग करता है जिसे हंगेरियन मैचिंग (Hungarian Matching) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आपके पास लोगों का एक समूह है (वे चेहरे जिन्हें आप चाहते हैं) और खाली कुर्सियों का एक समूह है (वे बॉक्स जो आर्किटेक्ट ने बनाए हैं)। यह देखने के बजाय कि व्यक्ति A को कुर्सी A में जबरदस्ती फिट किया जाए, सिस्टम पूरे समूह को देखता है। यह कहता है, "व्यक्ति A कुर्सी 2 में सबसे अच्छी तरह फिट बैठता है, और व्यक्ति B कुर्सी 1 में सबसे अच्छी तरह फिट बैठता है।"
  • परिणाम: यह AI को चेहरों के आकार और स्थिति को थोड़ा समायोजित करने की अनुमति देता है ताकि वे स्वाभाविक दिखें, जबकि यह भी सुनिश्चित करता है कि सही व्यक्ति सही सामान्य क्षेत्र में रहे। यह "कॉपी-पेस्ट" वाले लुक को रोकता है।

ट्रेनिंग: करके सीखना (रीइन्फोर्समेंट लर्निंग)

उन्होंने आर्टिस्ट को लाखों वास्तविक तस्वीरों के बिना इतना अच्छा कैसे बनाया?

  • उन्होंने रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) तकनीक का उपयोग किया (जैसे कुत्ते को ट्रीट देकर प्रशिक्षित करना)।
  • AI एक छवि उत्पन्न करता है, और फिर एक "जज" (एक रिवॉर्ड सिस्टम) तीन चीजों की जांच करता है:
    1. गिनती (Count): क्या हमें लोगों की सही संख्या मिली?
    2. पहचान (Identity): क्या चेहरे संदर्भ तस्वीरों की तरह दिखते हैं?
    3. गुणवत्ता (Quality): क्या यह एक वास्तविक फोटो जैसा दिखता है?
  • यदि AI गलती करता है (जैसे, दो चेहरों को मिला देता है), तो उसे "खराब स्कोर" मिलता है। यदि वह सही करता है, तो उसे "ट्रीट" (इनाम) मिलता है। समय के साथ, AI इन नियमों को संतुलित करने के लिए सीख जाता है ताकि एकदम सटीक ग्रुप फोटो बनाई जा सके।

यह क्यों महत्वपूर्ण है

अधिकांश अन्य AI मॉडल एक "वन-मैन बैंड" बनने की कोशिश करते हैं, जो लेआउट की योजना बनाने और चित्र बनाने का काम एक साथ करने की कोशिश करते हैं। यह पेपर दिखाता है कि विशेषज्ञता (specialization) बेहतर काम करती है

  • आर्किटेक्ट तर्क (गिनती और स्पेसिंग) को संभालता है।
  • आर्टिस्ट रचनात्मकता (लाइटिंग, टेक्सचर और पहचान) को संभालता है।

इस दो-चरणीय दृष्टिकोण का उपयोग करके, Ar2Can 3, 4 या यहाँ तक कि 5 अलग-अलग लोगों के स्वाभाविक रूप से बातचीत करने वाली तस्वीरें बना सकता है, बिना उनके आपस में मिलने या गायब होने के। यह वास्तविक समूह दृश्यों को बनाने में एक बड़ी छलांग है, और वह भी मुख्य रूप से सिंथेटिक (कंप्यूटर-जनित) डेटा का उपयोग करके, जिसका अर्थ है कि उन्हें इसे बनाने के लिए लाखों वास्तविक लोगों की तस्वीरें चुराने की आवश्यकता नहीं पड़ी।

संक्षेप में: Ar2Can एक सख्त प्रोजेक्ट मैनेजर को फ्लोर प्लान बनाने के लिए नियुक्त करने और फिर एक विश्व स्तरीय कलाकार को कमरा पेंट करने के लिए नियुक्त करने जैसा है। परिणाम? एक बेहतरीन ग्रुप फोटो जहाँ हर कोई अपनी सही जगह पर है, और बिल्कुल अपने जैसा दिख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →