← नवीनतम पेपर
💻 computer science

Falcon Perception

यह शोध पत्र फाल्कन परसेप्शन (Falcon Perception) को प्रस्तुत करता है, जो एक एकीकृत सघन ट्रांसफॉर्मर (unified dense Transformer) है जो पारंपरिक मॉड्यूलर एनकोडर-डिकोडर पाइपलाइनों के स्थान पर एक एकल अर्ली-फ्यूजन आर्किटेक्चर को प्रतिस्थापित करता है ताकि धारणा (perception) और कार्य मॉडलिंग (task modeling) को एक साथ संभाला जा सके, जो सरल डिज़ाइन और विशिष्ट प्रशिक्षण संकेतों के माध्यम से मास्क प्रेडिक्शन और OCR कार्यों में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Aviraj Bevli, Sofian Chaybouti, Yasser Dahou, Hakim Hacid, Ngoc Dung Huynh, Phuc H. Le Khac, Sanath Narayan, Wamiq Reyaz Para, Ankit Singh

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aviraj Bevli, Sofian Chaybouti, Yasser Dahou, Hakim Hacid, Ngoc Dung Huynh, Phuc H. Le Khac, Sanath Narayan, Wamiq Reyaz Para, Ankit Singh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सिखाने की कोशिश कर रहे हैं कि एक बिखरे हुए कमरे को कैसे देखा जाए, आपके निर्देशों को कैसे सुना जाए और फिर ठीक से बताए कि विशिष्ट वस्तुएं कहाँ हैं, और यहाँ तक कि उनके चारों ओर एक सटीक रूपरेखा (outline) भी खींचे।

परंपरागत रूप से, इंजीनियरों ने रोबोट बनाने के लिए "दो-व्यक्ति टीम" (Two-Person Team) दृष्टिकोण का उपयोग किया:

  1. फोटोग्राफर (एन्कोडर - Encoder): एक विशेषज्ञ जो कमरे की तस्वीर लेता है और जो कुछ भी वह देखता है उसका एक विस्तृत मानचित्र बनाता है।
  2. डिटेक्टिव (डिकोडर - Decoder): एक अलग विशेषज्ञ जो उस मानचित्र को देखता है और अनुमान लगाने की कोशिश करता है कि आपने क्या पूछा था।

समस्या क्या है? फोटोग्राफर और डिटेक्टिव अंत तक एक-दूसरे से बात नहीं करते हैं। यदि फोटोग्राफर कोई सूक्ष्म विवरण छोड़ देता है, तो डिटेक्टिव उसे ठीक नहीं कर सकता। यदि डिटेक्टिव किसी जटिल निर्देश (जैसे, "नीली किताब के पीछे वाला लाल कप") से भ्रमित हो जाता है, तो उसे एक स्थिर मानचित्र के आधार पर अनुमान लगाना पड़ता है, न कि जीवंत दृश्य के आधार से।

फाल्कन परसेप्शन (Falcon Perception) एक नया रोबोट है जो कहता है: "दो लोग क्यों होने चाहिए? आइए एक सुपर-स्मार्ट दिमाग रखें जो सब कुछ एक साथ कर सके।"

यह यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं के साथ:

1. "ऑल-इन-वन" मस्तिष्क (अर्ली फ्यूजन - Early Fusion)

एक फोटोग्राफर और एक डिटेक्टिव के बजाय, फाल्कन परसेप्शन एक एकल, एकीकृत मस्तिष्क है।

  • यह कैसे काम करता है: यह पहले क्षण से ही छवि के पिक्सेल और आपके वाक्य के शब्दों को देखता है और उन्हें एक साथ मिला देता है।
  • उपमा: कल्पना कीजिए कि एक शेफ जो केवल सब्जियों को काटता नहीं है (दृष्टि) और फिर बाद में मसालों को जोड़ता है (टेक्स्ट)। इसके बजाय, शेफ प्याज काटते समय ही सॉस को चखता है। प्याज का स्वाद काटने के तरीके को बदल देता है, और मसाला स्वाद को बदल देता है। यह रोबोट को "मेज के नीचे बिल्ली" जैसे जटिल संबंधों को पुराने दो-चरणीय तरीके की तुलना में बहुत बेहतर ढंग से समझने की अनुमति देता है।

2. "परसेप्शन की श्रृंखला" (कार्य करने से पहले सोचना - Chain of Perception)

जब आप रोबोट को कुछ खोजने के लिए कहते हैं, तो वह तुरंत रूपरेखा नहीं बना देता। यह एक सख्त, तार्किक क्रम का पालन करता है, जैसे कोई जासूस अपराध सुलझाता है:

  1. यह कहाँ है? (निर्देशांक - Coordinates)
  2. यह कितना बड़ा है? (आकार - Size)
  3. यह कैसा दिखता है? (मास्क/रूपरेखा - Mask/Outline)
  • उपमा: एक पोर्ट्रेट (चित्र) बनाने के बारे में सोचें। आप आँखों को रंगना शुरू नहीं करते हैं। पहले, आप सिर की रूपरेखा खींचते हैं (कहाँ?), फिर आप चेहरे का आकार तय करते हैं (आकार?), और फिर आप विवरण भरते हैं (मास्क?)।
  • यह कैसे मदद करता है: रोबोट को रूपरेखा बनाने से पहले "कहाँ" और "कितना बड़ा" का पता लगाने के लिए मजबूर करके, यह भ्रमित होने से बचता है। यह पेंट करने से पहले ठीक जानता है कि वह किस वस्तु के बारे में बात कर रहा है।

3. "विशेष ब्रश" (लाइटवेट हेड्स - Specialized Paintbrushes)

भले ही मस्तिष्क एक बड़ी इकाई है, लेकिन रोबोट के पास अलग-अलग कामों के लिए अलग-अलग "उपकरण" हैं।

  • उपमा: एक स्विस आर्मी नाइफ की कल्पना करें। मुख्य हैंडल मस्तिष्क (ट्रांसफॉर्मर) है, लेकिन इसमें पेंचों के लिए पेचकश, काटने के लिए चाकू और बोतलों के लिए कॉर्कस्क्रू है।
  • पेपर में: रोबोट निर्देशांक मापने के लिए एक "फोरियर फीचर" (Fourier Feature) टूल का उपयोग करता है (एक अत्यंत सटीक रूलर की तरह) और मास्क पेंट करने के लिए एक "डॉट प्रोडक्ट" (Dot Product) टूल का उपयोग करता है (एक स्प्रे पेंटर की तरह जो तुरंत आकार भर देता है)। यह रोबोट को तेज़ और कुशल रखता है, भले ही वह जटिल गणित कर रहा हो।

4. "भीड़भाड़ वाला कमरा" टेस्ट (PBench)

शोधकर्ताओं ने एक नया टेस्ट बनाया जिसे PBench कहा जाता है, ताकि यह देखा जा सके कि क्या रोबोट कठिन स्थितियों को संभाल सकता है।

  • स्तर (Levels):
    • स्तर 1: "कप ढूंढो।" (आसान)
    • स्तर 2: "तारे वाला कप ढूंढो।" (विशेषताएं - Attributes)
    • स्तर 3: "वह कप ढूंढो जिस पर 'Starbucks' लिखा है।" (टेक्स्ट पढ़ना/OCR)
    • स्तर 4: "किताब के बाईं ओर वाला कप ढूंढो।" (स्थानिक तर्क - Spatial logic)
    • स्तर 5: "चम्मच पकड़े हुए कप को ढूंढो।" (संबंध - Relationships)
  • परिणाम: पुराने रोबोट (जैसे SAM 3) स्तर 1 में बहुत अच्छे थे लेकिन स्तर 4 और 5 पर भ्रमित हो गए। फाल्कन परसेप्शन कठिन स्तरों में उत्कृष्ट रहा क्योंकि इसके "मस्तिष्क" ने शब्दों और छवि के बीच के संबंध को तुरंत समझ लिया।

5. "जादुई ट्रिक" (सैंपलिंग - Sampling)

कभी-कभी, रोबोट का पहला अनुमान सही नहीं होता है। लेकिन क्योंकि यह संभावनाओं (इंसानों की तरह अनुमान लगाने) में सोचता है, इसलिए उसके दिमाग में कई संभावित उत्तर होते हैं।

  • उपमा: यदि आप किसी इंसान से पूछते हैं "बिल्ली कहाँ है?", तो वे कह सकते हैं "शायद सोफे पर, शायद बिस्तर के नीचे।" यदि आप उन्हें 8 अलग-अलग संभावनाओं की जांच करने देते हैं, तो वे लगभग निश्चित रूप से सही चीज़ ढूंढ लेंगे।
  • परिणाम: शोधकर्ताओं ने पाया कि यदि वे रोबोट को 8 अलग-अलग अनुमान लगाने और सबसे अच्छा चुनने देते हैं, तो इसकी सटीकता आसमान छू जाती है, जो बहुत बड़े और महंगे मॉडलों को भी पीछे छोड़ देती है।

6. "कॉम्पैक्ट OCR" (Falcon OCR)

उन्होंने इसी "ऑल-इन-वन ब्रेन" को बहुत छोटा (300 मिलियन पैरामीटर्स) भी बनाया है ताकि दस्तावेजों से टेक्स्ट पढ़ा जा सके।

  • उपमा: आमतौर पर, एक अस्त-व्यस्त दस्तावेज़ को पढ़ने के लिए एक विशाल सुपरकंप्यूटर की आवश्यकता होती है। Falcon OCR एक स्मार्टफोन ऐप की तरह है जो एक सुपरकंप्यूटर के समान ही हाथ से लिखे या छपे हुए दस्तावेज़ को पढ़ सकता है, लेकिन यह आपकी जेब में समा जाता है और अविश्वसनीय रूप से तेज़ चलता है।

मुख्य निष्कर्ष (The Big Takeaway)

AI बनाने का पुराना तरीका कई अलग-अलग असेंबली लाइनों वाले कारखाने के निर्माण जैसा था। यदि एक लाइन टूट जाती, तो पूरा काम रुक जाता।

फाल्कन परसेप्शन एक एकल, स्व-चालित कार (self-driving car) की तरह है। यह सड़क देखता है, यातायात संकेतों को समझता है, और एक ही समय में स्टीयरिंग व्हील घुमाता है। यह सरल है, तेज़ है, और पुराने "दो-व्यक्ति टीम" वाले रोबोटों की तुलना में जटिल, भीड़भाड़ वाली और भ्रमित करने वाली स्थितियों को बहुत बेहतर तरीके से संभालता है।

संक्षेप में: उन्होंने साबित किया कि दुनिया को समझने के लिए आपको एक जटिल, बहु-चरणीय मशीन की आवश्यकता नहीं है। आपको बस एक स्मार्ट दिमाग चाहिए जो एक साथ देखना और बोलना सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →