← नवीनतम पेपर
💻 computer science

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

यह शोध पत्र COCOTree प्रस्तुत करता है, जो ओपन ट्री-स्ट्रक्चर्ड विजुअल डीकंपोजिशन के लिए एक विशाल-स्तरीय डेटासेट और बेंचमार्क है, जो 21K छवियों में 1.8M पदानुक्रमित नोड्स उत्पन्न करने के लिए एक स्वचालित LVLM और SAM 3 पाइपलाइन का लाभ उठाता है, जिसके साथ मास्क परिशुद्धता, लेबल सटीकता और संरचनात्मक निरंतरता का आकलन करने के लिए एक नया मूल्यांकन मीट्रिक (OTQ) भी दिया गया है।

मूल लेखक: Junhyub Lee, Seunghun Chae, Hyosu Kim

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junhyub Lee, Seunghun Chae, Hyosu Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रसोई की तस्वीर देख रहे हैं।

पुराना तरीका:
पारंपरिक कंप्यूटर विज़न उपकरण उस फोटो को देखते हैं और कहते हैं, "मुझे एक व्यक्ति, एक मेज और एक कुर्सी दिख रही है।" वे शायद उस व्यक्ति को थोड़ा और तोड़ भी सकते हैं: "सिर, धड़, हाथ।" लेकिन वे वहीं रुक जाते हैं। वे छवि को वस्तुओं की एक सपाट सूची की तरह मानते हैं। यदि आप कंप्यूटर से पूछते हैं, "वह कैबिनेट से जुड़ा हुआ हैंडल क्या है?", तो वह शायद केवल अंतरिक्ष में तैरते हुए एक "हैंडल" को देखेगा। उसे यह नहीं पता होगा कि वह हैंडल कैबिनेट का हिस्सा है, जो रसोई का हिस्सा है, या वह हैंडल एक विशिष्ट नॉब और पेंच से बना है। उसमें वस्तुओं का "फैमिली ट्री" (वंशवृक्ष) बनाने की क्षमता नहीं है।

नया तरीका (COCOTREE):
यह पेपर COCOTREE पेश करता है, जो कंप्यूटर को दुनिया को केवल एक सपाट सूची के रूप में नहीं, बल्कि एक विशाल, शाखाओं वाले फैमिली ट्री के रूप में देखने का सिखाने का एक नया तरीका है।

इसे एक रशियन नेस्टिंग डॉल (रूसी गुड़िया) या जड़ों और शाखाओं वाले पेड़ की तरह समझें:

  1. जड़ (Root): पूरी छवि तना है।
  2. शाखाएं (Branches): तना बड़ी वस्तुओं में विभाजित होता है (एक व्यक्ति, एक कैबिनेट)।
  3. टहनियां (Twigs): वे वस्तुएं और भी हिस्सों में विभाजित होती हैं (कैबिनेट, दरवाजे, शेल्फ और हैंडल में विभाजित होता है)।
  4. पत्तियां (Leaves): हिस्से और भी गहराई तक विभाजित होते हैं (हैंडल, नॉब और पेंच में विभाजित होता है)।

लक्ष्य हर दृश्य भाग का मानचित्र बनाना है, जो किसी वस्तु के सबसे छोटे विवरण तक जाता है, और उन्हें एक तार्किक पदानुक्रम (hierarchy) में जोड़ता है।

उन्होंने इसे कैसे बनाया? (रोबोट शेफ)

हजारों तस्वीरों के लिए इस तरह का नक्शा हाथ से बनाना असंभव होगा। इंसानों को हर एक पेंच और कब्जे (hinge) को लेबल करने में सालों लग जाएंगे।

इसके बजाय, लेखकों ने उनके लिए काम करने के लिए एक पूरी तरह से स्वचालित "रोबोट शेफ" बनाया। यह रोबोट दो शक्तिशाली AI उपकरणों के मेल का उपयोग करता है:

  1. दिमाग (LVLM): एक लार्ज विजन-लैंग्वेज मॉडल एक जिज्ञासु शेफ की तरह कार्य करता है। वह छवि को देखता है और कहता है, "मुझे एक कैबिनेट दिख रहा है। इसके अंदर क्या है? आह, एक शेल्फ और एक हैंडल!" वह अपने "कॉमन सेंस" का उपयोग करके अनुमान लगाता है कि कौन से भाग मौजूद हैं।
  2. हाथ (SAM 3): एक सटीक सेगमेंटेशन मॉडल स्थिर हाथों की एक जोड़ी की तरह कार्य करता है। एक बार जब 'दिमाग' "हैंडल" का अनुमान लगा लेता है, तो 'हाथ' उस विशिष्ट हैंडल के चारों ओर एक सटीक रूपरेखा खींच देते हैं।

प्रक्रिया:
रोबोट पूरी छवि से शुरू करता है। वह 'दिमाग' से मुख्य भाग खोजने के लिए कहता है। 'हाथ' उनके चारों ओर रेखाएं खींचते हैं। फिर, रोबमान केवल उस "कैबिनेट" वाले हिस्से को लेता है, ज़ूम इन करता है, और फिर से 'दिमाग' से पूछता है: "अब जब मैं केवल कैबिनेट को देख रहा हूँ, तो मुझे क्या दिख रहा है?" 'दिमाग' कहता है: "एक दरवाजा और एक हैंडल।" 'हाथ' उन्हें खींचते हैं। यह प्रक्रिया बार-बार (recursively) तब तक चलती है जब तक कि रोबोट और छोटे हिस्से नहीं ढूंढ पाता।

परिणाम: पेड़ों का एक विशाल पुस्तकालय

परिणाम COCOTREE है, जिसमें 21,000 से अधिक चित्र और 1.8 मिलियन स्ट्रक्चरल नोड्स (वस्तुओं के हिस्से) शामिल हैं।

  • अनकन्स्ट्रेंड (Unconstrained): पुराने डेटासेट्स के विपरीत जो केवल 80 या 100 विशिष्ट शब्दों (जैसे "कुत्ता" या "कार") को जानते हैं, यह डेटासेट एक "ओपन वोकैबुलरी" का उपयोग करता है। यह किसी अजीब या अद्वितीय वस्तु को एक लंबे, विशिष्ट विवरण के साथ लेबल कर सकता है यदि वह उसे देखता है।
  • गहराई (Deep): यह पिछले तरीकों की तुलना में बहुत अधिक गहरा है। जहाँ पुराने डेटासेट्स शायद "दरवाजा" पर रुक जाते, यह "दरवाजा -> हैंडल -> नॉब -> पेंच" तक जाता है।
  • सत्यापित (Verified): लेखकों ने केवल रोबोट पर भरोसा नहीं किया। उन्होंने काम की जांच करने के लिए 20 मानव समीक्षकों को लगाया। इंसानों ने पुष्टि की कि रोबोट के "फैमिली ट्री" सटीक थे और वे उसी तरह थे जैसे इंसान दुनिया को देखते हैं।

हम रोबोट को ग्रेड कैसे देते हैं? (OTQ स्कोर)

आप उस टेस्ट को कैसे ग्रेड करेंगे जहाँ उत्तर जटिल पेड़ (trees) हैं? आप केवल यह चेक नहीं कर सकते कि रोबोट ने "कार" को सही पहचाना या नहीं। आपको यह भी देखना होगा:

  1. क्या उसने पहिये की रूपरेखा सही ढंग से खींची? (मास्क प्रिसिजन)
  2. क्या उसने इसे "टायर" के बजाय "व्हील" कहा? (लेबल सटीकता)
  3. क्या उसने व्हील को कार के नीचे और टायर को व्हील के नीचे सही ढंग से रखा? (स्ट्रक्चरल कंसिस्टेंसी)

इसे करने के लिए, उन्होंने OTQ (ओपन ट्री क्वालिटी) नामक एक नया स्कोरिंग सिस्टम बनाया। यह एक रिपोर्ट कार्ड की तरह है जो एक एकल स्कोर देता है कि रोबोट ने चित्र कितनी अच्छी तरह बनाया, भागों को क्या नाम दिया, और फैमिली ट्री को कितनी अच्छी तरह व्यवस्थित किया।

सारांश

संक्षेप में, COCOTREE एक विशाल, स्वचालित रूप से निर्मित लाइब्रेरी है जो कंप्यूटर को परतों (layers) में दुनिया को देखना सिखाती है। यह केवल "तस्वीर में क्या है" से आगे बढ़कर "तस्वीर की चीजें कैसे बनी हैं और आपस में कैसे जुड़ी हैं" तक जाती है, जिसमें नक्शा बनाने के लिए AI रोबोटों की एक टीम और नक्शे की सटीकता सुनिश्चित करने के लिए मानव समीक्षकों का उपयोग किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →