← नवीनतम पेपर
💻 computer science

RVLM: Recursive Vision-Language Models with Adaptive Depth

यह शोध पत्र RVLM को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो ऑडिट करने योग्य, कोड-आधारित तर्क के लिए एक पुनरावृत्ति जनरेट-एक्जीक्यूट लूप और कार्य की जटिलता के आधार पर कम्प्यूटेशनल संसाधनों को अनुकूलित करने वाले एक अनुकूली डेप्थ कंट्रोलर (RRouter) को जोड़कर मेडिकल एआई को उन्नत करता है, जो ब्रेन एमआरआई और चेस्ट एक्स-रे डेटासेट पर उच्च निरंतरता और सटीकता प्रदर्शित करता है।

मूल लेखक: Nicanor Mayumu, Zeenath Khan, Melodena Stephens, Patrick Mukala, Farhad Oroumchian

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicanor Mayumu, Zeenath Khan, Melodena Stephens, Patrick Mukala, Farhad Oroumchian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल चिकित्सा रहस्य को सुलझाने की कोशिश कर रहे हैं, जैसे कि ब्रेन स्कैन में छिपे हुए ट्यूमर को ढूंढना या चेस्ट एक्स-रे में किसी समस्या का पता लगाना।

पुराना तरीका (द "ब्लैक बॉक्स" डिटेक्टिव):
वर्तमान में, अधिकांश AI डॉक्टर एक जादूगर की तरह काम करते हैं जो टोपी से खरगोश निकालता है। आप उन्हें तस्वीर दिखाते हैं, और पफ—वे आपको उत्तर दे देते हैं। "वहाँ एक ट्यूमर है।" लेकिन वे यह नहीं बताएंगे कि उन्होंने इसे कैसे पाया, उन्होंने किन सुरागों को देखा, या वे इस बात के बारे में कितने आश्वस्त हैं। यदि एक मानव डॉक्टर पूछता है, "आपको कैसे पता चला?" तो AI बस कहता है, "मेरे कंप्यूटर दिमाग ने बताया।" चिकित्सा के क्षेत्र में यह खतरनाक है क्योंकि डॉक्टरों को केवल परिणाम की नहीं, बल्कि साक्ष्यों की आवश्यकता होती है।

नया तरीका (RVLM: द "मेथोडिकल डिटेक्टिव"):
यह पेपर एक नई प्रणाली पेश करता है जिसे RVLM (रिकर्सिव विजन-लैंग्वेज मॉडल) कहा जाता है। एक ही बार में उत्तर का अनुमान लगाने के बजाय, RVLM एक अत्यंत व्यवस्थित जासूस की तरह कार्य करता है जो अपनी जांच का हर एक कदम एक नोटबुक में लिखता है (जो कि कंप्यूटर कोड है)।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. "डू-इट-योरसेल्फ" टूलकिट (द REPL)

कल्पना कीजिए कि AI केवल अपनी आँखों से एक्स-रे को नहीं देख रहा है; उसके पास एक टूलबॉक्स है।

  • पुराना AI: पूरी तस्वीर को देखता है और अनुमान लगाता है।
  • RVLM: तस्वीर लेता है, एक विशिष्ट स्थान पर ज़ूम करता है, बारीकी से देखने के लिए एक हिस्सा काटता है, कंट्रास्ट को बढ़ाता है, और दूसरे प्रकार के स्कैन के साथ तुलना करता है। यह यह करने के लिए एक छोटा सा स्क्रिप्ट (कोड) लिखता है: "ठीक है, आइए मस्तिष्क के बाएं हिस्से को क्रॉप करें, इसे चमकीला बनाएं, और एक सब-AI से पूछें, 'क्या आपको यहाँ ट्यूमर दिख रहा है?'"
  • परिणाम: AI द्वारा किया गया प्रत्येक दावा एक "रसीद" (कोड) द्वारा समर्थित है। यदि कोई डॉक्टर काम की जाँच करना चाहता है, तो वे कोड को फिर से चला सकते हैं और देख सकते हैं कि AI ने वास्तव में क्या देखा। यह अपने उत्तर के बजाय अपना गणित का होमवर्क दिखाने जैसा है।

2. "स्मार्ट मैनेजर" (RECURSIONROUTER)

दूसरा मुद्दा जिसे यह पेपर हल करता है, वह है दक्षता (एफिशिएंसी)

  • पुराना तरीका: कल्पना कीजिए कि एक मैनेजर अपने प्रत्येक कर्मचारी को बताता है, "आपको ठीक 12 घंटे काम करना होगा, चाहे कुछ भी हो।"
    • यदि कार्य आसान है (जैसे एक छोटा, स्पष्ट ट्यूमर ढूंढना), तो कर्मचारी 9 घंटे बिना कुछ किए बर्बाद कर देता है।
    • यदि कार्य कठिन है (जैसे एक उलझा हुआ, जटिल ट्यूमर), तो 12 घंटे पर्याप्त नहीं होते, और काम पूरा होने से पहले ही उनका समय समाप्त हो जाता है।
  • RVLM का तरीका: इस प्रणाली में एक स्मार्ट मैनेजर (जिसे RECURSIONROUTER कहा जाता है) है। काम शुरू होने से पहले, मैनेजर केस को देखता है और पूछता है: "यह कितना कठिन है?"
    • आसान केस: "यह सरल लग रहा है। आइए 3 त्वरित जाँच करें और रुक जाएँ।" (समय और पैसा बचाता है)।
    • कठिन केस: "यह उलझा हुआ लग रहा है। आइए यह सुनिश्चित करने के लिए 6 या 7 गहरी जाँचों की योजना बनाएं कि हम कुछ भी मिस न कर दें।"
    • "स्टाल" चेक: मैनेजर काम पर नज़र भी रखता है। यदि AI अटक जाता है और बिना कोई नया सुराग मिले बार-बार एक ही चीज़ दोहराता रहता है, तो मैनेजर कहता है, "रुक जाओ! हम कुछ भी नया नहीं सीख रहे हैं," और सत्र को जल्दी समाप्त कर देता है।

3. "अनुवादक" (द रिपोर्ट जनरेटर)

चूंकि AI की "नोटबुक" कंप्यूटर कोड से भरी है (जो इंसानों को डरावना लग सकता है), सिस्टम में एक अंतिम चरण होता है: एक अनुवादक (ट्रांसलेटर)

  • यह सभी कोड, ज़ूम की गई छवियों और चरण-दर-चरण तर्क को लेता है, और इसे एक साफ, पेशेवर मेडिकल रिपोर्ट में बदल देता है जिसे एक मानव डॉक्टर पढ़ सके।
  • यह नीचे एक छोटा सा नोट भी जोड़ता है: "यह AI द्वारा जेनरेट किया गया है; कृपया दोबारा जाँच करें।"

यह क्यों महत्वपूर्ण है?

  1. विश्वास (ट्रस्ट): डॉक्टर AI की "कार्यप्रणाली" को देख सकते हैं। वे गणित और तर्क को सत्यापित कर सकते हैं।
  2. सुरक्षा: यह AI को "भ्रमित" (हैलुसिनेट) होने से रोकता है क्योंकि उसे अपने निष्कर्षों को कोड के साथ सिद्ध करना होता है।
  3. गति और लागत: यह आसान मामलों में पैसा बर्बाद नहीं करता है, लेकिन कठिन मामलों में हार भी नहीं मानता।

संक्षेप में:
RVLM AI को एक रहस्यमयी भविष्यवक्ता (जो केवल उत्तर देता है) से बदलकर एक पारदर्शी, मेहनती इंटर्न में बदल देता है जो अपना होमवर्क दिखाता है, फंसने पर मदद मांगता है, और यह जानता है कि समय बर्बाद करने के लिए काम कब रोकना है। यह AI को एक डरावने ब्लैक बॉक्स के बजाय अस्पताल में एक विश्वसनीय साथी बनाने की दिशा में एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →