← नवीनतम पेपर
💻 computer science

Agentic Discovery with Active Hypothesis Exploration for Visual Recognition

यह शोध पत्र HypoExplore को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो न्यूरल आर्किटेक्चर डिस्कवरी को लार्ज लैंग्वेज मॉडल्स, इवोल्यूशनरी ब्रांचिंग और मल्टी-एजेंट फीडबैक का उपयोग करके एक परिकल्पना-संचालित वैज्ञानिक जांच के रूप में मानता है, ताकि लाइटवेट विजन आर्किटेक्चर को पुनरावृत्त रूप से परिष्कृत और मान्य किया जा सके, जिससे CIFAR और MedMNIST जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और डिज़ाइन स्पेस की एक हस्तांतरणीय समझ विकसित होती है।

मूल लेखक: Jaywon Koo, Jefferson Hernandez, Ruozhen He, Hanjie Chen, Chen Wei, Vicente Ordonez

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jaywon Koo, Jefferson Hernandez, Ruozhen He, Hanjie Chen, Chen Wei, Vicente Ordonez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया, सुपर-एफिशिएंट केक बनाने की रेसिपी का आविष्कार करने की कोशिश कर रहे हैं।

पुराना तरीका (पारंपरिक AI अनुसंधान):
आज के अधिकांश वैज्ञानिक उस शेफ की तरह व्यवहार करते हैं जिसके मन में एक विशिष्ट, प्रसिद्ध केक (जैसे चॉकलेट फज) का विचार होता है। वे रेसिपी में थोड़े बदलाव करते हैं: "क्या होगा अगर मैं इसमें एक चुटकी नमक और डाल दूँ?" या "क्या होगा अगर मैं इसे 2 मिनट और ज़्यादा बेक करूँ?" वे हज़ारों छोटे-छोटे बदलाव करने की कोशिश करते हैं। कभी-कभी उन्हें एक बेहतर केक मिलता है, लेकिन अक्सर वे उसी पुराने केक के थोड़े अलग संस्करण तक ही सीमित रह जाते हैं, या बिना यह महसूस किए कि वे क्या कर रहे हैं, गलत विचारों के चक्रव्यूह में फंस जाते हैं।

नया तरीका (HypoExplore):
यह पेपर HypoExplore नामक एक सिस्टम पेश करता है। यह केवल रेसिपी में बदलाव करने के बजाय, ऐसे काम करता है जैसे प्रतिभाशाली, जिज्ञासु वैज्ञानिकों की एक टीम आर्किटेक्चर डिज़ाइन को एक वैज्ञानिक अभियान (scientific expedition) की तरह मानती है।

यह कैसे काम करता है, यहाँ सरल रूपकों (metaphors) में दिया गया है:

1. अभियान का मानचित्र (द ट्रैजेक्टरी ट्री - The Trajectory Tree)

कल्पना कीजिए कि वैज्ञानिक एक विशाल, धुंधले जंगल की खोज कर रहे हैं। हर बार जब वे एक नया रास्ता आज़माते हैं, तो वे एक नक्शा बनाते हैं।

  • पेड़ (The Tree): वे बिना किसी दिशा के नहीं भटकते। वे अपने विचारों का एक विशाल पारिवारिक पेड़ (family tree) बनाते हैं। यदि "विचार A" एक मृत अंत (dead end) की ओर ले जाता है, तो वे उसे नक्शे पर चिह्नित कर देते हैं ताकि कोई भी दोबारा वहां समय बर्बाद न करे। यदि "विचार B" एक सुंदर झरने की ओर ले जाता है, तो वे नोट करते हैं कि वे वहां तक कैसे पहुंचे।
  • लाभ: यह उन्हें गोल-गोल घूमने या जो उन्होंने पहले सीखा है उसे भूल जाने से रोकता है।

2. परिकल्पना बैंक (The "Idea Ledger")

केवल यह कहने के बजाय कि "यह केक स्वादिष्ट है," वैज्ञानिक यह लिखते हैं कि उन्हें क्यों लगता है कि यह स्वादिष्ट है।

  • परिकल्पना (The Hypothesis): वे एक नियम लिखते हैं जैसे: "यदि हम चॉकलेट के बजाय वैनिला का उपयोग करते हैं, तो केक हल्का होगा।"
  • विश्वास स्कोर (The Confidence Score): हर बार जब वे इस नियम का परीक्षण करते हैं, तो वे एक "विश्वास स्कोर" को अपडेट करते हैं।
    • यदि केक हल्का है, तो स्कोर बढ़ता है।
    • यदि केक सूखा है, तो स्कोर घटता है।
    • समय के साथ, सिस्टम सीख जाता है कि कौन से नियम वास्तव में सच हैं और कौन से केवल भाग्यशाली अनुमान हैं।

3. विशेषज्ञों की टीम (The Multi-Agent System)

HypoExplore केवल एक रोबोट नहीं है; यह मिलकर काम करने वाले विभिन्न विशेषज्ञों की एक टीम है:

  • विचार जनरेटर (The Idea Generator): द ड्रीमर (सपना देखने वाला)। यह अनुसंधान की दिशा के आधार पर नए और अनोखे विचार लाता है (जैसे, "आइए सामग्री को एक सीधी रेखा के बजाय एक घेरे में जोड़ें!")।
  • निर्माता (The Builder/Coder): द इंजीनियर। यह सपने देखने वाले के विचार को लेता है और मॉडल बनाने के लिए वास्तविक कोड लिखता है। यदि कोड टूट जाता है, तो यह तुरंत उसे ठीक करता है।
  • न्यायाधीश (The Judge/Redundancy Filter): द बाउंसर। किसी भी नए विचार को आज़माने से पहले, न्यायाधीश मानचित्र की जाँच करता है। "हे, हमने पिछले हफ्ते कुछ ऐसा ही आज़माया था। यह काम नहीं किया। चलिए इसमें समय बर्बाद न करें।"
  • विश्लेषक (The Feedback Agents): मॉडल को प्रशिक्षित करने के बाद, चार अलग-अलग विशेषज्ञ परिणामों को देखते हैं:
    • सांख्यिकीविद् (The Statistician): आंकड़ों (सटीकता, गति) को देखता है।
    • दृश्य कलाकार (The Visual Artist): उन छवियों को देखता है जिन्हें मॉडल ने गलत पहचाना ताकि यह समझा जा सके कि क्यों (जैसे, "इसने बिल्ली को कुत्ते के रूप में भ्रमित कर दिया क्योंकि यह चेहरे के बजाय बालों को देख रहा था")।
    • जासूस (The Detective): यह पता लगाता है कि किस सटीक बदलाव के कारण सुधार या विफलता हुई।
    • ट्रबलशूटर (The Troubleshooter): यदि कोड क्रैश हो जाता है, तो यह त्रुटियों को ठीक करता है।

4. रणनीति: "एक्सप्लोरेशन बनाम एक्सप्लोइटेशन" (Exploration vs. Exploitation)

यह सबसे स्मार्ट हिस्सा है। सिस्टम को तय करना होता है: क्या हमें जो काम कर रहा है उसी पर टिके रहना चाहिए, या हमें कुछ जोखिम भरा आज़माना चाहिए?

  • एक्सप्लोइटेशन (The Safe Bet): यदि किसी परिकल्पना का विश्वास स्कोर उच्च है (जैसे, "ग्लोबल टोकन जोड़ने से 90% बार सफलता मिलती है"), तो सिस्टम उस सफलता पर निर्माण करने की कोशिश करता है।
  • एक्सप्लोरेशन (The Wild Card): यदि किसी परिकल्पना का स्कोर कम या अनिश्चित है, तो सिस्टम कहता है, "हमें अभी नहीं पता। आइए इसे टेस्ट करें!" यह टीम को एक स्थानीय जाल (local trap) में फंसने से रोकता है जहाँ वे केवल "ठीक-ठाक" समाधान पाते हैं और "शानदार" समाधानों को मिस कर देते हैं।

परिणाम: उन्होंने क्या पाया?

टीम ने इस सिस्टम को एक मानक कंप्यूटर विज़न चुनौती (CIFAR-10) पर परखा।

  • प्रारंभिक बिंदु: वे एक बहुत ही बुनियादी, कम प्रदर्शन करने वाले मॉडल (18.91% सटीकता) के साथ शुरू हुए।
  • यात्रा: 50 राउंड के "प्रयोगों" के माध्यम से, सिस्टम ने पुनरावृत्ति की, अपनी गलतियों से सीखा और अपनी परिकल्पनाओं को परिष्कृत किया।
  • फिनिश लाइन: उन्होंने GSTN (Global Shape Token Network) नामक एक नया आर्किटेक्चर खोजा।
    • इसने 94.11% सटीकता प्राप्त की।
    • यह अविश्वसनीय रूप से छोटा और कुशल है (बहुत कम "पैरामीटर्स" या मस्तिष्क कोशिकाओं का उपयोग करता है)।
    • यह इतना अच्छा काम कर गया कि इसने बिना दोबारा प्रशिक्षित किए कठिन पहेलियों (मेडिकल इमेज) को भी हल कर लिया।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि हमें केवल AI को रैंडम अंदाज़ा लगाने और जांचने के लिए नहीं छोड़ना चाहिए। इसके बजाय, हमें AI को एक वैज्ञानिक पद्धति (scientific method) देनी चाहिए। AI को परिकल्पना बनाने, साक्ष्य ट्रैक करने और अपने स्वयं के "वैज्ञानिक शोध पत्रों" से सीखने के लिए मजबूर करके, यह बेहतर समाधान तेज़ी से खोज सकता है और सबसे महत्वपूर्ण बात यह है कि यह समझ सकता है कि वे समाधान क्यों काम करते हैं।

यह एक बंदर द्वारा पियानो की कुंजियों को बेतरतीब ढंग से दबाने और एक संगीतकार के बीच का अंतर है जो संगीत सिद्धांत को समझता है, अपने विचारों को लिखता है, और एक उत्कृष्ट कृति बनाने के लिए तब तक दोहराता है जब तक कि वह सफल न हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →