BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents
BioMedArena एक ओपन-सोर्स टूलकिट है जिसे मूल्यांकन परतों (evaluation layers) को अलग करके, बेंचमार्क और टूल्स की एक विशाल लाइब्रेरी प्रदान करके, और मॉड्यूलर घटक (modular components) पेश करके बायोमेडिकल डीप रिसर्च एजेंट्स में पुनरुत्पादकता (reproducibility) की चुनौतियों को संबोधित करने के लिए डिज़ाइन किया गया है, जो अत्याधुनिक परिणामों (state-of-the-art results) की तुलना में मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अलग-अलग शेफ के कौशल की तुलना करने की कोशिश कर रहे हैं ताकि यह देखा जा सके कि कौन एक जटिल भोजन सबसे अच्छा बना सकता है। अभी, यदि आप शेफ A को कोई व्यंजन बनाने के लिए कहते हैं, तो वे अपने स्वयं के किचन, अपने चाकू के सेट और अपनी रेसिपी बुक का उपयोग करते हैं। यदि आप शेफ B को वही बिल्कुल समान व्यंजन बनाने के लिए कहते हैं, तो वे पूरी तरह से अलग किचन, उपकरणों का एक अलग सेट और भोजन चखने का एक अलग तरीका उपयोग करते हैं।
क्योंकि किचन और उपकरण इतने अलग हैं, इसलिए यह बताना असंभव है कि शेफ A वास्तव में बेहतर है, या उनके पास बस चाकुओं का एक बेहतर सेट था। यही वह समस्या है जिसे इस पेपर के लेखक AI शोधकर्ताओं के लिए हल कर रहे हैं।
यहाँ उन्होंने क्या बनाया है, इसका एक सरल विवरण दिया गया है:
1. समस्या: एक अस्त-व्यस्त किचन
वर्तमान में, यदि कोई शोधकर्ता एक नए AI "शोधकर्ता" (एक एजेंट जो उत्तर खोजने के लिए उपकरणों का उपयोग करता है) का परीक्षण करना चाहता है, तो उन्हें शून्य से एक कस्टम परीक्षण स्थल बनाना पड़ता है।
- अलग-अलग किचन: प्रत्येक AI सिस्टम एक अलग "हार्नेस" (सोचने और कार्य करने का लूप) का उपयोग करता है।
- अलग-अलग उपकरण: एक सिस्टम के पास एक मेडिकल डेटाबेस हो सकता है, जबकि दूसरे के पास एक अलग डेटाबेस हो सकता है।
- अलग-अलग जज: एक सिस्टम अपने काम को एक सरल नियम के साथ ग्रेड करता है, जबकि दूसरा एक अलग AI का उपयोग करके उसे ग्रेड करता है।
इसका मतलब है कि दो AI की तुलना करना एक रेस कार ड्राइवर की मिट्टी के ट्रैक पर और दूसरे की फॉर्मूला 1 ट्रैक पर तुलना करने जैसा है। परिणाम अनुचित हैं, और एक नया परीक्षण बनाने में इंजीनियरिंग के हफ्तों लग जाते हैं।
2. समाधान: BioMedArena (एक सार्वभौमिक किचन)
लेखकों ने BioMedArena बनाया है, जो एक ओपन-सोर्स टूलकिट है जो एक सार्वभौमिक, मानकीकृत किचन के रूप में कार्य करता है।
- एक मानक काउंटर: आप इसमें कोई भी AI (बैकबोन) प्लग करें, उसे ठीक समान 166 बायोमेडिकल टेस्ट (जैसे मेडिकल क्विज़ या केमिस्ट्री की समस्याएं) मिलते हैं।
- एक टूल चेस्ट: प्रत्येक AI को 75 उपकरणों तक पहुंच मिलती है (जैसे मेडिकल लिटरेचर खोजना, जीन का विश्लेषण करना, या ड्रग इंटरैक्शन की जांच करना)।
- एक जज: प्रत्येक उत्तर को समान सख्त नियमों या एक ही AI जज द्वारा ग्रेड किया जाता है, ताकि स्कोर निष्पक्ष हो।
अब, हर नए AI के लिए नया किचन बनाने के बजाय, शोधकर्ता बस एक छोटे से एडॉप्टर (कोड की कुछ पंक्तियों) के साथ अपने AI को BioMedArena में प्लग कर सकते हैं। यह एक नए शेफ को एक मानक किचन में प्लग करने जैसा है ताकि यह देखा जा सके कि वे कैसा प्रदर्शन करते हैं।
3. गुप्त हथियार: "Mutual-Evolve"
पेपर में AI के सोचने का एक विशेष तरीका पेश किया गया है जिसे MUTUAL-EVOLVE कहा जाता है। कल्पना कीजिए कि चार जासूस एक पुराने अनसुलझे मामले (cold case) पर काम कर रहे हैं।
- पुराना तरीका: प्रत्येक जासूस बिना किसी के प्रभाव के अपने विचारों को विकसित करने के लिए एक अलग कमरे में अकेले काम करता है। अंत में, वे सभी अपना अंतिम अनुमान चिल्लाकर बताते हैं, और समूह सबसे लोकप्रिय अनुमान को चुनता है। यदि एक जासूस ने जल्दी ही एक महत्वपूर्ण सुराग खोज लिया था लेकिन उसे चिल्लाकर नहीं बताया, तो समूह उसे मिस कर देता है।
- Mutual-Evolve तरीका:
- निजी चरण (Private Phase): जासूस दूसरों से प्रभावित हुए बिना अपने विचार बनाने के लिए कुछ समय तक अकेले काम करते हैं।
- साझा ब्लैकबोर्ड (The Shared Blackboard): वे एक साझा कमरे में जाते हैं जिसमें एक विशाल व्हाइटबोर्ड होता है जो चार खंडों में विभाजित है: गलतियाँ (Mistakes), कौशल (Skills), उपयोग किए गए उपकरण (Tools Used), और तथ्य (Facts)।
- साझा करना (Sharing): वे बोर्ड पर अपने निष्कर्ष लिखने के लिए बारी-बारी से आते हैं। यदि जासूस A को एहसास होता है कि एक रास्ता बंद गली है, तो वे बोर्ड पर "गलती" लिखते हैं। यदि जासूस B को एक महत्वपूर्ण तथ्य मिलता है, तो वे उसे "तथ्य" के अंतर्गत लिखते हैं।
- अंतिम वोट (The Final Vote): अंतिम उत्तर देने से पहले, वे सभी पूरे व्हाइटबोर्ड को पढ़ते हैं। अंतिम वोट केवल एक साधारण गिनती नहीं है; जिन जासूसों ने बोर्ड में अधिक उपयोगी जानकारी का योगदान दिया है, उन्हें थोड़ा भारी वोट मिलता है।
यह तरीका AI टीम को केवल अंतिम परिणाम पर वोट देने के बजाय एक-दूसरे की गलतियों और खोजों से सीखने की अनुमति देता है।
4. परिणाम: एक बड़ी बढ़त
लेखकों ने 12 अलग-अलग AI मॉडल (ओपन-सोर्स और प्रसिद्ध कमर्शियल दोनों) का उपयोग करके इस नए टूलकिट का परीक्षण किया।
- जादू: जब उन्होंने इन AI को मानक उपकरण और "Mutual-Evolve" सोचने की शैली दी, तो उनके प्रदर्शन में उल्लेखनीय उछाल आया।
- स्कोर: औसतन, AI ने 8 विभिन्न मेडिकल और वैज्ञानिक बेंचमार्क पर 15 प्रतिशत अंक का सुधार किया।
- रिकॉर्ड: हर एक टेस्ट में, BioMedArena से लैस AI ने पिछले "बेस्ट इन क्लास" रिकॉर्ड को पछाड़ दिया। उदाहरण के लिए, एक कठिन मेडिकल परीक्षा में, एक AI लगभग 46% सही होने से बढ़कर 56% सही होने पर पहुँच गया, जिसने पिछले सर्वश्रेष्ठ स्कोर को भी पीछे छोड़ दिया।
सारांश
पेपर यह दावा नहीं करता कि ये AI अब बीमारियों का इलाज कर रहे हैं या अस्पतालों में निदान (diagnose) कर रहे हैं। इसके बजाय, यह दावा करता है कि उन्होंने पहला निष्पक्ष खेल का मैदान बनाया है जहाँ हम अंततः यह तुलना कर सकते हैं कि विभिन्न AI शोधकर्ता बायोमेडिकल समस्याओं को हल करने में कितने अच्छे हैं। उन्होंने यह भी दिखाया कि इन AI को सहयोग करने का बेहतर तरीका (Mutual-Evolve) और उपकरणों का एक बेहतर सेट देने से वे इन विशिष्ट कार्यों में काफी स्मार्ट हो जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।