← नवीनतम पेपर
💬 NLP

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

यह शोध पत्र BioTool को पेश करता है, जो 34 बायोमेडिकल टूल्स के लिए 7,040 मानव-सत्यापित क्वेरी-API युग्मों का एक व्यापक डेटासेट है, जो बड़े भाषा मॉडलों (LLMs) को फाइन-ट्यून करने के लिए उपयोग किए जाने पर, उनकी टूल-कॉलिंग क्षमताओं और डाउनस्ट्रीम उत्तर गुणवत्ता को महत्वपूर्ण रूप से बढ़ाता है, और GPT-5.1 जैसे अत्याधुनिक वाणिज्यिक मॉडलों से भी बेहतर प्रदर्शन करता है।

मूल लेखक: Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ BioTool पेपर का सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: वह "सब कुछ जानने वाला" जो गलतियाँ करता है

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान, सुपर-स्मार्ट लाइब्रेरियन (लार्ज लैंग्वेज मॉडल, या LLM) है जिसने दुनिया की लगभग हर किताब पढ़ ली है। यदि आप उससे पूछें, "प्राइड एंड प्रेजुडिस किसने लिखी थी?" तो वह तुरंत और सही उत्तर देगा।

लेकिन, यदि आप उससे बहुत विशिष्ट प्रश्न पूछते हैं जैसे, "इस विशिष्ट चिकन जीन के लिए सटीक प्रोटीन अनुक्रम (sequence) क्या है?" तो लाइब्रेरियन अनुमान लगाना शुरू कर सकता है। क्योंकि उन्होंने अस्तित्व में मौजूद हर एक जीन को याद नहीं किया है, इसलिए वे एक ऐसा अनुक्रम बना सकते हैं जो सुनने में तो सही लगे, लेकिन पूरी तरह से गलत हो। चिकित्सा जगत में, इन "अनुमानों" को हैलुसिनेशन (hallucinations) कहा जाता है, और ये खतरनाक होते हैं।

असली वैज्ञानिक अनुमान नहीं लगाते; वे स्रोत (source) के पास जाते हैं। वे एक विशिष्ट डेटाबेस खोलते हैं, एक कोड टाइप करते हैं, और सटीक उत्तर प्राप्त करते हैं। समस्या यह है कि वर्तमान AI मॉडल यह जानने में खराब हैं कि कौन सा डेटाबेस खोलना है और सही जानकारी के लिए कैसे पूछना है।

समाधान: BioTool (AI के लिए "टूलबॉक्स")

लेखकों ने BioTool नामक एक नया डेटासेट बनाया है। इसे एक विशाल, उच्च-गुणवत्ता वाले प्रशिक्षण मैनुअल के रूप में समझें जिसे AI को 34 वैज्ञानिक टूलबॉक्सेस (NCBI, Ensembl और UniProt जैसे डेटाबेस) का उपयोग करना सिखाने के लिए डिज़ाइन किया गया है।

केवल तथ्यों को याद करने के बजाय, AI सीखता है:

  1. मानव प्रश्न को सुनना (जैसे, "इस बैक्टीरिया के समान जीन खोजें")।
  2. शेल्फ से सही उपकरण (tool) चुनना
  3. सही तकनीकी कोड और पैरामीटर्स के साथ फॉर्म भरना (API कॉल)।
  4. परिणाम को पढ़ना और मानव को उत्तर देना।

उन्होंने इसे कैसे बनाया: "रिवर्स इंजीनियरिंग" रसोई

इस डेटासेट को बनाना कठिन था। आप AI से केवल यह नहीं कह सकते कि "जीव विज्ञान के बारे में प्रश्न बनाओ" क्योंकि वह नकली विज्ञान का आविष्कार कर सकता है। इसलिए, शोधकर्ताओं ने एक चतुर "रिवर्स इंजीनियरिंग" रेसिपी का उपयोग किया:

  1. उपकरणों का चयन: उन्होंने 34 वास्तविक, लोकप्रिय उपकरणों को चुना जिनका वैज्ञानिक हर दिन उपयोग करते हैं।
  2. "रसीदें" उत्पन्न करना: उन्होंने इन उपकरणों के लिए हजारों वैध अनुरोध (requests) स्वचालित रूप से उत्पन्न करने के लिए कंप्यूटर का उपयोग किया और उन वास्तविक उत्तरों (अवलोकन/observations) को रिकॉर्ड किया जो टूल्स ने वापस दिए थे।
  3. "ऑर्डर" लिखना: उन्होंने उन वास्तविक उत्तरों को लिया और एक सुपर-स्मार्ट AI से पूछा कि एक ऐसा मानव प्रश्न क्या होगा जो तार्किक रूप से उस उत्तर तक ले जाए।
    • उपमा: कल्पना कीजिए कि एक शेफ एक बेहतरीन स्टेक (API परिणाम) पका रहा है। फिर वे एक AI से पूछते हैं, "एक ग्राहक इस सटीक स्टेक को पाने के लिए क्या ऑर्डर करेगा?" AI लिखता है, "मुझे एक मीडियम-रेयर रिबआई (ribeye) चाहिए।"
  4. मानव स्वाद-परीक्षण (Human Taste-Test): वास्तविक मानव विशेषज्ञों (बायोइन्फॉर्मेटिशियंस) ने काम की समीक्षा की। उन्होंने किसी भी ऐसे "ऑर्डर" को हटा दिया जो अजीब, अस्पष्ट या "रसीद" से मेल नहीं खाता था। उन्होंने केवल 7,040 सटीक उदाहरणों को रखा।

परिणाम: छोटा AI बनाम विशाल AI

शोधकर्ताओं ने इस नई प्रशिक्षण पद्धति का परीक्षण एक अपेक्षाकृत छोटे AI मॉडल (4 बिलियन पैरामीटर्स) पर किया और इसकी तुलना सबसे बड़े, सबसे महंगे वाणिज्यिक मॉडलों (जैसे GPT-5.1 और Claude) से की।

  • आश्चर्य: छोटे AI ने, जो BioTool पर प्रशिक्षित है, विशाल मॉडलों को हरा दिया
  • उपमा: कल्पना कीजिए कि एक छोटा, विशिष्ट मैकेनिक जिसके पास कार के हर हिस्से के लिए एक विशेष रिंच (wrench) है (BioTool-प्रशिक्षित) बनाम एक प्रतिभाशाली सामान्यज्ञ (generalist) जो कारों के बारे में सब कुछ जानता है लेकिन उसने कभी रिंच पकड़ा ही नहीं है (बड़ा वाणिज्यिक मॉडल)। जब किसी विशिष्ट इंजन भाग को ठीक करने के लिए पूछा जाता है, तो सही उपकरण वाला विशेषज्ञ जीत जाता है।
  • स्कोर: BioTool-प्रशिक्षित मॉडल, वाणिज्यिक मॉडल की तुलना में उपकरणों का सही ढंग से उपयोग करने में 15% बेहतर था, भले ही वाणिज्यिक मॉडल सैकड़ों गुना बड़ा था।

यह क्यों महत्वपूर्ण है: अनुमान लगाने से तथ्य-जांच (Fact-checking) तक

यह पेपर दिखाता है कि जब आप एक AI को "टूल कॉल" करने की क्षमता देते हैं, तो उसके उत्तरों की गुणवत्ता आसमान छू लेती है।

  • बिना टूल्स के: AI अनुमान लगाता है। वह कह सकता है, "यह प्रोटीन शायद लीवर में पाया जाता है," जो एक अस्पष्ट सामान्यीकरण है।
  • BioTool के साथ: AI कहता है, "मैंने डेटाबेस की जाँच की। यह प्रोटीन Spirillospora sp. CA-255316 में पाया जाता है।"

शोधकर्ताओं ने सिद्ध किया कि इस "टूल-कॉलिंग" क्षमता को जोड़ने से मानव विशेषज्ञों के अनुसार AI के उत्तर 88% अधिक सटीक हो जाते हैं। यह AI को मनगढ़ंत बातें बनाने से रोकता है और उसे सत्य के स्रोत (source of truth) तक जाने के लिए मजबूर करता है।

यह क्या नहीं करता (सीमाएँ)

पेपर इस बात के प्रति ईमानदार है कि BioTool अभी क्या नहीं कर सकता:

  • एक बार में एक कदम: वर्तमान में, AI एक प्रश्न के लिए केवल एक टूल कॉल कर सकता है। यह एक जटिल जांच नहीं कर सकता जिसके लिए टूल A पूछने, फिर उस उत्तर का उपयोग टूल B पूछने के लिए करने, और फिर टूल C पूछने की आवश्यकता हो।
  • बहुत अधिक डेटा: कभी-कभी डेटाबेस से उत्तर इतना बड़ा होता है कि AI घबरा जाता है। उन्हें इसे संक्षिप्त (summarize) करना पड़ा, जिसका अर्थ है कि कुछ सूक्ष्म विवरण खो सकते हैं।

निष्कर्ष

BioTool एक प्रशिक्षण डेटासेट है जो AI मॉडल को अनुमान लगाना बंद करने और इंटरनेट के सर्वश्रेष्ठ वैज्ञानिक डेटाबेस का सही ढंग से उपयोग करना सिखाता है। यह साबित करता है कि एक अच्छा वैज्ञानिक बनने के लिए आपको एक विशाल, महंगे मस्तिष्क की आवश्यकता नहीं है; आपको बस सही उपकरणों का उपयोग करना आना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →