← أحدث الأبحاث
💬 NLP

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

تقدم الورقة البحثية BioTool، وهي مجموعة بيانات شاملة تتكون من 7,040 زوجًا من الاستعلامات وواجهات برمجة التطبيقات (API) التي تم التحقق منها بشريًا لـ 34 أداة طبية حيوية، والتي عندما تُستخدم لضبط النماذج اللغوية الكبيرة، تعزز بشكل كبير قدراتها على استدعاء الأدوات وجودة الإجابات النهائية، متفوقة حتى على النماذج التجارية المتطورة مثل GPT-5.1.

المؤلفون الأصليون: Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

المشكلة الكبرى: "العالِم بكل شيء" الذي يخطئ في كل شيء

تخّديل أن لديك أمين مكتبة عبقرياً وذكياً للغاية (النموذج اللغوي الكبير، أو LLM) قد قرأ كل كتاب تقريباً في العالم. إذا سألته: "من هو كاتب رواية كبرياء وتحامل؟"، سيجيبك فوراً وبشكل صحيح.

لكن، إذا سألته سؤالاً متخصصاً للغاية مثل: "ما هو التسلسل البروتيني الدقيق لهذا الجين المحدد في الدجاج؟"، فقد يبدأ هذا الأمين بالتخمين. ولأنه لم يحفظ كل جين موجود على وجه الأرض، فقد يخترع تسلسلاً يبدو منطقياً ولكنه خاطئ تماماً. في عالم الطب، تُسمى هذه "التخمينات" بـ الهلوسة (Hallucinations)، وهي أمر خطير.

العلماء الحقيقيون لا يخمنون؛ بل يذهبون إلى المصدر. يفتحون قاعدة بيانات محددة، ويكتبون رمزاً معيناً، ويحصلون على الإجابة الدقيقة. المشكلة هي أن نماذج الذكاء الاصطناعي الحالية سيئة في معرفة أي قاعدة بيانات يجب فتحها وكيفية طلب المعلومات الصحيحة.

الحل: BioTool (صندوق الأدوات الخاص بالذكاء الاصطناائي)

أنشأ المؤلفون مجموعة بيانات جديدة تسمى BioTool. فكر في هذا كدليل تدريب ضخم وعالي الجودة مصمم لتعليم الذكاء الاصطناعي كيفية استخدام مجموعة محددة من 34 صندوق أدوات علمياً (قواعد بيانات مثل NCBI وEnsembl وUniProt).

بدلاً من مجرد حفظ الحقائق، يتعلم الذكاء الاصطناعي:

  1. الاستماع إلى سؤال بشري (مثلاً: "ابحث عن جينات مشابهة لهذا البكتيريا").
  2. اختيار الأداة المناسبة من الرف.
  3. ملء النموذج (استدعاء الـ API) بالأكواد والمعايير التقنية الصحيحة.
  4. قراءة النتيجة وإعطاء الإنسان الإجابة.

كيف بنوا ذلك: "الهندسة العكسية" للمطبخ

كان إنشاء مجموعة البيانات هذه أمراً صعباً. لا يمكنك ببساطة أن تطلب من الذكاء الاصطناعي "ابتكار أسئلة حول البيولوجيا" لأنه قد يخترع علماً مزيفاً. لذا، استخدم الباحثون وصفة ذكية تعتمد على "الهندسة العكسية":

  1. اختيار الأدوات: اختاروا 34 أداة حقيقية وشائعة يستخدمها العلماء يومياً.
  2. توليد "الإيصالات": استخدموا أجهزة الكمبيوتر لتوليد آلاف الطلبات الصالحة لهذه الأدوات تلقائياً وسجلوا الإجابات الفعلية (الملاحظات) التي قدمتها تلك الأدوات.
  3. كتابة "الطلب": أخذوا تلك الإجابات الحقيقية وطلبوا من ذكاء اصطناعي فائق الذكاء أن يكتب سؤالاً بشرياً يؤدي منطقياً إلى تلك الإجابة.
    • تشبيه: تخيل طباخاً يعد شريحة لحم مثالية (نتيجة الـ API). ثم يسأل الذكاء الاصطناعي: "ماذا يجب أن يطلب الزبون للحصول على هذه الشريحة بالضبط؟". فيكتب الذكاء الاصطناعي: "أريد شريحة لحم ريب آي متوسطة الاستواء".
  4. اختبار المذاق البشري: قام خبراء بشريون حقيقيون (متخصصون في المعلوماتية الحيوية) بمراجعة العمل. استبعدوا أي "طلبات" كانت غريبة أو غامضة أو لا تتطابق مع "الإيصال". واحتفظوا فقط بـ 7,040 مثالاً مثالياً.

النتائج: ذكاء اصطناعي صغير مقابل ذكاء اصطناعي عملاق

اختبر الباحثون طريقة التدريب الجديدة هذه على نموذج ذكاء اصطناعي صغير نسبياً (4 مليارات بارامتر) وقارنوه بأكبر النماذج التجارية وأكثرها تكلفة (مثل GPT-5.1 وClaude).

  • المفاجأة: الذكاء الاصطناعي الصغير، المدرب على BioTool، هزم العمالقة.
  • التشبيه: تخيل ميكانيكياً متخصصاً صغيراً لديه مفتاح ربط محدد لكل جزء في السيارة (المدرب على BioTool) مقابل خبير عام عبقري يعرف كل شيء عن السيارات ولكنه لم يمسك مفتاح ربط قط (النموذج التجاري الكبير). عندما يُطلب منه إصلاح جزء معين من المحرك، فإن المتخصص الذي يملك الأداة الصحيحة هو من يفوز في كل مرة.
  • النتيجة: كان النموذج المدرب على BioTool أفضل بنسبة 15% في استخدام الأدوات بشكل صحيح من أفضل النماذج التجارية، رغم أن النموذج التجاري أكبر منها بمئات المرات.

لماذا هذا مهم: من التخمين إلى التحقق من الحقائق

تثبت الورقة البحثية أنه عندما تمنح الذكاء الاصطناعي القدرة على "استدعاء أداة" بشكل صحيح، فإن جودة إجاباته ترتفع بشكل هائل.

  • بدون الأدوات: يخمن الذكاء الاصطناعي. قد يقول: "هذا البروتين يوجد غالباً في الكبد"، وهو تعميم غامض.
  • مع BioTool: يقول الذكاء الاصطناعي: "لقد تحققت من قاعدة البيانات. هذا البروتين موجود في Spirillospora sp. CA-255316".

لقد أثبت الباحثون أن إضافة قدرة "استدعاء الأدوات" هذه تجعل إجابات الذكاء الاصطناعي أكثر دقة بنسبة 88% وفقاً للخبراء البشريين. إنها توقف الذكاء الاصطناعي عن اختلاق الأمور وتجبره على الذهوة إلى مصدر الحقيقة.

ما لا يستطيع فعله (القيود)

تتحدث الورقة البحثية بصراحة عن الأشياء التي لا يستطيع BioTool فعلها بعد:

  • خطوة واحدة في كل مرة: حالياً، يمكن للذكاء الاصطناعي إجراء استدعاء واحد فقط للأداة لكل سؤال. لا يمكنه القيام بتحقيق معقد يتطلب سؤال الأداة (أ)، ثم استخدام تلك الإجابة لسؤال الأداة (ب)، ثم الأداة (ج).
  • كثرة البيانات: أحياناً تكون الإجابة من قاعدة البيانات ضخمة جداً لدرجة أن الذكاء الاصطناعي يشعر بالارتباك. كان عليهم تلخيصها، مما يعني أن بعض التفاصيل الدقيقة قد تضيع.

الخلاصة

BioTool هو مجموعة بيانات تدريب تعلم نماذج الذكاء الاصطناعي كيفية التوقف عن التخمين والبدء في استخدام أفضل قواعد البيانات العلمية على الإنترنت بشكل صحيح. إنها تثبت أنك لا تحتاج إلى عقل ضخم ومكلف لتكون عالماً جيداً؛ بل تحتاج فقط إلى معرفة كيفية استخدام الأدوات المناسبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →