← أحدث الأبحاث
💻 computer science

UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation

يُعد UltraSAM3 نموذجاً تأسيسياً قائماً على المفاهيم يستفيد من التوصيف المستهدف القائم على النصوص ومن وكيل موجه بالتعليمات لتحقيق تقسيم قوي وعالمي لصور الموجات فوق الصوتية عبر مختلف الأعضاء والآفات، متفوقاً بذلك على الأساليب الحالية المخصصة لمهام معينة والمبنية على المحفزات البصرية.

المؤلفون الأصليون: Bo Xu, Quanhao Zhu, Rui Lin, Boling Zhu, Chenyuan Wang, Hongfei Lin, Feng Xia, Chenhua Ji

نُشر 2026-08-03
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Bo Xu, Quanhao Zhu, Rui Lin, Boling Zhu, Chenyuan Wang, Hongfei Lin, Feng Xia, Chenhua Ji

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على لعبة معينة في صندوق رمال ضخم وفوضوي. إذا قلت فقط "ابحث عن السيارة الحمراء"، فقد يقوم روبوت مفيد بمسح الصندوق بأكمله والإشارة إليها. ولكن ماذا لو كان الرمل يتلاطم، والضوء خافتاً، والسيارة الحمراء تشبه دلواً أحمر؟ هذا هو بالضبط التحدي الذي يواجهه الأطباء في التصوير بالموجات فوق الصوتية (الألتراساوند). الموجات فوق الصوتية تشبه الأشعة السينية السحرية التي تعمل بالوقت الفعلي، حيث تستخدم الموجات الصوتية بدلاً من الإشعاع. إنها رخيصة، وآمنة، ومحمولة، مما يجعلها مفضلة لفحص كل شيء، من نبضات قلب الجنين إلى عضلة ملتهبة. ومع ذلك، فإن الصور التي تنتجها صعبة للغاية؛ فهي غالباً ما تكون محببة (مثل التشويش في التلفزيونات القديمة)، ولها حواف ضبابية، ويمكن أن تبدو مختلفة تماماً بناءً على الشخص الذي يمسك بالمسبار.

لسنوات، كانت البرامج الحاسوبية المصممة لـ "رؤية" هذه الصور مثل روبوتات متخصصة: روبوت واحد يعرف فقط كيفية إيجاد رأس الجنين، وآخر يعرف فقط كيفية إيجاد الكبد، وثالث يبحث فقط عن عقد الغدة الدرقية. إذا أراد الطبيب تغيير المهمة، كان عليه استبدال الروبوتات. وفي الآونة الأخيرة، بنى العلماء "نماذج تأسيسية" (Foundation Models)—وهي عقول ذكاء اصطناعي فائقة الذكاء تدربت على ملايين الصور لتفهم المفاهيم العامة. لكن حتى هذه العقول العملاقة تعاني مع الموجات فوق الصوتية لأن "الضجيج" في الصور يربكها. قد تفهم كلمة "كلية" ولكنها تفشل في إيجادها في صورة موجات فوق صوتية محببة لأنها تدربت في الغالب على صور أشعة مقطعية (CT) أو رنين مغناطيسي (MRI) واضحة. السؤال الكبير كان: هل يمكننا بناء روبوت واحد ذكي يفهم المفاهيم الطبية ويمكنه إيجاد أي عضو أو آفة في صورة موجات فوق صوتية مليئة بالضجيج بمجرد الاستماع إلى وصف بسيط؟

هنا يأتي دور UltraSAM3، وهو اختراع جديد من قبل فريق من الباحثين يعمل كـ "مترجم عالمي" لصور الموجات فوق الصوتية. فكر فيه كأنه محقق خارق لا يكتفي فقط بالنظر إلى الصورة، بل يستمع إلى دليل قصير ومحدد مثل "ابحث عن البطين الأيسر" أو "حدد عقدة الغدة الدرقية" ويرسم فوراً خطاً خارجياً مثالياً حولها، حتى في أكثر صور الموجات فوق الصوتية فوضوية وتذبذباً.

مشكلة الروبوتات القديمة

قبل UltraSAM3، كانت أفضل الأدوات لهذه المهمة إما "خاصة بمهمة معينة" أو "تعتمد على التوجيه (Prompt-based)".

  • النماذج الخاصة بمهمة معينة كانت مثل المفتاح الذي يفتح باباً واحداً فقط. إذا دربت نموذجاً على إيجاد أورام الثدي، فلن يتمكن فجأة من إيجاد رأس طفل. كان على الأطباء استخدام نموذج مختلف لكل جزء من الجسم، مما يجعل العملية بطيئة وغير عملية.
  • النماذج المعتمدة على التوجيه (مثل عائلة SAM الشهيرة) كانت خطوة للأمام. فقد سمحت للمستخدمين برسم مربع أو نقطة على الشاشة للقول: "انظر هنا". ولكن في العيادة الحقيقية، لا يملك الطبيب دائماً الوقت لرسم مربع مثالي. هو فقط يريد أن يقول: "أرني الشريان السباتي". إذا كان على الطبيب الإشارة يدوياً إلى الصورة الضبابية أولاً، فإن النظام لن يكون مفيداً جداً.

حل UltraSAM3

قرر الباحثون وراء UltraSAM3 تعليم نموذج ذكاء اصطناعي قوي (يسمى SAM3) كيف يتحدث لغة "الموجات فوق الصوتية" و"المفاهيم الطبية" في آن واحد. فبدلاً من مجرد عرض الصور والمربعات عليه، قاموا بتغذيته بمكتبة ضخمة تضم 37 مجموعة بيانات مختلفة للموجات فوق الصوتية تغطي 13 جزءاً مختلفاً من الجسم (مثل القلب، الكبد، الجنين، والأعصاب).

إليكم الخدعة السحرية: لقد علموا النموذج باستخدام "الثلاثيات" (Triplets). تخيل بطاقة تعليمية تحتوي على ثلاثة أشياء:

  1. صورة الموجات فوق الصوتية (الصورة المحببة).
  2. القناع (Mask) (الخط الخارجي المثالي للجسم).
  3. المفهوم (Concept) (تسمية نصية بسيطة مثل "رأس جنين" أو "كلية").

من خلال رؤية ملايين من هذه الثلاثيات، تعلم UltraSAM3 ربط الأنماط البصرية الفوضوية والمشوشة للموجات فوق الصوتية بالمعنى الواضح للكلمات الطبية. لقد تعلم أنه على الرغم من أن "الغدة الدرقية" تبدو مختلفة في كل مسح، إلا أن كلمة "غدة درقية" تشير دائماً إلى شكل محدد في ذلك الضجيج. وهذا يسمح للنموذج بتجاوز خطوة "رسم المربع". يمكن للطبيب ببساطة كتابة "حدد الغدة الدرقية"، وسيعرف الذكاء الاصطناعي بالضبط ما يجب فعله.

"الوكيل الموجه بالتعليمات" (The Instruction-Guided Agent)

أدرك الباحثون أن الأطباء قد يكتبون أحياناً جملًا طويلة ومعقدة مثل: "هل يمكنك من فض Form البحث في هذه الصورة وإيجاد الكتلة المشبوهة في الثدي؟". وبينما يعد UltraSAM3 ذكياً، إلا أن الجمل الطويلة قد تربكه أحياناً. ولحل هذه المشكلة، بنوا مساعداً صغيراً يسمى "الوكيل الموجه بالتعليمات" (Instruction-Guided Agent).

فكر في هذا الوكيل كمترجم أو سكرتير. عندما يكتب الطبيب طلباً معقداً، يقوم الوكيل بقراءته بسرعة، ويستخلص الجزء الأكثر أهمية (مثلاً: "آفة الثدي")، ويعيد كتابته إلى أمر قصير وموجز لـ UltraSAM3. الأمر يشبه قول الوكيل: "حسناً، لقد سمعت أنك تريد كتلة الثدي. سأخبر الروبوت أن يبحث عن 'آفة ثدي'". هذا يجعل العملية برمتها أكثر سلاسة ودقة، خاصة عندما تكون تعليمات الطبيب طويلة أو غامضة.

ما وجدوه

اختبر الفريق UltraSAM3 على مجموعة متنوعة ضخمة من صور الموجات فوق الصوتية، بما في ذلك بعض الصور التي لم يسبق له رؤيتها. وكانت النتائج مبهرة:

  • أفضل من المنافسين: في 13 جزءاً مختلفاً من الجسم، تفوق UltraSAM3 باستمرار على النماذج الرائدة الأخرى. على سبيل المثال، في صور الغدة الدرقية، حسّن الدقة (التي تُقاس بدرجة تسمى Dice) بمقدار هائل قدره 0.8297 مقارم النموذج التالي له، والذي كان بالكاد أعلى من الصفر.
  • التعامل مع الضجيج: عمل بشكل جيد حتى في الصور الصعبة ذات التباين المنخفض أو الحبيبات الكثيفة، مما أثبت أن تعليمه خصيصاً حول "ضجيج" الموجات فوق الصوتية كان الخطوة الصحيحة.
  • الوكيل يساعد: عندما استخدموا "الوكيل الموجه بالتعليمات" لترجمة الجمل المعقدة، ارتفعت الدقة بشكل أكبر، حيث تحسن متوسط الدرجة بمقدار 0.161 عبر جميع الأعضاء. وهذا أظهر أن تفكيك الطلبات المعقدة إلى مفاهيم بسيطة يساعد الذكاء الاصطناعي حقاً على التركيز.

لماذا يهم هذا؟

تشير الورقة البحثية إلى أن UltraSAM3 يمثل خطوة كبيرة للأمام لأنه يبتعد عن فكرة أننا بحاجة إلى روبوت مختلف لكل جزء من الجسم. بدلاً من ذلك، فإنه يقدم أداة شاملة يمكنها التعامل مع مهام عديدة بمجرد الاستماع إلى النص. كما تقترح الورقة أننا من خلال تعليم الذكاء الاصطناعي "لغة" الموجات فوق الصوتية الخاصة (الضجيج، الظلال، الحبيبات)، يمكننا جعل هذه الأدوات أكثر فائدة في المستشفيات الحقيقية.

ويوضح الباحثون بحذر أنه بينما كانت النتائج قوية، إلا أن هذه أداة جديدة تحتاج إلى اختبار في العيادات الواقعية. هم لا يدعون أنها مثالية أو أنها تحل محل الأطباء، بل إنها توفر طريقة مرنة وتفاعلية لمساعدة الأطباء على رؤية ما يحتاجون لرؤيته، بشكل أسرع وأكثر دقة. ومن خلال تحويل الأسئلة الطبية المعقدة إلى أوامر بسيطة وقابلة للتنفيذ، يهدف UltraSAM3 إلى جعل تصوير الموجات فوق الصوتية أكثر سهولة وقوة للجميع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →