RCC-AID: Renal Cell Carcinoma AI Dataset for Medical Imaging Research
تقدم هذه الورقة البحثية RCC-AID، وهي مجموعة بيانات متاحة للعموم تضم 129 صورة مقطعية معززة بالتباين تم تصنيفها من قبل خبراء لـ 91 مريضاً بسرطان الخلايا الكلوية، صُممت لمعاللة ندرة التوصيفات العامة للآفات وتعزيز الأبحاث القابلة للتكرار في مجال الذكاء الاصطناعي في التصوير الطبي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
حقيبة أدوات المحقق الرقمي الجديدة
تخيل عالماً تعمل فيه الحواسيب ككشافين خارقين، تمسح الصور الطبية للعثور على أدلة خفية حول أمراض مثل السرطان. ولكي تصبح هذه "الأدمغة" الحاسوبية (المعروفة بالذكاء الاصطناعي أو AI) بارعة حقاً في هذا المجال، فإنها تحتاج إلى التدرب على ملايين الأمثلة، تماماً كما يحتاج الطالب إلى دراسة آلاف الكتب المدرسية لاجتياز الامتحان. في عالم سرطان الكلى، وتحديداً نوع يسمى سرطان الخلايا الكلوية (RCC)، يعتمد الأطباء بشكل كبير على الأشعة المقطعية (CT scans) — وهي صور أشعة ثلاثية الأبعاد فائقة التفصيل تظهر داخل الجسم على شكل شرائح. ولكي يتعلم الذكاء الاصطناعي كيفية رصد ورم ما، أو التمييز بين فقاعة مملوءة بسائل غير ضارة (كيس/cyst) وكتلة صلبة خطيرة، أو حتى تخمين "النكهة" المحددة لنوع السرطان، فإنه يحتاج إلى شخص يرسم حدوداً دقيقة حول كل قطعة من قطع اللغز. تُسمى هذه العملية "التوسيم" (Annotation).
ومع ذلك، هناك مشكلة كبيرة: فبينما نمتلك الكثير من صور الأشعة المقطعية الخام المتاحة من الأرشيفات الطبية العامة، فإن الرسومات التفصيلية (التوسيمات) التي تخبر الذكاء الاصطناعي بما هو موجود بالضبط غالباً ما تكون مفقودة، أو غير متسقة، أو مغلقة بعيد المنال. الأمر يشبه امتلاك مكتبة مليئة بروايات الغموض ولكن دون مفاتيح إجابة للتحقق مما إذا كان عملك ككشاف صحيحاً أم لا. وبدون هذه المفاتيح المشتركة وعالية الجودة، ينتهي الأمر بفرق بحثية مختلفة ببناء قواعد خاصة بها وغير متوافقة، مما يجعل من الصعب المقارنة لمعرفة من هو الكشاف الأفضل حقاً. تأتي هذه الورقة البحثية لتصلح هذا الفجوة عبر إنشاء "مفتاح إجابة" ضخم ومفتوح المصدر لأبحاث سرطان الكلى، مما يضمن أن الجميع يلعبون بنفس القواعد ويستخدمون نفس بيانات التدريب عالية الجودة.
مشروع خريطة الكلى العظيمة
تعرفوا على فريق RCC-AID، وهم مجموعة من رسم الخرائط الرقمية الذين قرروا رسم خريطة للمناطق غير المستكشفة في صور سرطان الكلى. لقد أدركوا أنه بينما كان لدى "TCGA" (مكتبة ضخمة عامة لبيانات السرطان) آلاف الصور المقطعية، إلا أنها كانت تفتقر إلى رسومات "وضع علامة X في مكان الكنز" الضرورية ليتعلم منها الذكاء الاصطناعي. ولحل هذه المشكلة، لم يكتفوا بالتخمين؛ بل بنوا مجموعة بيانات ضخمة مفتوحة تسمى RCC-AID (مجموعة بيانات الذكاء الاصطناعي لسرطان الخلايا الكلوية) والتي تعمل كمعيار ذهبي لتدريب النماذج الحاسوبية.
إليكم كيف نفذوا عملية سطو البيانات هذه:
البحث عن الصور الجيدة
بدأ الفريق بالبحث في جبل من 1,915 صورة مقطعية من ثلاثة أرشيفات مختلفة لسرطان الكلى. كان عليهم أن يكونوا انتقائيين، حيث قاموا بتصفية الصور التي كانت ضبابية للغاية، أو ناقصة الشرائح، أو التي أُخذت بعد الجراحة. بعد عملية التنظيف الأولية هذه، تبقى لديهم 759 صورة. لكنهم لم يتوقفوا عند هذا الحد؛ فقد علموا أن نوعاً واحداً من سرطان الكلى (الخلايا الصافية - clear cell) شائع جداً، بينما النوعان الآخران (الحليمي - papillary، والكروموفوب - chromophobe) نادران ولكنهما مخادعان. ولضمان ألا يصبح ذكاؤهم الاصطناعي خبيراً في النوع الشائع ويتجاهل الأنواع النادرة، احتفظوا بـ جميع الحالات النادرة التي وجدوها (56 حالة حليمية و27 حالة كروموفوب) بينما اختاروا عشوائياً 200 حالة فقط من حالات الخلايا الصافية الشائعة. كانت هذه خطوة استراتيجية لضمان أن "فصلهم التدريبي" يحتوي على مزيج متوازن من الطلاب.
خط تجميع التوسيم
بمجرد حصولهم على قائمتهم النهائية المكونة من 283 صورة، بدأ العمل الحقيقي. لم يكن بإمكانهم مجرد الطلب من الكمبيوتر رسم الخطوط بدقة لأن الحواسيب ترتكب الأخطاء. بدلاً من ذلك، أنشأوا خط تجميع يعتمد على "الإنسان في الحلقة" (human-in-the-loop):
- المسودة الذكية: أولاً، قام نموذج حاسوبي مؤتمت برسم تخطيطي لمكان الكلى والكتل المحتملة.
- المحررون الطلاب: عمل اثنان من الطلاب المدربين كمحررين؛ حيث راجعوا المسودة التي رسمها الكمبيوتر وصححوا أي أخطاء واضحة. إذا فات الورم على الكمبيوتر أو رسم كيساً في مكان خاطئ، يقوم الطلاب بتصحيحه. كما تعين عليهم التحقق يدوياً مما إذا كانت الصور "معززة بالصبغة" (أي تم استخدام صبغة خاصة لإبراز الأعضاء)، وهو تفصيل لا يستطيع الكمبيوتر التحقق منه بموثوقية بمفرده.
- المشرف الخبير: إذا لم يكن الطالب متأكداً بشأن حالة ما — ربما بدا الورم غريباً أو كانت الصورة ضبابية — فإنه يرسلها إلى طبيب أشعة معتمد (كشاف طبي حقيقي يتمتع بسنوات من الخبرة) للحصول على الحكم النهائي.
صندوق الكنز النهائي
بعد كل عمليات التصفية والتصحيح والمراجعات الخبيرة، انتهى الفريق بمجموعة بيانات مصقولة وجاهزة للاستخدام مكونة من 129 صورة مقطعية من 91 مريضاً.
- التفاصيل: تتضمن هذه المجموعة 85 حالة خلايا صافية، و26 حالة حليمية، و18 حالة كروموفوب.
- الدقة: تأتي كل صورة مع خريطة على مستوى "الفوكسل" (voxel). فكر في الفوكسل كبكسل ثلاثي الأبعاد صغير جداً. تخبر مجموعة البيانات الكمبيوتر بالضبط أي البكسلات ثلاثية الأبعاد تنتمي للكلية، وأيها تنتمي للورم الصلب، وأيها تنتمي للأكياس.
- التنوع: تراوحت أعمار المرضى من 26 إلى 82 عاماً (بمتوسط 56 عاماً)، وتفاوتت أحجام الأورام بشكل كبير؛ فبعضها كان صغيراً جداً بقطر 8 ملم فقط، بينما وصل بعضها إلى 169 ملم. كما التقطت مجموعة البيانات "لحظات" مختلفة من التصوير، بما في ذلك المراحل الشريانية، والوريدية، والمتأخرة، بإجمالي 26 و50 و53 صورة على التوالي.
لماذا هذا مهم (وما ليس كذلك)
المؤلفون واضحون جداً بشأن ماهية هذه المجموعة وما ليست عليه. فهم يؤكدون أن هذه أداة بحثية، وليست عصا سحرية للاستخدام الفوري في المستشفيات. لقد تم إنشاء التوسيمات بواسطة طلاب وراجعها خبراء، ولكن لم يتم اختبارها مقابل عدة خبراء لمعرفة مدى اختلاف آرائهم (التباين بين المراقبين). لذلك، يقترح المؤلفون التعامل مع هذه الخرائط كـ "توسيمات بحثية خاضعة لضبط الجودة" وليس كحقيقة مطلقة لا تقبل الجدل. كما يحذرون من أنه نظراً لأن البيانات تأتي غالباً من مراكز أكاديمية في أمريكا الشمالية ومعظم المرضى من الذكور (67 من أصل 91 مريضاً)، فإن نماذج الذكاء الاصطناعي المدربة عليها قد لا تعمل بشكل مثالي لكل الناس في بقية العالم.
النتيجة
من خلال إصدار هذه المجموعة من البيانات بشكل مفتوح، يأمل الفريق في وقف الباحثين عن إعادة اختراع العجلة. فبدلاً من أن يقضي كل مختبر شهوراً في رسم خرائطه الخاصة، يمكنهم جميعاً استخدام RCC-AID لتدريب كشافي الذكاء الاصطناوئي الخاص بهم. وفي تجربة اختبارية، استخدموا هذه المجموعة لمساعدة نموذج في التمييز بين أنواع مختلفة من كتل الكلى. كانت النتائج واعدة: حقق نموذج "الراديوميكس" (نوع من الذكاء الاصطناعي الذي ينظر إلى الأنسجة والأنماط) دقة عالية، حيث سجل درجات بلغت 0.93 للأكياس، و0.84 للخلايا الصافية، و0.90 للحليمي، و0.86 للكروموفوب.
باختصار، RCC-AID هي صندوق أدوات ضخم ومفتوح المصدر يمنح مجتمع الذكاء الاصطناعي مجموعة مشتركة وعالية الجودة من "مفاتيح الإجابة" لسرطان الكلى. هي لا تعالج المرض نفسه، لكنها توفر أرضية التدريب الأساسية اللازمة لبناء أدوات ذكاء اصطناعي أفضل، وأكثر عدلاً، وأكثر موثوقية في المستقبل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.