Development and Validation of Performance Assessment Scales for Core Cardiac Surgical Procedures: A National Simulation-Based Study
نجحت هذه الدراسة الوطنية القائمة على المحاكاة في تطوير والتحقق من صحة أربعة مقاييس لتقييم الأداء المهاري الجراحي (PASS) خاصة بكل إجراء لكل من بضع القص العجاني، ونصب جهاز القلب والرئة، واستبدال الصمام الأبهري الجراحي، وحصاد الشريان الثديي الداخلي، مما أظهر موثوقيتها وصلاحيتها العالية كأدوات موضوعية للتدريب على جراحة القلب القائم على الكفاءة.
المؤلفون الأصليون:Clément Colombier, Géraldine Allain, Lisa Durocher, Stéphanie Ragot, Jean-Pierre Faure, Denis Oriot, Christophe Jayle, Delphi group
إنَّ تصبح جراح قلب هو رحلة تتطلب سنوات من الدراسة والممارسة المكثفة. إنه مجال لا يكاد يوجد فيه هامش للخطأ، حيث تكون القدرة على إجراء مناورات دقيقة على عضو ينبض هي الفارق بين الحياة والموت. لعقود من الزمن، اعتمد المسار نحو الإتقان بشكل كبير على مراقبة معلم ثم الممارسة على المرضى، وهي طريقة تطورت ببطء لتشمل المحاكاة عالية الدقة. في هذه البيئات المحاكية، يمكن للمتدربين صقل مهاراتهم على نماذج واقعية دون مخاطرة. ومع ذلك، كان هناك جزء حاسم مفقود من اللغز: وسيلة لقياس مدى جودة أداء المتدرب بدقة. وبينما يمكن للمدربين تقديم ملاحظات عامة، فقد سعى المجتمع الطبي طويلاً للحصول على أداة معيارية موضوعية تفكك العمليات الجراحية المعقدة إلى خطوات محددة وقابلة للملاحظة. وبدون مثل هذه الأداة، يصعب معرفة ما إذا كان الطالب قد أتقن تقنية ما حقاً أم أنه يكرر الحركات فحسب دون فهم الدقة الكامنة وراءها.
لقد سعى فريق من الباحثين في فرنسا لحل هذه المشكلة من خلال إنشاء واختبار مجموعة جديدة من أنظمة تسجيل النقاط لأكثر الإجراءات جوهرية في جراحة القلب. لقد ركزوا على أربع مهام متميزة ولكنها مترابطة: قطع عظمة الصدر للوصو لقلب، وتوصيل المريض بجهاز قلب ورئة، واستبدال صمام أورطي مصاب، واستخراج شريان حيوي من جدار الصدر لاستخدامه كطعم. أطلق الباحثون على هذه الأدوات الجديدة اسم مقاييس PASS، وهي اختصار لـ "تقييم الأداء للمهارات الجراحية" (Performance Assessment of Surgical Skills). ولبناء هذه المقاييس، لم يعتمدوا مجرد التخمين حول الخطوات المهمة؛ بل جمعوا لجنة مكونة من ثلاثة عشر خبيراً وطنياً في جراحة القلب. راجع هؤلاء الخبراء الإرشادات القائمة وناقشوا كل خطوة من خطوات الإجراءات حتى توصلوا إلى إجماع حول ما يشكل إجراءً صحيحاً. ثم اختبروا هذه القوائم خلال جلسات المحاكاة، وقاموا بتنقيح اللغة حتى أصبح كل عنصر واضحاً وغير غامض. وكانت النتيجة النهائية عبارة عن قوائم مراجعة حيث يمكن تحديد كل خطوة كـ "غير منجزة"، أو "منجزة جزئياً"، أو "منجزة تماماً"، مما يحول الأداء الجراحي المعقد إلى سلسلة من الحقائق القابلة للقياس.
ولرؤية ما إذا كانت هذه القوائم تعمل بالفعل، نظم الباحثون حدثاً تدريبياً ضخماً شارك فيه ثلاثة وأربعون مقيماً جراحياً. قام هؤلاء المتدربون، الذين كانوا في منتصف تدريبهم المتخصص، بإجراء عملية استبدال صمام قلب كاملة محاكية على نموذج واقعي لجسم بشري. لم يكن هذا النموذج لعبة بلاستيكية؛ بل كان جسداً بشرياً متبرعاً به تمت إعادة توصيله بنظام دوران وجهاز تنفس، مما سمح للجراحين بالعمل في ظروف تشبه وتماثل العمليات الحقيقية تماماً. وبينما كان المقيمون يعملون، كان اثنان من الجراحين الخبراء المستقلين يراقبونهم عن كثب، حيث يقوم كل منهما بتعبئة أوراق تسجيل النقاط الجديدة دون معرفة ما كتبه الآخر. كان الهدف هو معرفة ما إذا كانت المقاييس يمكنها التمييز بشكل موثوق بين مستويات المهارة المختلفة وما إذا كان خبيران مختلفان سيتفقان على الدرجة الممنوحة لنفس الأداء.
أظهرت النتائج أن المقاييس الجديدة كانت فعالة للغاية. فعندما حلل الباحثون الدرجات، وجدوا أن العناصر الموجودة في كل قائمة مراجعة تترابط منطقياً، وتقيس نفس مجموعة المهارات الأساسية. وبالنسبة للإجراء الأكثر تعقيداً، وهو استبدال الصمام الكامل، كان الاتساق بين الخطوات المختلفة عالياً بشكل استثنائي. والأهم من ذلك، أن المراقبين المستقلين اتفقا تقريباً دائماً على الدرجات التي أعطياها. لم يكن هناك فرق جوهري بين ما اعتقد فيه أحد الخبراء وما اعتقده الآخر، وكانت المقايات الإحصائية لاتفاقهما من بين الأعلى الممكنة. وهذا يعني أن الأداة لا تعتمد على الرأي الشخصي لمعلم واحد؛ بل توفر معياراً مستقراً وموضوعياً يمكن للخبراء المختلفين استخدامه لتقييم الأداء بنفس الطريقة. كما طلب الباحثون من المتدربين تقييم أنفسهم، وبينما كان الطلاب صادقين بشكل عام، إلا أنهم كانوا يميلون إلى أن يكونوا أكثر قسوة على عملهم من الخبراء، مما يسلط الضوء على صعوبة التقييم الذاتي في مثل هذا المجال عالي المخاطر.
كان للدراسة حدودها الخاصة. فقد تمت عملية التحقق بأكملها داخل بيئة محكومة في مختبر محاكاة، باستخدام نوع محدد من النماذج البشرية. وأشار الباحثون إلى أنه بينما أدت الأدوات أداءً مثالياً في هذا الإعداد، فإن قدرتها على قياس الأداء في غرفة عمليات حقيقية مع مريض حي لا تزال بحاجة إلى تأكيد. بالإضافة إلى ذلك، فإن مجموعة الخبراء الذين ساعدوا في تصميم المقاييس جاءت من جمعية وطنية واحدة، مما قد يحد من مدى تطبيق هذه الأدوات على الجراحين المدربين في أجزاء مختلفة من العالم. وبالرغم من هذه القيود، فإن النتائج تقدم خطوة كبيرة للأمام. فقد خلص الباحثون إلى أن هذه المقاييس الجديدة هي أدوات صالحة وموثوقة يمكن استخدامها لتتبع التقدم في جراحة القلب بشكل موضوعي. ومن خلال توفير خريطة واضحة وخطوة بخطوة لما يبدو عليه الأداء الجيد، يمكن لهذه الأدوات مساعدة المتدربين في تحديد نقاط ضعفهم المحددة والسماح للمعلمين بتوجيههم بشكل أكثر فعالية نحو المستوى العالي من الكفاءة المطلوبة لإجراء العمليات على قلب الإنسان.
ملخص تقني: تطوير والتحقق من صحة مقاييس تقييم الأداء للإجراءات الجراحية القلبية الأساسية
بيان المشكلة تتطلب جراحة القلب تدريباً مكثفاً لتحقيق الإتقان، مما يستلي زمناً لتدريس الإجراءات الأساسية بشكل منهجي ومنظم منذ المراحل المبكرة من منهج المتدرب. وبينما أصبح التدريب القائم على المحاكاة جزءاً لا يتجزأ من تعليم جراحة القلب، إلا أن المجال يفتقر إلى أدوات تقييم قوية وموضوعية. إن أدوات تقييم الأداء الحالية مستمدة في الغالب من مقاييس "ليكرت" (Likert-type scales)، والتي غالباً ما تفتقر إلى إجماع الخبراء الرسمي أو التحقق المنهجي الصارم. علاوة على ذلك، فإن مقاييس التقييم العالمية، مثل تلك القائمة على التقييم المنظم للمهارات التقنية (OSATS)، محدودة في دقتها؛ فهي تعتمد على أوصاف ذاتية تفشل في توفير التفاصيل الدقيقة المطلوبة لتمكين المتدربين من تحديد وتحليل الأخطاء التقنية المحددة بوضوح. وبناءً على ذلك، هناك حاجة ماسة لأدوات محددة لكل إجراء، وتكون صالحة وموثوقة لتقييم الأداء التقني بشكل موضوعي ودعم التعليم القائم على الكفاءة في جراحة القلب.
المنهجية تبعت هذه الدراسة التعليمية الوطنية الاستشرافية (التي أجريت من يناير 2022 إلى أكتوبر 2025) إطار عمل "داونينج" (Downing) لتطوير والتحقق من صحة أدوات التصنيف. تضمنت عملية التطوير والتحقق ثلاث مراحل أساسية:
تطوير المحتوى: تم بناء النسخ الأولية للمقاييس بناءً على الإرشادات الدولية وإجماع الخبراء. وقد قامت عملية "دلفي" (Delphi process)، التي شارك فيها 13 جراح قلب وطنيين (من الجمعية الفرنسية لجراحة الصدر والأوعية الدموية، SFCTCV)، بتنقيح هذه العناصر عبر جولتين من المراسلات بالبريد الإلكتروني. تم تقييم العناصر على مقياس "ليكرت" مكون من 6 نقاط من حيث الصلة؛ وحُذفت العناصر التي لم تحقق اتفاقاً بنسبة ≥50%.
تقييم عملية الاستجابة: تم اختبار المقاييس الأولية خلال برنامجين تدريبيين وطنيين لـ "سيم لايف" (SimLife) التابع للجمعية (SFCTCV). قام اثنا عشر جراحاً كبار بتقييم 24 متدرباً مبتدئاً في ظروف عمليات محاكية. وعقب جلسات استخلاص المعلومات المهيكلة، تم توضيح العناصر أو إعادة صياغتها أو تنقيحها بناءً على الملاحظات.
دراسة التحقق من الصحة: تم التحقق من صحة المقاييس النهائية باستخدام بيانات من 5 برامج تدريبية وطنية لـ "سيم لايف" (SimLife) التابعة للجمعية (SFCTCV).
المجتمع: قام 43 متدرباً (في سنوات التدريب من الثانية إلى السادسة PGY 2–6) بإجراء عملية محاكاة لاستبدال الصمام الأورطي الجراحي (SAVR) عبر شق عظمة القص، باستخدام جهاز القلب والرئة (CPB). كما تم تقييم 36 متدرباً إضافياً على حصاد الشريان الثديي الداخلي (IMA).
بيئة المحاكاة: أُجريت الإجراءات على نموذج "سيم لايف" (SimLife) (جثث بشرية مع إعادة تروية تحت تدفق نبضي وتهوية ميكانيكية) لإعادة إنشاء الظروف التشغيلية الفسيولوجية.
التقييم: قام مراقبان مستقلان (معمايان عن تقييمات بعضهما البعض) بتقييم كل متدرب. كما أكمل المتدربون تقييماتهم الذاتية.
التحليل الإحصائي: تم قياس الاتساق الداخلي باستخدام "ألفا كرونباخ" (α) و"أوميجا ماكدونالد" (ω). وتم تقييم موثوقية التوافق بين المراقبين عبر معامل الارتباط داخل الفئة (ICC)، واختبارات "ويلكوكسون" لفروق الدرجات، وارتباط "سبيرمان" الرتبي، وتحليل "بلاند-ألتمان".
المساهمات الرئيسية: مقاييس PASS نتج عن الدراسة أربعة مقاييس خاصة بالأداء (PASS) لكل إجراء، يستخدم كل منها نظام تسجيل مكون من 3 نقاط (0 = لم يتم، 1 = تم جزئياً، 2 = تم بالكامل) لتقليل الغموض التفسيري:
STERNO-PASS (شق عظمة القص): 10 عناصر (5 للفتح، 5 للإغلاق؛ الدرجة القصوى 20).
CPB-PASS (جهاز القلب والرئة): 33 عنصراً (9 للإعداد، 9 للبدء، 15 للفطام؛ الدرجة القصوى 66).
تغطي المقاييس التسلسل الإجرائي بأكمله، من شق الجلد إلى إغلاق عظمة القص، بما في ذلك التنقيب، واستئصال الصمام، وزرع الصمام الاصطناعي، وفطام جهاز القلب والرئة.
النتائج
الاتساق الداخلي (الصلاحية):
CPB-PASS: α = 0.86، ω = 0.89.
SAVR-PASS: α = 0.88، ω = 0.88.
IMA-PASS: α = 0.83، ω = 0.86.
STERNO-PASS: α = 0.64، ω = 0.79. يشير المؤلفون إلى أن انخفاض قيمة "ألفا" يعود على الأرجح إلى "تأثير السقف" في إغلاق الصدر (الذي تم تنفيذه بشكل صحيح من قبل الجميع تقريباً)، بينما تؤكد "أوميجا" الاتساق المقبول من خلال مراعاة المساهمات غير المتساوية للعناصر.
إجراء SAVR الكامل (STERNO + CPB + SAVR): α الإجمالي = 0.92، ω الإجمالي = 0.95.
موثوقية التوافق بين المراقبين:
تراوحت قيم ICC بين 0.92 و0.96 عبر جميع المقاييس والإجراء الكامل.
لم توجد فروق ذات دلالة إحصائية بين المراقبين لأي من المقاييس (p > 0.05).
بالنسبة لإجراء SAVR الكامل، كان الارتباط الخطي (R²) هو 0.93، وأظهر تحليل "بلاند-ألتمان" متوسط فرق قدره 1.05 نقطة مع حدود اتفاق ضيقة (−9.06 إلى 11.15).
التقييم الذاتي مقابل تقييم المراقب:
كان الارتباط بين درجات المراقب والتقييم الذاتي أقل عموماً من التوافق بين المراقبين، لا سيما في SAVR-PASS (ICC = 0.69).
مال المتدربون إلى تقييم أنفسهم بصرامة أكبر من المراقبين، رغم أن هذا الفرق لم يكن ذا دلالة إحصائية.
الأهمية والادعاءات خلص المؤلفون إلى أن مقاييس STERNO-PASS وCPB-PASS وSAVR-PASS وIMA-PASS هي أدوات صالحة وموثوقة للتقييم الموضوعي للأداء التقني في تدريب جراحة القلب. وتشمل الادعاءات الرئيسية بشأن أهميتها ما يلي:
تقييم الكفاءة المهيكل: على عكس مقاييس التقييم العالمية، توفر هذه الأدوات تقييماً شاملاً للاستمرارية الإجرائية، حيث تلتقط كلاً من الخطوات التقنية المنفصلة والإيماءات غير التقنية (مثل التعبير اللفظي عن الأفعال).
الفائدة التعليمية: تسمح نقاط التفتيش الإجرائية الصريحة ونظام التسجيل البسيط المكون من 3 نقاط للمتعلمين بتحديد أوجه القصور التقنية بدقة وفهم المعايير التشغيلية المتوقعة، مما يسهل التحسين المركز.
دعم التعليم القائم على الكفاءة: صُممت المقاييس لدعم التقدم المهيكل على طول منحنى التعلم ويمكن دمجها في المناهج التدريبية لتوف تقديم ملاحظات مستهدفة.
قابلية التكرار: تشير موثوقية التوافق العالية بين المراقبين إلى إمكانية استخدام المقاييس باستمرار من قبل مقيمين بمستويات خبرة متفاوتة.
المحددات يقر المؤلفون بأن لجنة "دلفي" كانت مقتصرة على خبراء من جمعية وطنية واحدة، مما قد يحد من إمكانية تعميم النتائج. كما أُجري التحقق من الصحة حصرياً في بيئة محاكاة عالية الدقة؛ وتظل قابلية نقل هذه المقاييس إلى غرفة العمليات الحقيقية أمراً يتطلب الإثبات. بالإضافة إلى ذلك، حالت قيود حجم العينة دون إجراء تحليلات تفصيلية بناءً على مستويات خبرة المتدربين.