Graph Convolutional Networks for Automated Anthropometric Measurement Estimation from Three-Dimensional Human Body Meshes
تُظهر هذه الدراسة أن الشبكة العصبية التلافيفية الرسومية يمكنها تقدير ستة عشر قياساً بشرياً معيارياً بفعالية مباشرة من نماذج الجسم البشري ثلاثية الأبعاد، محققةً دقة واعدة على البيانات الاصطناعية مع تسليط الضوء على تحديات تكييف النطاق عند تطبيقها على المسوحات الواقعية.
إن الأشياء اليومية، من الكراسي التي نجلس عليها إلى الملابس التي نرتديها، مصممة مع مراعاة الأجسام البشرية. ولعدة قرون، اعتمد ضمان الملاءمة الجيدة على طقس بسيط ومستهلك للوقت: قيام خياط أو مصمم بقياس الشخص باستخدام شريط قياس. وبينما تنجح هذه الطريقة، إلا أنها بطيئة، وعرضة للخطأ البشري، ومن الصعب تطبيقها على آلاف الأشخاص في وقت واحد. ولحل هذه المشكلة، لجأ المهندسون إلى الماسحات الضوئية ثلاثية الأبعاد التي تلتقط شكل الشخص كـ "سحابة من النقاط" أو سطح هيكلي. ومع ذلك، فإن هذه المسوحات الرقمية ليست سوى بيانات خام؛ فهي لا تعرف تلقائياً أين يقع خط الخصر أو كم يبلغ طول الذراع. إن استخراج تلك الأرقام المحددة من شكل ثلاثي الأبعاد معقد كان يتطلب تقليدياً إيجاد نقاط تشريحية محددة يدوياً أو مطابقة نموذج جسم عام للمسح الضوئي، وكلاهما عملية ثقيلة حاسوبياً وغير دقيقة أحياناً.
لقد استكشف باحث في جامعة واين ستيت مساراً مختلفاً، حيث تعامل مع جسم الإنسان ليس كمجموعة من النقاط أو قالب صلب، بل كشبكة متصلة. في نهجه هذا، يُنظر إلى سطح مسح الجسم ثلاثي الأبعاد كـ "رسم بياني" (graph)، حيث تُعتبر كل نقطة صغيرة على الجلد "عقدة" (node) متصلة بجيرانها عبر "حواف" (edges)، تماماً مثل خريطة المدن المرتبطة بالطرق. وباستخدام نوع من الذكاء الاصطنيعي يُعرف باسم "الشبكة العصبية التلافيفية الرسومية" (graph convolutional network)، علّم الباحث الحاسوب كيف ينظر إلى هيكل الشبكة بأكره دفعة واحدة. وبدلاً من البحث عن المعالم واحداً تلو الآخر، يتعلم النظام كيف يرتبط شكل الجسم بأكمله بالقياسات المحددة، مثل محيط الصدر أو طول الساق. يهدف هذا الأسلوب إلى تجاوز الخطوات الوسيطة البطيئة للمسح التقليدي والانتقال مباشرة من الشكل ثلاثي الأبعاد إلى الأرقام اللازمة للتصنيع.
قام الباحث بتدريب نظامه باستخدام مكتبة ضخمة من أشكال الأجسام الاصطناعية التي تم إنشاؤها بواسطة نموذج حاسوبي. كانت هذه الأجسام الرقمية مثالية، حيث عُرفت كل قياساتها بدقة، مما سمح للشبكة بتعلم العلاقة بين الشكل والحجم دون الضجيج الموجود في المسوحات الواقعية. وبمجرد تدريبها، تم اختبار النظام على مجموعتين مختلفتين من البيانات. أولاً، تم تقييمه على أجسام اصطناعية لم يسبق له رؤيتها لمعرفة مدى جودة تعلمه للأنماط. وفي هذه البيئة المحكومة، أثبتت الشبكة قدرة جيدة، حيث تنبأت بستة عشر قياساً مختلفاً للجسم بمتوسط خطأ يبلغ حوالي 22 ملم. ولحوالي 45 بالمائة من هذه التنبؤات، كان الخطأ ضمن نطاق 20 ملم، وهو هامش مقبول غالباً في العديد من تطبيقات التصميم. وقد كان النظام جيداً بشكل خاص في قياس الأجزاء الصلبة من الجسم، مثل عرض الكتفين أو محيط المعصم، حيث توفر العظام هيكلاً واضحاً وثابتاً.
ومع ذلك، جاء الاختبار الحقيقي عندما طبق الباحث نفس النظام المدرب على بيانات واقعية من مسوحات بشرية فعلية. هنا، انخفض الأداء بشكل ملحوظ، حيث ارتفع متوسط الخطأ إلى ما يقرب من 58 ملم. وتبرز هذه الفجوة بين بيانات التدريب الاصطناعية المثالية والواقع الفوضوي للأجسام البشرية تحدياً شائعاً في الذكاء الاصطناعي: ما يعمل بشكل مثالي في المحاكاة غالباً ما يعاني عند مواجهة عدم القدرة على التنبؤ في العالم الحقيقي. لقد عانى النظام أكثر مع القياسات التي تعتمد على الأنسجة الرخوة، مثل الخصر أو الفخذ. فخلافاً للكتف أو المعصم، اللذين يرتكزان على العظام، يمكن للخصر أن يتغير ويتحول شكله بناءً على كيفية وقوف الشخص أو تنفسه. وقد مال النظام إلى التقليل من تقدير قياسات الأنسجة الرخوة هذه، مما يشير إلى أن طريقته في توزيع المعلومات عبر الجسم بأكمله قد أدت أحياناً إلى "تنعيم" التفاصيل الدقيقة اللازمة للحصول على هذه الأرقام المحددة بدقة.
وعلى الرغم من هذه القيود، تقدم الدراسة إثبات مفهوم مقنع لطريقة جديدة في التفكير حول قياس الجسم. لقد أظهر الباحث أن الكمبيوتر يمكنه تعلم قراءة "الشبكة" (mesh) ثلاثية الأبعاد للجسم مباشرة، دون الحاجة أولاً إلى إيجاد نقاط محددة أو مطابقة قالب عام. هذا النهج المباشر فعال من الناحية الحسابية، حيث يتطلب تمريرة واحدة فقط عبر الشبكة لتوليد النتائج، وهو أمر أسرع بكثير من طرق التحسين التكرارية المستخدمة في التقنيات القديمة. وتشير النتالئج إلى أنه بينما لا تزال هذه التكنولوجيا غير جاهزة للتصنيع عالي الدقة الفوري دون مزيد من التطوير، فإن الاستراتيجية الأساسية سليمة. إن الطريق نحو المستقبل يتضمن سد الفجوة بين التدريب الاصطناعي والتطبيق الواقعي، ربما من خلال تعليم النظام كيفية التعامل مع تباين الأنسجة الرخوة بشكل أفضل، أو من خلال تكييف الشبكة للعمل مباشرة من الصور الفوتوغرافية ثنائية الأبعاد بدلاً من اشتراط مسح ثلاثي الأبعاد مسبق البناء. وفي الوقت الحالي، يمثل هذا العمل خطوة مهمة نحو أتمتة فن القياس القديم، وتحويل الهندسة المعقدة للشكل البشري إلى بيانات يمكن للآلات فهمها واستخدامها.
بيان المشكلة يعد القياس الأنثروبومتري الدقيق أمراً بالغ الأهمية للتصميم الإرغونومي (الهندسة البشرية)، وتحديد مقاسات الملابس، وتركيب الأطراف الاصطناعية، والتصنيع الرقمي. إن القياس اليدوي التقليدي يتطلب جهداً مكثفاً ويصعب توحيده معيارياً، بينما يفرض المسح ثلاثي الأبعاد للجسم عائقاً جديداً: وهو استخراج القياسات من السحب النقطية (point clouds) أو الشبكات (meshes) الخام. تندرج الاستراتيجيات المؤتمتة الحالية عموماً تحت فئتين:
الطرق القائمة على المعالم (Landmark-based): تحديد النقاط التشريحية لحساب المسافات. وهي طرق بديهية ولكنها حساسة لضجيج المسح، والانسداد، والبيانات المفقودة.
الطرق القائمة على القوالب (Template-based): مطابقة نماذج بارامترية (مثل SMPL) على عمليات المسح واستخلاص القياسات من القالب المطابق. ورغم أنها أكثر متانة تجاه الضجيج، إلا أنها تتطلب تسجيلاً غير صلب (non-rigid registration) مكلفاً حوسبياً وتعتمد على قدرة القالب على تمثيل التنوع الجسدي.
يوفر التعلم العميق مساراً لتجاوز هذه الخطوات الوسيطة، لكن الشبكات التلافيفية التقليدية (CNNs) تواجه صعوبة مع الشبكات ثلاثية الأبعاد (3D meshes) لأنها مصممة للشبكات الإقليدية المنتظمة، بينما الشبكات ثلاثية الأبعاد هي رسوم بيانية (graphs) غير منتظمة. تعالج هذه الدراسة تحدي استرجاع القياسات الأنثروبومترية مباشرة من رسوم بيانية لشبكة جسم بشرية ثلاثية الأبعاد دون الحاجة إلى كشف المعالم الوسيط أو تحسين القوالب.
المنهجية تقترح الدراسة بنية شبكة تلافيفية رسومية (GCNN) (النموذج I) مصممة للعمل مباشرة على البنية الطوبولوجية لشبكة جسم بشرية ثلاثية الأبعاد.
تمثيل البيانات: تُعامل كل شبكة ثلاثية الأبعاد كـ "رسم بياني" (graph) حيث تمثل الرؤوس عقدًا (vertices) وتُشكل اتصالات الشبكة حوافاً (edges).
ميزات العقدة: يتم تخصيص متجه ميزات سداسي الأبعاد لكل رأس، يتكون من إحداثيات ثلاثية الأبعاد طبيعية وتشفيرات موضعية للحفاظ على السياق المكاني.
أوزان الحواف: يتم وزن الحواف بناءً على المسافة الإقليدية بين الرؤوس المتصلة لتوفير إشارات هندسية صريحة.
الأهداف: تعمل ستة عشر عملية قياس أنثروبومترية قياسية (مثل المحيطات، الأطوال، العروض) كأهداف استرجاع على مستوى الرسم البياني.
بنية الشبكة:
العمود الفقري (Backbone): شبكة GCN مكونة من خمس طبقات. تقوم الطبقة الأولى برسم الخرائط من المدخلات سداسية الأبعاد إلى 128 بُعداً؛ وتحافظ الطبقتان 2-3 على 128 بُعداً؛ ثم توسع الطبقة الرابعة الأبعاد إلى 256؛ وتقوم الطبقة الخامسة بإعادة المشروع إلى 128 بُعداً. تتضمن كل طبقة تطبيع الدفعة (batch normalization) وتنشيط ReLU.
التجميع (Pooling): تقوم عملية تجميع المتوسط العالمي (global mean-pooling) بتجميع تضمينات العقد في تمثيل واحد على مستوى الرسم البياني.
رأس الاسترجاع (Regression Head): شبكة متصلة بالكامل مكونة من ثلاث طبقات (128 → 512 → 256 → 16) مع إسقاط (dropout) بنسبة (p=0.2) وتطبيع الدفعة، لإنتاج 16 مخرجاً مستمراً.
بروتوكول التدريب:
مصادر البيانات: تم تدريب النموذج على مجموعة بيانات اصطناعية ضخمة مشتقة من نماذج SMPL مع 16 قياساً مُصنفاً. وتم تقييمه على مجموعة اختبار اصطناعية محجوزة، وعلى مجموعة مسح NOMO3D حقيقية (194 ذكراً، 181 أنثى) لاختبار التعميم.
التحسين: تم التدريب باستخدام الانحدار الاشتقاقي العشوائي (SGD) مع زخم (0.9) لتقليل متوسط الخطأ التربيعي (MSE). تم إعادة تحجيم الأهداف إلى الفاصل الزمني للوحدة.
اختيار النموذج: تم استخدام استراتيجية إيقاف مبكر صريحة لكل بُعد، حيث تم حفظ نقاط التحقق (checkpoints) كلما وصل خطأ التحقق من بُعد قياس معين إلى حد أدنى جديد.
المساهمات الرئيسية
بنية قائمة على الرسوم البيانية: مسار مبتكر يعامل شبكات الجسم ثلاثية الأبعاد كرسوم بيانية لاسترجاع القياسات الأنثروبومترية مباشرة، مما يلغي الحاجة إلى كشف المعالم الوسيط أو مطابقة القوالب.
التقييم التجريبي: تقييم شامل لدقة وسلوك الخطأ عبر ستة عشر نوعاً من القياسات على كل من البيانات الاصطناعية والواقعية.
تحليل القيود: تقديم حساب صريح للقيود الحالية للمنهج، وتحديداً الفجوة بين المجال الاصطناعي والواقعي، والمقايضات الخاصة باستراتيجية التدريب لكل بُعد، مما يوفر مساراً واضحاً للتحقق المستقبلي.
النتائج
أداء البيانات الاصطناعية: على مجموعة الاختبار الاصطناعية المحجوزة، حقق النموذج متوسط خطأ مطلق (MAE) قدره 22.05 مم عبر جميع الأبعاد الستة عشر. وكانت الدقة ضمن نطاق سماحية 20 مم هي 45.12%.
الأداء في العالم الحقيقي: عند التقييم على مجموعة مسح NOMO3D الواقعية (المقتصرة على 10 أبعاد متداخلة)، ارتفع متوسط الخطأ المطلق (MAE) إلى 57.66 مم، وانخفضت الدقة عند 10 مم إلى 10.62%. ويعكس هذا فجوة كبيرة بين المجال الاصطناعي والواقعي.
أنماط الخطأ:
نوع القياس: كانت الأخطاء أعلى باستمرار في القياسات المعتمدة على الأنسجة الرخوة (محيط الخصر، الصدر، الحوض، الفخذ) مقارنة بالقياسات الصلبة المرتبطة بالمعالم (عرض الكتفين، محيط المعصم، محيط الرقبة). على سبيل المثال، كان لوسط الخصر متوسط خطأ مطلق قدره 51.21 مم، بينما كان لعرض الكتفين 7.98 مم.
التحيز الاتجاهي: أظهر النموذج ميلاً نظامياً نحو نقص التقدير، لا سيما في المحيطات الكبيرة (مثلاً خطأ نقص تقدير محيط الخصر بلغ 4.96 مم مقابل زيادة قدرها 0.16 مم). ويعزو المؤلف ذلك إلى عملية التجميع المتوسط العالمي التي قد تقلل من وزن مناطق الأنسجة الرخوة المتغيرة.
الأهمية والادعاءات يدعي البحث أن التعلم القائم على الرسوم البيانية هو نهج سليم معمارياً وفعال حوسبياً للقياسات الأنثروبومترية المؤتمتة. ومن خلال العمل مباشرة على رسم الشبكة البياني، يتجنب هذا النهج تكاليف التحسين التكراري لمطابقة القوالب مع الاستفادة من الطوبولوجيا الهندسية المتأصلة لسطح الجسم.
ومع ذلك، يلتزم المؤلف بموقف متواضع فيما يتعلق بالنشر الفوري:
النتائج الحالية تمثل "سقفاً" لقدرة البنية التحتية تحت نظام التدريب المحدد لكل بُعد، وليس أداء نموذج واحد قابل للنشر عالمياً.
يشير الانخفاض الكبير في الأداء على البيانات الواقعية إلى أن توزيع التدريب الاصطناعي الحالي لا يستوعب تماماً تنوع الشكل والوضعية وضجيج المستشعرات في العالم الحقيقي.
يُقدم النهج كخطوة قابلة للتطبيق نحو أنظمة جاهزة للتصنيع، لكن المؤلف يحدد صراحة الحاجة إلى التحقق المتبادل، ونقطة تحقق عالمية واحدة، ودراسات الاستبعاد (ablation studies)، وتوسيع المسار ليقبل الصور ثنائية الأبعاد كمدخلات لتحقيق المنفعة العملية الكاملة.