GEGLU-Transformer for IMU-to-EMG Estimation with Few-Shot Adaptation
تقترح هذه الورقة إطار عمل GEGLU-Transformer الذي يعيد بناء أغلفة تنشيط العضلات المستمرة من بيانات وحدة القياس بالقصور الذاتي (IMU) مع تكيف سريع بأسلوب التعلم القليل (few-shot adaptation)، مما يوفر بديلاً قوياً وقابلاً للتوسع للتحسس المباشر لتخطيط العضلات السطحي (EMG) للتحكم في الروبوتات القابلة للارتداء.
تخيل أنك تحاول تعليم روبوت كيف يمشي مثل البشر. للقيام بذلك بشكل آمن وطبيعي، يحتاج الروبوت إلى معرفة متى وكيف تعمل عضلاتك بالضبط وبأي قوة. عادةً، نستخدم مستشعرات خاصة لاصقة تسمى أقطاب EMG الكهربائية لـ "الاستماع" إلى الإشارات الكهربائية لعضلاتك. ولكن تكمن المشكلة هنا في أن هذه المستشعرات تشبه الميكروفونات الحساسة في حفلة روك صاخبة؛ فإذا حركت ذراعك قليلاً، أو تعرقت قليلاً، أو تحرك الملصق من مكانه، سيحدث تشوه في الصوت. كما أنها "متطلبة" للغاية، بمعنى أن إعداد المستشعرات الذي يعمل بشكل مثالي معك قد يكون عديم الفائدة لصديقك.
تقترح هذه الورقة البحثية حلاً ذكياً: بدلاً من الاستماع إلى العضلات مباشرة، دعونا نستمع إلى الحركة.
الفكرة الجوهرية: "مترجم الجسم"
قام الباحثون ببناء برنامج حاسوبي ذكي (ذكاء اصطناعي) يعمل كمترجم.
المدخلات: يأخذ بيانات من وحدات القياس بالقصور الذاتي (IMUs). فكر في هذه الوحدات كأنها مستشعرات الحركة الصغيرة الموجودة داخل هاتفك الذكي أو ساعتك الذكية؛ فهي متينة، رخيصة الثمن، ولا تهتم بالعرق أو تحرك الملصقات. هي فقط تقيس كيفية تحرك ساقيك.
المخرجات: يحاول الذكاء الاصطناعي تخمين ما ستفعله عضلاتك بناءً على تلك الحركات. إنه يعيد بناء "غلاف تنشيط العضلات" — وهو ببساطة منحنى سلس يوضح مدى قوة عمل كل عضلة بمرور الوقت.
المشكلة: الجميع يتحركون بشكل مختلف
الجزء الصعب هو أن كل إنسان فريد من نوعه. أسلوب مشيتك، وقوة عضلاتك، وبنية عظامك تختلف عن غيرك.
الطريقة القديمة: يتم تدريب معظم نماذج الذكاء الاصطناعي على مجموعة ضخمة من الناس ثم يتم "تجميدها". وعندما تضعها على شخص جديد، غالباً ما تتعثر لأنها لم تتعلم الخصائص الفريدة لهذا الشخص. الأمر يشبه محاولة التحدث إلى أجنبي باستخدام قاموس يحتوي فقط على عبارات عامة؛ سيعمل الأمر بشكل مقبول، لكن ليس بشكل مثالي.
الطريقة الجديدة: تقدم هذه الورقة نظاماً يمكنه التعلم أثناء العمل. إنه يشبه امتلاك مترجم يمكنه التقاط لهجتك فوراً بعد سماع جمل قليلة فقط.
السر الكامن: "GEGLU-Transformer"
بنى الفريق نوعاً جديداً من عقول الذكاء الاصطناعي يسمى GEGLU-Transformer.
الترانسفورمر (Transformer): تخيل أميناً للمكتبة يمكنه قراءة كتاب كامل وفهم كيفية ارتباط البداية بالنهاية فوراً، حتى لو كان بينهما مئات الصفحات. هذا يساعد الذكاء الاصطناعي على فهم الأنماط طويلة المدى في مشيتك، وليس فقط الخطوة اللحظية.
الـ GEGLU (وحدة خطية ذات بوابة): هذه "بوابة" خاصة داخل الذكاء الاصطناعي. فكر فيها كحارس أمن عند ملهى ليلي يقرر أي المعلومات مهمة وأيها يجب تجاهله. يساعد هذا الذكاء الاصطناعي على التركيز على الإشارات الصحيحة وتجاهل الضجيج، مما يجعله أفضل بكثير في تخمين نشاط العضلات لمختلف الأشخاص.
هذا هو الجزء الأكثر إثارة. اختبر الباحثون نظامهم على شخص جديد لم يروه من قبل.
البداية الباردة: أولاً، تركوا الذكاء الاصطناعي يخمن باستخدام ما تعلمه فقط من الجميع الآخرين. كان أداؤه جيداً (حوالي 70% من الدقة في مطابقة أنماط العضلات).
التعديل ببيانات قليلة: بعد ذلك، عرضوا على الذكاء الاصطناعي 0.5% فقط من بيانات مشي هذا الشخص الجديد. ولوضع ذلك في الاعتبار: إذا قام شخص بـ 2,400 خطوة في اختبار، فإن الذكاء الاصطناعي احتاج فقط إلى النظر في حوالي 12 خطوة ليتعلم كيفية التكيف.
النتيجة: بعد رؤية تلك الـ 12 خطوة الصغيرة، قفزت دقة الذكاء الاصطناعي بشكل كبير. لقد تعلم أسلوبه الخاص بشكل فوري تقريباً.
ماذا وجدوا؟
أفضل من الحرس القديم: كان نموذج الذكاء الاصطناعي الجديد الخاص بهم (GEGLU-Transformer) يتفوق باستمرار على نماذج الذكاء الاصطناعي القديمة والمعيارية (مثل LSTMs)، حتى قبل أن تتاح له فرصة التعلم من الشخص الجديد.
متعلم سريع: نجحت خدعة "الـ 0.5% من البيانات" بشكل مذهل. لم يحتج الذكاء الاصطناعي إلى ساعات من المعايرة؛ بل احتاج فقط إلى ثوانٍ من بيانات المشي ليصبح مخصصاً.
القوة والمتانة: عمل النظام بشكل جيد سواء كان الشخص يمشي على أرض مستوية، أو يصعد الدرج، أو يمشي على منحدر.
الخلاصة
تزعم الورقة البحثية أنه من خلال استخدام بنية "المترجم الذكي" هذه، يمكننا تقدير نشاط العضلات باستخدام مستشعرات حركة بسيطة ومتينة بدلاً من مستشعرات العضلات المزعجة. والأهم من ذلك، أن النظام يمكنه التكيف مع مستخدم جديد فوراً وببيانات قليلة جداً. وهذا يجعل فكرة الروبوتات القابلة للارتداء (مثل الهياكل الخارجية للمساعدة في المشي) أكثر عملية للاستخدام في العالم الحقيقي، حيث لا يمكنك قضاء ساعات في معايرة المستشعرات لكل شخص على حدة.
إليك ملخص تقني مفصل للورقة البحثية بعنوان "GEGLU-Transformer لتقدير EMG من IMU مع التكيف بلقطات قليلة (Few-Shot Adaptation)."
1. بيان المشكلة
يتمثل التحدي الجوهي الذي تعالجه الورقة في التقدير الموثوق لـ التنشيط العصبي العضلي (EMG) من وحدات القياس بالقصور الذاتي القابلة للارتداء (IMUs) لاستخدامها في الروبوتات القابلة للارتداء التكيفية (مثل الهياكل الخارجية، والأطراف الاصطناعية).
محدودية الـ EMG المباشر: بينما يوفر الـ EMG بيانات مباشرة عن تنشيط العضلات، إلا أنه من الصعب نشره خارج المختبرات بسبب عدم استقرار الإشارة، والحساسية لموضع الأقطاب الكهربائية، والآثار الحركية، والتباين القوي بين الأفراد.
محدودية نماذج (IMU-to-EMG) الحالية: تعتمد النهج القائمة على التعلم حاليًا على نماذج ثابتة يتم تدريبها مسبقًا (offline) على مجموعات بيانات متعددة المستخدمين. غالبًا ما تفشل هذه النماذج في التعميم على مستخدمين جدد لأنها لا تأخذ في الاعتبار الاستراتيجيات العصبية العضلية الفردية. علاوة على ذلك، فهي تفتقر إلى آليات فعالة للتخصيص السريع الخاص بكل مستخدم (التكيف بلقطات قليلة) في السيناريوهات الواقعية التي تتضمن مهام حركة متنوعة (السلالم، المنحدرات، إلخ).
2. المنهجية
يقترح المؤلفون إطار عمل تعلمي تكيفي يتكون من ثلاثة مكونات رئيسية:
أ. معالجة الإشارات
مصدر البيانات: بيانات متزامنة من الـ IMU (بتردد 200 هرتز) والـ EMG (بتردد 1000 هرتز) من 22 شخصًا بالغًا سليمًا يؤدون مهامًا مختلفة (المشي على أرض مستوية، السلالم، المنحدرات، جهاز المشي).
المعالجة المسبقة:
الـ EMG: تمت تصفية الإشارة باستخدام مرشح تمرير النطاق (Band-pass filter) (20–450 هرتز)، ثم تم تقويم الموجة الكاملة (full-wave rectification)، وتطبيق مرشح تمرير منخفض (low-pass filter) عند 8 هرتز لاستخراج أغلفة التنشيط السلسة.
المحاذاة: تمت إعادة أخذ عينات من إشارات الـ IMU والـ EMG إلى 200 هرتز ومحاذاتها.
التقسيم: تم تقسيم البيانات إلى دورات مشي (0–100%) وتطبيعها زمنيًا إلى 101 عينة.
التطبيع: تم تحجيم الإشارات لتصبح في النطاق [0, 1] واستخدام المرشح الوسيط (median filter) لإزالة الآثار الاصطناعية.
ب. بنية GEGLU-Transformer
استبدل النموذج البنى المتكررة القياسية (مثل LSTM) بمشفر يعتمد على الـ Transformer مصمم للتعميم عبر المستخدمين.
الواجهة الأمامية الالتفافية (Convolutional Front-End): تقوم طبقة التفات (1D Convolutional layer) بحجم نواة (5) بإسقاط 24 ميزة قصورية إلى فضاء كامن ذي 256 بُعدًا لالتقاط أنماط الحركة المحلية.
مشفر الانتباه الذاتي (Self-Attention Encoder): أربع طبقات مشفر Transformer متراكمة مع انتباه متعدد الرؤوس (8 رؤوس) لالتقاط التبعيات الزمنية طويلة المدى.
تغذية GEGLU الأمامية: بدلاً من شبكات التغذية الأمامية القياسية، يستخدم النموذج وحدات الخطية ذات البوابة الغاوسية (GEGLU).
الآلية:FFGEGLU(x)=Wo(GELU(W1x)⊙(W2x)).
الفائدة: تعمل آلية البوابة على تعديل التنشيطات عبر القنوات، مما يحسن اختيار الميزات وتدفق التدرج مقارنة بالبوابات القائمة على دالة السيجمويد (sigmoid)، وهو أمر بالغ الأهمية لمهام الانحدار (regression).
المخرج: يقوم إسقاط خطي برسم التمثيل الكامن إلى أغلفة الـ EMG المستهدفة لعدة عضلات.
ج. التكيف بلقطات قليلة (Few-Shot Adaptation)
للتعامل مع المستخدمين غير الموجودين في التدريب، يستخدم الإطار استراتيجية تكيف خفيفة الوزن:
البروتوكول: تُستخدم مجموعة فرعية صغيرة من بيانات المستخدم الجديد (على سبيل المثال، من 0.5% إلى 10% من دورات المشي) للمعايرة.
العملية: يتم ضبط معاملات النموذج المدرب مسبقًا باستخدام التدرج المنحدر (AdamW) على مجموعة التكيف الصغيرة هذه.
القيود: يتم تحديث جميع المعاملات (لا يوجد تجميد للطبقات) للسماح بالتخصيص الكامل، ولكن العملية مقيدة بمعدل تعلم منخفض وتقليم معيار التدرج (gradient norm clipping) لمنع النسيان الكارثي وضمان الاستقرار.
3. المساهمات الرئيسية
بنية مبتكرة: تقديم GEGLU-Transformer لتقدير (IMU-to-EMG)، والذي يتفوق على النماذج المتكررة المرجعية (LSTM و CNN-LSTM) في التعميم عبر المستخدمين.
القوة تجاه التباين البيئي: تقييم منهجي عبر أوضاع حركة متنوعة (أرض مستوية، سلالم، منحدرات، جهاز مشي)، مما يثبت أن تفوق النموذج لا يقتصر على ظروف المشي البسيطة.
التكيف الفعال بلقطات قليلة: إثبات أن البنية المقترحة تحقق تخصيصًا سريعًا بأقل قدر من البيانات (ما يصل إلى 0.5% فقط من دورات مشي الشخص)، حيث تصل إلى مرحلة تشبع الأداء بسرعة مقارنة بالنماذج المرجعية.
4. النتائج التجريبية
تم تقييم النموذج باستخدام بروتوكول التحقق المتبادل "ترك مستخدم واحد خارج المجموعة" (LOSO) على مجموعة بيانات تضم 22 شخصًا.
المقارنة مع النماذج المرجعية (بدون تكيف):
الارتباط (Correlation - r): حقق GEGLU-Transformer نسبة 0.706 (مقابل 0.664 لـ CNN-LSTM و 0.647 لـ LSTM).
معامل التحديد (Coefficient of Determination - R2): حقق GEGLU-Transformer نسبة 0.474 (مقابل 0.420 و 0.397).
مقاييس الخطأ: أظهر خطأ جذر متوسط مربع تربيعي معياري (nRMSE) أقل، وانخفاضًا في أخطاء التوقيت والذروة (peak timing/amplitude).
ملاحظة: أدت نسخة GEGLU تحديدًا إلى تحسين R2 بنسبة ~1.5% والارتباط بنسبة ~0.33% مقارنة بـ Transformer غير المزود ببوابات، مما يؤكد فائدة آلية البوابة.
التكيف بلقطات قليلة (0.5% من البيانات):
مع 0.5% فقط من بيانات التكيف، ارتفع ارتباط GEGLU-Transformer إلى 0.761 و R2 إلى 0.559.
يمثل هذا قفزة كبيرة في الأداء مع بيانات ضئيلة، بينما أظهرت النماذج المرجعية مكاسب أقل بكثير.
وصلت مكاسب الأداء إلى التشبع بسرعة؛ حيث لم تؤدِ زيادة البيانات إلى أكثر من 5% إلى تحسينات هامشية، مما يشير إلى كفاءة عالية في العينات.
الأداء الخاص بالعضلات:
حقق النموذج أفضل أداء في العضلات ذات السعة العالية والمنتظمة (مثل Soleus، Gastrocnemius، Vastus).
العضلات الأقل أداءً (مثل Gracilis، Biceps Femoris) أظهرت تباينًا أعلى، مما يشير إلى تحديات تتعلق بجودة الإشارة والتعقيد الميكانيكي الحيوي وليس مجرد قدرة النموذج.
5. الأهمية والتأثير
القابلية للتوسع في الروبوتات القابلة للارتداء: من خلال تقليل الاعتماد على مستشعرات الـ EMG المباشرة (التي تتسم بهشاشة وصعوبة في المعايرة) وتمكين التخصيص السريع بأقل قدر من البيانات، يجعل هذا النهج التحكم القائم على الـ EMG أمرًا ممكنًا للاستخدام الواقعي طويل الأمد.
التحكم التكيفي: يدعم إطار العمل نموذج "التحكم التكيفي" في الروبوتات، مما يسمح للأنظمة بالتكيف بسرعة مع مستخدمين جدد دون جلسات معايرة مطولة.
القدرة على التعميم: الطبيعة المستقلة عن المهام لهذه البنية تشير إلى إمكانية توسيعها لتشمل حركات الأطراف العلوية أو تطبيقات روبوتية مساعدة أخرى تتجاوز حركة المشي في الأطراف السفلية.
الكفاءة: تثبت النتائج أن البنى القائمة على الانتباه، عند دمجها مع الوحدات البوابية (gated units) والتكيف خفيف الوزن، تقدم بديلًا متفوقًا للنماذج المتكررة التقليدية لعمليات انحدار التنشيط العصبي العضلي المستمرة.
في الختام، يقدم هذا العمل حلاً عمليًا وقابلاً للتوسع لتقدير التنشيط العضلي من مستشعرات القصور الذاتي، مما يسد الفجوة بين دقة المختبرات والقدرة على الاستخدام في العالم الحقيقي في الروبوتات القابلة للارتداء.