Vision-Language System using Open-Source LLMs for Gestures in Medical Interpreter Robots
تقدم هذه الورقة إطار عمل للرؤية واللغة يحافظ على الخصوصية لروبوتات الترجمة الطبية، يستفيد من نماذج لغوية كبيرة مفتوحة المصدر ومنتشرة محلياً ومجموعة بيانات مشروحة مبتكرة للكشف بدقة عن الأفعال الكلامية السريرية وتوليد إيماءات روبوتية بشرية الطابع ومناسبة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل روبوتًا يعمل كمساعد طبيب يقف في غرفة مستشفى مزدحمة. مهمته هي مساعدة الطبيب في التحدث مع مريض يتحدث لغة مختلفة. عادةً، تكتفي هذه الروبوتات بترجمة الكلمات، مما قد يجعل الأمر يبدو آليًا وباردًا. ولكن ماذا لو استطاع الروبوت أيضًا أن يومئ برأسه، أو يشير بإصبعه، أو يرفع يده في اللحظة المناسبة تمامًا، تمامًا كما يفعل البشر؟ هذا هو هدف هذه الورقة البحثية.
قام الباحثون ببناء "جسد ذكي" لروبوت طبي، يفهم ليس فقط ماذا يُقال، بل كيف ينبغي قول ذلك جسديًا. وإليك كيف فعلوا ذلك، مشروحًا ببساطة:
١. المشكلة: المترجم "الصامت"
في المستشفى، الكلمات ليست كافية. إذا قال الطبيب: "أحتاج إلى إذنك للمتابعة"، فقد يمد يده أو يميل للأمام ليظهر أنه يطلب الموافقة (الرضا). وإذا قال: "خذ نفسًا عميقًا"، فقد يستعرض الحركة.
أدوات الترجمة الحالية تشبه الراديو: فهي تبث الصوت فقط، وتفتقر إلى لغة الجسد. أراد الباحثون روبوتًا يمكنه "التحدث" بيديه وذراعيه أيضًا، لجعل المريض يشعر بالأمان والفهم.
٢. الحل: "عقل" يضع الخصوصية أولاً
لجعل الروبوت ذكيًا بما يكفي لمعرفة متى يقوم بالإيماءات، احتاجوا إلى عقل (ذكاء اصطناعي) يمكنه الاستماع إلى المحادثة والقرار: "هل الطبيب يطلب الإذن؟ هل الطبيب يعطي تعليمات؟ أم أن هذا مجرد حديث عابر؟"
- العقل المحلي: معظم نماذج الذكاء الاصطناعي تعيش في "السحابة" (خوادم ضخمة بعيدة). ولكن في المستشفى، خصوصية المريض هي كل شيء. لا تريد أن تطير البيانات الطبية الحساسة عبر الإنترنت. لذا، بنى الفريق نظامًا يعمل بالكامل على كمبيوتر الروبوت الخاص. إنه يشبه وجود أمين مكتبة شخصي في الغرفة لا يغادر المبنى أبدًا ولا يخبر أحدًا عما تقرأه.
- خدعة "التعلم من أمثلة قليلة" (Few-Shot): علموا هذا الذكاء الاصطناعي المحلي باستخدام طريقة ذكية تسمى "التحفيز بالأمثلة القليلة". تخيل أنك تعلم طفلًا التعرف على قطة. بدلًا من إظهار مليون صورة له، تعرض عليه ثلاثة أمثلة: "هذه قطة. هذه قطة. هذه قطة. الآن، هل هذه قطة؟" تعلم الذكاء الاصطناعي تمييز جمل "الموافقة" و"التعليمات" بمجرد رؤية حفنة من الأمثلة.
٣. مجموعة البيانات: "قاموس الإيماءات"
لتدريب الروبوت، احتاج الفريق إلى قاموس من المحادثات الطبية المقترنة بالإيماءات.
- أخذوا ٥٨ فيديو حقيقي لأطباء يتحدثون مع مرضى (من قناة عامة على يوتيوب).
- قاموا بتقسيم هذه الفيديوهات إلى آلاف المقاطع الصغيرة.
- وضعوا علامة (Label) على كل مقطع: "هذه الجملة هي طلب للموافقة،" أو "هذه تعليمات لتحريك ذراع."
- حتى أنهم سجلوا حركات يد الطبيب في هذه المقاطع حتى يتمكن الروبوت من تعلم كيفية تقليدها.
٤. النظام ذو الوضعين
لدى الروبوت طريقتان للحركة، اعتمادًا على ما يسمعه الذكاء الاصطناعي:
الوضع أ: المرآة (محاكاة الإنسان)
إذا سمع الذكاء الاصطناعي جملة موافقة أو تعليمات، ينتقل الروبوت إلى "وضع المرآة". ينظر إلى فيديو المتحدث البشري، ويلتقط حركات يده، ويقلدها بدقة.- تشبيه: يشبه الأمر شريك رقص يقلد خطواتك بدقة. إذا رفع الطبيب يده ليقول "توقف"، يرفع الروبوت يده أيضًا. هذا يبدو طبيعيًا جدًا وبشريًا.
الوضع ب: المرتجل (توليد الإيماءات من الكلام)
إذا سمع الذكاء الاصطناعي محادثة عادية (ليست تعليمات محددة أو موافقة)، يستخدم الروبوت ذكاءً اصطناعيًا آخر لابتكار إيماءة تناسب الحالة المزاجية.- تشبيه: هذا يشبه عازف الجاز. إذا كانت المحادثة عفوية، يضيف الروبوت إيماءة بسيطة بالرأس أو موجة باليد للحفاظ على الإيقاع، حتى لو لم يخبره أحد بما يجب فعله بالضبط.
٥. النتائج: هل نجح الأمر؟
اختبروا ذلك على روبوت "بيبر" (Pepper)، وهو روبوت بشري ودود يُستخدم كثيرًا في الأبحاث، مع ٢٦ متطوعًا من البشر.
- "اختبار البشر": شاهد الناس فيديوهات لحركة الروبوت. عندما كان الروبوت يقلد إيماءات بشرية حقيقية (الوضع أ)، صنف الناس الروبوت على أنه أكثر شبهاً بالبشر مما كان عليه عندما كان يولد إيماءات عشوائية. بدا أقل شبهاً بالآلة وأقرب إلى الشخص.
- "اختبار الملاءمة": تحقق الناس أيضًا مما إذا كانت الإيماءات تتناسب مع الكلمات. أدى الروبوت بشكل جيد مثل أفضل الأنظمة الموجودة حاليًا في التأكد من أن الإيماءات منطقية.
- فوز الخصوصية: نظرًا لأن كل شيء يعمل محليًا على الروبوت، فإنه يستهلك ذاكرة قليلة جدًا ويحافظ على سلامة بيانات المرضى داخل الآلة نفسها.
الصورة الكبيرة
فكر في هذا النظام كمن يمنح الروبوت جسدًا ذا روح. قبل ذلك، كانت الروبوتات الطبية تشبه الهواتف — جيدة في السمع، لكنها سيئة في الشعور. هذا النظام الجديد يسمح للروبوت باستخدام "لغة جسده" لبناء الثقة، وتقليل القلق، والتأكد من أن المرضى يفهمون رعايتهم حقًا، كل ذلك مع الحفاظ على أسرارهم الطبية الخاصة داخل صندوق مغلق على الروبوت نفسه.
إنها خطوة نحو روبوتات لا تترجم الكلمات فحسب، بل تترجم التواصل الإنساني.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.